Research Log

2026-03-28

데이터 수집 (Phase 0)

  • KCI에서 “콘텐츠” AND “산업” 제목 검색으로 416건 수집
  • WoS에서 TS=(“content industry” OR “creative industry” OR “cultural industry”) 검색으로 489건 수집
  • KCI 데이터 정제: 41컬럼 -> 18핵심컬럼 (kci_content_industry_clean.csv)
  • WoS 데이터 정제: 489건 -> 311건 (주제 무관 178건 제거, 36.4% 노이즈)

PRISMA 스크리닝 (Phase 1)

  • 수집 905건 (KCI 416 + WoS 489) -> 중복제거 895건 (-10건)
  • ScholarRAG v1.2.4 AI-PRISMA 스크리닝 실행
    • 자동 포함 (score>=40): 449건 (50.2%)
    • 검토 대기: 250건 (27.9%)
    • 자동 제외: 196건 (21.9%)
  • 최종 선정 524건 (자동포함 449 + 검토대기 상위30% 75건)
    • KCI 315편 (60.1%), WoS 209편 (39.9%)

R 기반 교차비교 분석 (Phase 1-6)

  • 14개 R 스크립트로 6개 Phase 분석 파이프라인 실행
  • Phase 1: 기술통계 교차비교 – 연도추이, 학술지, 인용, 종합 (그래프 9개, 테이블 8개)
  • Phase 2: 키워드 교차비교 – 키워드 겹침률 4.3% 발견 (그래프 3개, 테이블 4개)
  • Phase 3: STM 토픽모델 – KCI 7토픽, WoS 7토픽, 통합 9토픽 (그래프 9개, 테이블 5개)
  • Phase 4: 키워드 네트워크 – 밀도(KCI 0.175 vs WoS 0.170), Thematic Map (그래프 5개, 테이블 4개)
  • Phase 5: 갭 분석 – 정책/제도 KCI 21.1% vs WoS 8.2% (그래프 2개, 테이블 3개)
  • Phase 6: 시기별 Thematic Evolution + Three-Field Plot (그래프 11개, 테이블 3개)
  • 총 산출물: 그래프 35개, 테이블 25개

RAG 구축 및 문서 생성 (Phase 7)

  • finalized_papers.json (524편) 기반 ChromaDB 벡터 DB 구축
  • 임베딩: all-MiniLM-L6-v2 (384차원)
  • 5개 산출물 생성:
    1. 구조화 분석표 (524편 x 19열)
    2. 주석 참고문헌 (524편)
    3. 개념적 프레임워크 (8이론, 4층 다이어그램)
    4. 통합적 문헌고찰 (~9,500자)
    5. RQ별 에세이 4편

논문 초고 작성 (Phase 8)

  • Quarto + apaquarto (APA 7th Edition) 템플릿으로 Draft.qmd 작성
  • reference.bib 구축 (532항목: 방법론 8 + 논문 524)
  • 분석 그래프 21개 + 분석 CSV 7개 포함
  • 한국어 본문, 영문 메타데이터, PDF/DOCX/HTML 동시 출력 설정