2026-03-28
데이터 수집 (Phase 0)
- KCI에서 “콘텐츠” AND “산업” 제목 검색으로 416건 수집
- WoS에서 TS=(“content industry” OR “creative industry” OR “cultural industry”) 검색으로 489건 수집
- KCI 데이터 정제: 41컬럼 -> 18핵심컬럼 (
kci_content_industry_clean.csv)
- WoS 데이터 정제: 489건 -> 311건 (주제 무관 178건 제거, 36.4% 노이즈)
PRISMA 스크리닝 (Phase 1)
- 수집 905건 (KCI 416 + WoS 489) -> 중복제거 895건 (-10건)
- ScholarRAG v1.2.4 AI-PRISMA 스크리닝 실행
- 자동 포함 (score>=40): 449건 (50.2%)
- 검토 대기: 250건 (27.9%)
- 자동 제외: 196건 (21.9%)
- 최종 선정 524건 (자동포함 449 + 검토대기 상위30% 75건)
- KCI 315편 (60.1%), WoS 209편 (39.9%)
R 기반 교차비교 분석 (Phase 1-6)
- 14개 R 스크립트로 6개 Phase 분석 파이프라인 실행
- Phase 1: 기술통계 교차비교 – 연도추이, 학술지, 인용, 종합 (그래프 9개, 테이블 8개)
- Phase 2: 키워드 교차비교 – 키워드 겹침률 4.3% 발견 (그래프 3개, 테이블 4개)
- Phase 3: STM 토픽모델 – KCI 7토픽, WoS 7토픽, 통합 9토픽 (그래프 9개, 테이블 5개)
- Phase 4: 키워드 네트워크 – 밀도(KCI 0.175 vs WoS 0.170), Thematic Map (그래프 5개, 테이블 4개)
- Phase 5: 갭 분석 – 정책/제도 KCI 21.1% vs WoS 8.2% (그래프 2개, 테이블 3개)
- Phase 6: 시기별 Thematic Evolution + Three-Field Plot (그래프 11개, 테이블 3개)
- 총 산출물: 그래프 35개, 테이블 25개
RAG 구축 및 문서 생성 (Phase 7)
- finalized_papers.json (524편) 기반 ChromaDB 벡터 DB 구축
- 임베딩: all-MiniLM-L6-v2 (384차원)
- 5개 산출물 생성:
- 구조화 분석표 (524편 x 19열)
- 주석 참고문헌 (524편)
- 개념적 프레임워크 (8이론, 4층 다이어그램)
- 통합적 문헌고찰 (~9,500자)
- RQ별 에세이 4편
논문 초고 작성 (Phase 8)
- Quarto + apaquarto (APA 7th Edition) 템플릿으로 Draft.qmd 작성
- reference.bib 구축 (532항목: 방법론 8 + 논문 524)
- 분석 그래프 21개 + 분석 CSV 7개 포함
- 한국어 본문, 영문 메타데이터, PDF/DOCX/HTML 동시 출력 설정