NotebookLM과 사람이 작성한 문헌고찰 비교 실험
NotebookLM과 사람이 작성한 문헌고찰 비교 실험, 연구자는 정말 시간을 아낄 수 있을까?
논문을 작성하는 사람이라면 누구나 문헌고찰의 중요성을 알고 있다. 학위논문이든 학술지 논문이든 연구보고서든 가장 먼저 수행해야 하는 과정은 선행연구를 검토하고 연구 흐름을 파악하는 일이다.
하지만 문헌고찰은 생각보다 많은 시간과 노력이 필요한 작업이다.
관련 논문을 찾고, 읽고, 정리하고, 공통점과 차이점을 분석한 뒤 연구 공백을 도출해야 한다. 논문 20편만 읽어도 수백 페이지에 달하는 분량이 된다.
최근에는 NotebookLM을 활용해 문헌고찰을 수행하는 연구자들이 늘어나고 있다.
실제로 NotebookLM은 여러 논문을 동시에 비교하고 공통된 연구 흐름을 정리하는 데 활용되고 있으며, 일부 연구에서는 문헌검토 보조도구로서의 가능성을 검토하기도 했다.
그렇다면 실제 연구자가 직접 작성한 문헌고찰과 NotebookLM이 생성한 문헌고찰은 얼마나 차이가 있을까?
이번 글에서는 실제 문헌고찰 작성 과정을 가정하여 NotebookLM과 사람이 작성한 결과를 비교해봤다.
특히 다음 세 가지를 중심으로 분석했다.
연구 흐름 분석 능력
문헌고찰 품질 비교
시간 절약 효과
AI가 연구자를 완전히 대체할 수 있는지 확인하기보다는 실제 연구 과정에서 얼마나 도움이 되는지를 검증하는 데 초점을 맞췄다.
왜 문헌고찰 비교 실험을 진행했을까?
석사논문이나 박사논문을 작성할 때 가장 많은 시간이 들어가는 부분 중 하나가 문헌고찰이다.
특히 다음과 같은 작업이 반복된다.
논문 검색
초록 검토
전문 읽기
주요 결과 정리
연구 흐름 파악
연구 공백 도출
문헌고찰 작성
이 과정은 수십 시간에서 수백 시간이 소요될 수 있다.
NotebookLM은 여러 PDF를 동시에 분석하고 주제를 분류할 수 있기 때문에 연구 생산성을 높여줄 수 있다는 평가를 받고 있다.
하지만 실제 연구 품질까지 확보할 수 있는지는 별개의 문제다.
그래서 직접 비교 실험을 진행해보기로 했다.
실험에 사용한 자료
이번 실험에서는 특정 연구주제를 선정한 뒤 관련 학술논문 30편을 준비했다.
자료 구성은 다음과 같았다.
국내 학술논문 18편
해외 학술논문 12편
최근 5년 이내 연구 중심
동료심사 학술지 논문 위주
총 분량은 약 900페이지 수준이었다.
실제 석사논문 문헌고찰에서 충분히 활용 가능한 규모다.
실험 방법
이번 비교는 두 가지 방식으로 진행했다.
첫 번째는 전통적인 방식이다.
논문을 직접 읽고
엑셀에 정리하고
주제별로 분류한 뒤
문헌고찰 초안을 작성했다.
두 번째는 NotebookLM 방식이다.
논문 PDF를 업로드한 뒤
다음 질문들을 순차적으로 입력했다.
연구 흐름을 정리해줘
공통 연구주제를 분류해줘
연구자들이 합의하는 내용을 알려줘
상반된 결과를 보여주는 논문을 찾아줘
연구 공백을 정리해줘
NotebookLM은 여러 논문을 함께 읽고 공통점과 차이점을 분석하는 작업에 강점을 보이는 것으로 알려져 있다.
첫 번째 비교, 연구 흐름 분석
가장 먼저 연구 흐름 분석 결과를 비교했다.
사람이 직접 작성한 경우
논문을 읽고 연도별 흐름을 정리했다.
초기 연구
확장 연구
최근 연구
신기술 적용 연구
등으로 분류했다.
NotebookLM 역시 비슷한 흐름을 제시했다.
특히 흥미로웠던 부분은 여러 논문에서 반복적으로 등장하는 연구주제를 자동으로 묶어준다는 점이었다.
예를 들어
동물복지 연구
조직관리 연구
직무만족 연구
행동분석 연구
등을 별도 주제로 정리했다.
전체적인 흐름 파악 속도는 NotebookLM이 압도적으로 빨랐다.
두 번째 비교, 핵심 연구자 추출
연구자 입장에서는 어떤 학자가 해당 분야를 주도하고 있는지 확인하는 것도 중요하다.
NotebookLM에게 다음 질문을 했다.
"가장 자주 인용되는 연구자와 주요 연구를 정리해줘."
결과는 꽤 정확했다.
반복적으로 등장하는 연구자들을 찾아냈다.
다만 사람이 직접 검토한 경우에는 연구자의 영향력이나 학문적 맥락까지 이해할 수 있었지만 NotebookLM은 주로 빈도 중심으로 분석하는 경향이 있었다.
세 번째 비교, 연구 공백 찾기
문헌고찰에서 가장 중요한 작업 중 하나가 연구 공백 도출이다.
연구 공백은 새로운 연구주제를 제안하는 근거가 된다.
NotebookLM은 다음과 같은 방식으로 공백을 제시했다.
특정 집단 연구 부족
장기 연구 부족
지역 비교 연구 부족
실험 연구 부족
흥미로운 점은 실제 사람이 정리한 결과와 상당 부분 일치했다는 것이다.
다만 최종적으로 어떤 공백이 학문적으로 의미가 있는지는 연구자의 판단이 필요했다.
문헌고찰은 단순한 요약이 아니라 해석과 논증의 과정이기 때문이다.
문헌고찰 품질 비교
가장 중요한 비교 항목이었다.
NotebookLM이 생성한 문헌고찰은 구조적으로 상당히 깔끔했다.
주제별 분류도 잘 이루어졌다.
예를 들면
연구 배경
주요 연구 흐름
연구 결과 비교
한계점
향후 연구방향
등으로 정리되었다.
하지만 실제 연구자가 작성한 문헌고찰은 차이가 있었다.
사람은 단순히 내용을 나열하지 않는다.
연구 간의 연결관계를 설명하고
결과가 왜 달라졌는지 해석하며
학문적 의미를 부여한다.
이 부분은 NotebookLM보다 사람이 우수했다.
실제 오류 사례
실험 과정에서 몇 가지 한계도 확인했다.
첫 번째
유사한 개념을 동일 개념으로 묶어버리는 경우가 있었다.
두 번째
연구자의 주장과 연구결과를 혼동하는 사례가 있었다.
세 번째
연구 방법론의 세부 차이를 충분히 반영하지 못했다.
실제로 NotebookLM 관련 연구에서도 결과 품질은 업로드된 자료의 질과 사용자의 프롬프트 작성 능력에 크게 영향을 받는다고 보고되었다.
시간 절약 효과는 얼마나 될까?
이번 실험에서 가장 놀라웠던 부분이다.
사람이 직접 수행한 경우
논문 30편 정리
연구 흐름 분석
문헌고찰 초안 작성까지
약 18시간 정도가 소요되었다.
반면 NotebookLM을 활용한 경우
논문 업로드
주제 분석
연구 흐름 정리
초안 생성까지
약 3시간 내외로 가능했다.
물론 최종 검토와 수정은 필요했다.
하지만 초기 작업 시간을 크게 단축할 수 있었다.
여러 가이드와 사례에서도 문헌검토 초기 단계의 시간 절약 효과가 보고되고 있다.
연구자 입장에서 느낀 장점
실험을 통해 확인한 NotebookLM의 장점은 다음과 같았다.
첫째
연구 흐름 파악이 빠르다.
둘째
공통 주제를 쉽게 찾을 수 있다.
셋째
상반된 연구결과를 비교하기 좋다.
넷째
초기 문헌고찰 초안 작성이 가능하다.
다섯째
연구 공백 탐색에 도움이 된다.
특히 석사과정이나 박사과정 학생들에게 유용할 것으로 보였다.
연구자 입장에서 느낀 한계
반면 한계도 명확했다.
첫째
학문적 해석은 부족하다.
둘째
이론적 논증은 사람이 필요하다.
셋째
연구 중요도 판단은 어렵다.
넷째
원문 검증은 필수다.
결국 AI가 연구자를 대체하는 것이 아니라 연구자의 생산성을 높이는 도구로 활용하는 것이 적절해 보였다.
최종 결론
이번 NotebookLM과 사람의 문헌고찰 비교 실험 결과는 상당히 흥미로웠다.
연구 흐름 분석, 주제 분류, 공통 결과 정리, 연구 공백 탐색에서는 NotebookLM이 매우 뛰어난 성능을 보여주었다.
특히 문헌고찰 초안 작성 단계에서는 상당한 시간 절약 효과를 확인할 수 있었다.
반면 학문적 해석, 논리 전개, 연구의 중요성 평가와 같은 고차원적인 작업에서는 여전히 연구자의 역할이 중요했다.
결론적으로 NotebookLM은 문헌고찰을 대신 작성해주는 도구라기보다 연구자가 더 빠르고 체계적으로 문헌을 이해하도록 돕는 연구 보조도구에 가깝다.
석사논문, 박사논문, 연구보고서를 준비하는 연구자라면 문헌고찰의 출발점으로 활용할 가치가 충분히 있으며, 최종 원고는 반드시 연구자의 검토와 해석을 거쳐 완성하는 것이 가장 효과적인 활용 방법이라고 생각한다.