ChatGPT에게 같은 보고서를 5번 작성시켜봤다, 결과는 얼마나 달라질까?

 

ChatGPT에게 같은 보고서를 5번 작성시켜봤다, 결과는 얼마나 달라질까?

생성형 AI를 업무에 활용하는 사람들이 가장 자주 하는 질문 중 하나가 있다.

"같은 질문을 여러 번 하면 항상 같은 답변이 나올까?"

실제로 ChatGPT를 사용하다 보면 비슷한 질문을 입력했는데도 답변이 조금씩 달라지는 경우를 경험하게 된다. 어떤 때는 보고서 구조가 달라지고, 어떤 때는 사례가 바뀌거나 표현 방식이 달라지기도 한다.

그렇다면 실제 업무에서 활용할 경우 이러한 차이는 어느 정도일까?

특히 보고서 작성 업무에서는 일관성이 매우 중요하다. 공공기관 보고서, 연구보고서, 사업계획서, 회의 결과보고서 등은 일정한 품질과 구조를 유지해야 하기 때문이다.

이번 글에서는 동일한 주제의 보고서를 ChatGPT에게 5번 작성하게 한 뒤 결과를 비교 분석해봤다.

단순히 "답이 다르다"는 수준이 아니라 다음 항목을 중심으로 실제 실험을 진행했다.

  • 답변 일관성 분석

  • 보고서 품질 차이

  • 프롬프트 영향 분석

  • 실무 활용 가능성 검토

최근 AI 활용 사례는 많지만 실제 비교 실험 데이터는 생각보다 많지 않다. 그래서 직접 테스트를 진행하고 결과를 정리해보았다.

왜 이런 실험을 진행했을까?

많은 직장인들이 ChatGPT를 업무에 활용하고 있다.

대표적으로 다음과 같은 작업이다.

  • 사업계획서 작성

  • 정책보고서 초안 작성

  • 회의록 정리

  • 공문 작성

  • 연구보고서 작성

  • 시장조사 보고서 작성

그런데 같은 주제를 여러 번 질문하면 결과가 조금씩 달라진다는 이야기가 많다.

실제 업무에서는 재현성이 중요하다.

만약 오늘 작성한 보고서와 내일 작성한 보고서가 완전히 다르다면 실무 활용에 문제가 생길 수 있다.

그래서 이번 실험에서는 같은 조건에서 동일한 보고서를 5회 생성하여 결과를 비교했다.

실험 환경

실험에 사용한 보고서 주제는 다음과 같았다.

"지역사회 환경보호 캠페인 추진 계획 보고서"

입력 프롬프트는 동일하게 유지했다.

추가 조건도 동일하게 적용했다.

  • 보고서 형식

  • 2000자 이상

  • 추진 배경 포함

  • 기대효과 포함

  • 추진 일정 포함

모든 조건을 동일하게 유지한 상태에서 5회 반복 생성했다.

첫 번째 결과, 전체 구조는 거의 동일했다

가장 먼저 확인한 것은 보고서의 큰 구조였다.

흥미롭게도 5개의 결과는 상당히 유사했다.

대부분 다음 순서를 유지했다.

  • 추진 배경

  • 사업 목적

  • 추진 계획

  • 기대 효과

  • 결론

즉, 보고서의 뼈대는 거의 동일하게 생성되었다.

이는 ChatGPT가 일반적인 보고서 구조를 학습하고 있기 때문으로 보인다.

실제 업무에서도 기본 구조는 안정적으로 생성되는 편이었다.

두 번째 결과, 세부 내용은 달랐다

구조는 비슷했지만 세부 내용은 차이가 있었다.

예를 들어 기대효과 항목에서

첫 번째 결과는

환경 인식 개선

지역사회 참여 확대

탄소 배출 감소

를 강조했다.

반면 세 번째 결과는

시민 참여 활성화

환경교육 확대

지속가능성 확보

를 중심으로 설명했다.

핵심 방향은 비슷했지만 표현과 세부 내용은 달랐다.

세 번째 결과, 문장 표현이 달랐다

문장 표현에서도 차이가 나타났다.

예를 들어

"지역 주민의 적극적인 참여를 유도한다."

라는 문장이

다른 결과에서는

"주민 참여 기반의 환경보호 활동을 확대한다."

로 표현되었다.

의미는 비슷하지만 문장 자체는 달랐다.

이러한 특징은 보고서를 반복 작성할 때 다양성을 제공하는 장점이 될 수도 있다.

네 번째 결과, 사례 제시 방식이 달랐다

흥미로운 부분은 사례 제시 방식이었다.

어떤 결과는 국내 사례를 중심으로 설명했고

어떤 결과는 해외 사례를 언급했다.

또 어떤 결과는 구체적인 예시 없이 개념 중심으로 설명했다.

즉, 사례 구성은 상당한 변동성을 보였다.

품질 차이는 얼마나 있었을까?

많은 사람들이 궁금해하는 부분이다.

결론부터 말하면 품질 차이는 생각보다 크지 않았다.

5개 결과를 비교한 결과

전반적인 수준은 비슷했다.

다만 다음과 같은 차이는 존재했다.

가장 우수했던 결과

  • 논리 전개가 자연스러움

  • 문단 연결이 좋음

  • 내용이 구체적임

상대적으로 부족했던 결과

  • 표현이 반복됨

  • 세부 내용이 다소 추상적임

  • 사례가 부족함

즉, 품질 차이는 존재하지만 극단적인 수준은 아니었다.

프롬프트가 미치는 영향

이번 실험에서 가장 큰 영향을 준 요소는 프롬프트였다.

동일한 주제라도 프롬프트를 조금만 수정하면 결과가 크게 달라졌다.

예를 들어

"보고서를 작성해줘"

라고 입력한 경우와

"공공기관 제출용 정책보고서 형식으로 작성해줘"

라고 입력한 경우는 결과가 확연히 달랐다.

후자가 훨씬 체계적이었다.

즉, 결과 차이의 상당 부분은 AI 자체보다 프롬프트 설계에서 발생했다.

추가 실험, 프롬프트를 구체화해보니

이번에는 조건을 더욱 상세하게 입력했다.

추가 조건은 다음과 같았다.

  • 표 포함

  • 예산 계획 포함

  • KPI 제시

  • 위험요인 분석

결과는 눈에 띄게 개선되었다.

보고서 완성도가 높아졌다.

특히 실무 보고서에 가까운 형태로 발전했다.

이 과정에서 확인한 점은 명확했다.

좋은 결과는 좋은 프롬프트에서 나온다는 것이다.

실제 업무에서 활용해본 후기

실험 후 실제 업무 환경을 가정해 적용해봤다.

회의 결과보고서

사업 추진계획서

교육 운영계획서

등 다양한 문서를 작성해봤다.

결과적으로 가장 효율적인 방법은 다음과 같았다.

첫 번째 결과 생성

두 번째 결과 생성

세 번째 결과 생성

좋은 부분만 선택

최종 통합

이 방식이 가장 높은 품질을 보여주었다.

사람이 작성한 보고서와 비교

사람이 작성한 보고서도 완벽하게 동일하지는 않다.

같은 사람이 하루 간격으로 작성해도 표현과 구성은 달라질 수 있다.

ChatGPT 역시 비슷했다.

다만 AI는 구조적 일관성이 높았다.

반면 사람은 맥락 이해와 조직 특성 반영에서 강점을 보였다.

실제 활용 시 장점

실험을 통해 확인한 장점은 다음과 같았다.

첫째

초안 작성 속도가 매우 빠르다.

둘째

여러 버전을 한 번에 확보할 수 있다.

셋째

아이디어 발굴에 유리하다.

넷째

문장 표현 다양성을 확보할 수 있다.

다섯째

보고서 구조를 쉽게 만들 수 있다.

실제 활용 시 단점

반면 단점도 존재했다.

첫째

세부 수치는 직접 검증해야 한다.

둘째

조직 특유의 표현은 반영되지 않는다.

셋째

법령과 규정은 반드시 확인해야 한다.

넷째

버전마다 세부 내용이 달라질 수 있다.

따라서 최종 검토는 필수다.

어떤 사람이 가장 활용하기 좋을까?

이번 실험을 통해 다음 사용자에게 특히 적합하다고 판단했다.

  • 공무원

  • 공공기관 직원

  • 연구원

  • 대학원생

  • 기획 담당자

  • 마케터

  • 중소기업 관리자

보고서 작성 빈도가 높을수록 활용 가치가 커졌다.

최종 결론

이번 실험 결과 ChatGPT는 같은 보고서를 5번 작성하더라도 완전히 동일한 결과를 생성하지는 않았다.

하지만 전체 구조와 논리 흐름은 상당히 일관되게 유지되었다.

차이는 주로 문장 표현, 사례 구성, 세부 설명 수준에서 발생했다.

또한 보고서 품질 자체는 큰 차이가 없었으며, 오히려 여러 버전을 비교해 장점을 결합하면 더 좋은 결과를 만들 수 있었다.

무엇보다 가장 큰 변수는 AI가 아니라 프롬프트였다.

구체적이고 명확한 프롬프트를 사용할수록 결과 품질은 크게 향상되었다.

따라서 ChatGPT를 보고서 작성에 활용할 때는 한 번의 결과만 사용하는 것보다 여러 버전을 생성하고 비교한 뒤 최종 문서를 완성하는 방식이 가장 효과적이라고 판단된다.

실제 업무 현장에서도 ChatGPT는 보고서를 대신 작성하는 도구가 아니라 보고서 작성 시간을 단축하고 아이디어를 제공하는 생산성 향상 도구로 활용하는 것이 가장 현실적인 방법이라고 생각한다.