AI 검색 도구 5종을 같은 질문으로 비교해봤다, ChatGPT·Gemini·Perplexity·Felo·Claude의 답변은 얼마나 달랐을까?

 

AI 검색 도구 5종을 같은 질문으로 비교해봤다, ChatGPT·Gemini·Perplexity·Felo·Claude의 답변은 얼마나 달랐을까?

최근에는 궁금한 내용을 찾기 위해 검색창에 키워드를 입력하는 대신 AI에게 질문하는 경우가 많아졌다.

예전에는 여러 검색 결과를 직접 열어보고 필요한 내용을 찾아야 했다면 이제는 AI가 여러 정보를 정리해서 하나의 답변으로 만들어준다.

그런데 여기서 한 가지 궁금한 점이 생겼다.

같은 질문을 ChatGPT, Gemini, Perplexity, Felo, Claude에게 동시에 입력하면 과연 비슷한 답변이 나올까?

검색 결과가 다르다면 그 이유는 무엇일까?

그리고 어떤 AI가 더 정확하다고 단순하게 판단할 수 있을까?

이번에는 이 궁금증을 확인하기 위해 AI 검색 및 조사 기능을 활용할 수 있는 5개 서비스를 동일한 조건에서 비교하는 실험을 진행했다.

비교 대상은 ChatGPT, Gemini, Perplexity, Felo, Claude다.

이번 실험에서 가장 중요하게 생각한 것은 특정 AI를 무조건 좋거나 나쁘다고 평가하는 것이 아니었다.

같은 질문에 어떤 자료를 찾고, 어떤 방식으로 답변을 구성하며, 출처를 얼마나 확인하기 쉽게 보여주는지를 비교하는 것이 목적이었다.

왜 같은 질문으로 비교했을까?

AI 서비스마다 기본적인 성격이 다르다.

어떤 서비스는 대화와 문서 작업에 강하고, 어떤 서비스는 웹 검색과 출처 확인에 편리하다.

또 어떤 서비스는 긴 문서를 분석하거나 복잡한 질문을 단계적으로 처리하는 데 초점을 맞추고 있다.

따라서 단순히 "어떤 AI가 가장 좋은가?"라는 질문은 정확한 비교 방법이라고 보기 어렵다.

사용 목적에 따라 결과가 달라질 수 있기 때문이다.

그래서 이번에는 동일한 질문을 5개 서비스에 입력하는 방식으로 조건을 통일했다.

비교 항목도 미리 정했다.

첫째는 답변의 정확성이다.

둘째는 최신 정보 반영 여부다.

셋째는 출처 확인의 편리성이다.

넷째는 답변의 구체성이다.

다섯째는 추가 질문을 했을 때의 대응 능력이다.

이렇게 평가 기준을 정해놓으면 단순히 답변이 마음에 드는지를 기준으로 판단하는 것을 어느 정도 줄일 수 있다.

실험에 사용한 질문은 어떻게 정했을까?

질문 하나만 가지고 AI를 비교하면 결과가 특정 질문의 특성에 영향을 받을 수 있다.

그래서 서로 다른 유형의 질문을 준비하는 방식으로 테스트하는 것이 적절하다고 판단했다.

예를 들어 다음과 같은 유형이다.

최신 정보가 필요한 질문

전문적인 설명이 필요한 질문

자료 출처가 중요한 질문

비교 분석이 필요한 질문

복잡한 내용을 정리해야 하는 질문

실제 업무에 활용할 수 있는 정보를 요구하는 질문

이렇게 질문 유형을 나누면 단순한 지식 문제와 실제 검색형 문제를 구분할 수 있다.

특히 최신 정보가 필요한 질문에서는 AI의 웹 검색 기능이 중요한 변수가 된다.

현재 ChatGPT는 웹 검색을 통해 최신 정보를 확인하고 관련 출처를 제시할 수 있다. OpenAI 역시 검색 결과의 인용을 직접 확인하고 원문이 답변을 실제로 뒷받침하는지 검토할 것을 안내하고 있다.

Gemini 역시 Deep Research를 통해 웹을 검색하고 여러 출처를 분석하는 기능을 제공한다. Google은 Gemini Deep Research에서 Google Search를 기본 정보원으로 사용할 수 있고, 필요하면 Gmail이나 Drive 같은 추가 자료원을 선택할 수 있다고 안내하고 있다.

따라서 이번 비교에서는 단순히 답변 내용만 보는 것이 아니라 AI가 어떤 방식으로 정보를 수집하고 근거를 제시하는지도 함께 살펴봤다.

첫 번째 비교, ChatGPT

ChatGPT의 가장 큰 특징은 질문과 답변을 자연스럽게 이어가는 데 있었다.

처음 질문에 답한 뒤 "그 내용을 표로 정리해줘", "반대되는 사례도 찾아줘", "출처를 확인해줘"와 같이 추가 질문을 이어가기가 편했다.

특히 처음에는 일반적인 설명을 요청하고 이후에 구체적인 조건을 추가하는 방식으로 사용하기 좋았다.

웹 검색을 활성화하면 최신 정보와 관련 출처를 기반으로 답변할 수 있다는 점도 장점이었다.

하지만 여기서 중요한 점이 하나 있었다.

답변이 자연스럽게 작성되어 있다고 해서 모든 내용이 자동으로 검증되는 것은 아니었다.

특히 논문 제목이나 연구 결과처럼 정확성이 중요한 정보는 반드시 원문을 확인하는 것이 필요했다.

실제로 AI 챗봇의 참고문헌 생성 정확성을 조사한 연구에서도 AI가 제시하는 학술 참고문헌에 오류가 발생할 수 있다는 결과가 보고된 바 있다.

따라서 연구 목적으로 사용할 때는 AI 답변 자체보다 원출처를 확인하는 습관이 중요하다.

두 번째 비교, Gemini

Gemini는 웹 검색과 Google 생태계와의 연결성을 함께 살펴볼 필요가 있었다.

특히 최신 정보를 찾는 질문에서는 Google Search를 기반으로 정보를 조사할 수 있다는 점이 눈에 띄었다.

Deep Research를 사용하면 질문을 입력한 뒤 조사 계획을 생성하고, 여러 출처를 분석한 보고서 형태의 결과를 만들어낼 수 있다. Google의 안내에 따르면 Deep Research는 복잡한 주제를 조사할 때 여러 출처를 분석하며 일반적으로 몇 분 정도의 시간이 걸릴 수 있다.

실제 비교에서는 단순한 한두 문장의 질문보다 "여러 자료를 조사하고 종합해달라"는 유형에서 이런 기능의 차이가 더욱 잘 드러났다.

또한 Gmail이나 Drive 등 Google Workspace와 연계할 수 있는 환경이라면 업무 자료를 활용한 조사 방식도 생각해볼 수 있다.

다만 Gemini 역시 AI가 정리한 내용이라는 점은 동일하다.

따라서 중요한 숫자나 정책 내용, 연구 결과 등은 원문을 다시 확인하는 과정이 필요했다.

세 번째 비교, Perplexity

Perplexity는 처음부터 검색형 AI라는 느낌이 강했다.

질문을 입력하면 관련 웹 자료를 찾아서 답변을 구성하고 출처를 함께 확인할 수 있도록 만들어져 있다.

따라서 "어떤 자료가 있는지 찾아보자"라는 단계에서 특히 편리했다.

예를 들어 새로운 연구 주제를 조사한다고 가정해보자.

처음에는 어떤 논문이나 보고서가 존재하는지 알기 어렵다.

이때 검색어를 여러 개 입력하면서 자료를 찾는 것보다 AI에게 관련 자료를 찾아달라고 요청하고 결과에 포함된 출처를 하나씩 확인하는 방식이 효율적일 수 있다.

다만 여기에서도 중요한 원칙이 있었다.

AI가 보여준 출처를 그대로 믿는 것이 아니라 반드시 원문을 열어봐야 한다는 것이다.

검색 결과에 포함된 자료라고 해서 해당 자료가 내가 찾는 주장과 정확히 일치한다고 보장되는 것은 아니기 때문이다.

네 번째 비교, Felo

Felo는 한국어로 검색하고 자료를 조사하는 사용자라면 비교해볼 만한 서비스였다.

이번 비교에서는 한국어 질문을 중심으로 테스트했다.

특히 여러 자료를 하나의 답변으로 정리하는 과정과 검색 결과의 활용성을 살펴봤다.

Felo를 사용할 때는 단순히 질문 하나를 던지는 것보다 원하는 결과의 형태를 구체적으로 지정하는 것이 중요했다.

예를 들어

"관련 자료를 찾아줘"

라고 질문하는 것보다

"2025년 이후 자료를 중심으로 찾아서 핵심 주장과 출처를 표로 정리해줘"

와 같이 조건을 추가하는 편이 결과를 비교하기 쉬웠다.

이것은 Felo에만 해당되는 이야기는 아니다.

AI 검색 도구를 사용할 때는 질문을 얼마나 구체적으로 작성하느냐가 결과의 품질에 영향을 줄 수 있기 때문이다.

다섯 번째 비교, Claude

Claude는 일반적인 검색엔진이라기보다 긴 내용을 이해하고 정리하는 연구 보조 도구라는 관점에서 비교하는 것이 적절했다.

웹에서 새로운 자료를 발견하는 것뿐만 아니라 이미 확보한 문서를 분석하거나 여러 자료를 비교해야 하는 상황에서 활용성이 높았다.

예를 들어 논문 10편을 확보한 상태라면 단순히 "관련 논문을 찾아줘"라고 질문하는 것보다 해당 논문들을 제공하고

"10편의 연구 목적과 연구방법을 비교해줘"

"서로 다른 연구 결과가 나온 이유를 분석해줘"

"공통적으로 언급되는 연구 한계를 찾아줘"

와 같은 질문을 하는 방식이 훨씬 유용했다.

결국 Claude는 검색 자체보다 확보한 자료를 활용해 생각을 정리하는 과정에서 장점이 드러났다.

같은 질문인데 왜 답변이 달랐을까?

5개 AI에 동일한 질문을 입력했는데도 결과에는 상당한 차이가 있었다.

가장 큰 이유는 AI마다 사용하는 검색 방식과 정보 처리 과정이 다르기 때문이다.

검색하는 자료의 범위가 다르고

검색어를 만드는 방식이 다르며

정보를 정리하는 방법도 다르다.

같은 웹페이지를 참고하더라도 어떤 내용을 중심으로 답변을 구성하느냐에 따라 결과가 달라질 수 있다.

따라서 AI 검색 결과가 서로 다르다는 것은 반드시 어느 하나가 틀렸다는 의미는 아니다.

오히려 서로 다른 결과를 비교하면 중요한 정보를 발견할 가능성도 있다.

실제 연구에 적용한다면 어떻게 사용할까?

연구를 시작한다고 가정해보자.

처음부터 하나의 AI에 모든 일을 맡기는 방법보다는 단계별로 도구를 나누는 방식이 효율적이었다.

첫 번째 단계는 탐색이다.

연구 주제와 관련된 최신 논문이나 보고서를 찾는다.

두 번째 단계는 검증이다.

AI가 제시한 출처를 직접 열어 원문을 확인한다.

세 번째 단계는 자료 축적이다.

실제로 사용할 논문과 보고서를 PDF 등으로 확보한다.

네 번째 단계는 문서 분석이다.

확보한 자료를 AI에 제공하고 연구 목적, 방법, 결과, 한계를 비교한다.

다섯 번째 단계는 사람이 최종적으로 판단하는 것이다.

이 과정을 거치면 AI가 연구자를 대신하는 것이 아니라 연구 과정의 반복 작업을 줄이는 보조 도구로 활용할 수 있다.

실제 사용하면서 가장 중요하다고 느낀 점

이번 비교에서 가장 크게 느낀 부분은 "어떤 AI가 가장 좋은가?"라는 질문 자체가 별로 중요하지 않다는 것이다.

예를 들어 최신 웹 자료를 찾는 것이 목적이라면 검색 기능과 출처 확인이 중요하다.

반면 이미 확보한 논문을 비교하는 것이 목적이라면 장문 문서 분석 능력이 더 중요하다.

보고서 초안을 작성한다면 문서 구조화와 글쓰기 능력이 중요하다.

결국 목적에 따라 평가 기준도 달라져야 한다.

AI 검색 결과를 그대로 믿으면 안 되는 이유

이번 실험에서 공통적으로 확인할 수 있었던 부분이 있다.

AI는 매우 그럴듯한 답변을 만들어낼 수 있지만 그 자체가 사실 확인을 의미하지는 않는다는 것이다.

특히 학술자료를 검색할 때는 더욱 주의해야 한다.

논문 제목

저자명

발행연도

학술지명

연구 결과

통계 수치

등은 반드시 원문을 확인해야 한다.

ChatGPT의 공식 안내에서도 검색 결과의 출처를 직접 열어 해당 출처가 답변을 뒷받침하는지 확인할 것을 권장하고 있다.

결국 AI를 잘 사용하는 사람은 AI의 답변을 무조건 믿는 사람이 아니라 AI가 찾아준 정보를 다시 확인할 줄 아는 사람에 가깝다.

다섯 가지 AI를 함께 사용한다면?

개인적으로는 다음과 같은 방식으로 역할을 나누는 것이 가장 현실적이라고 생각한다.

ChatGPT는 질문을 발전시키고 결과를 정리하는 용도

Gemini는 Google 검색과 연계한 최신 정보 조사 용도

Perplexity는 웹 자료 탐색과 출처 확인 용도

Felo는 한국어 중심의 자료 탐색과 검색 활용 용도

Claude는 긴 문서와 연구자료를 분석하고 구조화하는 용도

물론 이것은 고정된 정답이 아니다.

각 서비스의 기능과 요금제, 모델, 검색 환경은 계속 바뀌기 때문에 실제 사용할 때는 현재 제공되는 기능을 확인해야 한다.

최종 결론

이번 비교를 통해 확인한 것은 AI 검색 도구마다 답변 방식과 활용 목적에 차이가 있다는 점이었다.

같은 질문을 입력해도 검색 과정과 정보 구성 방식이 달라 결과가 완전히 동일하게 나오지 않았다.

따라서 단순히 답변의 문장이 더 자연스럽거나 길다는 이유만으로 특정 AI가 더 정확하다고 판단하는 것은 적절하지 않았다.

오히려 중요한 것은 질문의 목적을 먼저 정하는 것이었다.

자료를 찾는 것인지

최신 정보를 확인하는 것인지

논문을 비교하는 것인지

긴 보고서를 분석하는 것인지

보고서를 작성하는 것인지에 따라 적합한 도구가 달라진다.

이번 실험을 하면서 가장 현실적인 활용법은 AI 하나에 모든 작업을 맡기는 것이 아니라 각각의 강점을 나눠 사용하는 것이었다.

그리고 마지막으로 가장 중요한 것은 사람이 직접 원문과 출처를 확인하는 과정이다.

AI는 자료조사 시간을 줄여줄 수 있지만 연구나 업무에서 최종적인 판단까지 대신해주는 것은 아니다.

결국 AI 검색 도구를 잘 활용한다는 것은 가장 좋은 AI 하나를 찾는 것이 아니라 필요한 작업에 맞는 도구를 선택하고, 여러 결과를 비교하고, 중요한 정보는 직접 검증하는 능력을 갖추는 것이라고 생각한다.