AI 5개에 같은 질문을 던졌더니, 67%가 서로 다른 답을 했다
요즘 ChatGPT, Claude, Gemini 같은 AI에게 뭔가를 물어보고 그 답을 그대로 믿는 분들 많으시죠. 그런데 같은 질문을 5개의 최첨단 AI에게 던졌더니 10번 중 7번꼴로 답이 서로 달랐다는 연구 결과가 나왔습니다. 우리가 무심코 신뢰하는 그 답변, 정말 정답일까요?
67%라는 숫자가 의미하는 것
연구진은 실제 팩트체커들이 검증한 1,000개의 주장을 가져와 다섯 개의 프론티어 LLM에게 동일하게 물어봤습니다. 결과는 충격적이었는데요. 무려 67%의 질문에서 모델들이 서로 다른 판단을 내렸습니다.
이건 단순히 “AI가 가끔 틀린다"는 수준의 이야기가 아닙니다. 같은 회사가 만든 다른 버전도 아니고, OpenAI, Anthropic, Google 같은 업계 최정상 모델들끼리도 의견이 갈렸다는 뜻입니다. 어떤 모델은 “사실"이라고 했고, 어떤 모델은 “거짓"이라고 한 거죠.
“어느 AI를 믿을 것인가"라는 새로운 문제
이 연구가 진짜로 던지는 질문은 따로 있습니다. 바로 “우리는 어떤 모델의 답을 채택해야 하는가?"입니다.
지금까지 사람들은 막연하게 “ChatGPT가 그렇게 말했어"라거나 “Claude가 알려준 거야"라고 인용해왔는데요. 만약 같은 질문에 모델마다 다른 답이 나온다면, 그 인용은 사실상 뽑기 결과를 인용한 것과 다름없습니다. 그 시점, 그 모델, 그 프롬프트가 우연히 만들어낸 답일 뿐이라는 거죠.
특히 뉴스 기사 작성, 법률 검토, 의료 정보 같은 영역에서 이 문제는 심각합니다. “AI가 검증했다"는 말이 별 의미가 없어지니까요.
왜 모델마다 답이 다를까
같은 인터넷, 비슷한 데이터로 학습했을 텐데 왜 결과가 이렇게 갈릴까요. 몇 가지 이유가 있습니다.
첫째, 학습 데이터의 차이입니다. 각 회사가 어떤 데이터를 우선시했는지, 어떤 출처를 신뢰했는지가 다릅니다. 둘째, RLHF(인간 피드백 강화학습) 방향성이 다릅니다. 같은 정보라도 “조심스럽게 답하라"고 학습된 모델과 “단호하게 답하라"고 학습된 모델은 결론이 갈릴 수 있습니다. 셋째, 안전 가드레일의 강도가 다릅니다. 어떤 모델은 논쟁적 주제에 대해 판단을 유보하고, 어떤 모델은 명확히 입장을 내립니다.
합의가 안 되는 영역의 패턴
흥미로운 건 모델들이 의견 일치를 보는 주제와 갈리는 주제 사이에 패턴이 있다는 점입니다.
명확한 과학적 사실이나 역사적 사건 같은 건 대체로 일치합니다. 반면 정치적 주장, 통계 해석, 최근 사건, 미묘한 뉘앙스가 있는 주장에서 의견이 엇갈리는 경향이 강했습니다. 즉, 우리가 진짜로 AI의 도움이 필요한 모호한 영역일수록 모델들의 답이 따로 노는 셈입니다. 가장 답이 필요한 곳에서 가장 답이 흔들린다는 아이러니죠.
그럼 우리는 어떻게 써야 할까
이 연구가 “AI를 쓰지 말라"는 결론은 아닙니다. 오히려 “AI를 쓰는 방식”을 다시 생각해보라는 메시지에 가깝습니다.
실용적인 대응책 몇 가지를 생각해볼 수 있습니다. 중요한 사실 확인이 필요할 땐 한 모델에만 의존하지 말고 2-3개 모델에 같은 질문을 던져보기. 답이 갈리면 그 자체로 “이 주제는 더 검증이 필요하다"는 신호입니다. 또한 모델의 답을 그대로 인용하기보다 출처를 직접 확인하는 습관, 그리고 “AI가 그렇게 말했다"는 표현 자체를 줄이는 것도 방법입니다.
마치며
이 연구가 보여주는 건 결국 AI는 정답 기계가 아니라 의견 기계에 가깝다는 사실입니다. 그것도 서로 의견이 다른 다섯 명이 한 방에 모여 있는 상황이죠. 우리는 그동안 그중 한 명의 말만 듣고 결정해왔는지도 모릅니다.
여러분은 마지막으로 AI 답변을 받았을 때, 그 답을 한 번 더 의심해본 적이 있으신가요? 아니면 다른 모델에도 같은 질문을 던져본 적이 있으신가요? 이번 연구는 그 작은 습관 하나가 생각보다 중요할 수 있다는 걸 알려주고 있습니다.
댓글
댓글을 불러오는 중...