AI 3분 소요

새 모델이 더 똑똑한데 왜 쓰기는 더 답답할까 — Opus 5 체감 성능 논쟁

새 AI 모델이 나올 때마다 개발자 커뮤니티에서 똑같은 장면이 반복됩니다. 벤치마크 점수는 전작을 확실히 넘어섰는데 정작 며칠 써본 사람들은 “예전이 더 나았다"고 말합니다. Opus 5를 두고 벌어진 최근 논쟁도 그 패턴 그대로였는데요. 재밌는 건 이게 특정 모델의 문제가 아니라는 겁니다. 지난 3년간 GPT-4 터보, Claude 3.5, Gemini까지 거의 모든 주요 모델 업데이트에서 같은 일이 벌어졌습니다.

솔직히 밝혀둘 게 있습니다. 이 주제로 최근 30일치 커뮤니티 데이터를 훑어봤지만 수치로 검증할 만한 신규 스레드는 못 찾았습니다. 그래서 특정 논쟁을 실시간으로 중계하는 대신, 이 현상이 왜 자꾸 반복되는지 뜯어보는 쪽으로 방향을 잡았습니다.

벤치마크가 측정하지 않는 것

벤치마크는 대부분 단발성 문제를 잽니다. 코딩 벤치마크의 대표 격인 SWE-bench는 깃허브 이슈 하나를 주고 패치를 만들게 합니다. 문제가 명확하고 정답도 하나입니다. 채점 기준이 확실하죠.

그런데 실제 개발자가 모델과 보내는 시간은 그렇지 않습니다. 애매한 요구사항을 던지고, 절반쯤 마음에 안 드는 결과물을 받고, “아니 그게 아니라"를 세 번쯤 반복합니다. 여기서 중요한 건 정답률이 아니라 수정 가능성입니다. 내 의도를 얼마나 빨리 알아듣느냐, 지적했을 때 얼마나 정확히 고치느냐.

벤치마크는 이 축을 거의 못 잽니다. 그래서 점수가 오르는데 체감은 나빠지는 구간이 생깁니다. 첫 시도에서 더 정교한 답이 나오지만, 그 답이 내가 원한 방향이 아닐 때 되돌리기가 더 어려워지는 식입니다.

근면함이 만드는 마찰

최근 모델들의 공통된 변화가 하나 있습니다. 더 많이 생각하고 더 많이 확인합니다. 설명도 길어졌습니다. 안전성과 정확도만 놓고 보면 분명한 개선입니다.

문제는 이게 반복 작업에서 쌓인다는 겁니다. 간단한 리팩터링 하나 시켰는데 관련 파일 다섯 개를 먼저 읽고, 영향 범위를 정리해 보고하고, 확인을 요청합니다. 한 번이면 꼼꼼하다 싶지만 하루에 마흔 번이면 답답합니다.

개발자들이 자주 하는 말이 있습니다. “예전 모델은 틀려도 빨랐다.” 틀린 결과를 빨리 받아서 내가 고치는 쪽이 맞는 결과를 느리게 받는 것보다 나을 때가 있습니다. 코드베이스를 이미 잘 아는 사람이라면 특히요.

기준선은 이미 올라가 있다

체감 성능 논쟁에서 가장 자주 빠지는 변수가 기대치입니다.

전작을 6개월 썼다면 그 모델의 실패 패턴을 몸으로 익힌 상태입니다. 어떤 프롬프트가 먹히는지, 어떤 요청은 피해야 하는지 감이 있습니다. 새 모델은 그 노하우가 초기화됩니다. 실력이 같아도 나한테는 처음 만나는 동료인 셈입니다.

하나 더 있습니다. 전작 초기에 느꼈던 감탄은 시간이 지나면 당연한 것이 됩니다. 그래서 새 모델을 평가할 때 비교 대상은 “출시 당시의 전작"이 아니라 “내가 6개월간 길들인 전작"이 됩니다. 공정한 비교가 아닌데도 체감은 그렇게 굳습니다.

개인화되지 않은 인프라 변수

여기까지는 착시에 가까운 이야기입니다. 그렇다고 체감 저하가 전부 착각이라는 뜻은 아닙니다.

서비스 쪽 변수도 실제로 있습니다. 출시 직후 트래픽이 몰리면 추론 자원 배분을 조정하고, 컨텍스트 처리 방식이나 시스템 프롬프트를 조용히 손보기도 합니다. 사용자한테 이런 변경을 알려주는 일은 드뭅니다. “어제는 잘 되던 게 오늘은 안 된다"는 경험이 진짜로 생기는 이유입니다.

문제는 개인이 이걸 증명하기 어렵다는 겁니다. 같은 프롬프트를 넣어도 출력이 매번 다르니, 저하를 느낀 사람은 재현 사례를 내놓기 어렵고 제공자는 벤치마크 수치로 반박합니다. 양쪽 다 자기 근거로는 맞는 말을 하는데 대화가 겉돕니다. 이 논쟁이 매번 소모적으로 끝나는 것도 그래서입니다.

그래서 어떻게 봐야 할까

방법은 하나뿐입니다. 자기만의 평가 세트를 만드는 겁니다.

거창할 필요 없습니다. 내 코드베이스에서 실제로 자주 하는 작업 열 개를 골라두고 새 모델이 나올 때마다 돌려보면 됩니다. 공개 벤치마크보다 이쪽이 훨씬 정확합니다. 내 작업 분포를 반영하니까요.

최소 일주일은 써보는 게 좋습니다. 첫 이틀의 이질감은 대부분 적응 비용입니다. 그 시기를 지나서도 남아 있는 불편함이 진짜 신호입니다.

새 모델이 답답하게 느껴진다면 모델이 나빠져서일 수도 있고, 내 사용 습관이 전작에 최적화돼 있어서일 수도 있습니다. 둘을 가르는 건 결국 데이터입니다. 새 모델 나올 때 다들 뭘 기준으로 판단하시는지 궁금합니다. 감이 아니라 기록으로 남겨두면 다음 모델이 나왔을 때 훨씬 편합니다.

AI LLM 개발자 Claude 벤치마크

댓글

    댓글을 불러오는 중...