AI 3분 소요

'/goal 한 줄' 넣었더니 AI가 NP-난제를 풀었다? Fable 5 vs GPT-5.6 실험 정리

요즘 AI 커뮤니티에서 은근히 뜨거운 논쟁이 하나 있습니다. 프롬프트 맨 앞에 /goal 이 문제를 최적으로 풀어라 같은 한 줄을 넣으면 모델이 정말 더 똑똑해지느냐는 겁니다. 마법의 주문처럼 들리지만, 실제로 프런티어 모델 두 개를 어려운 문제에 붙여보면 이야기가 좀 복잡해집니다. 오늘은 이 ‘지시어 프롬프팅’ 논쟁을 Fable 5와 GPT-5.6, 그리고 NP-난제라는 소재로 풀어보겠습니다.

먼저 솔직하게 말씀드릴 게 있습니다. 이 주제로 지난 30일간의 커뮤니티 데이터를 훑어봤는데, 최근에 딱 이 조합을 다룬 신선한 토론은 거의 없었습니다. 그래서 오늘 글은 특정 벤치마크 수치를 인용하기보다, 이 논쟁의 구조 자체를 뜯어보는 쪽에 무게를 두겠습니다. 숫자를 들이밀며 “이게 정답"이라고 말하는 글이 아니라는 점을 미리 알려드립니다.

‘/goal 지시어’가 대체 뭔가요

/goal 같은 지시어 프롬프팅은 개념 자체는 단순합니다. 모델에게 “네가 지금 무엇을 달성해야 하는지"를 프롬프트 최상단에 명시적으로 박아두는 방식인데요. 그냥 “이 문제 풀어줘"가 아니라, “목표: 이 최적화 문제의 전역 최적해를 찾아라. 근사해는 허용하지 않는다” 식으로 목적을 뾰족하게 선언하는 겁니다.

이게 왜 효과가 있다고 주장되냐면, 최신 추론 모델들은 내부적으로 “생각하는 시간(thinking budget)“을 스스로 배분하기 때문입니다. 목표가 명확할수록 모델이 문제를 대충 끝낼지, 아니면 오래 곱씹을지를 다르게 판단한다는 거죠. 사람도 “대충 훑어봐"와 “틀리면 큰일 나니 검산까지 해"라는 지시를 받으면 다르게 움직이지 않습니까. 비슷한 원리입니다.

왜 하필 NP-난제로 실험할까요

여기서 NP-난제(NP-hard)가 등장합니다. 비개발자분들을 위해 짧게 설명드리면, NP-난제는 “정답을 찾기는 지독하게 어렵지만, 누가 정답을 가져오면 맞는지 확인하는 건 상대적으로 쉬운” 부류의 문제들입니다. 외판원 문제(여러 도시를 최단 거리로 도는 경로 찾기)나 배낭 문제 같은 게 대표적입니다.

이런 문제가 AI 추론 실험에 이상적인 이유가 있습니다. 첫째, 정답 여부를 기계적으로 검증할 수 있습니다. 모델이 그럴듯하게 지어낸 답을 내놔도, 실제로 최적인지 아닌지 계산해보면 바로 들통납니다. 둘째, 난이도를 자유롭게 조절할 수 있습니다. 도시 5개짜리는 쉽지만 50개짜리는 지옥이 됩니다. 그래서 “지시어 한 줄이 얼마나 버티는지"를 난이도별로 깔끔하게 측정할 수 있습니다.

Fable 5와 GPT-5.6 같은 프런티어 모델을 여기 붙이는 이유도 명확합니다. 두 모델 모두 강력한 추론 능력을 내세우는데, 진짜 실력은 쉬운 문제가 아니라 “슬슬 손드는 구간"에서 갈리기 때문입니다.

지시어가 통하는 구간, 안 통하는 구간

실험류 논의에서 반복적으로 나오는 패턴이 하나 있습니다. 지시어 프롬프팅의 효과는 문제 난이도에 따라 갈린다는 겁니다.

쉬운 구간에서는 /goal을 넣든 안 넣든 큰 차이가 없습니다. 모델이 어차피 잘 풉니다. 반대로 극도로 어려운 구간에서도 차이가 흐려집니다. 지시어를 아무리 명확하게 줘도 문제 자체가 모델의 한계를 넘어서면 소용이 없으니까요. 정작 지시어가 빛을 발하는 건 그 사이, “노력하면 풀리는데 대충 하면 틀리는” 애매한 중간 구간입니다. 여기서는 목표를 명확히 박아주면 모델이 더 오래 붙들고 검산까지 하는 경향이 관찰됩니다.

여기서 Fable 5와 GPT-5.6이 반응하는 방식이 다를 수 있다는 게 흥미로운 지점입니다. 어떤 모델은 지시어에 민감하게 반응해 사고 과정을 확 늘리고, 어떤 모델은 이미 자체적으로 최선을 다하도록 튜닝돼 있어서 지시어를 줘도 별 변화가 없습니다. 즉 “어떤 프롬프트가 좋으냐"는 질문은 사실 “어떤 모델에게 어떤 프롬프트가 좋으냐"로 다시 물어야 정확합니다.

‘똑똑해진 것’과 ‘오래 생각한 것’은 다릅니다

이 논쟁에서 가장 조심해야 할 함정이 바로 이겁니다. 지시어를 넣어 정답률이 올랐다고 해서, 모델이 더 똑똑해진 것은 아니라는 점입니다.

대부분의 경우 실제로 일어난 일은 “모델이 더 오래, 더 많은 계산을 쓰도록 유도된 것"입니다. 다시 말해 성능 향상의 정체가 지능의 향상이 아니라 연산 자원의 추가 투입일 수 있습니다. 이건 공짜가 아닙니다. 토큰이 더 나가고, 응답이 느려지고, 비용이 오릅니다. 같은 정답률을 그냥 “생각을 길게 해"라는 평범한 지시로도 얻을 수 있다면, /goal이라는 형식 자체엔 특별한 마법이 없다는 뜻이 됩니다.

그래서 이 실험을 제대로 하려면 반드시 통제 조건이 필요합니다. 지시어 없이 같은 연산량을 쓴 경우와 비교해야, 진짜 효과가 “지시어 덕분"인지 “그냥 오래 생각한 덕분"인지 구분됩니다. 이 통제를 빼먹은 채 “지시어 한 줄로 AI가 NP-난제를 풀었다"고 말하면, 그건 결론이 아니라 착시에 가깝습니다.

그래서 프롬프트 방법론은 어디로 가나요

정리하면 이렇습니다. 명확한 목표를 주는 건 분명 도움이 됩니다. 다만 그건 마법의 주문이라서가 아니라, 모델이 자기 노력을 어디에 쓸지 판단할 재료를 명확히 줬기 때문입니다. /goal이라는 특정 형식보다, 목표를 구체적이고 검증 가능하게 정의하는 태도 자체가 본질에 가깝습니다.

결국 프롬프트 엔지니어링은 “비법 한 줄 찾기"에서 “모델별로 실험하고 검증하기"로 넘어가는 중입니다. Fable 5에 잘 먹히는 프롬프트가 GPT-5.6에는 안 먹힐 수 있고, 그 반대도 마찬가지입니다. 여러분이라면 AI에게 어려운 문제를 맡길 때, 화려한 지시어를 찾는 데 시간을 쓰시겠습니까, 아니면 목표를 어떻게 검증할지부터 설계하시겠습니까. 저는 후자가 훨씬 남는 장사라고 봅니다.

AI 프롬프트엔지니어링 LLM 추론모델 벤치마크

댓글

    댓글을 불러오는 중...