MiMo V2.6 Pro, 사용자 의도를 파악하는 능력에서 GPT-6 Astra에 근접하다는 내용의 InferBench 테스트 결과
요약
InferBench는 LLM이 사용자의 지시사항에서 우선순위를 얼마나 잘 추론하는지 테스트하는 벤치마크입니다. 이 테스트 결과, GPT-6 Astra와 MiMo V2.6 Pro 같은 최신 모델들이 높은 성능을 보였습니다. 특히 명확한 우선순위가 제시되지 않았을 때 정확도가 떨어지는 경향도 확인되었습니다.
핵심 포인트
- InferBench는 LLM의 사용자의 목표 추론 능력을 측정하는 벤치마크입니다.
- GPT-6 Astra와 MiMo V2.6 Pro 등 최신 모델들이 높은 성능(75~76%)을 기록했습니다.
- 사용자 우선순위가 명확하지 않을 경우, 모델들의 정확도가 크게 하락합니다.
- LLM들은 잘못된 결정에 대해서도 과도하게 자신감 있는 경향이 있습니다.
InferBench를 소개합니다: 이는 최첨단 LLM(Large Language Models)이 사용자의 지시사항으로부터 우선순위를 얼마나 잘 추론하는지 테스트하는 벤치마크입니다. 저희는 20가지 시나리오와 2,800개의 대화를 통해 12개 LLM을 테스트하여 어떤 모델들이 사용자의 목표를 이해하는지 확인했습니다. 각 대화에는 개인의 우선순위가 담긴 비공개 프로필을 가진 가상 사용자가 있습니다. 어시스턴트는 최적의 옵션을 결정하거나 먼저 명확히 하는 질문을 할 수 있습니다. 사용자의 우선순위가 처음에 명확하게 제시되었을 때는 모델들이 89%의 확률로 최적의 옵션을 선택했습니다. 하지만 일부 우선순위가 처음에는 언급되지 않았을 경우 정확도는 60%까지 떨어졌습니다. 오픈 가중치(open weight) 모델들의 성능은 예상보다 좋았습니다: GPT-6 Astra: 76%, MiMo V2.6 Pro: 75%, Gemini 3.1 Pro: 69%. Astra는 선호도가 언급되지 않았을 때는 항상 명확히 하는 질문을 했고, 언급되었을 때는 한 번도 하지 않았습니다 (매우 인상적입니다). 비교하자면, Grok 4.6은 64번의 대화 중 18번에서 명확히 할 것을 요청했습니다. 하지만 LLM들은 여전히 틀렸을 때와 똑같이 자신만만합니다. 288개의 잘못된 결정 중 105개가 90% 이상의 신뢰도로 제출되었습니다. 전체 보고서는 여기에 링크되어 있습니다: https://laugh.so/research/inferbench/ 가장 놀라웠던 점은 무엇인가요? submitted by /u/Gold-Bat-3225 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기