
LLM의 자발적 선택 벤치마크 모델 분석 결과 공유
요약
본 글은 LLM의 자발적 선택(spontaneous selection) 벤치마크 모델 분석 결과를 공유합니다. 연구자는 다양한 언어와 범주에 걸쳐 여러 모델에게 질문을 던져 결정론성, 엔트로피, 단일 답변 개수, 언어 일관성을 측정했습니다. 그 결과, 일부 최첨단 모델들이 예상보다 더 안정적이고 정형화된 행동 패턴을 보이는 것이 주요 발견입니다.
핵심 포인트
- Claude Opus 4.8이 가장 높은 결정론성(0.933)을 보였습니다.
- Gemma 4와 Hy-MT2는 높은 결정론성과 언어 일관성을 동시에 보여주었습니다.
- 자발적 답변 생성은 무작위하지 않으며, 모델들은 특정 개념에서 반복적인 선택 경향을 가집니다.
- 높은 결정론성이 반드시 높은 언어 일관성을 의미하는 것은 아닙니다.
안녕하세요, 여러분. LLM에 대한 자발적 선택(spontaneous selection) 벤치마크 중 이번에는 모델 측면을 공유하고 싶었습니다. 이 연구에서 저는 40개의 다양한 모델에게 한국어, 영어, 스페인어로 총 20가지 다른 범주에 걸쳐 자발적인 질문들을 던졌습니다. 각 질문은 모든 모델에 대해 5번씩 반복했습니다. 이를 통해 모델당 총 300개의 답변을 얻었습니다. 제 목적은 모델들이 얼마나 결정론적(deterministic)인지, 얼마나 다양하며, 언어가 바뀔 때 얼마나 일관되게 행동하는지를 측정하는 것이었습니다. 🎉🔥
이 요약 표에서는 모델들을 네 가지 축으로 순위를 매겼습니다:
- 결정론성 (Determinism): 같은 답변에 얼마나 자주 돌아오는가?
- 엔트로피 (Entropy): 답변 분포가 얼마나 다양한가?
- 단일 답변 개수 (Unique response count): 답변 공간이 얼마나 넓은가?
- 언어 일관성 (Language consistency): 한국어, 영어, 스페인어 사이에서 비슷한 선호도를 보이는가?
첫 결과들은 매우 흥미롭습니다. 상단에 위치한 일부 최첨단(frontier) 모델들은 자발적인 답변에서 우리가 생각했던 것보다 훨씬 더 안정적이고 정형화된 행동을 보입니다. 특히:
- Claude Opus 4.8이 가장 결정론적인 프로필로 두드러집니다 (결정론성 0.933)
- 그 뒤를 Claude Sonnet 5 (0.913)와 Qwen3.8 2.4T-A95B (0.910)가 따릅니다.
- Hy-MT2 30B-A3B와 Gemma 4 31B는 높은 결정론성과 강력한 언어 일관성을 동시에 보여주며 주목을 받습니다.
반면에 하단에 위치한 일부 모델들은 더 분산되어 있고, 엔트로피가 높으며, 언어 간 선호도가 덜 일관적입니다.
가장 흥미로운 점은 자발적인 답변 생성이 생각만큼 '무작위'가 아니라는 것입니다. 심지어 많은 강력한 모델들이 특정 개념에서 반복적으로 같은 선택에 돌아갑니다. 하지만 이 표는 또한 다음을 보여줍니다: 높은 결정론성이 항상 높은 언어 일관성을 의미하는 것은 아닙니다. 즉, 한 모델이 단일 언어에서는 매우 안정적으로 행동하더라도, 언어가 바뀌면 동일한 확신을 보이지 않을 수 있습니다.
이 표를 통해 프로젝트에서
AI 자동 생성 콘텐츠
본 콘텐츠는 X @alicankiraz0 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기