GLM-5.3 *flash*, ExploitBench에서 Mythos Preview보다 높은 점수 기록
요약
GLM-5.3 *flash*가 ExploitBench에서 Mythos Preview의 점수를 능가하며 성능 향상을 보여주었습니다. 이는 모델 크기 및 최신성이 인간과의 인지적 행동 유사성(Cognitive Behavioral Similarity)을 높이는 경향과 관련이 있습니다.
핵심 포인트
- GLM-5.3 *flash*가 ExploitBench에서 높은 성능을 기록함.
- 모델의 크기 및 최신성이 인간과의 행동 정렬성을 높임.
- TTC 스케일링은 범주적 능력 계층을 파괴하는 경향이 있음.
지금까지 본 것 중 가장 놀라운 일: GLM-5.3 flash가 ExploitBench에서 Mythos Preview의 점수를 능가할 수 있다.
하지만 사실 그리 놀랍지는 않다. 나는 오랫동안 TTC 스케일링이 범주적 능력 계층을 파괴한다고 말해왔다. 모델들은 이제 계속해서 진전을 이룰 만큼 충분히 AGI(범용 인공지능)하다.
@tenobrus
깨어나라, 깨어나라
또 다른 발견: CogGym은 AI와 인간 간의 인지적 행동 유사성을 평가하기 위한 프레임워크이다.
요약하자면: «더 크고 최근에 출시된 모델들이 인간과 더 높은 행동 정렬성을 보여준다». 자연스러운 추상화에는 승리다… 하지만 모델들은 우리보다 서로가 더 비슷하다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: 오픈소스 LLM의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기