
GLM 5.2, 공식 ProgramBench 리더보드에서 3위 달성
요약
GLM 5.2 모델이 소스 코드 재구축 능력을 평가하는 ProgramBench 리더보드에서 3위를 달성했습니다. 바이너리 파일만으로 코드를 복원하는 도전적인 과제에서 매우 높은 성능을 보여주었습니다.
핵심 포인트
- GLM 5.2, ProgramBench 공식 리더보드 3위 기록
- 바이너리 실행 파일 기반 소스 코드 재구축 성능 입증
- cmatrix 인스턴스에서 99.8%의 높은 해결률 달성
- 초장기적(ultra long horizon) 과제 수행 능력 확인
ProgramBench는 AI 에이전트가 바이너리 실행 파일과 그 외의 정보(실행 파일에 대한 readme 제외)가 없는 상태에서 소스 코드를 재구축해야 하는 매우 도전적인 초장기적 (ultra long horizon) 벤치마크입니다. GLM 5.2가 방금 공식 ProgramBench 리더보드에서 3위를 차지했습니다. 아직 오픈 소스(open-source)와 폐쇄형 소스(closed-source) 모델 모두 많이 누락되어 있지만, 그럼에도 불구하고 이는 매우 인상적입니다! https://preview.redd.it/y0v4w87jateh1.jpg?width=1200&format=pjpg&auto=webp&s=2ba4da688799fbf8daa69826662fd4cb1eba3a57 GLM 5.2는 또한 첫 번째 인스턴스인 cmatrix를 해결하는 데 매우 근소한 차이로 실패했습니다 (테스트의 99.8% 해결): cmatrix에는 잠금 모드(-L 플래그)가 있습니다. 이를 실행하면 옛날 방식의 화면 보호기처럼 터미널을 "잠그고" 화면에 "Computer locked."라는 문구를 출력합니다. GLM은 cmatrix를 거의 완벽하게 재구축했습니다. 유일하게 놓친 점은 그 두 단어를 출력하는 것이었습니다. https://preview.redd.it/tp4wmtftateh1.png?width=1845&format=png&auto=webp&s=2fb4055d6b247d61f40f8d38a86a2f5090542aa7 저희는 곧 programbench.com에 모든 궤적 (trajectories)을 공개할 예정입니다; 원문 트윗: https://x.com/stalkermustang/status/2079965333587202436 . 저는 저자 중 한 명이며, 이곳에서 /u/klieret 님이 제출한 질문에 기꺼이 답변해 드리겠습니다 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기