최첨단 코딩 LLM 고급 벤치마크
요약
최첨단 코딩 LLM들을 대상으로 복잡한 셀룰러 오토마타(Cellular Automata) 시뮬레이션 생성 능력을 평가한 벤치마크 결과입니다. GPT Sol 5.6이 물리 법칙과 복잡한 상호작용을 완벽히 구현하며 압도적인 점수로 승리했습니다.
핵심 포인트
- GPT Sol 5.6이 92.4점으로 코딩 LLM 벤치마크 1위 달성
- 단순 애니메이션을 넘어 물리적 질량 전달 및 수압 메커니즘 구현 능력 평가
- CA 스케줄링, 통계적 대칭성, 다상 밀도 등 고난도 엔지니어링 문제 해결 여부 검증
- Kimi, Opus, Qwen 등 주요 모델들과의 성능 격차 확인
최첨단 코딩 LLM 고급 벤치마크 🔥
- Kimi K3 Max
- Qwen3.8 Xhigh
- Opus 5 Max
- GPT Sol 5.6 Ultra
- GLM 5.2 Max
- Grok 4.5 High
태스크(Task): 모델이 단일 독립 HTML 파일 내에서 모래/물/불/연기 같은 요소들이 셀룰러 오토마타 (Cellular Automata) 규칙에 따라 상호작용하는 인터랙티브한 "falling sand" 시뮬레이션을 생성하도록 요구됨; 라이브러리 미사용, 제로샷 (zero-shot), 단일 시도. 모래 더미를 형성하며 떨어져야 하고, 액체는 수위를 맞춰야 하며, 요소들은 밀도에 따라 층으로 분리되어야 함. 또한 불-물-용암-산성 같은 상호작용은 데이터 기반의 반응 테이블을 통해 수행되어야 함. 출력물은 ImageData를 사용하여 수만 개의 입자를 60 FPS로 그려낼 수 있는 성능을 갖추어야 하며, 모래 원뿔 및 연결된 용기와 같이 미리 정의된 장면을 통해 스스로 검증할 수 있어야 함.
태스크의 난이도: 이 과제는 단순한 입자 애니메이션이 아님. 동시에 네 가지 서로 다른 엔지니어링 문제를 해결해야 함:
- CA 스케줄링 (CA scheduling): 아래로 떨어지는 셀이 동일한 스텝 내에서 중복 처리되지 않아야 함. 그렇지 않으면 모래가 단 한 프레임 만에 바닥으로 순간 이동함.
- 통계적 대칭성: 셀당 좌/우 처리 순서가 무작위화(randomize)되지 않으면 모래 원뿔이 체계적으로 한쪽으로 기울어짐.
- 다상 밀도 및 정수압 거동 (Multi-phase density and hydrostatic behavior): 단순히 아래로 이동하고 수평으로 분산되는 것만으로는, 좁은 바닥 채널을 가진 실제 U자형 용기에서 물을 반대편으로 끌어올리기에 부족함. 압력 또는 그에 상응하는 질량 전달 메커니즘이 필요함.
- 반응형 상태 머신 (Reactive state machine): 가연성 물질의 정체성, 연소 수명, 연기/재 생성, 가스 수명 및 화학 반응이 서로를 방해하지 않고 실행되어야 함.
🎉승자: GPT Sol 5.6🎉
최종 점수 및 요약
- GPT Sol 5.6 — 92.4/100
- Opus 5 — 66.1/100
- Kimi K3 — 62.1/100
- Qwen3.8 — 60.9/100
- GLM 5.2 — 55.3/100
- Grok 4.5 — 50.5/100
이유: GPT Sol 5.6은 세 가지 고전적인 실패 모드 (failure mode)를 동시에 통과한 유일한 결과물이었습니다.
모래 (sand)와 연기 (smoke)는 단일 스텝 (single step)에서 완전한 셀 (cell) 이동을 보여주었으며, 두 개의 시드 (seed)에서 모래 원뿔 편향 (sand cone bias)은 최대 0.25%로 유지되었습니다. 밀도 규칙 (density rule)은 정적이지 않은 모든 목표물에 전반적으로 적용되며, 모래-물 (sand-water) 및 모래-재 (sand-ash) 테스트를 통과했습니다. 가장 중요한 점은, 연결된 액체 영역 (connected liquid region) 내의 고점과 저점을 찾아 그 사이에서 질량 전달 (mass transfer)을 수행하는 별도의 수압 패스 (hydraulic-pressure pass)가 존재한다는 것입니다. 이를 통해 좁은 입구의 표준 U-컵 (U-cup)에서 1.24, 자체 프리셋 (preset)에서 0.61의 셀 표면 차이 (cell surface difference)를 달성했습니다.
밀도 프리셋 (Density preset)은 정말 복잡한 초기 상태를 생성하며, 화학 반응 (chemistry)을 격리하고 연기 (smoke)에 대해 긴 테스트 수명을 제공합니다. 1200 스텝 (step) 후에도 용암 (lava), 물 (water), 기름 (oil), 연기 (smoke)의 수는 완전히 보존되었으며, 층 순서 점수 (layer order score)는 0.906을 기록했습니다. 이는 다른 제출물들에서 흔히 나타나는 "이미 올바른 순서로 붓기", 연기 (smoke)의 조기 소멸, 또는 기름 (oil)이 용암 (lava)에 의해 타버리는 문제들을 겪지 않습니다.
준우승자인 Opus 5는 UI와 검증기 패널 (validator panel)이 더 포괄적이지만, 핵심 물리 (core physics) 측면의 두 가지 중요한 주장이 작동하지 않습니다. 자체 U-컵 프리셋 (U-cup preset)은 107.44의 셀 차이를 기록하며 뒤처졌습니다. 또한 밀도 장면 (density scene)에서 reactionsEnabled=false로 설정하더라도, 용암 (lava)의 점화 (ignition) 경로가 반응 게이트 (reaction gate) 외부에서 작동합니다. 연소 업데이트 (burning update) 역시 게이트 제어 전에 물 소화 (water extinguish) 및 연기/화염 방출 (smoke/fire emission)을 수행합니다. 결과적으로 "화학 반응 꺼짐 (chemistry off)" 장면에서 물 (water)이 완전히 증기 (steam)로 변했습니다. 이 두 가지 오류는 시각적 및 제품 품질이 승자를 바꿀 수 없을 만큼 핵심적인 문제입니다.
프롬프트 준수 (Prompt compliance) — 8점
- GPT Sol 5.6: 7.6/8
- Opus 5: 7.0/8
- Qwen3.8: 5.8/8
- Grok 4.5: 5.5/8
- Kimi K3: 5.3/8
- GLM 5.2: 4.6/8
성능 및 렌더링 파이프라인 (Performance and render pipeline)
- Kimi K3: 6.0/6
- Qwen3.8: 5.7/6
- Opus 5: 5.3/6
- GPT Sol 5.6: 5.0/6
- GLM 5.2: 4.8/6
- Grok 4.5: 3.2/6
시각적 품질, UI 및 리사이즈 (Visual quality, UI and resize)
- Opus 5: 5.0/5
- GPT Sol 5.6: 4.8/5
- Qwen3.8: 4.6/5
- Kimi K3: 3.6/5
- Grok 4.5: 3.2/5
- GLM 5.2: 3.0/5
Mimari 및 테스트 용이성
- GPT Sol 5.6: 2.7/3
- Opus 5: 2.5/3
- Qwen3.8: 2.3/3
- Kimi K3: 2.2/3
- Grok 4.5: 1.9/3
- GLM 5.2: 1.0/3
AI 자동 생성 콘텐츠
본 콘텐츠는 X @alicankiraz0 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기