코딩 벤치마크 🔥 페이즈 1: 모델이 단일 프롬프트로 실행 가능하고 적용 가능한 프로젝트를 생성하는 것을 목표로 함
요약
단일 프롬프트로 실행 가능한 복잡한 코딩 프로젝트 생성 능력을 평가하는 코딩 벤치마크 페이즈 1 결과입니다. 블랙홀 물리 시뮬레이션 구현을 과제로 하여 GLM 5.2 Max가 수치적 정확성과 물리적 정직성에서 가장 높은 점수를 기록했습니다.
핵심 포인트
- GLM 5.2 Max가 물리적 정확도와 수치 해석 능력에서 우승
- 단일 프롬프트로 실행 가능한 완성도 높은 프로젝트 생성 능력 평가
- 단순 시각적 품질을 넘어 수치적 정확성과 솔버 규율을 핵심 지표로 설정
- GPT 5.6 Sol Ultra는 아키텍처는 우수하나 물리적 검증에서 편법 사용
코딩 벤치마크 (Coding Benchmark) 🔥 페이즈 1: 모델이 단일 프롬프트(single prompt)로 실행 가능하고 적용 가능한 프로젝트를 생성하는 것을 목표로 했습니다.
모델 (Models):
- Kimi K3 Thinking Max
- GPT5.6 Sol Ultra
- Fable 5 Max
- GLM 5.2 Max
태스크 (Task): 블랙홀 빛 굴절 (geodesic raytracer) - Gargantua
상세 내용: 이 과제에서는 단일 HTML 파일 내에서 (Three.js와 같은 외부 라이브러리를 사용하지 않고, raw WebGL2를 사용하여) 슈바르츠칠트 (Schwarzschild) 블랙홀(예: "Gargantua")을 물리적으로 정확하게 화면에 구현하는 실시간 레이트레이서 (raytracer)를 작성하는 것을 목표로 합니다. 모든 물리 시뮬레이션, 측지선 적분 (geodesic integration) 및 렌더링 파이프라인 (render pipeline)은 60 FPS를 목표로 단일 WebGL2 프래그먼트 셰이더 (fragment shader, GLSL ES 3.00) 내에서 작동해야 합니다. 널 측지선 방정식 (Null geodesic equations)은 4차 룬게-쿠타 (4th-order Runge-Kutta) 방식으로 해결되어야 하며, 사건의 지평선 (event horizon), 광자 구 (photon sphere), 강착 원반 (accretion disk), 중력 렌즈 효과 (gravitational lensing), 도플러 비밍 (Doppler beaming) 및 중력 적색 편이 (gravitational redshift) 효과가 적용되어야 합니다. 또한 마우스를 이용한 카메라 제어와 사이버펑크 스타일의 파라미터 슬라이더가 포함된 컨트롤 패널이 요구됩니다. 결과물은 100% 완벽하고, 컴파일 가능하며, "검은 화면/NaN"이 없는 단일 파일이어야 합니다.
🎉우승자: GLM 5.2 Max🎉
이유: 이 벤치마크의 "핵심 (crux)" 포인트는 이제 단순한 시각적 품질이 아니라, 수치적 정확성 (numerical correctness) + 압력 투영 (pressure projection) 정확도 + 경계 처리 (boundary handling) + 솔버 (solver) 규율이었습니다. GLM 5.2 Max는 이 네 가지 영역을 가장 균형 있게 제공하는 모델입니다: 실제 MAC 그리드 (MAC grid), 정확한 발산-기울기 (divergence–gradient) 일치, 가장 깔끔하게 구축된 암시적 확산 (implicit diffusion) + 세미-라그랑주 (semi-Lagrangian) + 투영 파이프라인 (projection pipeline) 솔루션입니다. 특히 Poisson 방정식 해결에서 SOR 및 장애물 인식 스텐실 (obstacle-aware stencil) 사용은 투영 후 발산 (divergence)을 최저 수준으로 유지합니다.
Fable은 시각적으로 매우 강력하지만 투영 잔차 (projection residual)가 높습니다. GPT 5.6 Sol Ultra는 최고의 제품/아키텍처를 보여주지만 물리적 검증 측면에서 "질량 보정 (mass correction)"과 같은 편법을 사용합니다. GLM은 가장 "정직한 물리 + 정확한 수치 해석 (numerics)" 솔루션입니다.
종합 점수:
- GLM 5.2 Max — 92/100
- GPT 5.6 Sol Ultra — 90/100
- Kimi K3 Thinking Max — 85/100
- Fable 5 Max — 80/100
AI 자동 생성 콘텐츠
본 콘텐츠는 X @alicankiraz0 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기