새로운 LLM 코딩 벤치마크 결과: Trail과 이중 진자 Euler vs RK4 적분 작업
요약
Trail 벤치마크를 통해 이중 진자 적분 태스크에서의 LLM 코딩 성능을 분석했습니다. 알고리즘, 수학, 프론트엔드 역량을 종합하여 모델별 품질 대비 성능과 가성비를 평가했습니다.
핵심 포인트
- Opus 5는 비용과 상관없이 최대 품질 및 시각적 품질에서 1위를 기록함
- DeepSeek V4 Flash는 최저 예산에서 완전한 기능을 제공하는 최고의 가성비 모델임
- Qwen 3.8은 프로덕션 환경에서 가장 뛰어난 가성비를 보여줌
- 모델별로 수치 적분, 검증, UI, 아키텍처 등 강점이 다르게 나타남
여러분, 새로운 LLM 코딩 벤치마크 (Coding Benchmark) 결과가 준비되었습니다. 🎉 이번에는 어려운 분야들을 한데 모은 Trail과 함께 '이중 진자: Euler vs RK4 적분' 태스크를 테스트했습니다. 이 태스크를 통해 모델들의 하이브리드 능력인 알고리즘, 수학, 코딩 및 프론트엔드 (Frontend) 역량을 측정했습니다.
모든 모델에 opencode를 사용하여 코딩을 시켰습니다. 동시에 모든 모델에 최고 수준의 사고 (thinking) 노력을 사용했습니다. 이번 점수 산정은 가성비 (Price/Performance)와 품질 대비 성능 (Quality/Performance) 척도로 진행했습니다.
평가는 모델의 이름을 보지 않은 상태에서 GPT 5.6 Pro가 수행했습니다. 테스트에 참여한 모델들은 다음과 같습니다:
- DeepSeek V4 Flash 0731
- Gemini 3.6 Flash
- Grok 4.5
- Sonnet 5
- GPT5.6-Luna
- GPT5.6-Sol
- Opus 5
- Kimi K3
- Qwen 3.8
품질 대비 성능 (Quality/Performance) - 전체 순위:
- Opus 5 — 96.32/100 - $1.4660
- GPT5.6-Sol — 93.85/100 - $0.3627
- GPT5.6-Luna — 92.15/100 - $0.2373
- Kimi K3 — 91.70/100 - $0.3312
- Qwen3.8 — 89.95/100 - $0.2807
- Sonnet 5 — 88.16/100 - $0.4429
- DeepSeek V4 Flash 0731 — 85.12/100 - $0.0994
- Gemini 3.6 Flash — 83.24/100 - $0.0637
- Grok 4.5 — 79.82/100 - $0.4768
가성비 (Price/Performance) - 전체 순위:
- DeepSeek V4 Flash - 88.00
- GPT5.6-Luna - 87.04
- Qwen 3.8 - 85.75
- Kimi K3 - 84.91
- Gemini 3.6 Flash - 83.57
- GPT5.6-Sol - 82.91
- Grok 4.5 - 81.87
- Sonnet 5 - 80.66
- Opus 5 - 80.22
종합 평가:
- 프로덕션 (Prod) 가성비 승자: Qwen3.8.
- 비용 상관없이 최대 품질: Opus 5.
- 최저 예산에서 충분하고 완전한 기능을 갖춘 결과물: DeepSeek V4 Flash
- 가장 균형 잡힌 중간 지점: GPT5.6-Luna 및 Kimi K3
기술 분야별 성과:
- 최고의 순수 수치 적분기 (numerical integrator): Opus 5 = GPT5.6-Sol
- 가장 정확한 내장 검증기 (built-in validator): GPT5.6-Luna
- 최고의 표준 런타임 (runtime) 성능: DeepSeek V4 Flash 및 Kimi K3
- 최고의 시각적 품질: Opus 5
- 최고의 UI/제품: GPT5.6-Sol
- 최고의 아키텍처 (architecture): Opus 5
- 최고의 경제적 가성비 (F/P): DeepSeek V4 Flash
- 최고의 프로덕션 가성비 (production F/P): GPT5.6-Sol
- 가장 비싼 한계 품질 향상: Opus 5
- 가장 심각한 검증기 (validator) 오류: Grok 4.5
- 가장 높은 핫 패스 (hot-path)/GC 리스크: Gemini 3.6 Flash
AI 자동 생성 콘텐츠
본 콘텐츠는 X @alicankiraz0 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기