Show HN: Benzi – 코드 지능/Code Intelligence를 활용하여 Claude Code와 CodeGraph를 능가하는 성능을
요약
Benzi는 코드 지능(Code Intelligence)를 활용하여 기존의 CodeGraph 및 주류 하네스 대비 우수한 성능을 입증한 새로운 벤치마크 시스템입니다. SWE-bench Verified에서 78.2%의 이슈를 해결했으며, 낮은 비용으로 높은 효율성을 보여줍니다. 특히 '읽은 라인 수'와 '비용(달러)' 측면에서 Benzi가 기존 모델 대비 월등히 낮은 지표를 기록하며 코드 문제 해결 능력을 입증했습니다.
핵심 포인트
- Benzi는 SWE-bench Verified에서 78.2%의 이슈를 성공적으로 해결했습니다.
- 코드 난이도 증가에 따른 '읽은 라인 수'와 비용 측면에서 Benzi가 우위를 점합니다.
- DeepSeek 시리즈 모델은 Claude Code 대비 토큰당 약 20배 저렴한 비용 효율성을 제공합니다.
Benzi · 벤치마크
사과와 사과 비교: Benzi 하네스 대 주류 하네스, 24개 GitHub 이슈, 10개 언어.
SWE-bench Verified에서 작동하는 Benzi 하네스. 500개의 실제 이슈 중 78.2%를 해결했으며 건당 비용은 10센트 미만입니다.
사과와 사과 비교: Code Graph의 코드 지능 대 Benzi의 AI 네이티브 코드 지능
버그가 어려워질수록 모든 하네스는 더 많은 소스 코드를 열어봅니다. 중요한 것은 기울기(slope)입니다. 각 점은 하나의 버그를 나타내며, 24개의 버그는 왼쪽에서 오른쪽으로 쉬운 순서부터 어려운 순서로 배열되어 있습니다.
난이도는 해당 버그에 대한 Claude Code의 실행 횟수(turn count)로 측정됩니다. 이는 제3자 기준점(yardstick)이므로 어떤 하네스도 축 상에 자체 위치를 설정하지 않습니다. **읽은 라인 수(Lines read)**는 파일 읽기 호출(file-read calls)을 통해 반환된 내용만을 계산합니다. grep이나 셸 출력은 검색일 뿐, 읽기는 아닙니다. 각 줄 옆의 그림이 그 하네스의 기울기입니다: 난이도 단계가 올라갈 때 해당 하네스가 추가로 여는 라인 수입니다. 버그와 그 개수에 대해 아무 점이나 마우스를 올려보세요.
| bug | Benzi Sonnet | Benzi DeepSeek | Claude Code Sonnet | DeepSeek Harness DeepSeek |
|---|---|---|---|---|
| mux | 64 | 64 | 383 | 1,372 |
| commons-cli | 39 | 235 | 456 | 771 |
| ... | ||||
**읽은 라인 수(Lines read)**는 파일 읽기 호출을 통해 반환된 내용만을 계산합니다. grep이나 셸 출력은 검색일 뿐, 읽기는 아닙니다. 각 행의 녹색 그림이 네 가지 중 가장 낮은 값을 나타냅니다. |
동일한 24개의 버그를 동일한 순서로, '읽은 라인 수' 대신 실제 경과 시간(wall clock)을 사용했습니다.
여기서의 벽시계(Wall clock)는 **원시 값(raw)**입니다. 위의 표와 달리, Benzi의 리포지토리별 인덱스 빌드 시간이 차감되지 않았기 때문에 이 초 단위 수치는 본 페이지 다른 곳에 언급된 '준비 완료' 수치보다 약간 높게 나타납니다. 각 점은 해당 버그에 대해 그 하네스가 가장 최근에 해결한 실행 기록입니다. 아직 해결되지 않았거나 미완성인 실행 기록은 빠지므로 플로팅되지 않습니다. Benzi가 Sonnet으로 http-parser를 해결하지 못했고 DeepSeek 하네스는 nats-server를 실행하지 못했기 때문에, 이 두 점은 부재하며 어느 쪽도 적합한 곡선(fit)에 포함되지 않습니다.
그리고 세로축에는 달러($) 단위가 적용된 동일한 그래프입니다.
게시된 토큰당 요율로 가격이 책정되었으며, 위의 차트와 동일한 실행 선택을 사용합니다. 두 DeepSeek 시리즈는 두 Sonnet 모델보다 한 자릿수(order of magnitude)만큼 저렴하여, 이 규모에서는 기준선 근처에 위치하며 — 그 뒤의 버그당 수치는 아래쪽 DeepSeek 표에 있습니다. 축이 보여주는 것은 **기울기(slope)**입니다: Claude Code의 비용은 다른 어떤 시리즈보다도 난이도가 높아질수록 더 빠르게 상승합니다.
| bug | Benzi Sonnet | Benzi DeepSeek | Claude Code Sonnet | DeepSeek Harness DeepSeek |
|---|---|---|---|---|
| mux | $0.39 | $0.036 | $0.25 | $0.023 |
| commons-cli | $0.26 | $0.030 | $0.29 | $0.014 |
| ... |
게시된 토큰당 요율로 가격이 책정되었습니다. 각 행의 녹색 수치는 네 가지 중 가장 낮은 값이며, 두 DeepSeek 열은 해당 모델이 토큰당 약 20배 적게 비용이 들기 때문에 훨씬 저렴합니다. 빈 셀은 수정 사항을 생성하지 못한 두 번의 실행입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN Claude Code Search의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기