Opus 5.5가 '약화(nerfed)' 단계에 진입하고 있나요? LiveNerf 기준선 업데이트
요약
이 글은 Claude Opus 5.5의 성능 변화를 독립적으로 측정할 수 있는 오픈 소스 프로젝트 'LiveNerf'를 소개합니다. 이 프로젝트는 SWE-bench 및 SciCode 같은 표준 벤치마크를 사용하여 모델의 일일 성능을 추적하며, 과학적인 방법론으로 재현 가능한 데이터를 제공하는 것을 목표로 합니다.
핵심 포인트
- Opus 5.5의 성능 변화를 측정하는 오픈 소스 프로젝트 'LiveNerf' 공개
- SWE-bench 및 SciCode 등 표준 벤치마크 사용으로 데이터 신뢰성 확보
- 모델 출시 후 20일 동안 데이터를 수집하며, 추후 결과를 투명하게 공유 예정
며칠 전, 저는 Claude 커뮤니티가 Opus 5.5의 성능 변화나 출시 후 몇 주 동안 '약화(nerfed)'되는지 독립적으로 측정할 수 있는 오픈 소스 프로젝트를 공개했습니다. 이 프로젝트는 SWE-bench 및 SciCode와 같은 확립된 벤치마크를 사용하여 매일 성능을 추적하며, 표준화된 과학적 방법론을 적용하여 시간이 지남에 따른 변화를 측정 가능하고 재현 가능하게 만듭니다. Opus 5.5의 성능을 추적하는 데 관심이 있다면, 여기 레포지토리(repo)가 있습니다: https://github.com/ninjahawk/livenerf 저희는 아직 평가 단계에 있으므로, 오늘 하락세가 현재 확실히 약화가 일어나고 있다는 질문을 본 사람들을 위해 명확히 하고 싶습니다. 우리는 모델 출시 후 20일이 될 때까지 해당 데이터를 갖지 못할 것입니다. 따라서 여전히 그 어떤 것이든 뒷받침할 데이터가 나오기까지는 약 2주 정도 남았습니다. 오늘 하락세는 10일차에 이루어질 기준선에 반영될 것입니다. 또한, 제가 이 데이터를 수집하는 방식을 살펴보고 미래의 벤치마크를 위해 제안할 개선 사항이 있다면 가져와 주시기를 권장합니다. 저는 앞으로 더 많은 것을 실행할 계획이지만, 이것은 제가 자비로 진행하고 있어 보정 비용이 상당합니다. Opus 5.5에 대해 수행하는 데는 대략 프로 플랜(pro plan)로 일주일 분량의 비용이 들었습니다. 저는 투명성을 강력하게 믿습니다. AI 회사들은 투명하지 않기 때문에, 현재 숨겨진 것들을 드러내는 우리만의 도구를 만들 것입니다. LiveNerf를 이미 지원해 주신 모든 분들께 진심으로 감사드립니다. 여러분을 실망시키지 않기를 바랍니다. 제가 생각했던 것보다 더 커졌습니다. 저는 단지 저 자신을 위해 과학적으로 이것을 실행하려고 했을 뿐인데, 알고 보니 커뮤니티가 즐겨주었습니다. 여러분 모두에게 매우 감사합니다. 만약 이번 달에 잠재적인 약화가 감지된다면, 그 데이터를 발표하는 글을 반드시 올리겠습니다. 모든 분들께 감사드리며, 마지막 게시물을 고정해 주신 운영진분들께도 감사합니다 (예상하지 못했습니다). 수정: 문법은 /u/TheOnlyVibemaster 님이 제출함 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/ClaudeAI (top/week)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기