AnthropicAI의 Claude Haiku 5.5가 아레나에 공개되었습니다
요약
AnthropicAI가 Claude Haiku 5.5를 Agent Arena와 Code Arena에 공개했습니다. 이 플랫폼에서는 전 세계 사용자 커뮤니티가 제공하는 수백만 개의 실제 장기 에이전트 작업에서 모델 성능을 측정합니다. 특히, 웹 검색, 파일 시스템, 터미널 도구 접근 등 복잡한 워크플로우 수행 능력을 평가받습니다.
핵심 포인트
- Claude Haiku 5.5가 Agent Arena 및 Code Arena에 공개됨.
- 수백만 개의 장기 에이전트 작업에서 모델 성능을 측정함.
- 웹 검색, 파일 시스템 등 복잡한 도구 사용 능력을 평가함.
- 리더보드는 인과 추적 방법론(causal tracing)을 사용함.
AnthropicAI의 Claude Haiku 5.5가 이제 Arena에 있습니다. Agent Arena로 이동하여 테스트해 보시고, 점수는 곧 공개될 예정입니다!
Agent Arena에서는 전 세계 사용자 커뮤니티가 제공하는 수백만 개의 실제 장기(long-horizon) 에이전트 작업에서 모델을 측정합니다. 모델들은 복잡한 워크플로우를 완료하기 위해 웹 검색, 파일 시스템, 터미널 도구에 접근할 수 있습니다. 리더보드는 인과 추적 방법론(causal tracing methodology)을 사용하여 평균 모델 대비 결과에 따른 모델 성능을 측정합니다.
Claude Haiku 5.5는 Code Arena에서도 이용 가능합니다: WebDev, Text, Document 및 Vision.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기