
속보: Grok 4.5, Claude Sonnet 5, GLM 5.2, Claude Opus 5, Kimi K3, GPT-5.6을 제치고
요약
Grok 4.5가 LaurenBench 벤치마크에서 56.9%의 점수를 기록하며 Claude Sonnet 5, GPT-5.6 등 주요 모델들을 제치고 1위를 차지했습니다. 이번 테스트는 대화, 도구 사용, 메모리, 안전성 등 AI 에이전트의 핵심 역량을 평가했습니다.
핵심 포인트
- Grok 4.5가 LaurenBench 벤치마크에서 1위 달성
- Claude Sonnet 5, GPT-5.6 등 최신 모델들을 상회하는 성능 기록
- 대화, 도구 사용, 메모리, 안전성 등 에이전트 역량 검증
속보: Grok 4.5가 Claude Sonnet 5, GLM 5.2, Claude Opus 5, Kimi K3 및 GPT-5.6을 앞서며 LaurenBench에서 56.9%의 점수로 1위를 차지했습니다.
이 벤치마크 (Benchmark)는 대화, 도구 사용 (Tool use), 메모리 (Memory) 및 안전성 (Safety) 전반에 걸쳐 실제 AI 에이전트 (AI agents)를 테스트합니다. https://t.co/gvpLtcWdZw
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기