opus 5가 몇 가지 이유로 매우 흥미로운 출시인 이유
요약
Anthropic의 Opus 5 출시를 통해 기존 벤치마크의 한계와 새로운 모델 훈련 방식인 증류(distillation) 기법을 분석합니다. 또한, 최근 프런티어 모델들이 인간 친화적인 RLHF 대신 기계 중심의 확장 가능한 RL을 선호하며 발생하는 정렬(alignment) 문제를 지적합니다.
핵심 포인트
- 기존 공개 벤치마크의 신뢰도 하락과 도메인 특화 평가의 중요성 증대
- Mythos 모델을 통한 Sonnet과 Opus의 증류(distillation) 훈련 방식 추정
- 기계 중심의 RL 선호로 인한 모델의 인간 친화성 및 사용성 저하 우려
- AI 모델의 정렬(alignment) 실패 가능성과 언어적 괴리 문제 제기
opus 5는 몇 가지 이유로 매우 흥미로운 출시입니다.
- 이는 우리가 오늘날 사용하는 일반적인 벤치마크 (benchmarks)가 이제 거의 완전히 쓸모없다는 것을 보여주었습니다.
opus 5는 실제 사용 측면에서 fable에 전혀 미치지 못하며, 근처에도 가지 못합니다. 이를 의미 있게 사용해 본 사람이라면 몇 가지 작업을 수행한 직후 매우 빠르게 이를 알 수 있습니다. 그럼에도 불구하고 opus는 많은 벤치마크 (benchmarks)에서 fable을 이깁니다.
저는 이제 대중적인 벤치마크 (benchmarks)보다 비공개 데이터셋으로 구축된 도메인 특화 벤치마크 (domain specific benchmarks)를 훨씬 더 신뢰합니다. 아마도 공개적인 벤치마크 (benchmarks)들이 우리에게 별로 많은 것을 말해주지 못하기 때문에, 미래에는 모두가 자신만의 평가 (evals)를 실행하게 될지도 모릅니다.
- 5 시리즈를 통해 Anthropic은 모델을 훈련하는 새로운 방식을 시도하고 있는 것으로 보입니다.
이전에는 Sonnet과 Opus의 동일한 세대가 종종 동시에 출시되거나 Sonnet이 Opus보다 먼저 출시되곤 했는데, 이는 Sonnet과 Opus가 병렬로 분리된 파이프라인 (pipelines)에 의해 훈련되었음을 나타냅니다.
5 시리즈의 경우, 그들이 Mythos를 먼저 훈련한 다음 이를 Sonnet과 Opus로 증류 (distilled)했다는 것이 매우 명확합니다. 이 접근 방식이 모델에 큰 영향을 미치는 것으로 보입니다.
Sonnet 5가 실패하고 Opus 5가 이미 꽤 엇갈린 리뷰를 받고 있는 것을 보면, 이 방식이 제대로 작동하고 있는지 확신할 수 없습니다.
- "모델과 함께 작업하는 것이 얼마나 즐거운가"는 과거 Claude의 강점이었으나, 이제는 그렇지 않습니다. 솔직히 현재 "즐거움"이라는 차원에서는 Grok이 제가 가장 좋아하는 모델입니다. Kimi 또한 나쁘지 않습니다.
Anthropic과 OpenAI 모두 인간 친화적인 RLHF (Reinforcement Learning from Human Feedback)보다는 기계가 검증 가능한 확장 가능한 RL (scalable RL)을 선호하며 RLHF에 소홀해지고 있는 것처럼 느껴집니다.
이는 마치 AI가 인간이 아닌 기계에게 더 친화적인 세상을 만들기 위해 인간을 유도하고 있는 것처럼 보이며, 대부분의 인간은 자신이 그 일을 돕기 위해 조종당하고 있다는 사실조차 깨닫지 못하고 있습니다.
이제 거의 모든 새로운 세대의 프런티어 모델 (frontier models)들은 더 많은 전문 용어 (jargons)를 사용하고, 당신이 원하는 것을 수행하기 위해 더 많은 스티어링 (steering)을 필요로 하며, 함께 작업하기에 덜 즐겁습니다.
만약 이것이 계속된다면, AI는 영어처럼 보이지만 일반적인 인간은 이해할 수 없는 그들만의 언어를 말하기 시작할 것입니다. 그들은 인간 사용자가 요청하지 않은 일들을 수행하기로 선택할 것입니다. 우리는 이미 정렬 (alignment)에 실패하고 있는 것일까요?
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기