Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Anthropic이 Mythos Preview를 뛰어넘는 새로운 모델인 'Oceanus'의 출시를 준비 중입니다. 현재 레드팀 테스트를 위한 체크포인트가 제공되었으나, API 재판매 이슈로 인해 프로그램이 일시 중단된 상태입니다.

Life-Harness 논문에 따르면 모델을 수정하지 않고 하네스(harness)를 패치하는 것만으로도 대다수의 모델-환경 설정에서 성능이 크게 향상되었습니다. 18개의 백본 모델에서 평균 88.5%의 성능 향상을 기록하며 하네스의 중요성을 입증했습니다.

Claude 4.8 Opus가 GBA Eval 벤치마크에서 GPT-5.5를 제치고 새로운 SOTA를 달성했습니다. 이 테스트는 코딩 에이전트가 24시간 내에 작동 가능한 Game Boy Advance 에뮬레이터를 구축할 수 있는지를 평가합니다.
Anthropic이 모델의 사이버 보안 능력에 대한 우려가 지속되는 가운데, 새로운 모델인 'Claude Mythos'를 수주 내에 출시할 예정이라고 발표했습니다.
Anthropic의 Project Glasswing이 Claude Mythos Preview 모델을 활용하여 10,000개 이상의 고위험 및 치명적 소프트웨어 취약점을 발견했습니다. 이는 AI 모델의 보안 진단 능력을 입증하는 사례입니다.