Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Anthropic이 새로운 모델 Claude Fable 5를 출시했습니다. Mythos 아키텍처를 기반으로 안전 가드레일이 강화되었으며, 코딩, 시각 능력, 신약 설계, 금융 분석 등 다양한 분야에서 압도적인 성능을 입증했습니다.
SCAIL-2는 포즈 스켈레톤이나 마스크 없이도 한 비디오의 동작을 다른 비디오로 전이할 수 있는 새로운 SOTA AI 모델입니다. 여러 캐릭터를 동시에 처리할 수 있으며, 오픈 웨이트 방식으로 공개되었습니다.

역대 가장 어려운 프로그래밍 벤치마크에서 AI의 성능이 단 하루 만에 2배로 향상되었습니다. 이는 AI 모델의 급격한 발전 속도를 보여주는 사례입니다.
비엔지니어의 관점에서 Claude Fable 5를 10억 토큰 규모로 테스트한 실무 리뷰입니다. 벤치마크 점수를 넘어 실제 업무에서의 생산성, 글쓰기 품질, 문제 포착 능력 등 '안목 테스트'를 통해 모델의 압도적인 성능을 평가합니다.

Anthropic이 강력한 성능을 가진 신규 모델 Claude Fable 5를 출시했습니다. 이 모델은 위험한 사용 사례를 차단하는 가드레일이 적용된 버전으로, 소프트웨어 엔지니어링 및 컴퓨터 사용 등 주요 벤치마크에서 경쟁 모델을 압도하는 성능을 보여줍니다.

Cognition이 AI 코드가 단순한 기능 구현을 넘어 실제 유지보수자가 병합할 수 있는 수준의 품질과 스타일을 갖추었는지 테스트하는 새로운 코딩 벤치마크인 FrontierCode를 소개했습니다. 이 벤치마크는 코드 리뷰와 프로젝트 관례 준수를 중점적으로 평가하며, 최고 모델들조차 높은 점수를 받기 어렵다는 사실을 보여주었습니다.
Cognition AI가 작동은 하지만 유지보수가 어렵고 관리하기 힘든 '슬롭 코드(slop code)'의 수준을 측정할 수 있는 새로운 벤치마크를 출시했습니다. 이 벤치마크는 모델이 단순히 코드를 생성하는 것을 넘어, 실제 개발 환경에서 사용 가능한 품질까지 검증하는 데 초점을 맞추고 있습니다.
학계와 산업계의 AI 평가(Eval) 방식 차이를 분석합니다. 학계는 벤치마크 일관성에 집중하는 반면, 산업계는 고객 피드백을 반영하여 실질적인 지표를 최적화하는 데 주력합니다.

Tencent Hy와 여러 대학이 협력하여 개발한 MMAE는 대규모 멀티태스크 오디오 편집을 위한 최초의 종합 벤치마크입니다. 기존 오디오를 자연어 지침에 따라 정밀하게 수정하는 능력을 평가하며, 현재 모델들의 낮은 정확도를 지적합니다.

DeepSWE 벤치마크를 통해 DeepSeek V4 Pro와 reasoning Max 모델의 성능을 직접 테스트한 결과입니다. 약 1B 토큰을 사용하여 실행했으나 5.31%라는 낮은 성공률을 기록했으며, 비용 효율적인 캐시 활용의 중요성을 강조합니다.

MIT의 새로운 논문은 고정된 설정 내에서 검색에 의존하는 기존 AI 과학 시스템의 한계를 지적합니다. 모든 데이터와 도구 출력을 유형화된 산물로 관리하여, 단순 검색을 넘어 새로운 과학적 개념과 설정을 스스로 발견하는 자기 진화형 AI 프레임워크를 제안합니다.
이번 주 25개 이상의 주목할 만한 오픈 웨이트 모델이 출시되며 AI 기술의 급격한 발전을 보여주었습니다. LLM, 이미지 생성, 오디오, 비전, 비디오 등 모든 모달리티에서 혁신적인 모델들이 공개되었습니다.

새로운 AI 벤치마크인 ProgramBench가 출시되었습니다. 이 벤치마크는 소스 코드와 인터넷 없이 컴파일된 바이너리만으로 프로그램을 재구축해야 하는 매우 높은 난이도의 소프트웨어 엔지니어링 능력을 측정합니다.
Anthropic의 미출시 모델 Mythos가 Project Glasswing을 통해 수만 개의 보안 취약점을 발견하며 뛰어난 성능을 입증했습니다. 이는 AI가 보안 분야에서 인간의 한계를 넘어서는 능력을 갖추었음을 시사합니다.