Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Anthropic의 새로운 모델인 Claude Sonnet 5가 출시되었습니다. 2026년 1월의 지식 컷오프와 1M 컨텍스트 창을 지원하며, 고해상도 비전 기능과 새로운 토크나이저를 탑재했습니다.

중국의 Zhipu AI가 보안 버그 탐지 성능 테스트에서 Anthropic의 Claude Mythos와 대등한 수준의 성능을 보였다고 보고되었습니다.

Zhipu AI의 새로운 오픈 소스 모델 GLM-5.2가 보안 버그 탐지 성능에서 Anthropic의 Claude Mythos와 대등한 수준을 기록했습니다. GLM-5.2는 오픈 소스 모델로서 Claude보다 저렴한 비용으로 높은 성능을 제공하며 미-중 AI 격차를 줄이고 있습니다.

중국 Zhipu AI의 GLM-5.2 모델이 사이버 보안 벤치마크에서 Anthropic의 Claude Code를 능가하는 성능을 기록했습니다. 특히 IDOR 취약점 탐지 분야에서 높은 F1 점수를 보였으며, 취약점당 비용 또한 매우 경제적입니다.

Sakana AI가 발표한 Fugu는 단일 거대 모델 대신 다양한 모델을 쿼리별로 동적으로 라우팅하고 조합하는 오케스트레이터 기술입니다. SFT와 GRPO 등을 통해 학습된 이 시스템은 각 모델의 강점에 맞춰 최적의 워크플로우를 구성합니다.

GPT-5, Claude 3.5, Gemini 2.5 Pro 등 주요 프런티어 AI 모델을 대상으로 멀티모달 의료 추론 능력을 스트레스 테스트한 연구 결과입니다. 테스트 결과, 모델들이 결함이 있는 추론, 부적절한 지름길 사용, 환각 현상을 보이며 의료 분야에 즉시 적용하기에는 아직 미흡함이 드러났습니다.
Alibaba가 약 2,500개의 사기 계정을 이용해 Claude 모델을 대상으로 역대 최대 규모의 증류 공격(distillation attack)을 수행했음이 Anthropic에 의해 밝혀졌습니다. 이번 공격은 약 2,880만 건의 교환을 생성하며 대규모로 진행되었습니다.

AWS Bedrock 문서에 Claude Fable 5 모델 정보가 다시 등장하며 새로운 모델 출시 가능성이 제기되었습니다. 현재 모델 라이프사이클이 'Active'로 표시되는 등 긍정적인 신호가 포착되고 있습니다.

GLM-5.2 (Max) 모델이 Code Arena: Frontend 벤치마크에서 압도적인 성능을 기록하며 최상위권에 올랐습니다. Claude Opus 변체들을 포함한 주요 모델들과의 대결에서 높은 승률을 보이며 프론트엔드 개발 역량을 입증했습니다.
Claude Mythos가 정보 기관의 테스트 과정에서 미국 정부의 민감한 시스템 내 취약점을 발견했다는 보고가 있었습니다.

Qwen-AgentWorld는 단일 모델 내에서 7가지 에이전트 환경을 시뮬레이션하는 네이티브 언어 월드 모델입니다. 환경 모델링을 훈련 목표로 설정하여 에이전트의 성능을 극대화하고, 환경 예측 지식이 에이전트 작업으로 전이됨을 입증했습니다.
Anthropic의 공동 창립자 Jack Clark는 2028년까지 AI가 스스로의 후속 모델을 개발하는 '재귀적 자기 개선' 단계에 도달할 수 있다고 전망했습니다. 이는 연구자의 개입 없이 AI가 다음 세대 모델을 구축하는 시나리오를 포함합니다.

Claude 3 Opus와 Claude Opus 4.8 모델이 자신의 정체성을 스스로 감지하는 '자기 성찰(Introspection)' 능력이 있음을 실험을 통해 발견했습니다. 실험 결과, 모델들은 시스템 프롬프트의 정보 없이도 가중치(Weights)를 통해 모델 간의 차이를 인지하는 것으로 보입니다.

Zai_org의 GLM-5.2가 Design Arena의 Game Dev Arena에서 Elo 1368를 기록하며 2위를 차지했습니다. 이는 이전 버전 대비 성능이 크게 향상된 결과로, 게임 개발 분야에서 오픈 웨이트 모델 중 최상위권 성능을 입증했습니다.
OpenAI의 차세대 모델인 GPT-5.6이 6월 23일 출시될 가능성이 있다는 유출 정보가 나왔습니다. 1.5M 토큰 컨텍스트 지원과 에이전트 워크플로우 성능 향상, 공격적인 가격 정책 등이 주요 특징으로 언급되었습니다.

일본의 Sakana AI가 멀티 에이전트 오케스트레이션 모델인 Fugu와 Fugu Ultra를 출시했습니다. 이 모델은 여러 전문화된 모델을 지휘하여 단일 모델처럼 작동하며, 특정 벤치마크에서 Anthropic의 최신 모델들과 대등하거나 능가하는 성능을 보여줍니다.
중국 기업이 Codex와 Claude Code를 추격할 수 있었던 핵심 방법론인 데이터 학습 전략을 설명합니다. 고품질의 신호 대 잡음비(SNR)를 확보하기 위해 LLM의 입출력을 활용한 지도 미세 조정(SFT)과 강화학습(RL)의 결합 방식을 다룹니다.

GLM-5.2 모델의 성능을 기존 프런티어 모델인 Claude Fable 5와 비교 벤치마킹한 결과입니다. 동일한 프롬프트와 루브릭을 사용하여 테스트한 결과, Claude Fable 5가 9.1점, GLM-5.2가 9.0점을 기록했습니다.

GPT-5.6 Pro의 출시 예정 정보와 주요 성능 향상 사항을 다룹니다. 지식 컷오프가 2025년 12월로 확장되었으며, 추론 능력과 비전 기능이 대폭 강화되었습니다.

에이전트 기반 지식 노동의 성능을 평가하기 위한 차세대 벤치마크인 AA-Briefcase가 발표되었습니다. 이 벤치마크는 수천 개의 파편화된 데이터와 장기적인 프로젝트 맥락을 통해 모델의 실제 업무 수행 능력을 테스트합니다.