Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

RL(강화학습) 기반 추론 모델이 Instruction-tuned 모델보다 수학적 추론 능력이 뛰어난 내부 메커니즘을 분석합니다. 연구 결과, RL은 모델의 내부 아키텍처를 재구조화하여 깊은 레이어에 핵심 추론 기능을 집중시키는 계층 구조를 형성함을 밝혀냈습니다.

Google Deepmind는 LLM이 통계적 패턴 매칭과 논리적 연역은 가능하지만, 과학적 발견의 핵심인 직관적 '도약(가추법)'은 불가능하다고 주장합니다. AI는 기존 데이터 내에서 보간할 수는 있으나, 새로운 물리적 공리를 스스로 공식화하는 데 한계가 있다는 분석입니다.
Grok 4.5와 Opus 4.8의 성능 비교 논쟁을 넘어, 단일 모델 사용에서 벗어나 여러 모델을 조합한 '로스터(roster)' 구축의 필요성을 제기합니다.
Baidu가 40페이지 분량의 문서를 한 번에 처리할 수 있는 오픈소스 OCR 모델 'Unlimited-OCR'을 공개했습니다. 32K 컨텍스트 윈도우를 통해 페이지 간 문맥과 표, 수식 등을 구조화된 마크다운 형식으로 정확하게 보존합니다.

기존의 GPT와 Claude 비교 논쟁을 넘어, 중국에서 등장하는 Kimi 같은 오픈 모델들이 강력한 기능을 갖추며 AI 생태계의 패러다임을 변화시키고 있습니다. 1M 컨텍스트, 멀티모달 추론, 에이전트 워크플로우 등 혁신적인 기능들이 오픈소스 영역으로 빠르게 확산되고 있습니다.

싱가포르 국립대학교 연구진이 Overleaf 내에서 작동하는 멀티 에이전트 AI 시스템인 PaperDebugger를 개발했습니다. 이 시스템은 논문 작성, 검토, 수정을 실시간으로 지원하며 연구자들의 워크플로우를 혁신하고 있습니다.

AI가 생성한 데이터로 학습된 차세대 AI 모델이 성능이 저하되는 '모델 붕괴(Model Collapse)' 현상을 설명합니다. Oxford와 Cambridge 연구진은 AI 데이터가 반복 학습될수록 창의적이고 희귀한 정보가 사라지고 평균적인 결과물만 남게 된다고 경고합니다.

Anthropic의 새로운 모델 Claude Fable 5가 출시되었습니다. 이 모델은 SWE-Bench Pro에서 80.3%라는 압도적인 성능을 기록하며 코딩 및 복잡한 문제 해결 능력을 입증했습니다.
Baidu가 단 한 번의 패스로 책 한 권 전체를 전사할 수 있는 'Unlimited OCR' 모델을 공개했습니다. 컨텍스트 윈도우를 늘리는 대신 어텐션 메커니즘을 최적화하여 메모리 사용량을 일정하게 유지하면서도 긴 문서 처리를 가능하게 했습니다.

OpenAI가 출시한 GPT-5.6 모델 시리즈(Sol, Terra, Luna)의 성능과 특징을 분석합니다. 특히 Sol Ultra 모델은 서브 에이전트 군집 방식을 통해 코딩 벤치마크에서 압도적인 성능을 보여주지만, 강력한 성능으로 인해 정부의 규제와 통제 대상이 되고 있음을 다룹니다.

Anthropic이 강력한 성능을 가진 새로운 AI 모델 Claude Fable 5를 출시했습니다. 이 모델은 프레젠테이션 제작, 재무 모델링, 심층 조사, 데이터 분석 등 기존 소프트웨어 구독 서비스를 대체할 수 있는 9가지 핵심 기능을 제공합니다.

옥스퍼드, 스탠퍼드 등 주요 연구기관의 25명 연구원들이 LLM 에이전트의 작동 원리를 심층 분석한 500페이지 논문 서베이를 발표했습니다. 이 논문은 계획 수립, 도구 사용, 메모리 등 핵심 역량과 실제 응용 분야를 포괄적으로 다룹니다.
미국 정부가 Anthropic에게 Fable 5와 Mythos 5의 외국 국적자 대상 사용을 중단하도록 강제했습니다. 이는 모델의 '탈옥(jailbreak)' 기능, 특히 코드 수정 요청과 관련된 규제 이슈를 다루고 있습니다.

Anthropic이 새로운 모델 출시와 함께 '전체 버전'을 제공하지 않는다는 전략적 변화를 발표했습니다. 이는 AI 경쟁의 초점이 단순히 모델의 지능 향상에서, 접근성과 사용 허가에 관한 문제로 이동했음을 시사합니다.

Anthropic의 Claude Fable 5 출시 소식을 언급하며, AI의 미래가 단순한 소프트웨어 단계를 넘어 국가 안보와 같은 근본적인 영역으로 진화하고 있음을 시사합니다. 이는 'Claude Mythos 5'라는 비범한 존재를 통해 새로운 차원의 가능성을 제시하는 것으로 보입니다.
현대 AI의 핵심 가설인 '검색(Search)' 중심의 접근 방식에 도전하며, AI에게 '기억(Memory)'하는 법을 가르쳐야 한다는 새로운 관점을 제시합니다.

Heretic 프로젝트는 기존 오픈 소스 LLM에서 거절 행동을 식별하고 제거하는 자동화된 프로세스를 공개했습니다. 재훈련이나 미세 조정 없이 모델의 특정 부분을 편집하여 검열되지 않은 모델 변형을 생성할 수 있음을 보여줍니다.
Anthropic이 강력한 성능의 Claude Opus 4.8 모델을 출시했습니다. 이 모델은 SWE-Bench Pro 및 컴퓨터 사용 작업에서 압도적인 벤치마크를 기록하며, 단순 챗봇을 넘어 자율적인 에이전트로서의 역량을 보여줍니다.
AI 기업들이 오랫동안 발표해 온 벤치마크 점수에는 근본적인 문제가 존재합니다. 대부분의 점수는 재현(reproduce)하기 어렵고, 모델 자체는 지속적으로 변화하며, 프롬프트와 평가 설정 역시 시간이 지남에 따라 변동되기 때문입니다. 이로 인해 제시된 점수들은 마케팅 자료에만 남아있을 뿐, 실제적인 가치를 갖기 어렵습니다.
이 글은 iFix AI가 개발한, 32가지 행동 검사(behavioral inspections)를 포함하는 포괄적인 AI 정렬 불량 테스트 프레임워크를 오픈 소스화한 것에 대해 높은 평가와 관심을 표명하고 있습니다. 작성자는 이 프로젝트의 가치를 강조하며 독자들에게 해당 GitHub 저장소에 별을 남겨줄 것을 권장합니다.