Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Anthropic의 새로운 플래그십 모델 Claude Opus 5가 출시되었습니다. 상위 모델인 Fable 5 대비 절반 가격임에도 불구하고 코딩 및 지식 작업 벤치마크에서 압도적인 성능을 기록하며, 특히 에이전트로서의 자율적 완수 능력이 크게 향상되었습니다.
Moonshot AI가 2.8조 개의 파라미터를 가진 오픈 웨이트 모델 Kimi K3를 공개했습니다. 이번 발표는 대규모 모델의 가중치를 공개함으로써 기존 폐쇄형 모델 중심의 AI 시장 판도를 흔드는 전략적 행보로 평가받습니다.
2026년 7월 기준 오픈 웨이트 AI 모델의 지형을 분석합니다. Kimi K3, GLM-5.2, DeepSeek V4가 각 분야를 선도하고 있으며, 온디바이스 구동을 위한 경량 모델의 발전과 국가별 AI 전략 차이를 다룹니다.
AI 메모리 벤더들의 발표 수치와 실제 오픈 하네스 테스트 결과 간의 격차를 분석합니다. 긴 컨텍스트 창이 유발하는 컨텍스트 부패(Context rot)와 정보 검색 저하 현상을 다룹니다.

Google Deepmind는 LLM이 통계적 패턴 매칭과 논리적 연역은 가능하지만, 과학적 발견의 핵심인 직관적 '도약(가추법)'은 불가능하다고 주장합니다. AI는 기존 데이터 내에서 보간할 수는 있으나, 새로운 물리적 공리를 스스로 공식화하는 데 한계가 있다는 분석입니다.

최첨단 배경 제거 모델인 FeyNoBg와 학습 라이브러리 NoBg를 소개합니다. 8개 벤치마크 중 4개에서 최고 성능을 기록했으며, 전경 인식과 경계 정밀도를 동시에 최적화하는 아키텍처를 사용합니다.

Microsoft가 사이버 보안 성능이 뛰어난 MAI-Cyber-1-Flash 모델과 멀티 에이전트 보안 하네스인 MDASH를 출시했습니다. MAI-Cyber-1-Flash는 CyberGym 벤치마크에서 96%의 높은 점수를 기록하며 탁월한 성능을 입증했습니다.

Microsoft가 사이버 보안에 특화된 첫 번째 생성형 AI 모델인 MAI-Cyber-1-Flash를 출시했습니다. 이 모델은 OpenAI의 GPT-5.4와 결합하여 CyberGym 벤치마크에서 Anthropic과 Google의 모델을 능가하는 성능을 보여주었습니다.

AI가 수학 연구의 미해결 문제 벤치마크인 FrontierMath에서 2-adic 수 체계의 절대 갈루아 군에 관한 프레젠테이션을 찾아내 해결했습니다. 이는 AI가 고도의 추상적 수학 문제를 해결할 수 있음을 보여주는 중요한 사례입니다.

시각-언어 모델의 연산 최적화된 모델 크기와 토큰 수에 관한 체계적인 연구를 다룹니다. 언어 및 멀티모달 목적 함수에 대한 명확한 확장 법칙(scaling laws)을 제시합니다.

StateAct는 픽셀 데이터 이전의 프로그램 상태를 활용하여 장기적 컴퓨터 사용 에이전트의 성능을 높이는 연구입니다. 기존 방식의 한계를 극복하고 더 정교한 에이전트 동작을 목표로 합니다.
MMOE는 Diffusion Transformer를 현대화하기 위해 LLM의 효율적인 확장 원칙을 적용한 새로운 아키텍처입니다. 공유 및 경량 전문가, 게이트-잔차 라우팅 등을 통해 생성 품질과 비용 간의 최적의 균형을 달성했습니다.
코딩 에이전트의 반복적인 수정 루프가 반드시 신뢰성을 보장하지 않는다는 점을 지적하며, 에이전트 기반 코드 수정의 상태 제한 증거 및 타입 지정 수정 계약을 제안합니다. 연구를 통해 반복 횟수에 따른 정확도 변화와 잘못된 추적 데이터의 위험성을 분석했습니다.
LLM이 사회 시뮬레이터로서 인간의 행동을 얼마나 정확히 모사하는지 평가하기 위해 '이유 매개 행동 모델'을 제안합니다. 단순히 결과값의 일치 여부를 넘어, LLM이 생성한 근거(rationale)가 인간의 의사결정 논리와 일치하는지 검증하는 프레임워크를 다룹니다.
고대 언어의 비구조적 텍스트 분석을 위해 레이블 없이 문장 임베딩을 최적화하는 두 가지 비지도 학습 전략(TSDAE, CSE)을 제안합니다. 실험 결과, 제안된 방식은 기존 다국어 인코더보다 뛰어난 성능을 보이며 성서 재사용 식별 및 노이즈 텍스트 처리에서 탁월한 효과를 입증했습니다.
PIVOT은 토큰 수준 희소 어텐션(DSA)의 인덱싱 병목 현상을 해결하기 위한 새로운 연구입니다. 인접한 쿼리 간의 중복성을 활용하여 단일 접두사 스캔을 공유함으로써, 정확도를 유지하면서도 추론 속도를 획기적으로 높였습니다.
LLM의 은닉 활성화(hidden activations) 기하학적 구조를 활용하여 환각을 탐지하는 새로운 지표인 D-Score를 제안합니다. 단 한 번의 순전파만으로 계산 가능한 스펙트럼 통계량을 통해 외부 검증 없이도 효과적으로 환각을 식별할 수 있습니다.
희소 오토인코더(SAE) 특징과 모델 행동 간의 불일치 문제를 해결하기 위해 특징 효과 기하학 분석(FEGA) 프레임워크를 제안합니다. 연구 결과, 특징은 값 유사 특징과 포인터 유사 특징으로 구분되며, 각기 다른 기하학적 효과를 나타냄을 밝혀냈습니다.
언어 모델의 제한된 작업 메모리 관리 문제를 '고정 지연 평활화' 관점에서 재구성한 연구입니다. 기존의 즉각적 결정 방식 대신, 일정 단계의 관찰을 통해 정보의 유용성을 측정하는 RMM 정책을 제안하며, 특정 조건에서 축적된 주의(attention)보다 측정된 유용성이 더 효과적임을 분석합니다.
분산 추론 시스템에서 지연 시간 데드라인을 악용하여 정확도를 떨어뜨리는 '정확도 붕괴(accuracy collapse)' 공격을 분석합니다. 특정 워크로드 공격이 공유 자원의 경합을 유발해 고정밀 예측값을 폐기하게 만듦을 입증했습니다.