Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Anthropic의 Claude Fable 5가 Artificial Analysis AI Index에서 1위를 차지한 배경을 분석합니다. 단순한 성능 지표를 넘어 거버넌스, 평가 파이프라인, 장기적 워크플로 시뮬레이션 능력이 새로운 AI 에이전트의 기준이 되고 있음을 설명합니다.
Transformer의 어텐션 메커니즘 대신 학습된 기하학적 관계를 활용하는 새로운 언어 모델 연구인 DRM Language Emitter를 소개합니다. 이 모델은 잠재 상태의 움직임을 통해 언어를 생성하며, 셀프 어텐션이나 KV 캐시 없이도 자기회귀적 생성이 가능함을 탐구합니다.

생성된 데이터셋을 활용하여 분류 모델의 강건성(Robustness)을 높이는 방법에 대해 다룹니다. 현실의 불확실성을 상상력을 통해 데이터로 구현하여 모델의 성능을 개선하는 접근법을 제시합니다.
12개의 다양한 AI 모델을 대상으로 월드컵 경기 예측 실험을 진행하여 모델의 성능과 편향성을 테스트했습니다. 실험 결과, 특정 모델의 우위보다는 모델들이 가진 '정배당 편향(favorite bias)'과 예측 패턴을 확인하는 데 중점을 두었습니다.
최근 LLM 학습 연구에서 단일 점수 형태의 스칼라 보상 대신, 평가 기준(Rubric)을 활용한 구조화된 피드백의 중요성이 부각되고 있습니다. 루브릭 조건부 자기 증류 방식은 모델에게 구체적인 개선 방향을 제공하여 학습 신호의 품질을 높입니다.
Google DeepMind가 발표한 DiffusionGemma 26B는 기존의 자기회귀 방식 대신 이산 확산(Discrete Diffusion) 기술을 사용하여 텍스트를 병렬로 생성하는 오픈 웨이트 모델입니다. 이 방식은 낮은 배치 크기에서도 H100 GPU 기준 초당 1,000개 이상의 토큰을 생성할 수 있어 지연 시간에 민감한 워크로드에 혁신적인 성능을 제공합니다.
Google DeepMind가 발표한 DiffusionGemma는 이미지 생성의 노이즈 제거 방식을 텍스트 생성에 적용하여 초당 1,000개 이상의 토큰을 생성하는 모델입니다. 기존 자기회귀 방식과 달리 텍스트 블록을 병렬로 처리하여 처리량을 약 4배 향상시켰습니다.

STU-Net은 대규모 지도 사전 학습을 통해 확장성과 전이 가능성을 높인 의료 영상 분할 모델입니다. 의료 영상 분야에서 효율적인 학습과 적용을 목표로 합니다.

과학적 실험을 수행하기 위해 스스로 조직화되는 AI 에이전트에 관한 연구를 소개합니다. 실험 과정에서 자율적으로 구조를 형성하고 문제를 해결하는 에이전트의 가능성을 다룹니다.
GLM-5.2와 Claude Opus의 코딩 성능 및 비용 효율성을 비교 분석합니다. 모델 단가는 GLM-5.2가 훨씬 저렴하지만, 동일한 성능을 내기 위해 필요한 토큰 양을 고려하면 실제 경제적 격차는 크지 않습니다.
ResNet, Transformer, RNN 등 주요 신경망 아키텍처를 Hamilton-Jacobi 편미분 방정식(PDE) 관점에서 통합적으로 분석합니다. 각 모델의 구조적 특징을 수치 적분기의 타임스텝과 해밀토니언으로 재정의하여 수학적 통일성을 제시합니다.
Lip Forcing 연구는 디노이징 단계를 단 2회로 줄여 실시간 립싱크(31 FPS)를 구현하는 기술을 제안합니다. 기존의 무거운 양방향 디퓨전 모델 대신 컨디셔닝 파이프라인을 재구성한 스튜던트 모델을 사용하여 속도와 동기화 성능을 동시에 개선했습니다.
GLM-5.2 모델의 API 성능과 특성을 분석한 리뷰입니다. 긴 컨텍스트에서의 일관성, 빠른 추론 속도, 그리고 불필요한 장황함이 없는 깔끔한 답변 능력을 높게 평가하며 프런티어 모델로서의 가능성을 제시합니다.

LectūraAgents는 AI 학습에 교수-학생 역학을 도입한 멀티 에이전트 시스템입니다. 개인 맞춤형 교육을 위해 체화된 레슨을 제공하며, ACE-Ego-0 모델을 통해 인간의 비디오를 로봇의 동작으로 변환하는 기술을 선보입니다.
Meta가 Hugging Face를 통해 VLA(Vision-Language-Action) 사전 학습을 위한 LAMP 데이터셋을 출시했습니다. 1인칭 시점의 인간 및 로봇 데이터를 통합하여 로봇의 동작 학습을 지원합니다.

AI 모델의 성능 저하 현상을 실시간으로 추적하는 벤치마크 플랫폼 AIStupidLevel을 소개합니다. 모델 업데이트, 양자화, 연산 자원 제한 등 성능 변화를 일으키는 주요 원인들을 분석합니다.

OpenAI의 새로운 이미지 생성 모델인 DALL-E(덕테잎)와 Google Gemini의 Nano Banana를 한국어 텍스트 생성 능력을 중심으로 비교 분석합니다. DALL-E가 복잡한 한국어 글자 구현에서 압도적인 성능을 보임을 확인했습니다.

OpenAI의 GPT 5.5 출시와 함께 Claude Opus 4.7과의 성능 및 토큰 효율성을 비교 분석합니다. 에이전트 코딩, 컴퓨터 사용, 과학 연구 분야의 향상과 더불어 토큰 효율을 통한 비용 절감 가능성을 다룹니다.
멀티태스크 학습 시 발생하는 태스크 간 간섭 문제를 해결하기 위해 필수 부분 공간 병합(ESM) 기술을 제안합니다. 모델 업데이트의 에너지가 집중된 핵심 부분 공간을 분석하여, 훈련 없이도 여러 모델의 지식을 효과적으로 통합하는 방법을 다룹니다.
Google DeepMind가 개발한 수학 특화 에이전트 시스템 Aletheia를 소개합니다. Gemini 3 Deep Think를 기반으로 하며, IMO 수준의 문제를 90% 이상의 정확도로 해결하고 자연어로 증명을 작성하는 것이 특징입니다.