Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Embodied AI 분야에 막대한 자본이 유입되고 있으나, 로봇의 성능을 평가할 표준화된 벤치마크가 부재한 문제를 지적합니다. 시뮬레이션과 실제 환경 간의 간극을 극복하기 위해 규칙 준수, 폐쇄 루프 피드백, 자기 일관성, 프레임워크 교정이라는 4단계 검증 계층을 제안합니다.

에이전트 학습을 위한 인터랙티브 월드 모델로의 비디오 생성 기술 진화 과정을 다룬 연구 큐레이션입니다. 비디오 생성 모델이 단순한 영상 제작을 넘어 에이전트의 학습 환경으로서 어떻게 발전하고 있는지 분석합니다.
LLM 평가 모델이 자신의 출력물이나 특정 모델 제품군의 문체를 선호하는 '자기 선호 편향(Self-Preference Bias)' 문제를 다룹니다. 연구 결과 GPT-4와 같은 모델이 자신의 생성물을 선택할 확률이 매우 높으며, 이는 평가의 객관성을 해치는 요소로 지적됩니다.

Pareto LoRA는 멀티모달 지시어 튜닝 시 발생하는 모달리티 간 그래디언트 불균형 문제를 해결하기 위해 이중 목적 최적화 방식을 제안합니다. Emu2 모델 실험 결과, 텍스트 성능을 유지하면서도 이미지 품질을 최대 44.9% 향상시키는 성과를 거두었습니다.
사후 API 가드레일은 모델의 근본적인 위험 능력을 제거하지 못하며 탈옥에 취약하다는 점을 지적합니다. 대신 강력한 평가, 단계적 출시, 오픈 소스 지원 및 독립적 검증을 통한 근본적인 안전 확보를 제안합니다.

오픈 소스 모델인 GLM-5.2가 1.5TB 크기에서 238GB로 부피를 84% 압축하는 데 성공했습니다. 이를 통해 성능의 82%를 유지하면서도 고사양 Mac 등 로컬 환경에서 구동이 가능해졌습니다.

오픈 웨이트 모델인 GLM-5.2가 Design Arena 코드 부문에서 역대 최고 점수를 기록하며 Claude Fable 5를 넘어섰습니다. 시각적 능력 없이도 Elo 점수 1360을 달성하며 뛰어난 성능을 입증했습니다.

레이블이 없는 Minecraft 게임플레이 영상을 활용하여 모방 학습을 수행하는 Video Pre-Training(VPT) 기술을 소개합니다. 인간의 시연 영상을 통해 행동을 복제하고, 강화학습을 통해 특정 목표를 달성하도록 미세 조정된 모델들을 제공합니다.
GLM-5 오픈 웨이트 모델 출시, SDXL 이미지 생성 벤치마크, 그리고 LoRA를 개선한 고급 미세 조정 기술을 소개합니다. 로컬 환경에서의 모델 최적화와 실행을 위한 최신 연구 동향을 다룹니다.

Purple Llama CyberSecEval은 언어 모델의 보안 코딩 능력을 평가하기 위해 설계된 새로운 벤치마크입니다. 모델이 보안 취약점이 있는 코드를 생성하거나 보안 위협을 식별하는 능력을 측정합니다.
에이전트 메모리를 단순한 데이터베이스(CRUD)로 취급할 때 발생하는 네 가지 실패 모드를 분석하고, 이를 해결하기 위한 새로운 모델인 GEM(Governed Evolving Memory)을 소개합니다. 메모리를 레코드 단위가 아닌 상태(state) 단위의 진화 과정으로 재정의해야 함을 강조합니다.

OpenAI가 새로운 모델 출시 전 실제 대화 데이터를 재현하여 위험성을 테스트하는 '배포 시뮬레이션' 기술을 도입했습니다. 이는 벤치마크의 한계를 넘어 실제 운영 환경에서의 안전성과 모델 품질을 검증하는 새로운 표준이 될 전망입니다.
Anthropic이 고성능 Mythos-class 모델인 Claude Fable 5를 출시했습니다. 이 모델은 강력한 추론 능력을 갖추되 새로운 분류기를 통해 안전 가드레일을 적용했으며, 이전 모델인 Opus 4.8 대비 높은 비용과 성능 향상을 특징으로 합니다.

Ovis는 멀티모달 거대 언어 모델(MLLM)의 성능을 높이기 위해 구조적 임베딩 정렬 방식을 제안합니다. 시각적 정보와 언어적 정보를 효과적으로 결합하여 모델의 이해도를 개선하는 연구를 다룹니다.

심층 리서치 에이전트가 외부 도구 사용 중 민감한 정보를 유출하는 '모자이크 효과' 위험을 분석한 연구입니다. MosaicLeaks라는 새로운 태스크를 제안하며, 강화학습 기반의 PA-DR 방법론을 통해 성능을 유지하면서 정보 유출을 획기적으로 줄이는 방안을 제시합니다.

OpenAI가 GPT-5.5 Instant를 통해 ChatGPT의 건강 지능(Health Intelligence)을 대폭 개선했습니다. 이 모델은 HealthBench 평가에서 프런티어 모델 수준의 성능을 보이며, 의사들의 검토를 통해 정확성과 안전성을 높였습니다.

ByteDance가 출시한 Seedance 2.1은 비디오 생성 시 오디오를 동시에 생성하는 네이티브 동기화 기능을 갖춘 최신 모델입니다. 2.0 대비 시각적 품질이 20% 향상되었으며, 멀티샷 일관성을 통해 장면 간 캐릭터와 스타일을 유지하는 능력이 탁월합니다.
Ant Group이 168억 개의 파라미터를 보유한 대규모 TTS 모델인 Ming-omni-tts-16.8B-A3B를 출시했습니다. 이 모델은 음성 생성뿐만 아니라 음악 제작 기능까지 갖추고 있으며, Hugging Face를 통해 공개되었습니다.

Kairos는 세계 이해, 생성, 행동을 통합한 4B 규모의 네이티브 월드 모델 아키텍처입니다. 하이브리드 선형 어텐션을 사용하여 실시간 엣지 추론이 가능하며, 낮은 연산 비용으로도 14B 모델을 능가하는 성능을 보여줍니다.
Laguna-M.1은 에이전트 기반 코딩과 장기 작업을 위해 설계된 225B 규모의 MoE 모델입니다. 256개의 전문가를 활용한 고용량 라우팅과 글로벌 어텐션 아키텍처를 통해 강력한 코딩 에이전트 성능을 제공합니다.