Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
기업용 AI가 실험 단계를 넘어 운영 단계로 진입함에 따라, 신뢰할 수 있는 인텔리전스 운영을 위한 컨트롤 플레인 모델인 AGL-1을 제안합니다. 이 모델은 검색, 메모리, 에이전트 실행 등 AI 실행 경로 전반에 걸친 거버넌스 체계를 구축하는 것을 목표로 합니다.
기업용 에이전트 AI의 배포를 위해 제어, 보증 및 거버넌스를 평가하는 새로운 프레임워크인 CAGE-1을 소개합니다. 단순 답변 정확도를 넘어 권한, 정책 집행, 도구 안전성 등 비즈니스 운영에 필수적인 다각도 평가 지표를 다룹니다.
코드 수리 성능을 높이기 위해 강화학습 기반의 '앵커드 셀프 플레이(ASP)' 기법을 제안합니다. 기존 셀프 플레이의 편향 문제를 해결하기 위해 코드 임베딩 유사도 보상과 참조 버그를 활용하여 합성 버그와 실제 버그 모두에서 높은 수리율을 달성했습니다.
실제 Unreal Engine 5 환경에서 C++ 코드를 수정하는 코딩 에이전트의 능력을 평가하기 위한 새로운 벤치마크인 GameEngineBench를 제안합니다. 110개의 복잡한 작업을 통해 최첨단 모델들이 실시간 상호작용 소프트웨어 개발에서 겪는 한계를 분석합니다.

DeepSeek-Prover-V2는 강화학습을 활용하여 복잡한 수학적 문제를 하위 목표로 분해하고 형식적으로 추론하는 모델입니다. 수학적 증명 과정에서 논리적 단계를 체계적으로 나누어 해결 능력을 높이는 데 집중합니다.
OpenAI의 Sora 서비스 중단 이후 시장을 주도하는 Runway Gen-4, Kling AI, Google Veo 3.1의 성능을 비교 분석합니다. 각 모델의 제어 기능, 가성비, 오디오 동기화 능력 및 비용 효율성을 데이터 기반으로 검토합니다.
Kokoro, Supertonic, Inflect-Nano, Pocket TTS 등 소형 TTS 모델들을 대상으로 CPU 환경에서의 성능과 UTMOS 점수를 비교 분석한 벤치마크 결과입니다. 모델별 아키텍처에 따른 RTF 스케일링 특성과 UTMOS 지표의 한계점을 심도 있게 다룹니다.
LingBot-Vision은 자기지도 사전학습을 위해 교사 모델이 예측한 조밀한 경계 필드를 활용하여 마스킹 전략을 개선한 모델입니다. DINOv3 대비 적은 데이터로도 우수한 NYUv2 선형 프로브 성능을 보이며, 특히 인코더 초기화 측면에서 강력한 성능을 입증했습니다.

Tencent에서 295B 파라미터 규모의 MoE 모델인 Hy3를 Apache 2.0 라이선스로 출시했습니다. 21B의 활성 파라미터를 사용하며, 기존 오픈 소스 플래그십 모델들과 경쟁할 수 있는 성능과 256K의 긴 컨텍스트 길이를 제공합니다.

PD-분리형 MoE 서빙 시 전문가 지역성을 고려하여 지연 시간을 줄이는 ELDR 라우팅 기법을 제안합니다. Prefill 단계의 전문가 활성화를 바탕으로 생성 단계의 전문가를 예측하여 최적의 워커에 요청을 할당합니다.
도구 설명(Tool description)과 도구 출력(Tool output) 간의 프롬프트 인젝션 취약성 차이를 분석한 연구입니다. 모델이 도구 출력은 낮은 우선순위로 처리하여 방어하지만, 도구 설명은 시스템 지침과 유사하게 신뢰하여 공격에 취약함을 밝힙니다.

Anthropic의 J-space 연구는 모델의 내부 사고 과정을 측정 가능한 공학적 문제로 전환했습니다. 모델의 중간 계층에서 다단계 추론을 구동하는 핵심 개념 공간을 발견하여, 모델의 의도를 출력 전 단계에서 직접 파악할 수 있는 기계론적 도구를 제시합니다.
코드 청결도가 코딩 에이전트 성능에 미치는 영향을 다룬 연구에 대해 방법론적 한계를 지적하며 비판적 분석을 제공합니다. 실험 설계의 통제 미흡을 지적하는 동시에, 실무적 관점에서 깨끗한 코드베이스와 린터 활용이 에이전트 효율성에 미치는 중요성을 강조합니다.

데이터 중심(data-centric) VLM 학습을 위한 대규모 벤치마크인 DataComp-VLM을 소개합니다. 160개의 데이터셋과 6T 토큰을 활용하여 적절한 데이터 혼합이 필터링보다 성능 향상에 더 효과적임을 입증했습니다.

OrbitQuant는 이미지 및 비디오 확산 트랜스포머(Diffusion Transformers)를 위한 캘리브레이션 프리 PTQ 기술입니다. W4A4 환경에서 SOTA를 달성했으며, 기존 방식이 실패하는 W2A4 환경에서도 이미지 생성이 가능합니다.
Anthropic은 Claude 모델이 사용자에게 공개되는 사고의 사슬(CoT)과는 별개로, 내부적으로 정보를 처리하는 'J-Space'라는 독립적인 작업 공간을 사용함을 발견했습니다. 이는 인간의 의식적 사고 방식과 유사한 구조를 보이며, 모델의 정렬 불량이나 비밀스러운 의도를 탐지하는 데 중요한 단서가 될 수 있습니다.
Qwen3.6-27B 모델의 성능을 유지하면서 사고 토큰(thinking tokens) 사용량을 획기적으로 줄인 ThinkingCap 모델을 소개합니다. 최첨단 파인튜닝 알고리즘을 통해 평균 50%, 최대 90% 이상의 토큰 절감 효과를 달성했습니다.
ZONOS2의 새로운 업데이트 소식을 발표하며, 표현력이 풍부한 음성 및 다국어 출력 기능을 포함한 데모를 공개했습니다. 로컬 추론 코드와 기술 보고서가 함께 제공되며, 새로운 가격 정책과 향상된 동시성 지원을 특징으로 합니다.
데이터가 극도로 부족한 위성 텔레메트리 환경에서 이상 징후를 탐지하기 위한 교차 모달 지식 증류(CMKD) 프레임워크를 제안합니다. 풍부한 멀티모달 데이터를 가진 교사 모델의 지식을 희소한 단일 모달리티를 가진 경량 학생 모델로 전이하여 성능을 극대화합니다.
Anthropic이 모델의 내부 활성화 상태에서 언어적 개념을 직접 추출하는 해석 가능성(interpretability) 연구인 J-lens를 공개했습니다. 이 연구는 모델의 텍스트 출력(CoT)과 실제 내부 계산 사이의 간극을 메우고, 모델 내부의 '언어적 워크스페이스'를 규명합니다.