Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
기존 에이전트 벤치마크가 성능 점수에만 집중했던 한계를 넘어, 작업 완료에 소요되는 비용 데이터를 결합한 새로운 계층을 구축했습니다. 에이전트 설정부터 검증된 결과 및 비용까지 연결하여 실질적인 경제성을 평가할 수 있는 데이터를 제공합니다.
PixWorld는 3D 장면 생성과 재구성을 통합하는 단일 픽셀 공간 확산 모델입니다. VAE 없이 미분 가능한 렌더링을 통해 3D 가우시안 필드를 직접 감독하며, 기하학 인지 손실을 도입하여 구조적 일관성을 확보합니다.

선형 미분 제약 조건이 존재하는 시스템을 위한 최적 모션 계획 알고리즘인 Kinodynamic RRT*에 대해 다룹니다. 시스템의 동역학적 특성을 고려하여 최적의 경로를 생성하는 연구 내용을 포함합니다.
추론 시 backward pass 없이 지속적 학습을 수행하는 3M 파라미터 규모의 Fast-weight Memory Transformer 연구를 소개합니다. 이 모델은 별도의 TTT나 optimizer 없이 forward pass만으로 새로운 규칙을 메모리 뱅크에 저장하고 일반화할 수 있습니다.



로컬 LLM을 활용한 코드 리뷰 실험을 통해 다수결 투표 방식의 한계를 분석했습니다. 실험 결과, 다수결 방식은 모델의 정확성보다 특정 패턴의 지속성을 선택하는 경향이 있으며, 온도 설정에 따라 결과의 결정론적 특성이 변화함을 확인했습니다.
NVIDIA가 Iterative Puzzle 압축 프레임워크를 통해 개발한 Nemotron-Labs-3-Puzzle-75B-A9B 모델을 공개했습니다. 이 모델은 하이브리드 MoE 아키텍처를 사용하여 파라미터 수를 줄이면서도 추론 효율성과 정확도를 극대화했습니다.

Kyutai Labs가 CPU 환경에서 효율적으로 작동하는 100M 파라미터 규모의 초경량 TTS 모델을 출시했습니다. GPU 없이도 실시간보다 빠른 성능을 제공하며, 5초의 오디오만으로 목소리 복제가 가능합니다.
중국의 한 연구소가 사진과 음성을 활용해 입 모양이 동기화된 비디오를 생성하는 오픈 소스 모델 'LongCat-Avatar'를 공개했습니다. 이 모델은 기존 유료 비디오 생성 서비스의 성능을 위협할 만큼 강력한 성능을 보여줍니다.

NVIDIA가 음성, 소리, 추론을 통합 처리하는 30B MoE 모델인 Audex를 Hugging Face에 출시했습니다. 또한 Microsoft는 PDF를 기반으로 비디오와 블로그 등 다양한 콘텐츠를 생성하는 ResearchStudio-Reel을 공개했습니다.

Xiaomi와 Tsinghua 연구진이 멀티 티처 온-폴리시 증류 기술을 적용한 8B GUI 에이전트인 UI-MOPD를 오픈 소스로 공개했습니다. 이 모델은 데스크톱과 모바일 환경 모두에서 뛰어난 성능을 보여줍니다.
HOLA 아키텍처가 매우 작은 KV 캐시를 사용하면서도 Full Attention보다 16% 더 나은 Perplexity를 달성했음을 분석합니다. 기존의 속도 향상 중심 기술들보다 선형 어텐션 기반의 정확도 개선이 갖는 가치를 강조합니다.
Robbyant의 LingBot-Depth 2.0은 센서의 결함 영역을 마스킹 신호로 활용하는 '센서 유효성 마스킹' 기법을 통해 깊이 모델링 성능을 혁신했습니다. 이 방식은 투명한 표면이나 정반사 영역 등 실제 센서 실패 분포를 학습하여 다수의 벤치마크에서 최적의 RMSE를 기록했습니다.

Netryx Astra V2는 단일 이미지만을 사용하여 정밀한 거리 수준의 지리 위치를 파악할 수 있는 기술입니다. 해당 프로젝트는 이미지 기반의 정밀한 지리 위치 추정 능력을 보여줍니다.

파운데이션 에이전트의 인지, 기억, 지각 능력을 다루는 논문 큐레이션과 주요 에이전트형 AI 도구 및 프레임워크를 정리한 리소스 모음입니다.
NVIDIA가 Nemotron-Cascade-2-30B-A3B를 기반으로 한 통합 오디오-텍스트 LLM인 Nemotron-Labs-Audex-30B-A3B를 공개했습니다. 이 모델은 텍스트 추론 능력을 유지하면서 오디오 인코더와 확장된 어휘를 통해 음성 인식, 번역, TTS 등 강력한 오디오 작업 능력을 제공합니다.
언어 모델의 암기(Memorization)와 일반화(Generalization)를 분리하여 모델의 용량을 측정하는 새로운 방법론을 제안합니다. GPT 스타일 모델의 파라미터당 용량이 약 3.6비트임을 밝히고, 모델 용량과 데이터 크기 사이의 스케일링 법칙을 도출했습니다.
스마트폰과 같은 모바일 엣지 디바이스에서 1B~7B 규모의 LLM 성능을 벤치마킹한 연구를 분석합니다. 다양한 SoC 환경에서 지연 시간, 메모리 점유율, 양자화 방식 및 최적의 스레드 설정 등 실질적인 배포 지표를 다룹니다.
커스텀 Silia 아키텍처를 기반으로 한 117M 파라미터 규모의 소형 모델 학습 결과와 연구 내용을 소개합니다. H100 GPU를 사용하여 5시간 만에 81M 토큰을 학습 완료하였으며, 모델 구조와 추론 방법 및 논문을 공유합니다.
AlphaEvolve, ASI-Arch 등 최신 AI 모델들이 공유하는 '진화 루프' 메커니즘을 요리 콘테스트에 비유하여 설명합니다. 평가기(evaluator)의 설계가 AI의 성능과 '꼼수' 방지에 결정적인 역할을 함을 강조합니다.
TurboQuant 논문을 통해 KV 캐시 양자화 기술의 핵심 원리를 분석합니다. 무작위 직교 회전을 통해 이상치를 분산시킨 후 최적의 스칼라 양자화를 적용하여 정밀도 손실을 최소화하는 방법을 다룹니다.