Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 로봇 조작에 유망한 VLA 모델의 계산 병목 현상을 해결하기 위해 ActionCache라는 외부 캐시를 제안합니다. 이 캐시는 과거 중간 액션을 재사용하여 목표 액션 근처에서의 생성을 워밍업함으로써 추론 지연 시간을 크게 줄입니다. 실험 결과, ActionCache는 대표적인 플로우 기반 VLA 모델에서 높은 태스크 성공률을 유지하며 상당한 추론 가속화를 달성했습니다.
복잡한 물리적 상호작용이 발생하는 환경을 위한 최초의 멀티플레이어 월드 모델을 소개합니다. Rocket League 데이터를 활용해 50억 파라미터 규모의 잠재 확산 모델을 구축하였으며, 여러 에이전트의 행동을 조건으로 실시간 상호작용을 생성합니다.
LLM 생성 텍스트에 삽입된 워터마크의 선택적 공개를 가능하게 하는 새로운 프레임워크 HeRo를 제안합니다. 계층적 어휘 라우팅을 통해 정보 노출을 최소화하면서도 세밀한 액세스 제어와 높은 탐지 정확도를 동시에 달성합니다.
언어 모델의 뉴런 기여도 점수가 인과적으로 중요한 행을 실제로 식별하는지 검증하는 연구입니다. 원샷 뉴런 제로화 방식을 통해 기여도 기반 방법이 모델의 유창성을 유지하면서도 유해한 요청에 대한 거절 메커니즘을 효과적으로 제어할 수 있음을 입증했습니다.
오프라인 강화학습의 오프-정책 평가를 위해 Bellman 완결성 가정 없이도 작동하는 FORE(Fitted Occupancy-Ratio Evaluation) 방법을 제안합니다. adjoint Bellman 재귀를 활용하여 할인된 점유율 비율을 추정하며, 이론적 수렴성과 유한 샘플 후회 경계를 입증했습니다.
장기적 목표를 수행하는 에이전트형 LLM의 컨텍스트 제한 문제를 해결하기 위해 컨텍스트 압축을 강화학습에 통합한 CompactionRL을 제안합니다. 토큰 수준 손실 정규화와 교차 궤적 일반화 어드밴티지 추정을 통해 작업 실행과 요약 생성을 동시에 최적화합니다.
변동성이 큰 자동화 작업(VA)을 위해 그래프 기반 정책(GaP)을 활용하는 멀티 에이전트 자기 학습 프레임워크를 제안합니다. MORSL 라이브러리를 통해 인지, 계획, 제어 노드를 포함하는 계산 그래프를 생성하고 시뮬레이션을 통해 이를 반복적으로 최적화합니다.
이산 확산 모델(Discrete Diffusion Model)의 학습 대상과 최적화 원리를 수학적으로 분석한 연구입니다. CTMC ELBO 유도를 통해 오라클 거리 정리를 증명하고, 디노이저, 스코어, 브릿지 플러그인 간의 관계를 규명합니다.
LLM의 검증 능력을 새로운 확장 축으로 정의한 'LLM-as-a-Verifier' 프레임워크를 소개합니다. 이 방식은 이산적 점수 대신 로짓 분포의 기댓값을 활용한 연속적 점수를 생성하여 검증의 정밀도와 정확도를 높입니다. 다양한 벤치마크에서 SOTA 성능을 기록하며 에이전트 모니터링 및 강화학습 피드백으로도 활용 가능함을 입증했습니다.
약한 모델의 강화학습(RL) 성과를 강한 모델로 효율적으로 전이하는 Direct-OPD 기법을 제안합니다. 교사 모델의 정책 변화를 암시적 보상 신호로 활용하여, 타겟 모델의 추가적인 롤아웃 비용 없이도 추론 성능을 크게 향상시킵니다.
카메라 보정 없이도 다양한 시점에서 동작 가능한 새로운 VLA 모델인 CamVLA를 소개합니다. 카메라 기하학을 예측하여 로봇 동작을 생성함으로써, 별도의 외부 파라미터나 깊이 정보 없이 단일 RGB 이미지로도 안정적인 로봇 제어를 구현합니다.
Brownian Bridge Diffusion Models(BBDM)의 효율적인 스케줄 설계를 위해 Mixture-of-Gaussians 기반의 분석 프레임워크를 제안합니다. Wasserstein과 MSE 기준을 통해 지각적 품질과 재구성 충실도 사이의 트레이드오프를 분석하고 범용적인 스케줄 설계 방식을 제시합니다.
CoDA는 멀티태스크 LoRA 학습 시 도메인 간의 간섭을 줄이고 긍정적 전이를 극대화하는 공동 적응형 컨트롤러입니다. 라벨 없는 프로브를 통해 도메인별 역량과 학습 궤적을 추적하여 최적의 데이터 참여도와 손실 가중치를 결정합니다.
비디오 이상 탐지를 위해 운동학적 정보와 의미론적 정보를 결합한 월드 모델 파이프라인인 PULS를 제안합니다. 잠재적 명확성 가설을 통해 예측된 미래 표현이 현재 관찰보다 의미론적으로 더 잘 분리됨을 입증했습니다.
지식 증류 시 교사 모델의 절대적 특징이 아닌, 등가 클래스 내의 불변량을 학습해야 함을 이론적으로 규명합니다. Qwen2.5와 Llama-3.1을 통해 은닉 표현 매칭과 모델 능력 복구 사이의 관계를 기하학적으로 분석했습니다.
WeightCLIP은 신경망 가중치와 데이터셋 정보를 정렬하여 가중치 공간 표현을 학습하는 새로운 방법론을 제안합니다. 대조 학습을 통해 데이터셋 특성이 반영된 잠재 공간을 구축하며, 이를 통해 검색, 생성, 정제 등 다양한 다운스트림 태스크에서 뛰어난 성능을 입증했습니다.
UNet, ViT, DiT 아키텍처에서 기하학적 섭동이 은닉 상태에 미치는 영향을 연구한 논문입니다. 이면각 군을 활용한 변환을 통해 특징 안정성을 분석하며, 기하학적 일관성이 모델의 안정적인 개입을 위한 핵심 원칙임을 입증합니다.
NetinfoGC는 고전적 구조 지표를 활용하여 그래프 분류를 수행하는 새로운 프레임워크를 제안합니다. 엔드투엔드 학습 없이도 NUI(네트워크 사용 가능 정보)를 통해 그래프 표현의 품질을 평가하고 최적의 구조적 기술자를 선택할 수 있습니다.
양자 고속 가중치 프로그래머(QFWP)의 긴 시퀀스 처리 시 발생하는 발산 문제를 해결하기 위해 유계 메모리 게이트를 적용한 새로운 연구를 소개합니다. tanh 게이트를 통해 이전 상태의 변조을 안정화함으로써 양자 시퀀스 모델링의 강건성을 향상시켰습니다.
HNSW 그래프의 탐욕적 탐색이 가진 정확성 보장 문제를 해결하기 위해 'Certify-then-Rectify' 프레임워크를 제안합니다. 통계적 인증을 통해 검색 품질을 평가하고, 필요 시 기하학적 스패너와 극값 이론을 활용해 정확한 검색으로 전환하여 속도와 정확성을 동시에 확보합니다.