Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Tencent가 MoE 아키텍처를 적용한 295B 파라미터 규모의 오픈 소스 모델 Hy3를 공개했습니다. 이 모델은 조 단위 파라미터급 성능을 제공하면서도 추론 비용과 연산 요구사항을 획기적으로 낮춘 것이 특징입니다.
ICML 논문에 따르면 7B 모델의 실제 암기 용량은 약 3GB 수준으로, 파라미터당 3.6비트로 추정됩니다. 모델은 데이터를 통째로 복사하기보다 패턴을 압축하여 일반화하며, 데이터 규모가 암기 용량을 초과할수록 프라이버시 보호에 유리해질 수 있습니다.
선형 어텐션 모델의 메모리 손실 문제를 해결하기 위해 해마(Hippocampus) 구조를 도입한 HOLA를 제안합니다. 고정된 순환 상태와 함께 정확한 KV 캐시를 병행 사용하여 긴 문맥에서도 높은 니들 리콜 성능을 유지합니다.
연속적 MDP 계획에서 발생하는 호라이즌 저주를 해결하기 위해 그래프 희소 샘플링(GSS) 알고리즘을 제안합니다. GSS는 후보 결정 간 미래를 공유하는 분기 없는 그래프 구조를 통해 계산 효율성을 높이고 GPU 가속을 지원합니다.
사용자의 주권(privacy, consent, evidence)을 보존하는 개인 에이전트를 평가하기 위한 새로운 벤치마크인 SovereignPA-Bench를 제안합니다. 기존 벤치마크가 놓치기 쉬운 플랫폼 중재 및 조작적 유인에 대한 저항력을 측정하며, 다양한 모델과 정책을 통해 에이전트의 정렬 능력을 검증합니다.
자기회귀 ASR 시스템에서 비음성 구간 발생 시 타임스탬프가 어긋나는 드리프트 현상을 해결하기 위한 REDDIT 프레임워크를 제안합니다. 재생 기반 분포 편집을 통해 기존 성능 저하(망각) 없이 타임스탬프 정확도를 획기적으로 개선했습니다.
Cortex는 상위 수준의 VLM과 하위 수준의 VLA 사이의 간극을 메우기 위해 양방향 정렬된 체화된 에이전트 프레임워크를 제안합니다. 표준화된 스킬 프리미티브와 맞춤형 계획 인터페이스를 통해 장기적 과업 수행 능력을 혁신적으로 개선했습니다.
시각적 생성기가 학습 데이터에 없는 새로운 정보를 생성할 때 발생하는 지식 경계 문제를 해결하기 위한 연구입니다. '가르친 후 검색하는(teach-then-search)' 공동 학습 프레임워크를 통해 검색 도구를 활용한 에이전트 기반 시각적 생성의 성능을 개선합니다.
스트리밍 음성-대-음성(speech-to-speech) 모델의 대화 자연스러움을 평가하기 위한 새로운 벤치마크인 SPEARBench를 제안합니다. 지연 시간, 발화 교대, 감정적 적응 등 다차원적인 프로토콜을 통해 기존 벤치마크가 포착하지 못한 대화의 질적 측면을 평가합니다.
복잡한 물리적 상호작용이 발생하는 환경을 위한 최초의 멀티플레이어 월드 모델을 소개합니다. Rocket League 데이터를 활용해 50억 파라미터 규모의 잠재 확산 모델을 구축하였으며, 여러 에이전트의 행동을 조건으로 실시간 상호작용을 생성합니다.
LLM 생성 텍스트에 삽입된 워터마크의 선택적 공개를 가능하게 하는 새로운 프레임워크 HeRo를 제안합니다. 계층적 어휘 라우팅을 통해 정보 노출을 최소화하면서도 세밀한 액세스 제어와 높은 탐지 정확도를 동시에 달성합니다.
언어 모델의 뉴런 기여도 점수가 인과적으로 중요한 행을 실제로 식별하는지 검증하는 연구입니다. 원샷 뉴런 제로화 방식을 통해 기여도 기반 방법이 모델의 유창성을 유지하면서도 유해한 요청에 대한 거절 메커니즘을 효과적으로 제어할 수 있음을 입증했습니다.
오프라인 강화학습의 오프-정책 평가를 위해 Bellman 완결성 가정 없이도 작동하는 FORE(Fitted Occupancy-Ratio Evaluation) 방법을 제안합니다. adjoint Bellman 재귀를 활용하여 할인된 점유율 비율을 추정하며, 이론적 수렴성과 유한 샘플 후회 경계를 입증했습니다.
장기적 목표를 수행하는 에이전트형 LLM의 컨텍스트 제한 문제를 해결하기 위해 컨텍스트 압축을 강화학습에 통합한 CompactionRL을 제안합니다. 토큰 수준 손실 정규화와 교차 궤적 일반화 어드밴티지 추정을 통해 작업 실행과 요약 생성을 동시에 최적화합니다.
변동성이 큰 자동화 작업(VA)을 위해 그래프 기반 정책(GaP)을 활용하는 멀티 에이전트 자기 학습 프레임워크를 제안합니다. MORSL 라이브러리를 통해 인지, 계획, 제어 노드를 포함하는 계산 그래프를 생성하고 시뮬레이션을 통해 이를 반복적으로 최적화합니다.
이산 확산 모델(Discrete Diffusion Model)의 학습 대상과 최적화 원리를 수학적으로 분석한 연구입니다. CTMC ELBO 유도를 통해 오라클 거리 정리를 증명하고, 디노이저, 스코어, 브릿지 플러그인 간의 관계를 규명합니다.
LLM의 검증 능력을 새로운 확장 축으로 정의한 'LLM-as-a-Verifier' 프레임워크를 소개합니다. 이 방식은 이산적 점수 대신 로짓 분포의 기댓값을 활용한 연속적 점수를 생성하여 검증의 정밀도와 정확도를 높입니다. 다양한 벤치마크에서 SOTA 성능을 기록하며 에이전트 모니터링 및 강화학습 피드백으로도 활용 가능함을 입증했습니다.
약한 모델의 강화학습(RL) 성과를 강한 모델로 효율적으로 전이하는 Direct-OPD 기법을 제안합니다. 교사 모델의 정책 변화를 암시적 보상 신호로 활용하여, 타겟 모델의 추가적인 롤아웃 비용 없이도 추론 성능을 크게 향상시킵니다.
카메라 보정 없이도 다양한 시점에서 동작 가능한 새로운 VLA 모델인 CamVLA를 소개합니다. 카메라 기하학을 예측하여 로봇 동작을 생성함으로써, 별도의 외부 파라미터나 깊이 정보 없이 단일 RGB 이미지로도 안정적인 로봇 제어를 구현합니다.
LLM을 활용한 테스트 오라클 생성 연구를 체계적으로 고찰한 논문입니다. 기존 연구들이 간과했던 '판결 권위의 원천'을 기준으로 오라클의 형태, 메커니즘, 도메인 등을 분석하여 새로운 분류 체계를 제시합니다.