Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
BORA는 VLA 모델의 숙련된 로봇 조작을 위해 설계된 오프라인-투-온라인 강화학습 프레임워크입니다. 오프라인 비평가 구축과 온라인 잔차 적응 메커니즘을 통해 실세계의 실행 오류를 줄이고 물리적 환경 적응력을 높입니다.
멀티 에이전트 시스템(MAS)의 최적화 문제를 해결하기 위해 시간적 및 구조적 신용 할당 방식을 제안합니다. 상태 공간 병목과 정적 역할 정책을 통해 오류 신호를 분리하고, 이를 기반으로 한 블록 좌표 하강 알고리즘을 통해 효율적인 프롬프트 최적화를 구현합니다.
VLM의 3D 공간 추론 능력을 향상시키기 위해 기하학적 사전 지식을 트랜스포머 레이어에 직접 주입하는 GASP 프레임워크를 제안합니다. 대규모 비디오 장면의 정답 기하학을 활용한 이중 목적 함수 학습을 통해 3D VQA 데이터 없이도 벤치마크 성능을 크게 개선했습니다.
언어 모델(LM)이 상태 변화에 따라 엔티티를 추적하는 메커니즘을 조사한 연구입니다. 모델이 점진적으로 상태를 추적하는 대신 마지막 토큰에서 정보를 병렬적으로 집계하는 비-점진적 방식을 사용함을 발견했습니다.
시각-언어 작업의 세밀한 감독을 위해 제안된 $RLR^3$ 방법론을 소개합니다. 결정론적 검증기와 LLM-as-a-Judge를 결합하여 루브릭 기반의 강건한 보상을 제공하며, 기존 RLVR 대비 우수한 성능을 입증했습니다.
멀티턴 대화 시 정보가 점진적으로 공개될 때 발생하는 모델의 성능 저하 문제를 해결하기 위한 CCOPD 기법을 제안합니다. 동일한 정보를 제공하더라도 대화 방식에 따라 답변이 달라지는 '자기 고정 드리프트' 현상을 완화하는 데 집중합니다.
LLUMI는 정신 건강 지원을 위해 Reddit 커뮤니티의 피드백을 활용하여 LLM의 공감 능력과 안전성을 개선하는 프레임워크입니다. 생성 모델과 개선 모델을 결합하여 오픈 소스 모델로도 GPT와 대등한 성능을 구현하며 개인정보 보호 문제를 해결합니다.
PhyGenHOI는 텍스트 입력을 기반으로 물리적으로 정확한 4D 인간-물체 상호작용(HOI) 장면을 생성하는 새로운 프레임워크입니다. Motion Diffusion Model과 물리 시뮬레이션(MPM)을 결합하여 시각적 충실도와 물리적 일관성을 동시에 확보합니다.
Qwen-VLA는 로봇의 조작, 내비게이션, 궤적 생성을 단일 모델로 통합한 체화된 파운데이션 모델입니다. DiT 기반 행동 디코더를 통해 다양한 로봇 형태와 환경에서도 높은 일반화 성능을 보여줍니다.
Loong은 3E 메모리 모듈을 활용하여 장문 문서 번역 시 발생하는 컨텍스트 제약과 중복 문제를 해결하는 에이전트입니다. 심층 추론과 강화학습을 통해 최적의 컨텍스트를 적응적으로 선택하며, 다국어 번역에서 높은 품질과 안정성을 입증했습니다.
점진적 정보 공개 환경에서 LLM의 과학적 가설 생성 능력을 평가하는 새로운 벤치마크 프레임워크인 ProjectionBench를 소개합니다. 모델이 최소한의 정보에서부터 상세한 기술 정보까지 단계적으로 제공받으며 혁신성과 근거 있는 추론 능력을 어떻게 발휘하는지 측정합니다.
MIRA는 LLM 중간 학습 단계에서 이질적인 데이터 소스에 최적화된 데이터 선택을 위해 제안된 프레임워크입니다. 자기 앵커링 루브릭 발견 기술을 통해 소스별 맞춤형 기준을 설정하고, 이를 학생 스코어러로 증류하여 확장성을 확보합니다. 실험 결과, 코드 중심 학습에서 데이터 사용량을 절반으로 줄이면서도 뛰어난 성능을 입증했습니다.
임상적 추론 능력을 평가하기 위해 비구조화된 텍스트를 HL7 FHIR R4 형식으로 변환하는 MedCase-Structured 데이터셋을 제안합니다. LLM의 환각을 줄이기 위해 단계별 생성과 용어 기반 검증 파이프라인을 결합하여 구조적 일관성을 확보했습니다.
Archon은 텍스트, 오디오, 모션, 시각적 콘텐츠 등 7가지 양식을 통합하는 인간 중심의 멀티모달 모델입니다. 시맨틱 비디오 재매개변수화와 '양식 내 사고(Thinking in Modality)' 방식을 통해 고충실도 디지털 휴먼 생성을 구현합니다.
시각적 생성 모델링 연구를 위한 대규모 허용형 이미지 코퍼스인 GPIC를 소개합니다. 약 28조 픽셀 규모의 데이터셋으로, 상업적 이용이 가능한 라이선스와 안전 필터링을 거친 1억 개의 학습 데이터를 포함합니다.
로봇의 인지적 추론과 창의적 문제 해결 능력을 평가하기 위한 새로운 양손 로봇 벤치마크인 RoboWits를 제안합니다. 멀티 에이전트 협력 프레임워크를 통해 자동화된 태스크 생성 파이프라인을 구축하여 다양한 변이 시나리오를 제공합니다.
LLM 학습 효율을 높이기 위해 데이터 선택을 넘어 전략적 데이터 구성(Data Organization)의 중요성을 탐구한 연구입니다. 사전 계산된 점수를 재사용하여 계산 오버헤드를 최소화하면서, 네 가지 핵심 가이드라인을 통해 최적의 데이터 순서 지정 방법을 제안합니다.
다중 구성 요소 LLM 에이전트에서 개별 요소는 일관적이지만 전체 시스템은 비일관해지는 '구성적 비일관성' 문제를 수학적으로 공식화했습니다. 구성적 잔차($\epsilon^*$)를 통해 이를 측정하며, 기존의 검색이나 프롬프팅 방식이 이 문제를 해결하는 데 한계가 있음을 입증했습니다.
VideoMLA는 비디오 확산 모델의 KV 캐시 메모리를 92.7% 감소시키는 저차원 잠재 어텐션 기술을 제안합니다. 기존 언어 모델과 달리 비디오 확산 모델의 특성에 맞춘 MLA의 작동 원리를 분석하고, 장기 비디오 생성 성능과 처리량을 크게 개선했습니다.
LLM의 추론 능력을 높이기 위해 중간 토큰 생성 대신 작업 기억(Working Memory)을 활용하는 RiM 방법론을 제안합니다. 고정된 메모리 블록을 사용하여 단일 순전파로 연산 효율성을 높이면서도 기존 방식과 대등하거나 뛰어난 추론 성능을 입증했습니다.