Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 환각 문제를 해결하기 위해 메타인지적 피드백을 활용한 강화학습(RLMF) 방법론을 제안합니다. 모델이 자신의 성능을 스스로 판단하고 불확실성을 정확히 표현하도록 유도하여 신뢰성을 높이는 연구입니다.
장기적 관점의 LLM 에이전트를 위한 밀집 감독(Dense supervision) 신호를 훈련 없이 직접 평가할 수 있는 새로운 테스트베드 QVal을 소개합니다. QVal은 신호의 품질을 훈련 엔지니어링 변수와 분리하여 다양한 방법론을 공통된 기반 위에서 벤치마킹할 수 있게 합니다.
언어 모델이 자신의 행동을 충실히 설명하도록 만드는 자기 설명 학습(Self-Explanation Training) 연구를 소개합니다. 고정된 반사실적 설명을 사용하더라도 모델의 행동 변화를 추적하며 충실한 자기 성찰을 생성할 수 있음을 발견했습니다.
UniTac은 촉각 이해와 생성을 통합한 최초의 멀티모달 모델(UMM)입니다. 센서와 물체의 속성을 모두 인코딩하는 이중 수준 표현을 통해 비접촉에서 접촉으로의 물리적 상호작용을 효과적으로 모델링합니다.
도구 사용 시 발생하는 오류를 스스로 수정할 수 있도록 학습하는 ReGRPO 프레임워크를 소개합니다. 반성 사고(RoT) 데이터와 그룹 상대적 정책 최적화를 결합하여, 멀티모달 에이전트의 도구 사용 성공률을 크게 높였습니다.
신경망의 중첩(superposition) 문제가 잠재 공간의 기하학적 구조를 손상시키는 문제를 해결하기 위해 희소 오토인코더(SAE)를 활용한 연구입니다. 이를 통해 이미지 표현을 정제하고, Gromov-Wasserstein 최적 운송을 이용해 이미지와 scRNA-seq 데이터를 정렬하는 GW-map 방법론을 제안합니다.
Transformer 모델의 효율적인 미세 조정을 위한 새로운 프레임워크인 Mixture-of-Control(MoC)을 제안합니다. 기존 상태 기반 미세 조정의 블록 간 정보 교환 한계를 극복하기 위해 로컬 및 글로벌 제어 신호를 적응적으로 통합합니다.
장기적 언어 에이전트가 암묵적 월드 모델에서 겪는 급격한 성능 저하 현상을 상전이(phase transition) 관점에서 분석합니다. 특정 임계점에서 상태 부하나 호라이즌의 미세한 변화가 월드 모델의 붕괴를 초래함을 밝혀냈습니다.
VLM이 시각적 모호성을 인식하지 못하고 과도하게 확신하는 문제를 해결하기 위해 시각적 의미 엔트로피(VSE)를 제안합니다. 기존 방식이 텍스트 변화에 민감했던 것과 달리, VSE는 이미지 섭동을 통해 시각적 불확실성을 효과적으로 측정합니다.
LLM을 활용한 인공 군집 지능(Artificial Swarm Intelligence)의 효과를 조사한 연구입니다. GPT-5, Gemini 2.5 Pro, Claude Sonnet 4.5를 대상으로 실험한 결과, 모델 내/간 집계를 통해 추정 오차를 최대 37% 감소시킬 수 있음을 확인했습니다.
Xiaomi-GUI-0는 실제 모바일 환경의 복잡한 상태 변화를 반영하기 위해 설계된 네이티브 멀티모달 GUI 에이전트입니다. 실제 기기 중심의 하이브리드 인프라와 오류 주도형 데이터 플라이휠을 통해 실제 애플리케이션에서의 실행 안정성을 극대화했습니다.
동결된 LoRA 어댑터들을 효율적으로 결합하기 위한 2단계 프레임워크인 Hard-Routed MoR-LoRA를 제안합니다. 하드 top-1 라우팅을 통해 각 전문가의 특성을 보존하면서도 적은 파라미터로 멀티 도메인 적응 성능을 극대화합니다.
동적 시나리오에서 발생하는 클래스 불균형과 지속적인 도메인 변화 문제를 동시에 해결하기 위한 새로운 TTA 방법론인 BP-TTA를 제안합니다. 배치 균형 샘플링과 프로토타입 가이드 적응을 결합하여 온라인 업데이트의 안정성과 의사 라벨의 신뢰성을 높였습니다.
단일 단계 비디오 객체 검출기가 실제 시간적 문맥을 활용하는지 진단하는 TemporalLens 프레임워크와 시공간 정보를 보존하는 YOLO-3D 아키텍처를 제안합니다. 실험을 통해 모델이 단순히 프레임 정보를 이용하는지, 아니면 시간적 의존성을 통해 추론하는지를 정량적으로 분석합니다.
언어 에이전트의 월드 모델 드리프트 문제를 해결하기 위해, 행동 전 환경에 질문하여 모델을 보정하는 예산 기반 탐색 기법을 제안합니다. 신념의 유형에 따라 효율적인 탐색 전략을 다르게 적용하여 작업 수행 중 발생하는 오류를 최소화합니다.
감정 감지 AI가 확산됨에 따라 발생하는 '인식론적 격차'와 감정 해석의 주권 문제를 다룹니다. AI의 측정 한계로 인해 발생하는 의미의 불확실성을 분석하고, 감정의 최종 해석 권한이 주체에게 있어야 한다는 '정동적 주권' 개념을 제안합니다.
LLM의 데이터 정제(Data Refinement) 능력을 평가하기 위한 새로운 벤치마크인 CDR-Bench를 소개합니다. 다단계 연산자의 구성과 실행 순서에 따른 모델의 성능을 분석하여, 현재 LLM이 복잡한 절차적 작업을 수행하는 데 한계가 있음을 보여줍니다.
심각한 클래스 불균형 상황에서 개인별 결근을 선제적으로 예측하기 위한 시계열 분류(TSC) 프레임워크를 제안합니다. 기존 회귀 방식의 한계를 극복하기 위해 시퀀스 데이터를 활용하며, BFL과 G-Mean 손실 함수를 통해 불균형 문제를 해결합니다.
CS2 스킨 시장과 같은 틈새 자산 시장에서 LLM을 활용한 언어 기반 트레이딩을 연구하기 위한 멀티 에이전트 프레임워크 CSTrader를 제안합니다. 다양한 신호를 통합하고 리스크 관리 에이전트를 통해 실제 거래 환경과 유사한 의사결정을 수행하며, 기존 LLM 베이스라인보다 높은 수익률을 입증했습니다.
워크로드 드리프트 상황에서 클라우드 VM 인스턴스 크기를 최적화하는 CLOUDADV 시스템을 제안합니다. 제로샷 시계열 예측과 LLM을 결합하여 비용 절감과 운영 효율성을 동시에 달성하는 의사결정 정렬형 권고 방식을 다룹니다.