Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 지식 그래프 기반 다단계 QA에서 발생하는 의미론적 격차 문제를 해결하기 위해 RSF-GLLM 프레임워크를 제안합니다. 이 모델은 순환 소프트 흐름(RSF) 모듈을 사용하여 연속적인 관련성 점수를 전파하고, 동적 게이팅 메커니즘으로 구조적 단서를 탐색합니다. 이를 통해 LLM 기반의 계산 비용 높은 방식 대비 우수한 성능과 추론 효율성을 입증했습니다.
본 논문은 시계열 파운데이션 모델(TSFMs)의 일반화 성능 향상을 위해 대규모 실세계 다변량 코퍼스인 RMISC를 구축했습니다. 이 아카이브는 200개 데이터셋과 1420억 개의 시점 데이터를 포함합니다. 실험 결과, 실세계 다변량 데이터로 학습된 TSFMs가 합성 데이터 기반 모델보다 전반적인 일반화 성능을 크게 향상시키는 것을 입증했습니다.
FreqDepthKV는 장문 컨텍스트 LLM 추론 시 발생하는 KV 캐시 메모리 및 대역폭 문제를 해결하는 새로운 캐시 압축 기법입니다. 이 방법은 인접 레이어의 KV 상태를 공유 저주파 깊이와 희소 고주파 잔차로 인수분해하여 효율적으로 압축합니다. 다양한 벤치마크에서 높은 정확도를 유지하면서 메모리 사용량과 처리량을 크게 개선했습니다.
본 논문은 VLM이 보지 못한 환경에서 물리적 추론 및 작업 일반화에 어려움을 겪는 문제를 다룹니다. 이를 해결하기 위해 VAORA라는 새로운 보상 설계(Visual Action Outcome Reasoning Alignment)를 제안합니다. 이 보상은 시각적 맥락 고정 및 행동 기반 근거지어짐을 통해 환각된 CoT와 추론-행동 불일치를 줄여 물리적 지능의 일반화를 돕습니다.
DepthWeave-KV는 장문 컨텍스트 언어 모델 추론 시 발생하는 키-값(KV) 캐시 메모리 및 대역폭 문제를 해결하는 토큰 적응형 캐시 압축 방법입니다. 이 기술은 낮은 계수 채널 베이스를 사용하여 트랜스포머 레이어 전반에 걸쳐 KV 상태를 분해하며, 중요한 토큰에는 높은 재구성 계수를 할당합니다. 이를 통해 기존 방식보다 훨씬 낮은 메모리 사용량으로도 뛰어난 작업 품질을 유지하며, 64K 컨텍스트에서 8.3배의 KV 메모리를 절감하고 초당 72.8 토큰이라는 빠른 속도를 달성했습니다.
본 기사는 종양학 분야의 임상 의사 결정 지원 시스템(CDSS)을 위한 새로운 오케스트레이션 프레임워크인 Large Cancer Assistant (LCA)를 제안합니다. LCA는 모델 비종속적 아키텍처와 알고리즘 불침투성 원칙에 기반하여, AI 추론과 데이터 처리를 구조적으로 분리하는 것이 핵심입니다. 이를 통해 병원 IT 환경의 변화에도 유연하게 적응하고 높은 실패 안전성을 보장합니다.
ELSA3D는 언어적 추론과 기하학적 추론을 공동으로 구조화하는 통합 3D 파운데이션 모델입니다. 기존 방식의 한계를 극복하기 위해 '탄성 의미 앵커링' 메커니즘을 도입했습니다. 이를 통해 이미지-대-3D, 텍스트-대-3D 생성 및 3D 캡셔닝 전반에서 최신 성능과 효율성을 동시에 달성합니다.
연속적 MDP 계획에서 발생하는 호라이즌 저주를 해결하기 위해 그래프 희소 샘플링(GSS) 알고리즘을 제안합니다. GSS는 후보 결정 간 미래를 공유하는 분기 없는 그래프 구조를 통해 계산 효율성을 높이고 GPU 가속을 지원합니다.
사용자의 주권(privacy, consent, evidence)을 보존하는 개인 에이전트를 평가하기 위한 새로운 벤치마크인 SovereignPA-Bench를 제안합니다. 기존 벤치마크가 놓치기 쉬운 플랫폼 중재 및 조작적 유인에 대한 저항력을 측정하며, 다양한 모델과 정책을 통해 에이전트의 정렬 능력을 검증합니다.
자기회귀 ASR 시스템에서 비음성 구간 발생 시 타임스탬프가 어긋나는 드리프트 현상을 해결하기 위한 REDDIT 프레임워크를 제안합니다. 재생 기반 분포 편집을 통해 기존 성능 저하(망각) 없이 타임스탬프 정확도를 획기적으로 개선했습니다.
Cortex는 상위 수준의 VLM과 하위 수준의 VLA 사이의 간극을 메우기 위해 양방향 정렬된 체화된 에이전트 프레임워크를 제안합니다. 표준화된 스킬 프리미티브와 맞춤형 계획 인터페이스를 통해 장기적 과업 수행 능력을 혁신적으로 개선했습니다.
시각적 생성기가 학습 데이터에 없는 새로운 정보를 생성할 때 발생하는 지식 경계 문제를 해결하기 위한 연구입니다. '가르친 후 검색하는(teach-then-search)' 공동 학습 프레임워크를 통해 검색 도구를 활용한 에이전트 기반 시각적 생성의 성능을 개선합니다.
스트리밍 음성-대-음성(speech-to-speech) 모델의 대화 자연스러움을 평가하기 위한 새로운 벤치마크인 SPEARBench를 제안합니다. 지연 시간, 발화 교대, 감정적 적응 등 다차원적인 프로토콜을 통해 기존 벤치마크가 포착하지 못한 대화의 질적 측면을 평가합니다.
DWI 영상에서 급성 허혈성 경색을 정확하게 분할하기 위한 EPRA U-Net 프레임워크를 제안합니다. EfficientNet 인코더, R2 블록, ASPP 및 이중 어텐션 메커니즘을 결합하여 효율성과 정확도를 높였습니다.
마스크 착용 시 발생하는 얼굴 가림 문제를 해결하기 위해 PLGSA-Transformer 프레임워크를 제안합니다. 폐안부 랜드마크 기반의 공간 어텐션과 폐쇄 적응형 코사인 임계값을 통해 높은 인식 정확도를 달성했습니다.
MentalThink는 MLLM이 SVG 코드를 생성하고 렌더링하여 '정신적 시각화'를 수행하도록 하는 새로운 시각-기호 추론 패러다임을 제안합니다. 모델은 SVG를 중간 시각 표현으로 사용하여 공간적 가설을 외재화하고 반복적으로 수정하며 추론 능력을 강화합니다.
우주선의 약한 질감과 조명 변화 문제를 해결하기 위해 기하학 인지 어텐션이 강화된 GAP-GDRNet 프레임워크를 제안합니다. AFR과 PGSA 모듈을 통해 단안 RGB 이미지 기반의 정밀한 6D 포즈 센싱을 구현합니다.
SelectTSL은 멀티모달 프롬프트를 활용하여 복잡한 음향 환경에서 특정 타겟 음원의 위치를 선택적으로 추적하는 새로운 엔드투엔드 아키텍처를 제안합니다. PGSA 모듈을 통해 프롬프트 정보를 임베딩하여 위상 단서를 정제하고, 타겟의 방향과 개수를 동시에 추정합니다.
본 논문은 컴파일러의 최적화 누락 문제를 해결하기 위한 에이전트 기반 패칭 연구를 다룹니다. LLVM 벤치마크를 통해 코딩 에이전트의 패치 생성 능력을 분석하고, 역사적 지식 증강 기술이 일반화 성능을 어떻게 향상시키는지 제시합니다.
개인화된 LLM에서 사용자 메모리가 추론 과정(reasoning trajectory)을 변화시키는 '추론 드리프트' 현상을 분석합니다. 새로운 측정 프레임워크인 DRIFTLENS를 통해 메모리가 유발하는 추론의 발산을 정량화하고, 이를 완화하기 위한 사후 학습 방법론을 평가합니다.