Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Cortex는 상위 수준의 VLM과 하위 수준의 VLA 사이의 간극을 메우기 위해 양방향 정렬된 체화된 에이전트 프레임워크를 제안합니다. 표준화된 스킬 프리미티브와 맞춤형 계획 인터페이스를 통해 장기적 과업 수행 능력을 혁신적으로 개선했습니다.
시각적 생성기가 학습 데이터에 없는 새로운 정보를 생성할 때 발생하는 지식 경계 문제를 해결하기 위한 연구입니다. '가르친 후 검색하는(teach-then-search)' 공동 학습 프레임워크를 통해 검색 도구를 활용한 에이전트 기반 시각적 생성의 성능을 개선합니다.
스트리밍 음성-대-음성(speech-to-speech) 모델의 대화 자연스러움을 평가하기 위한 새로운 벤치마크인 SPEARBench를 제안합니다. 지연 시간, 발화 교대, 감정적 적응 등 다차원적인 프로토콜을 통해 기존 벤치마크가 포착하지 못한 대화의 질적 측면을 평가합니다.
DWI 영상에서 급성 허혈성 경색을 정확하게 분할하기 위한 EPRA U-Net 프레임워크를 제안합니다. EfficientNet 인코더, R2 블록, ASPP 및 이중 어텐션 메커니즘을 결합하여 효율성과 정확도를 높였습니다.
마스크 착용 시 발생하는 얼굴 가림 문제를 해결하기 위해 PLGSA-Transformer 프레임워크를 제안합니다. 폐안부 랜드마크 기반의 공간 어텐션과 폐쇄 적응형 코사인 임계값을 통해 높은 인식 정확도를 달성했습니다.
MentalThink는 MLLM이 SVG 코드를 생성하고 렌더링하여 '정신적 시각화'를 수행하도록 하는 새로운 시각-기호 추론 패러다임을 제안합니다. 모델은 SVG를 중간 시각 표현으로 사용하여 공간적 가설을 외재화하고 반복적으로 수정하며 추론 능력을 강화합니다.
우주선의 약한 질감과 조명 변화 문제를 해결하기 위해 기하학 인지 어텐션이 강화된 GAP-GDRNet 프레임워크를 제안합니다. AFR과 PGSA 모듈을 통해 단안 RGB 이미지 기반의 정밀한 6D 포즈 센싱을 구현합니다.
SelectTSL은 멀티모달 프롬프트를 활용하여 복잡한 음향 환경에서 특정 타겟 음원의 위치를 선택적으로 추적하는 새로운 엔드투엔드 아키텍처를 제안합니다. PGSA 모듈을 통해 프롬프트 정보를 임베딩하여 위상 단서를 정제하고, 타겟의 방향과 개수를 동시에 추정합니다.
본 논문은 컴파일러의 최적화 누락 문제를 해결하기 위한 에이전트 기반 패칭 연구를 다룹니다. LLVM 벤치마크를 통해 코딩 에이전트의 패치 생성 능력을 분석하고, 역사적 지식 증강 기술이 일반화 성능을 어떻게 향상시키는지 제시합니다.
시각 장애인을 위해 온디바이스 딥러닝 모델을 활용한 Android 기반 멀티모달 어시스턴트 VisionAId를 소개합니다. ONNX Runtime을 통해 클라우드 연결 없이도 객체 탐지, 깊이 추정, 얼굴 인식을 수행하며 개인화된 객체 검색 기능을 제공합니다.
개인화된 LLM에서 사용자 메모리가 추론 과정(reasoning trajectory)을 변화시키는 '추론 드리프트' 현상을 분석합니다. 새로운 측정 프레임워크인 DRIFTLENS를 통해 메모리가 유발하는 추론의 발산을 정량화하고, 이를 완화하기 위한 사후 학습 방법론을 평가합니다.
안전 필수 실시간 자율 시스템을 위해 FPGA를 활용한 하드웨어 강제 세만틱 코디네이션 아키텍처를 제안합니다. 소프트웨어 방식의 한계를 극복하기 위해 TB-CSPN 프레임워크를 하드웨어 수준에서 구현하여 결정론적이고 검증 가능한 코디네이션을 제공합니다.
ACID는 월드 모델을 이용한 계획 수립 시 행동 일관성을 확보하기 위한 새로운 프레임워크를 제안합니다. 역역학 모델을 통해 예측된 궤적의 실현 가능성을 검증함으로써, 더 적은 연산량으로도 높은 계획 성능을 달성합니다.
코딩 에이전트의 보안 리스크와 확장성 문제를 해결하기 위해 접근 제어 및 코딩 컨벤션과 같은 제약 조건을 활용한 감독 방식을 제안합니다. 실험 결과, 제약 기반 시스템을 통해 백도어 탐지 재현율을 54.5%에서 90.9%까지 크게 향상시켰습니다.
비-맨해튼 환경에서 물리적으로 그럴듯한 3D 실내 장면을 생성하는 새로운 프레임워크 SPG-Layout을 제안합니다. 통계적 사전 정보와 계층적 배치 전략을 통해 기하학적 오류를 최소화하고 의미론적 사실성을 높였습니다.
WorldSample은 실제 로봇의 물리적 롤아웃과 세계 모델(world-model)을 결합하여 데이터 증강을 수행하는 프레임워크입니다. 정책 속도 학습(PPL)을 통해 시각적 환각을 줄이고, 로봇 조작 작업에서 훈련 단계 단축과 성공률 향상을 동시에 달성했습니다.
에이전트 기반 코드 생성 시 도구 추가보다 추론 노력(reasoning effort)을 높이는 것이 첫 시도 성공률을 높이는 데 훨씬 효과적임을 입증한 연구입니다. 실험 결과, 추론 수준을 높였을 때 완벽 실행 비율이 28%에서 89%로 급증했습니다.
VLA 모델의 데이터 부족 문제를 해결하기 위해 물리적 역량과 의미적 정렬을 분리하는 '태스크 불가지론적 사전 학습(TAP)' 프레임워크를 제안합니다. 라벨 없는 데이터를 통해 운동 사전 지식을 먼저 학습함으로써, 훨씬 적은 전문가 데이터로도 높은 성능과 견고함을 달성했습니다.
인간과 AI의 협업 성능이 단순한 인지 능력이나 모델 벤치마크가 아닌, 개인의 인적 자본(협업 특성)에 의해 결정된다는 연구 결과입니다. Polymarket을 활용한 분석 결과, 소수의 사용자는 상호 보완적 추론을 통해 시장 예측 능력을 능가하는 성과를 보였습니다.
순환 추론 모델(RRM)을 심볼릭 솔버와 통합하여 제약 충족 문제를 해결하는 G-RRM 프레임워크를 제안합니다. 신경망이 생성한 힌트를 심볼릭 솔버가 동적으로 활용할 때 탐색 효율성이 극대화됨을 입증했습니다.