Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 EEG 기반 꿈 상태 분석의 패러다임을 에너지 스펙트럼에서 위상 공간 기하학으로 전환하는 PHINN-EEG 프레임워크를 제안합니다. 이 모델은 동적 Betti 곡선을 추출하고, 이를 위상 조건부 흐름 일치(topology-conditioned flow matching)와 결합하여 꿈 내용 분류의 정확도를 높입니다. 궁극적으로는 꿈 상태 EEG 합성을 위한 새로운 모델도 제시합니다.
본 논문은 복잡한 사회적 상호작용을 담은 CSB 데이터셋을 소개하고, 지난 10년간 VLM의 발전 과정을 분석했습니다. 연구 결과, MLLMs는 단순 장면(MS-COCO)과 복잡 행동(CSB) 간의 설명 정확도 격차를 해소하며 성능이 크게 향상되었습니다. 특히 객체 탐지, 인식, 환각 오류가 개선에 가장 큰 영향을 미쳤습니다.
본 논문은 대규모 언어 모델이 텍스트 전용 표현만으로는 부족하며, 시각적 정보를 활용한 사전 학습의 중요성을 제기합니다. 그림이나 레이아웃 등 시각적으로 풍부한 자료를 직접 활용하는 비지도 시각 사전 학습 패러다임을 제시했습니다. 연구 결과, 시각 사전 학습은 텍스트 전용 방식보다 일관되게 우수한 성능을 보여줍니다.
본 논문은 복잡한 프로젝트 전반의 코드를 생성하기 위해 '절차적 유사성(procedural similarity)'을 도입한 ProjAgent 시스템을 제안합니다. ProjAgent는 목표 함수를 단계별로 분해하고, 각 단계에서 유사한 로직을 가진 저장소 함수들을 검색하여 코드 생성을 수행하는 에이전트 워크플로우를 사용합니다. 이 방식은 기존의 의미적/구조적 검색의 한계를 극복하며 높은 성능을 보였습니다.
본 논문은 제한 메모리 언어 모델(LMLMs)의 한계를 극복하기 위해 연속 질의 기반 LMLM (CO-LMLM)을 제안합니다. CO-LMLM은 외부 지식 베이스를 활용하여, 인간이 읽고 출처가 명시된 검색 지식을 생성 과정에 통합하는 것이 특징입니다. 이 모델은 기존 방식보다 높은 사실적 정확성과 낮은 퍼플렉서티를 보여주며, GPT-4o-mini와 유사하거나 능가하는 성능을 입증했습니다.
SkillCenter는 자율 AI 에이전트가 복잡한 작업을 수행할 때 필요한 대규모 오픈 스킬 라이브러리입니다. 이 시스템은 21만 개 이상의 구조화된 스킬을 제공하며, SkillGate 필터링 파이프라인과 다중 출처 수집 과정을 통해 정확하고 안전하며 유지보수 가능한 근거 기반 지식을 보장합니다.
본 논문은 인간-로봇 상호작용(HRI)에서 개인화가 핵심 역량임에도 불구하고, 윤리적 위험에 대한 구조적인 이해가 부족한 문제를 지적합니다. 이에 구현 인지 관점을 기반으로 생애 주기 및 맥락 민감형 프레임워크를 제시하며, 자율성 침식, 편향된 모델링 등 주요 윤리적 위험을 통합적으로 분석하고 설계 권장 사항을 제공합니다.
본 논문은 빌딩 IoT 예측을 위한 제로샷 프레임워크인 TopoBrick을 제시합니다. TopoBrick은 빌딩 지식 그래프를 활용하여 구조적 골격을 만들고, 에이전트적 토폴로지 샘플러를 통해 목표 외생 변수를 선택합니다. 이 방법론은 기존 모델보다 높은 성능을 보여주며, 특히 물리적 연결성을 고려한 샘플링의 중요성을 입증했습니다.
본 논문은 머신러닝 모델의 예측 설명을 위한 선언적 질의 언어 ExplAIner를 제안합니다. 기존 FOIL의 한계를 극복하고, 가설추론적, 대조적 등 다양한 설명 개념을 표현할 수 있습니다. 또한, 이 언어가 여러 부울 모델 클래스에서 다항 시간 내에 평가 가능함을 증명했습니다.
본 글은 2인, 제로섬, 불완전 정보 게임을 위한 오픈 소스 격투 게임 벤치마크 환경인 FootsiesGym을 소개합니다. 이 환경은 HiFight의 미니멀리스트 2D 격투 게임 'Footsies'를 기반으로 하며, 복잡한 전략적 상호작용을 분석하기 용이하도록 설계되었습니다.
본 논문은 지식 그래프 기반 다단계 QA에서 발생하는 의미론적 격차 문제를 해결하기 위해 RSF-GLLM 프레임워크를 제안합니다. 이 모델은 순환 소프트 흐름(RSF) 모듈을 사용하여 연속적인 관련성 점수를 전파하고, 동적 게이팅 메커니즘으로 구조적 단서를 탐색합니다. 이를 통해 LLM 기반의 계산 비용 높은 방식 대비 우수한 성능과 추론 효율성을 입증했습니다.
본 논문은 시계열 파운데이션 모델(TSFMs)의 일반화 성능 향상을 위해 대규모 실세계 다변량 코퍼스인 RMISC를 구축했습니다. 이 아카이브는 200개 데이터셋과 1420억 개의 시점 데이터를 포함합니다. 실험 결과, 실세계 다변량 데이터로 학습된 TSFMs가 합성 데이터 기반 모델보다 전반적인 일반화 성능을 크게 향상시키는 것을 입증했습니다.
FreqDepthKV는 장문 컨텍스트 LLM 추론 시 발생하는 KV 캐시 메모리 및 대역폭 문제를 해결하는 새로운 캐시 압축 기법입니다. 이 방법은 인접 레이어의 KV 상태를 공유 저주파 깊이와 희소 고주파 잔차로 인수분해하여 효율적으로 압축합니다. 다양한 벤치마크에서 높은 정확도를 유지하면서 메모리 사용량과 처리량을 크게 개선했습니다.
본 논문은 VLM이 보지 못한 환경에서 물리적 추론 및 작업 일반화에 어려움을 겪는 문제를 다룹니다. 이를 해결하기 위해 VAORA라는 새로운 보상 설계(Visual Action Outcome Reasoning Alignment)를 제안합니다. 이 보상은 시각적 맥락 고정 및 행동 기반 근거지어짐을 통해 환각된 CoT와 추론-행동 불일치를 줄여 물리적 지능의 일반화를 돕습니다.
DepthWeave-KV는 장문 컨텍스트 언어 모델 추론 시 발생하는 키-값(KV) 캐시 메모리 및 대역폭 문제를 해결하는 토큰 적응형 캐시 압축 방법입니다. 이 기술은 낮은 계수 채널 베이스를 사용하여 트랜스포머 레이어 전반에 걸쳐 KV 상태를 분해하며, 중요한 토큰에는 높은 재구성 계수를 할당합니다. 이를 통해 기존 방식보다 훨씬 낮은 메모리 사용량으로도 뛰어난 작업 품질을 유지하며, 64K 컨텍스트에서 8.3배의 KV 메모리를 절감하고 초당 72.8 토큰이라는 빠른 속도를 달성했습니다.
본 기사는 종양학 분야의 임상 의사 결정 지원 시스템(CDSS)을 위한 새로운 오케스트레이션 프레임워크인 Large Cancer Assistant (LCA)를 제안합니다. LCA는 모델 비종속적 아키텍처와 알고리즘 불침투성 원칙에 기반하여, AI 추론과 데이터 처리를 구조적으로 분리하는 것이 핵심입니다. 이를 통해 병원 IT 환경의 변화에도 유연하게 적응하고 높은 실패 안전성을 보장합니다.
ELSA3D는 언어적 추론과 기하학적 추론을 공동으로 구조화하는 통합 3D 파운데이션 모델입니다. 기존 방식의 한계를 극복하기 위해 '탄성 의미 앵커링' 메커니즘을 도입했습니다. 이를 통해 이미지-대-3D, 텍스트-대-3D 생성 및 3D 캡셔닝 전반에서 최신 성능과 효율성을 동시에 달성합니다.
연속적 MDP 계획에서 발생하는 호라이즌 저주를 해결하기 위해 그래프 희소 샘플링(GSS) 알고리즘을 제안합니다. GSS는 후보 결정 간 미래를 공유하는 분기 없는 그래프 구조를 통해 계산 효율성을 높이고 GPU 가속을 지원합니다.
사용자의 주권(privacy, consent, evidence)을 보존하는 개인 에이전트를 평가하기 위한 새로운 벤치마크인 SovereignPA-Bench를 제안합니다. 기존 벤치마크가 놓치기 쉬운 플랫폼 중재 및 조작적 유인에 대한 저항력을 측정하며, 다양한 모델과 정책을 통해 에이전트의 정렬 능력을 검증합니다.
자기회귀 ASR 시스템에서 비음성 구간 발생 시 타임스탬프가 어긋나는 드리프트 현상을 해결하기 위한 REDDIT 프레임워크를 제안합니다. 재생 기반 분포 편집을 통해 기존 성능 저하(망각) 없이 타임스탬프 정확도를 획기적으로 개선했습니다.