Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
안전 필수 실시간 자율 시스템을 위해 FPGA를 활용한 하드웨어 강제 세만틱 코디네이션 아키텍처를 제안합니다. 소프트웨어 방식의 한계를 극복하기 위해 TB-CSPN 프레임워크를 하드웨어 수준에서 구현하여 결정론적이고 검증 가능한 코디네이션을 제공합니다.
ACID는 월드 모델을 이용한 계획 수립 시 행동 일관성을 확보하기 위한 새로운 프레임워크를 제안합니다. 역역학 모델을 통해 예측된 궤적의 실현 가능성을 검증함으로써, 더 적은 연산량으로도 높은 계획 성능을 달성합니다.
비-맨해튼 환경에서 물리적으로 그럴듯한 3D 실내 장면을 생성하는 새로운 프레임워크 SPG-Layout을 제안합니다. 통계적 사전 정보와 계층적 배치 전략을 통해 기하학적 오류를 최소화하고 의미론적 사실성을 높였습니다.
WorldSample은 실제 로봇의 물리적 롤아웃과 세계 모델(world-model)을 결합하여 데이터 증강을 수행하는 프레임워크입니다. 정책 속도 학습(PPL)을 통해 시각적 환각을 줄이고, 로봇 조작 작업에서 훈련 단계 단축과 성공률 향상을 동시에 달성했습니다.
에이전트 기반 코드 생성 시 도구 추가보다 추론 노력(reasoning effort)을 높이는 것이 첫 시도 성공률을 높이는 데 훨씬 효과적임을 입증한 연구입니다. 실험 결과, 추론 수준을 높였을 때 완벽 실행 비율이 28%에서 89%로 급증했습니다.
VLA 모델의 데이터 부족 문제를 해결하기 위해 물리적 역량과 의미적 정렬을 분리하는 '태스크 불가지론적 사전 학습(TAP)' 프레임워크를 제안합니다. 라벨 없는 데이터를 통해 운동 사전 지식을 먼저 학습함으로써, 훨씬 적은 전문가 데이터로도 높은 성능과 견고함을 달성했습니다.
인간과 AI의 협업 성능이 단순한 인지 능력이나 모델 벤치마크가 아닌, 개인의 인적 자본(협업 특성)에 의해 결정된다는 연구 결과입니다. Polymarket을 활용한 분석 결과, 소수의 사용자는 상호 보완적 추론을 통해 시장 예측 능력을 능가하는 성과를 보였습니다.
순환 추론 모델(RRM)을 심볼릭 솔버와 통합하여 제약 충족 문제를 해결하는 G-RRM 프레임워크를 제안합니다. 신경망이 생성한 힌트를 심볼릭 솔버가 동적으로 활용할 때 탐색 효율성이 극대화됨을 입증했습니다.
시각-언어 모델(VLM)의 속도를 높이기 위한 시각적 토큰 프루닝 과정에서 발생하는 텍스트 노이즈와 특징 파편화 문제를 해결하는 EADP 프레임워크를 제안합니다. 엔트로피를 활용해 노이즈를 필터링하고 서브모듈러 최대화 기법으로 중복 없는 시각적 표현을 보장합니다.
자율적인 AI 코딩 에이전트가 코드베이스에 지속성을 가질 때 발생하는 분산 공격 위험을 연구합니다. 공격자가 여러 PR에 걸쳐 페이로드를 분산시키는 '점진적 공격'이 단일 모니터링 시스템을 효과적으로 회피할 수 있음을 실험을 통해 증명했습니다.
긴 문맥 추론 능력을 향상시키기 위해 학습 없이 적용 가능한 'RECONTEXT' 방법론을 제안합니다. 모델 내부의 관련성 신호를 활용해 증거 풀을 구축하고 재귀적으로 재생함으로써, 문맥 활용도를 높이는 메커니즘을 다룹니다.
MLLM의 지속적인 지식 편집 시 발생하는 의미론적 경계 제어 문제를 해결하기 위한 ScopeEdit를 제안합니다. ScopeEdit는 국소 흡수 분기와 증거 게이트 공유 일반화 분기를 통해 편집의 전파 범위를 정밀하게 제어합니다.
OntoLearner는 LLM을 활용하여 텍스트로부터 구조화된 지식 모델을 구축하는 모듈형 온톨로지 학습 프레임워크입니다. 22개 도메인의 데이터셋과 벤치마킹 인프라를 제공하며, 모델의 성능이 온톨로지의 구조적 복잡성에 따라 결정됨을 입증합니다.
DCASE 2026 Challenge를 위해 제안된 이종 오디오 분류 프레임워크를 설명합니다. CLAP 기반의 오디오-텍스트 표현을 활용하며, 데이터 확장, 특징별 분기, 계층 인식 분류기를 통해 성능을 최적화했습니다.
MolSight는 분자 구조의 시각적 표현과 위상학적 정보를 효과적으로 포착하기 위해 설계된 그래프 인식 시각-언어 모델(VLM) 프레임워크입니다. 분자 위상 모듈과 그라운딩 모듈을 통해 기존 모델의 구조적 정렬 문제를 해결하고 화학 이미지 이해 능력을 혁신적으로 향상시켰습니다.
본 연구는 다양한 경량 CNN 모델들의 성능과 자원 효율성을 CIFAR 및 Tiny ImageNet 데이터셋을 통해 비교 분석합니다. 최신 설계가 항상 보편적인 이득을 제공하지 않으며, 하드웨어 환경에 따라 지연 시간이 달라질 수 있음을 입증합니다.
에이전트의 정체성을 유지하면서 지식을 통합하는 새로운 구조를 제안합니다. 에피소드 메모리를 의미론적 지식 계층으로 변환하는 결정론적 함수를 통해, 에이전트의 인증된 정체성(identity)을 변경하지 않고도 효율적인 지식 업데이트가 가능함을 증명합니다.
InduceKV는 멀티모달 LLM의 배포 메모리 제한을 해결하기 위해 제안된 고정된 발자국 연속 적응 방법론입니다. 백본 모델을 변경하지 않고, 검색 기반의 컴팩트한 KV 페이로드를 사용하여 메모리 예산 내에서 효율적인 작업 적응을 수행합니다.
두 개의 2D 이미지로부터 기하학적 구조와 질감을 가진 3D 객체를 생성하는 새로운 3D 착시 기술인 Mirror Illusion Art를 소개합니다. 자동화된 설계 파이프라인인 AutoMIA를 통해 형태와 색상을 공동 최적화하여 매끄러운 3D 예술 작품을 생성합니다.
멀티모달 거대 언어 모델(MLLM)의 지속 학습 과정에서 답변 정확도는 유지되나 시각적·텍스트적 증거 활용 능력이 저하되는 '숨겨진 망각' 현상을 분석합니다. 이를 해결하기 위해 리플레이 없이 증거 의존성을 보존하는 새로운 프레임워크인 RCL을 제안합니다.