Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
IV-CoT는 텍스트-이미지 생성 시 객체 수, 공간 관계 등 구조적 프롬프트 준수 능력을 향상시키기 위한 새로운 프레임워크입니다. 구조적 계획과 외형 렌더링을 분리하여 암시적 시각적 사고 사슬을 통해 정교한 이미지 생성을 가능하게 합니다.
AI 기반 보완 대체 의사소통(AAC) 인터페이스 설계 시 발생하는 복잡성과 평가의 어려움을 다룹니다. 사용자의 교차적 특성을 반영할 수 있는 새로운 평가 방법론을 제안하며, AI가 AAC 사용자에게 미치는 영향과 문제 해결 방안을 탐구합니다.
FLUX3D는 이미지로부터 고충실도 3D 가우시안 스플래팅(3DGS)을 생성하는 새로운 프레임워크입니다. DA-SLAT와 SMDiT 기술을 통해 기존 방식의 표현 및 정렬 병목 현상을 해결하여 시각적 세부 사항을 획기적으로 개선했습니다.
OpenThoughts-Agent(OT-Agent)는 에이전트 모델 학습을 위한 완전 공개 데이터 큐레이션 파이프라인을 제안합니다. 10만 개의 학습 데이터로 Qwen3-32B를 미세 조정하여 기존 Nemotron-Terminal-32B보다 높은 벤치마크 성능을 달성했습니다.
InSight는 VLA 모델이 원시 행동(primitive-action) 수준에서 조종 가능하도록 하여 자율적인 기술 습득을 지원하는 프레임워크입니다. VLM을 활용해 시연을 세분화하고, 누락된 기술을 스스로 학습하는 데이터 플라이휠 구조를 통해 인간의 추가 시연 없이도 새로운 과제를 수행합니다.
희귀 질환 진단을 위해 추론 강화 학습을 적용한 32B 규모의 오픈 소스 LLM인 RaDaR를 소개합니다. RaDaR는 합성 데이터를 활용해 학습되었으며, 임상 시험 결과 의사의 진단 정확도를 크게 향상시키고 진단 리드 타임을 단축하는 성과를 보였습니다.
video-SALMONN-R³는 효율적인 비디오 이해를 위해 ReWatch, ReAsk, ReAnswer라는 3단계 학습 방법을 제안하는 엔드투엔드 비디오-LLM입니다. 강화학습을 통해 CoT 데이터 없이도 관련 세그먼트를 정밀하게 재시청하여 답변의 정확도를 높입니다.
Female-RHINO는 MRI 스캐너와 실시간으로 통합되어 자궁 MRI를 자동 분석하고 구조화된 보고서를 생성하는 AI 프레임워크입니다. 딥러닝을 통해 자궁 부피 측정, 근종 검출, 해부학적 랜드마크 추출을 수행하며 임상 워크플로의 표준화를 목표로 합니다.
LLM의 추론, 외교, 신뢰성을 평가하기 위한 1v1 전략 게임 벤치마크인 'Age of LLM'을 소개합니다. 전장의 안개와 엄격한 JSON 스키마 환경에서 15개 모델을 테스트하여 모델의 신념 추적 및 기만 능력을 분석했습니다.
EEG 기반 BCI 디코딩에서 단일 파이프라인이 모든 피험자에게 최적이라는 주장을 MOABB 프레임워크로 검증했습니다. 분석 결과, 데이터셋과 피험자에 따라 최적의 모델이 달라지며 보편적 디코더보다 개인화된 모델 선택이 필수적임을 입증했습니다.
동적 그래프에서의 연속적 서브그래프 매칭(CSM)을 가속화하기 위해 집계 불변량(Aggregate Invariants)을 활용하는 연구를 다룹니다. 스펙트럼 필터링의 한계를 분석하고, 로컬 스펙트럼을 정확하게 유지함으로써 특정 워크로드에서 최대 748배의 성능 향상을 달성할 수 있음을 입증합니다.
형식 검증 인증서를 비전문가도 이해할 수 있는 자연어로 설명하기 위한 순환 일관성 신경망 아키텍처를 제안합니다. 심볼릭 검증기를 활용한 미분 가능한 충실도 프록시와 포인터-생성기 메커니즘을 통해 높은 정확도와 효율성을 달성했습니다.
제한된 레코드 배치를 통해 동일 개체를 클러스터링하는 배치형 개체 해상도(Batched Entity Resolution) 문제를 연구합니다. 오라클 호출 비용을 제어하면서 재현율을 극대화하는 종량제 접근 방식을 제안하며, 최적 배치 선택의 NP-hard 성질을 증명합니다.
ATRIA는 임상의의 반복적인 워크플로우를 모방한 멀티 에이전트 기반 ECG 보고 시스템입니다. 기존의 단일 패스 방식과 달리, 모든 진술을 근거와 연결하고 문맥을 점진적으로 통합하여 보고서의 신뢰성을 높입니다.
본 논문은 변화하는 네트워크 정책과 실시간 제약 조건에 대응하기 위해 Agentic-LTPO라는 이중 수준 최적화 프레임워크를 제안합니다. 에이전트형 AI를 활용해 상위 수준의 구성을 생성하고 하위 수준의 물리 계층 결정을 최적화하여 시스템 성능을 극대화합니다.
1억 8천만 개의 오픈 소스 저장소를 대상으로 AI 코딩 에이전트의 확산 정도를 분석한 다중 방식 탐지 연구입니다. 단일 방식 탐지 시 실제 사용량을 심각하게 과소평가할 수 있음을 경고하며, Claude Code와 Codex 등 도구별 작업 패턴 차이를 규명했습니다.
조직병리학 이미지 분류를 위한 인코더 네트워크가 잠재 공간(latent space) 내에서 이미지 변환에 어떻게 반응하는지 분석한 연구입니다. 실험 결과, 인코더가 변환에 대해 어느 정도 강건성을 보이지만 완전히 불변하지는 않음을 확인했습니다.
의료용 포인트 클라우드 완성을 위해 Point Transformer(PTv3)와 Flow Matching을 결합한 PCFM 모델을 제안합니다. 이 모델은 기존 확산 모델보다 적은 샘플링 단계로도 최첨단 성능을 달성하며, 처리량 측면에서 뛰어난 효율성을 보여줍니다.
ReM-MoA는 기존 Mixture-of-Agents(MoA)가 층이 깊어질수록 성능이 정체되는 문제를 해결하기 위해 제안된 메모리 증강 프레임워크입니다. 순위 지정 추론 메모리와 큐레이션된 다양화 메모리 라우팅을 통해 추론 시간 스케일링을 지속시킵니다.
NoContactNoWorries는 촉각 센서 없이 시각(RGB-D)과 고유 수용 감각을 결합하여 로봇의 접촉 상태를 추론하는 멀티모달 프레임워크입니다. Transformer 기반 모델을 통해 의사 촉각 신호를 생성하며, 이는 물체 재방향 설정과 같은 강화학습 에이전트의 성능을 향상시킵니다.