Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
SUNTA는 예측 오차(놀라움)를 기반으로 비디오 시퀀스를 계층적으로 분할하는 새로운 HSSM 접근 방식을 제안합니다. 분리된 학습 전략을 통해 계층적 붕괴 문제를 해결하며, 장기 비디오 예측 성능을 획기적으로 개선했습니다.
구조적 일반화(SLOG) 성능 향상을 위해 CCG 방향성 타입을 활용한 심볼릭 백엔드 재설계 연구를 소개합니다. 기존 AM-Parser 대비 위치 이동 카테고리에서 뛰어난 성능을 보였으며, 인코더 업그레이드를 통해 방향성 표현의 병목 현상을 해결할 수 있음을 입증했습니다.
Flow-matching 기반의 시각-언어-행동(VLA) 정책에서 모델 재학습 없이 테스트 시간 가이드를 적용하는 Guided Action Flow 프레임워크를 제안합니다. 동결된 SmolVLA 정책에 행동-청크 비평가를 결합하여 로봇 조작 작업의 성공률을 유의미하게 향상시켰습니다.
멀티모달 모델의 오디오 이해 및 생성을 위한 효율적인 vLLM 기반 추론 파이프라인을 제안합니다. 자기회귀 디코딩 확장과 온-GPU 음향 디코더 통합을 통해 단일 스트림 루프의 충돌 문제를 해결했습니다. 특히 CFG 구현 시 공동 스케줄링을 통해 처리량 저하 문제를 획기적으로 개선했습니다.
LLM 시스템에서 가드레일에 의한 차단과 모델 자체의 거부를 구분하는 블랙박스 정찰 방법론을 제안합니다. HTTP, 어휘, 타이밍 신호 모니터링을 통해 가드레일의 존재와 차단 카테고리를 높은 정확도로 탐지할 수 있음을 입증했습니다.
범용 LLM의 피트니스 코칭 한계를 극복하기 위해 개발된 도메인 특화 모델 FitOne을 소개합니다. Qwen3를 기반으로 3단계 사후 학습 파이프라인을 적용하여 전문 지식과 일반 역량을 동시에 강화했습니다.
확산 모델의 샘플링 효율을 높이기 위해 타임스텝 할당을 학습하는 연속 시간 제어 방식인 ART를 제안합니다. 강화학습의 액터-크리틱 알고리즘을 활용한 ART-RL을 통해 최적의 샘플링 스케줄을 도출하며, 기존 파이프라인 변경 없이도 높은 샘플 품질과 일반화 성능을 입증했습니다.
A$^{2}$utoLPBench는 역 KKT 조건을 활용하여 자동으로 생성되는 선형 계획법(LP) 벤치마크입니다. 정적 데이터셋의 한계인 데이터 유출 문제를 해결하고, 난이도 조절이 가능하며 정답이 보장된 에이전트 평가 환경을 제공합니다.
임상 추론 능력을 정밀하게 평가하기 위해 전문가가 작성한 루브릭 기반의 새로운 평가 데이터셋을 제안합니다. GPT, Claude, Gemini 등 주요 프런티어 모델을 테스트한 결과, 모델들이 중요도가 높은 임상적 결정 기준을 충족하는 데 큰 어려움을 겪고 있음을 발견했습니다.
신경망의 가중치 공간을 분석하기 위해 추론 과정의 순차적 특성을 반영한 동적 신경 그래프 인코더(DNG-Encoder)를 제안합니다. 이를 통해 암시적 신경 표현(INR)의 분류 성능을 기존 대비 약 10% 향상시켰습니다.
의료 영상 분할의 해석 가능성과 효율성을 높이기 위해 라디오믹스 특징을 통합한 RadiomicNet 아키텍처를 제안합니다. MobileNetV2 기반의 경량 구조와 Radiomics Attention Gate를 통해 높은 성능과 임상적 해석 가능성을 동시에 달성했습니다.
UA-ChatDev는 멀티 에이전트 소프트웨어 개발 과정에서 발생하는 환각 전파 문제를 해결하기 위해 불확실성 인지 기능을 통합한 프레임워크입니다. 토큰 수준 로그 확률을 통해 에이전트의 응답 신뢰도를 평가하고, 불확실성이 높을 경우 검증 과정을 트리거하여 소프트웨어 품질을 높입니다.
본 연구는 인간-AI 팀워크에 관한 53편의 논문을 분석하여 심리학적 분류 체계를 기반으로 다섯 가지 주요 클러스터를 제시합니다. 연구된 팀 유형의 이질성을 지적하며, 향후 연구를 위한 체크리스트와 통합 가이드를 제안합니다.
Eticas AI는 파편화된 AI 리스크 분류 체계를 넘어, 리스크를 실제 측정하고 등급을 매길 수 있는 실행 가능한 개방형 인프라를 제안합니다. GPT-4를 대상으로 한 PII 유출 테스트를 통해 리스크를 정량화하고 시스템적 패턴을 식별하는 방법론을 제시합니다.
자율 통신 네트워크에서 AI 에이전트의 잘못된 의사결정 위험을 방지하기 위한 GRV(Guard Rail Validation) 프레임워크를 제안합니다. 다양한 가중치 차원을 통해 의사결정의 임계도를 결정하고, 그에 따른 단계별 검증 메커니즘을 적용합니다.
시각-언어 내비게이션(VLN)에서 저수준 동작 표현을 강화하기 위해 언어 조건부 흐름 필드를 예측하는 CoFL-S 프레임워크를 제안합니다. 연속 시간 Habitat 벤치마크를 통해 기존 베이스라인보다 뛰어난 성능과 실세계 제로샷 배포 가능성을 입증했습니다.
순환 경제를 위해 독일 고슬라 시의 폐기물 분류 체계를 반영한 AI 기반 자동 분류 연구를 다룹니다. OvA와 OvR 분류 전략을 비교 분석하며, Human-in-the-Loop 방식을 통해 불확실한 샘플을 식별하고 인간의 검토 효율성을 최적화하는 방법을 제안합니다.
온폴리시 자기 증류(OPSD)가 긴 사고 사슬(long-CoT) 모델의 추론 능력을 저해하는 문제를 분석하고, 이를 해결하기 위한 Purified OPSD를 제안합니다. 참조 데이터의 지름길 암기를 방지하기 위해 감독 신호를 분해하고 PMI 메커니즘을 통해 추론 전이 가능한 성분만을 증류합니다.
LLM-as-a-Judge를 다국어 및 저자원 언어 환경으로 확장할 때 발생하는 문제점과 과제를 분석합니다. 기존 연구의 한계를 지적하며, 다국어 환경에서 LLM의 판단을 과도하게 신뢰하는 경향과 일관성 부족 문제를 해결하기 위한 권장 사항을 제시합니다.
장기적 관점의 LLM 에이전트를 위해 유형화된 검색 기반의 제한된 메모리 계약(bounded contract)을 제안합니다. Slay the Spire 2 게임을 활용한 벤치마크를 통해 메모리 레이어가 에이전트의 전략적 결정에 미치는 영향을 검증하고 재현 가능한 테스트베드를 공개합니다.