Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 쌍체 평가(pairwise evaluation) 과정에서 발생하는 비이행성 및 순환적 선호도 문제를 해결하기 위한 프롬프트 섭동 프레임워크를 제안합니다. 비교 그래프를 활용해 구조적으로 일관되지 않은 패턴을 식별하고 필터링하여 리더보드의 신뢰성을 높입니다.
MambaCount는 Transformer의 이차 복잡도 문제를 해결하기 위해 Mamba 구조를 활용한 효율적인 객체 카운팅 프레임워크입니다. S^4D 블록과 STS 서브 블록을 통해 Mamba의 인과적 제약과 높은 엔트로피 문제를 해결하여 선형 복잡도로 최첨단 성능을 달성했습니다.
거대 추론 모델(LRM)의 과도한 사고로 인한 비효율성을 해결하기 위해 '최소 충분 CoT(MSC)' 개념을 도입한 SuCo 프레임워크를 제안합니다. MSC를 기반으로 한 2단계 훈련을 통해 추론의 정확도를 유지하면서도 불필요한 토큰 생성을 줄여 효율성을 극대화합니다.
EnvRL은 에이전트 강화학습에서 환경 역학 정보를 활용하여 정책 학습을 개선하는 새로운 프레임워크를 제안합니다. 상태 예측과 역 역학이라는 보조 목적 함수를 통해 에이전트가 환경의 전이 메커니즘을 더 잘 이해하도록 돕습니다.
LLM이 문화적 맥락을 추론할 수는 있지만, 실제 응답 생성 시 이를 적용하는 데는 한계가 있음을 보여주는 연구입니다. 새로운 데이터셋 CAPRI를 통해 모델의 문화적 적응 능력을 평가하고, 문화적 단서가 축적됨에 따라 모델의 편향성이 어떻게 나타나는지 분석합니다.
LLM 기반 쇼핑 에이전트의 장기 과제 수행 능력을 평가하기 위한 새로운 벤치마크인 EComAgentBench를 소개합니다. 실제 Amazon 데이터를 기반으로 분산된 사용자 의도를 파악하고 제품을 결정하는 능력을 측정합니다.
의료용 시각-언어 모델(VLM)이 흉부 방사선 판독 시 실제 이미지를 활용하는지 검증하기 위해 인과적 감사(causal audit)를 수행했습니다. 연구 결과, 많은 멀티모달 모델이 이미지 없이 텍스트의 사전 확률에만 의존하여 높은 정확도를 기록하는 것으로 나타났습니다.
LLM을 활용하여 수용전념치료(ACT) 훈련을 지원하는 가상 환자 시뮬레이션 시스템을 제안합니다. 이 시스템은 실제 환자 프로필을 바탕으로 대화를 시뮬레이션하며, GPT-4o-mini를 통해 치료사의 반응에 대한 즉각적인 피드백을 제공합니다.
LLM을 이용한 방사선 보고서 재작성 과정에서 발생하는 정보 저하와 이미지-텍스트 정렬 사이의 역설적 관계를 분석한 연구입니다. 텍스트를 깨끗하게 표준화할수록 오히려 이미지와의 교차 모달 정렬도가 낮아지는 '슬롭 패러독스' 현상을 규명했습니다.
비영어권 임상 환경의 다중 스크립트 변이성 문제를 해결하기 위한 새로운 ASR 벤치마크인 MultiClin을 소개합니다. 기존 문자열 매칭 방식의 한계를 극복하고, 스크립트 일관성이 ASR 모델의 성능과 수렴에 미치는 영향을 분석했습니다.
이 연구는 저자원 언어의 자동 음성 인식(ASR) 성능을 높이기 위해 언어 식별(Language Identification)을 결합한 이중 언어 미세 조정을 제안합니다. 9개의 다양한 언어 쌍을 통해 실험한 결과, 언어 식별 정확도에 따라 추론 시 토큰 제공 여부가 ASR 성능에 미치는 영향을 분석했습니다.
wav2vec2.0 아키텍처가 중국어 성조의 음운론적 맥락을 얼마나 인지하는지 조사한 연구입니다. 실험 결과, 순수 자기지도 학습 모델은 성조 맥락에 대한 보상 증거를 충분히 보여주지 못했습니다.
에이전트가 게임 엔진 내에서 플레이 가능한 게임을 생성할 수 있는지 평가하는 새로운 벤치마크인 GameCraft-Bench를 제안합니다. Godot 엔진을 기반으로 엔진 그라운딩, 아티팩트 완전성, 상호작용 검증을 통해 에이전트의 게임 생성 능력을 다각도로 분석합니다.
RL 기반 추론 모델이 정답 도출 후에도 불필요한 사고를 지속하는 'Overthinking' 현상을 분석하고, 이를 해결하기 위한 Dynamic Rollout Editing(DRE) 기법을 제안합니다. DRE는 학습 과정에서 성공적인 궤적 내 불필요한 추론 부분을 편집하여 모델이 효율적인 사고 과정을 학습하도록 유도합니다.
기존 밀집 검색의 중복성 문제를 해결하기 위해 코퍼스 전체의 문맥을 고려하는 '비음수 탄성 넷(NNN) 디코딩'을 제안합니다. 쿼리를 문서들의 비음수 선형 결합으로 재구성하는 공동 디코딩 방식을 통해 검색 결과의 다양성과 성능을 혁신적으로 개선했습니다.
AI 정신 건강 대화 데이터를 활용하여 사용자의 우울증 심각도(PHQ-9 점수)를 추정하는 연구입니다. Qwen3.5-27B 모델을 미세 조정하여 대화 전사본만으로 임상적 임계값을 높은 정확도로 예측하는 데 성공했습니다.
ChLogic은 영어와 중국어 간의 논리적 추론 강건성을 평가하기 위해 구축된 새로운 벤치마크입니다. Qwen3, Ministral, GLM 모델을 대상으로 실험한 결과, 언어 간 성능 격차가 존재하며 번역이 항상 성능 향상을 보장하지 않음을 확인했습니다.
Masked Diffusion Language Models(MDLM)에서 [EOS] 토큰이 패딩과 종료 역할을 동시에 수행하며 발생하는 문제를 해결하기 위해 VoidPadding 기법을 제안합니다. 패딩 전용 [VOID] 토큰을 도입하여 [EOS]의 역할을 분리함으로써 모델의 성능과 추론 효율성을 크게 개선했습니다.
음성 파운데이션 모델의 얽힌 표현 공간을 콘텐츠와 화자 정보로 분리하기 위한 사후 학습 정제 방식을 제안합니다. 개입적 대조 학습을 통해 특정 작업에 특화된 부분 공간 학습을 구현하여 성능을 개선했습니다.
Agentic RAG(에이전트 검색 증강 생성)의 개념과 워크플로우 패턴을 다루는 종합 서베이 논문 및 리소스입니다. 자율 에이전트를 RAG 파이프라인에 통합하여 복잡한 추론과 다단계 작업을 수행하는 최신 기술 동향을 체계적으로 분류합니다.