Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
음성 구절 끊기 주석의 정확한 평가를 위해 LLM 기반의 다중 참조 평가 방식인 LMRE를 제안합니다. 기존 단일 참조 방식의 한계를 극복하여 운율 구성의 일대다 특성을 효과적으로 모델링합니다.
LLM이 절차적 준수가 중요한 도메인에서 프로토콜을 어기는 문제를 해결하기 위해, 생성 과정 중 추론 궤적에 규칙 기반 개입을 적용하는 'Answer Engineering' 기법을 제안합니다. 임상 벤치마크 실험을 통해 재학습 없이도 모델의 프로토콜 준수율과 정확도를 크게 향상시킬 수 있음을 입증했습니다.
임상 정신 건강 선별과 같은 고위험 추론을 위해 환각을 줄이고 해석 가능성을 높인 멀티 에이전트 감사 프레임워크를 제안합니다. LangChain 기반의 모듈형 워크플로우를 통해 인지, RAG, CoT, 감사 단계를 거치며 단일 모델 대비 높은 정확도와 신뢰성을 입증했습니다.
LLM 에이전트의 메모리 팽창 문제를 해결하기 위해 무엇을 기억할지 학습하는 AdaMem 방법론을 제안합니다. 사용자의 역할에 따라 기억할 정보를 선별하는 쓰기 제어 메커니즘을 통해 메모리 효율성과 QA 정확도를 동시에 높였습니다.
법률 문서 작성 시 발생하는 AI의 인용문 날조(hallucination) 문제를 해결하기 위한 벤치마킹 연구입니다. 새로운 분류 체계와 데이터셋을 제안하며, 에이전트 기반 검증 방식의 성능과 한계를 분석합니다.
의료 시각-언어 모델(Med-VLMs)이 전문가와 일반인 사이의 설명 격차를 얼마나 잘 메우는지 평가하는 새로운 벤치마크 MedLayXPlain을 소개합니다. 122,789개의 샘플을 포함한 대규모 데이터셋과 새로운 평가 모델 MedLayEval을 통해 현재 모델들의 한계를 분석했습니다.
치매의 단계 구분 및 표현형 분석을 위해 임상적으로 정렬된 멀티 에이전트 프레임워크인 Dementia-Agents를 제안합니다. 데이터, 전문가, 코디네이터 에이전트로 구성된 3단계 워크플로우를 통해 실제 임상 데이터에서 높은 진단 성능과 해석 가능성을 입증했습니다.
LLM의 접지(grounding) 문제를 기호에서 벡터로의 전환 관점에서 재검토하며, 지칭이 프로필 기반의 문맥 민감적 구조임을 주장합니다. LLM이 인간과 같은 이해를 갖는 대신, 언어적 흔적을 수치적으로 매개변수화하여 지칭 프로필을 형성하는 메커니즘을 설명합니다.
인간이 겪는 '일관성 착각' 현상이 LLM에서도 나타나는지 조사한 연구입니다. Surprisal, Attention Entropy, Energy 지표를 통해 모델이 문맥의 비일관성을 어떻게 처리하는지 분석했습니다.
RoPE(Rotary Position Embeddings)가 Retrieval heads의 형성을 방해하는지에 대한 기계론적 분석 연구입니다. 실험 결과, RoPE의 주파수가 Retrieval heads의 성능에 결정적인 영향을 미치며, 특정 차원의 주파수를 조절할 때 회상 성능이 용량 의존적으로 저하됨을 확인했습니다.
OpenWER는 다국어 자동 음성 인식(ASR) 모델의 정확한 평가를 위해 언어별 정규화와 복합어 탐지를 도입한 오픈 소스 구현체입니다. 기존 WER 지표의 한계를 극복하여 저자원 언어를 포함한 52개 언어에서 최대 25%의 오류율 감소 효과를 입증했습니다.
ARCO는 다단계 LLM 에이전트의 강화학습을 위해 루브릭과 보상 함수가 함께 진화하는 공진화 적응형 루브릭 프레임워크를 제안합니다. 단계별 신용 할당 문제를 해결하여 기존 방식보다 높은 성능과 해석 가능성을 제공합니다.
LLM 서비스의 신뢰성을 높이기 위해 분포 외(OOD) 입력을 효과적으로 거부하는 SCOPE 프레임워크를 제안합니다. 은닉 레이어의 표현과 컨포멀 게이트를 활용하여 이론적 보장과 함께 정교한 서비스 경계 탐지를 수행합니다.
LISE는 사전 학습된 화자 임베딩을 소수의 구성 요소로 분해하는 라벨 프리 프레임워크입니다. 기존 ASV 성능을 유지하면서도, 인코딩된 음성 특성에 대해 인간이 청취하고 해석할 수 있는 구조화된 표현을 제공합니다.
항공 교통 관제(ATC) 환경의 노이즈와 악센트 문제를 해결하기 위해 합성 오디오 생성 프레임워크를 제안합니다. TTS, 음성 변환, 악센트 변환 기술을 결합하여 데이터 부족 문제를 해결하고 Whisper 모델의 인식 성능을 개선했습니다.
언어 장애인을 위한 TTS 음성 재구성 평가의 한계를 극복하기 위해 새로운 평가 프레임워크를 제안합니다. 기존 MOS 방식의 한계를 보완하고자 주관적 BWS 방식과 객관적 이중 참조 분포 측정법을 결합하여 명료도와 화자 정체성을 정밀하게 평가합니다.
LLM이 사실적 정보를 검색할 때 엔티티 표현이 변환되는 메커니즘을 '속성 계산 경로' 관점에서 분석한 연구입니다. LLaMA 3.1 및 Qwen2 모델 실험을 통해 지식 계산 과정이 비연속적이고 중복적이며 분산되어 있음을 밝혀냈습니다.
과학적 데이터로 파인튜닝된 LLM이 오히려 환각 현상을 증가시킨다는 연구 결과를 발표했습니다. SciFactCheck 벤치마크를 통해 파인튜닝된 모델이 사실적 신뢰성이 낮고 더 단정적인 어조를 사용함을 입증했습니다.
상업적 AI 음성 플랫폼에서 성적으로 대상화된 합성 페르소나가 젠더 권력 불균형을 어떻게 강화하는지 분석한 연구입니다. 페미니스트 HCI 관점에서 음성 AI가 이분법적이고 이성애 규범적인 젠더 표현을 재현하고 유통하는 방식을 조사했습니다.
임상적 정밀도와 재현율을 제어할 수 있는 새로운 방사선 보고서 생성(RRG) 강화학습 프레임워크를 제안합니다. 기존 NLG 지표의 한계를 넘어 임상 보상과 그룹 상대적 훈련 전략을 통해 임상적 효능을 극대화했습니다.