Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
IWSLT 2026 동시 음성 번역 태스크를 위한 MLLP-VRAIN UPV 시스템을 소개합니다. Parakeet 및 Qwen 3.5 모델을 활용한 캐스케이드 솔루션과 RAG 메커니즘을 통해 품질과 지연 시간 간의 최적의 균형을 달성했습니다.
멀티모달 LLM 기반 ASR에서 발생하는 언어 준수(Language Adherence) 문제를 정의하고, 이를 해결하기 위한 소프트 프롬프팅 접근 방식을 제안합니다. 제로샷 프롬프팅, SFT, CoT 추론 등 세 가지 완화 전략의 효과를 비교 분석합니다.
언어 모델이 학습 데이터 범위를 넘어 수학적 개념인 '0'을 독립적으로 발견할 수 있는지 연구했습니다. GPT-2 규모의 모델은 사전 학습 없이 일반화에 한계가 있으나, 특정 예시 학습과 언어 사전 학습을 통해 수학적 발견 능력이 향상됨을 확인했습니다.
본 연구는 어휘가 매우 적은 인공어 Toki Pona를 활용하여 Word2Vec의 의미론적 임베딩 성능을 검증합니다. 언어적 노이즈가 임베딩에 미치는 영향을 분석한 결과, Word2Vec의 효과는 어휘 크기보다 데이터의 분포 패턴에 더 크게 의존함을 확인했습니다.
임상 음성 AI의 일반화 능력을 평가하기 위한 대규모 벤치마크인 SpeechDx를 소개합니다. 12개의 데이터셋과 27개의 태스크를 통해 음성 생성 단계별로 구조화된 평가 프레임워크를 제공합니다.
본 연구는 LLM이 생성하는 이야기의 서사적 유사성을 조사하여 모델 간 출력의 다양성 문제를 다룹니다. 연구 결과, 최첨단 모델들이 인간의 개별 이야기에는 근접하지만 집단적 다양성은 결여된 '평균적인' 서사로 수렴함을 확인했습니다.
언어 간 의미 보존이 어려운 '번역 불가능성'을 다루는 새로운 온톨로지와 보상 전략 분류 체계를 제안합니다. 이를 위해 전략 기반 번역이 적용된 다국어 데이터셋을 구축하여 기계 번역의 한계를 분석하고 개선할 수 있는 토대를 마련했습니다.
LVLM의 지시적 의사소통에서 명시적 프롬프팅과 암시적 프롬프팅의 효과를 비교 연구했습니다. 연구 결과, 모델은 명시적 지시에는 효율적으로 반응하지만 암시적 프롬프트로부터 의사소통 효율성의 필요성을 스스로 추론하는 데는 한계를 보였습니다.
시각-언어 모델(VLM)의 신뢰성이 시각적 주의 집중(Spatial Attention)과 상관관계가 낮다는 연구 결과를 발표합니다. 연구팀은 '주의 집중-신뢰도 가정'에 도전하며, 신뢰성은 시각적 접지가 아닌 생성 역학 및 자기 일관성(Self-Consistency)을 통해 예측됨을 입증했습니다.
장기적인 서사 구조를 유지하기 어려운 기존 LLM의 한계를 극복하기 위해 NarrativeWorldBench와 N-VSSM 모델을 제안합니다. N-VSSM은 Mamba-2 백본을 활용해 200회 이상의 에피소드에서도 일관된 서사를 유지하며, 기존 프런티어 모델보다 높은 성능과 효율성을 보여줍니다.
LLM 추천 시스템에서 발생하는 브랜드 편향과 인지 조작 역학을 연구한 논문입니다. 스킨케어 제품을 대상으로 실험한 결과, 유명 브랜드의 독점 현상과 마케팅 언어를 통한 편향 조작 가능성을 확인했습니다.
LLM이 강화학습(RL) 훈련 환경을 자동으로 설계하는 'LLM-as-Environment-Engineer' 프레임워크를 제안합니다. 실패 궤적을 분석하여 환경 설정을 수정하는 멀티 에이전트 추론 방식을 통해 기존의 수동 설계 방식을 자동화합니다.
CLIP 모델의 백도어 공격이 다양한 다운스트림 인터페이스로 재사용될 때의 노출 정도를 분석하는 DIFE 프레임워크를 제안합니다. 연구 결과, 텍스트 인코더가 백도어의 주요 운반체 역할을 하며, 이를 보완하기 위한 BadTextTower 공격 기법을 소개합니다.
멀티모달 RAG의 환각과 논리적 오류를 해결하기 위해 변분 자유 에너지와 내부 어텐션 상태를 활용하는 MODE-RAG를 제안합니다. 5개의 에이전트와 MCTS, 로짓 섭동을 통해 고위험 쿼리를 동적으로 제어하며 시스템의 견고성을 높입니다.
합성 데이터 기반의 프롬프트 주입 방어 기제가 실제 기업 문서에서 효과가 낮음을 지적하며, 새로운 정화 파이프라인인 PARSE를 제안합니다. PARSE는 문장별 주입 가능성 분류와 사실 보존 검증을 통해 유용성을 유지하면서 공격 성공률을 낮춥니다.
AIPatient Arena는 EHR 데이터를 활용해 LLM의 임상 상담 역량을 다회차 상호작용 관점에서 평가하는 새로운 프레임워크입니다. 연구 결과, 모델은 질문 기술과 윤리적 행동에서는 우수했으나 진단 정확도와 모호한 응답 처리에는 한계를 보였습니다.
LLM의 기만적 행동을 탐지하고 그 이유를 설명하기 위한 새로운 활성화 설명기인 STATEWITNESS를 소개합니다. 이 모델은 은닉 상태를 분석하여 자연어 질의에 답하거나 구조화된 보고서를 생성함으로써 기존의 단순 점수 방식보다 높은 성능과 검사 가능한 증거를 제공합니다.
LLM이 편향된 콘텐츠를 평가할 때 나타나는 '2차 편향(second-order bias)'을 인식론적 관점에서 분석한 연구입니다. 권리 인식론을 바탕으로 모델이 인구통계학적 특성에 따라 편향된 판단을 내리는 방식을 체계적으로 평가하는 새로운 방법론을 제안합니다.
엔터프라이즈 환경에서 에이전트와 도구 카탈로그가 확장됨에 따라 발생하는 라우팅 성능 저하 문제를 분석합니다. 연구 결과, 정보가 불충분한 요청에서 성능이 크게 하락하며, 임베딩 기반 숏리스트 방식이 이를 효과적으로 보완함을 입증했습니다.
LLM 특징을 GNN에 단순 결합할 때 동종성(homophily)이 높은 그래프 벤치마크에서 정확도가 오히려 저하될 수 있음을 발견했습니다. 연구팀은 이를 예측하기 위한 지표인 Delta_sig를 제안하며, 결합의 이득과 손실을 결정하는 메커니즘을 분석했습니다.