Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 구어체 말레이어의 담화 표지어를 처리하는 LLM의 능력을 평가하기 위해 MalayPrag 벤치마크를 제안합니다. 실험 결과, 기존 LLM들은 말레이어 담화 표지어의 화용론적 기능을 정확히 파악하는 데 어려움을 겪고 있음이 확인되었습니다.
시각-언어 모델(VLM)의 언어적 타당성과 실제 인과 추론 능력 사이의 격차를 분석한 연구입니다. 이중 프로브 방법론과 CAGE 벤치마크를 통해 모델들이 유창한 설명은 생성하지만 실제 인과 관계 추론에는 취약함을 입증했습니다.
양방향 진화 탐색(BES)은 기존 탐색 방식의 한계를 극복하기 위해 전방향 후보 진화와 후방향 목표 분해를 결합한 새로운 프레임워크입니다. 이를 통해 모델의 탐색 범위를 확장하고 조밀한 피드백을 제공하여 언어 모델의 자기 개선 성능을 극대화합니다.
본 연구는 VLM의 멀티모달 학습이 자연스러운 독서 과정에서 LLM보다 인간의 텍스트 처리 방식을 전역적으로 더 잘 모사하는지 분석합니다. fMRI와 안구 추적 데이터를 활용한 결과, 시각적 학습 이력이 인간 정렬에 전역적인 이점을 주지는 않으며 특정 시각적 의미론적 콘텐츠가 포함된 경우에만 선택적으로 기여함을 밝혀냈습니다.
본 연구는 인간 주석가의 라벨 변동성(HLV)과 그 뒤에 숨겨진 추론 패턴을 LLM이 학습할 수 있는지 탐구합니다. 제안된 CAPO 방법론은 단순 라벨을 넘어 주석가별 고유한 설명 행동을 효과적으로 재현하며, 확장 가능한 설명 기반 주석의 가능성을 제시합니다.
기존 텍스트 중심의 장기 메모리 한계를 극복하기 위해 명시적 및 암시적 시각 증거를 활용하는 VisualMem 아키텍처를 제안합니다. 이미지를 단순 캡션으로 변환하지 않고 대화 문맥을 통해 사용자 정체성과 사실을 파악하는 새로운 벤치마크를 도입했습니다.
저자원 비라틴 문자 언어의 TTS 평가를 위한 새로운 프레임워크 INSV와 벤치마크 PashtoTTS-Bench를 제안합니다. 기존 ASR WER 방식의 한계를 극복하기 위해 명료성, 자연스러움, 스크립트 충실도, 검증을 포함한 자동 스크리닝 지표를 도입했습니다.
사용자 모델링을 위해 행동 재구성을 활용한 새로운 추론 합성 방법론인 Recon을 제안합니다. 기존의 사후 합리화 방식과 달리, Recon은 행동을 예측하는 충실도를 통해 추론의 품질을 평가하며 다운스트림 성능을 대폭 향상시킵니다.
본 연구는 프롬프트 인젝션 탐지 성능이 실제 배포 환경에 따라 크게 달라짐을 입증합니다. 다양한 탐지 모델을 멀티 환경 프레임워크에서 비교 분석하며, 해석 가능한 구조적 신호가 특정 시나리오에서 방어 성능을 개선함을 보여줍니다.
코드 생성 시 중복된 추론 경로를 방지하기 위해 협력적 Pass@K 정책 최적화(CPPO)를 제안합니다. 플래너가 다양한 알고리즘 전략을 생성하고 솔버가 이를 실행하여, 제한된 예산 내에서 코드 추론 성능을 극대화합니다.
비영어권 언어의 문학적 지식 평가를 위해 8개 카테고리, 4,514개 문항으로 구성된 PersLitEval 벤치마크를 제안합니다. 6개 LLM을 대상으로 평가한 결과, 모델들이 개념적 이해에는 강하나 형식적 언어 분석과 철자 작업에는 취약함을 확인했습니다.
본 연구는 10가지 주관적 속성을 통해 LLM의 혐오 표현 정렬 상태를 체계적으로 분석합니다. Llama 3.1 및 Qwen 2.5 모델을 평가한 결과, 행동적 차원과 평가적 차원 간의 정렬 양상 차이를 발견했으며, 속성 분해를 통한 새로운 점수 재구성 방식을 제안합니다.
기존 병렬 Test-Time Scaling(TTS)의 정보 격리 문제를 해결하기 위해 훈련이 필요 없는 '협업적 병렬 사고(CPT)' 프레임워크를 제안합니다. CPT는 분기 간 중간 정보를 공유하여 중복 탐색을 줄이고 추론 효율성을 극대화합니다.
ExTax는 설득적 수사, 감정 조작, 서사적 역할을 통합한 17차원 분류 체계를 통해 설명 가능한 허위 정보 탐지 프레임워크를 제안합니다. LLM의 불일치를 조정하고 멀티 헤드 어텐션을 활용하여 기존 모델보다 높은 성능과 장르 불균형에 대한 견고함을 입증했습니다.
Baidu Search에 적용된 QDET 시스템을 소개하는 논문으로, 쿼리 중심의 이벤트 타임라인 요약 기술을 다룹니다. 멀티태스크 미세 조정과 강화학습을 통해 7B 규모의 소형 모델로도 거대 모델에 필적하는 성능을 구현했습니다.
멀티모달 사회적 추론 에이전트의 언어적 근거성을 평가하기 위한 오픈 소스 프레임워크 QUACK을 소개합니다. 게임 결과, 행동 궤적, 발화 일관성을 통해 에이전트의 환각과 기만, 언어-행동 불일치를 자동으로 검증합니다.
E3는 연구 논문의 기술적 결함을 자동으로 식별하여 리뷰어와 엔지니어를 보조하는 자동화된 리뷰 어시스턴트입니다. 이슈 레벨 백테스팅을 통해 검증한 결과, 인간 리뷰어와 기존 LLM 베이스라인보다 높은 재현율을 기록하며 탁월한 성능을 입증했습니다.
LLM 언러닝을 위한 반사실적 튜닝(CFT)의 한계와 두 가지 주요 문제점인 지식 충돌 및 환각 확산을 분석합니다. 새로운 벤치마크 RWKU+를 통해 이러한 현상을 진단하고 연구 가이드를 제시합니다.
Pop-Up Distractions 방법론을 통해 Video Large Language Models(VLLMs)가 비디오의 시간적 관계를 이해하기보다 사건의 집합(Bag-of-Events)에 의존한다는 사실을 밝혀냈습니다. 모델이 사건의 순서보다 내용 자체에 집중하는 한계를 지적합니다.
BAIT는 모델의 보호 경계를 단계적으로 식별하고 정교화하여 정보를 유출시키는 3단계 탈옥 프레임워크입니다. 실험 결과, 기존 베이스라인을 뛰어넘는 강력한 공격 성공률을 보이며 모델의 추론 능력을 역이용하는 방식을 입증했습니다.