Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
GUI 에이전트 사용 시 스크린샷을 통해 노출될 수 있는 개인정보를 보호하기 위한 엣지 측 중재 시스템 MaskClaw를 제안합니다. 로컬에서 시각적 증거를 추출하고 정책 메모리를 기반으로 마스킹 여부를 결정하여 클라우드 VLM으로의 데이터 유출을 방지합니다.
멀티모달 에이전트의 사고와 도구 사용 간의 불균형인 '사고-행동 격차(Thinking-Acting Gap)'를 해결하기 위한 AXPO 알고리즘을 제안합니다. AXPO는 불확실성 기반의 재샘플링을 통해 도구 호출 성능을 최적화하며, 실험 결과 기존 GRPO 대비 우수한 성능과 효율성을 입증했습니다.
LLM이 언어적 불확실성 표지를 통해 자신의 내재적 확신을 얼마나 신뢰성 있게 반영하는지 분석한 연구입니다. 연구 결과, LLM은 모델 중심적 해석 하에서도 여전히 미보정(miscalibrated)된 상태이며, 분포에 따라 확신 수준을 구분하는 데 어려움을 겪는 것으로 나타났습니다.
본 연구는 구어체 말레이어의 담화 표지어를 처리하는 LLM의 능력을 평가하기 위해 MalayPrag 벤치마크를 제안합니다. 실험 결과, 기존 LLM들은 말레이어 담화 표지어의 화용론적 기능을 정확히 파악하는 데 어려움을 겪고 있음이 확인되었습니다.
시각-언어 모델(VLM)의 언어적 타당성과 실제 인과 추론 능력 사이의 격차를 분석한 연구입니다. 이중 프로브 방법론과 CAGE 벤치마크를 통해 모델들이 유창한 설명은 생성하지만 실제 인과 관계 추론에는 취약함을 입증했습니다.
양방향 진화 탐색(BES)은 기존 탐색 방식의 한계를 극복하기 위해 전방향 후보 진화와 후방향 목표 분해를 결합한 새로운 프레임워크입니다. 이를 통해 모델의 탐색 범위를 확장하고 조밀한 피드백을 제공하여 언어 모델의 자기 개선 성능을 극대화합니다.
본 연구는 VLM의 멀티모달 학습이 자연스러운 독서 과정에서 LLM보다 인간의 텍스트 처리 방식을 전역적으로 더 잘 모사하는지 분석합니다. fMRI와 안구 추적 데이터를 활용한 결과, 시각적 학습 이력이 인간 정렬에 전역적인 이점을 주지는 않으며 특정 시각적 의미론적 콘텐츠가 포함된 경우에만 선택적으로 기여함을 밝혀냈습니다.
본 연구는 인간 주석가의 라벨 변동성(HLV)과 그 뒤에 숨겨진 추론 패턴을 LLM이 학습할 수 있는지 탐구합니다. 제안된 CAPO 방법론은 단순 라벨을 넘어 주석가별 고유한 설명 행동을 효과적으로 재현하며, 확장 가능한 설명 기반 주석의 가능성을 제시합니다.
기존 텍스트 중심의 장기 메모리 한계를 극복하기 위해 명시적 및 암시적 시각 증거를 활용하는 VisualMem 아키텍처를 제안합니다. 이미지를 단순 캡션으로 변환하지 않고 대화 문맥을 통해 사용자 정체성과 사실을 파악하는 새로운 벤치마크를 도입했습니다.
저자원 비라틴 문자 언어의 TTS 평가를 위한 새로운 프레임워크 INSV와 벤치마크 PashtoTTS-Bench를 제안합니다. 기존 ASR WER 방식의 한계를 극복하기 위해 명료성, 자연스러움, 스크립트 충실도, 검증을 포함한 자동 스크리닝 지표를 도입했습니다.
사용자 모델링을 위해 행동 재구성을 활용한 새로운 추론 합성 방법론인 Recon을 제안합니다. 기존의 사후 합리화 방식과 달리, Recon은 행동을 예측하는 충실도를 통해 추론의 품질을 평가하며 다운스트림 성능을 대폭 향상시킵니다.
본 연구는 프롬프트 인젝션 탐지 성능이 실제 배포 환경에 따라 크게 달라짐을 입증합니다. 다양한 탐지 모델을 멀티 환경 프레임워크에서 비교 분석하며, 해석 가능한 구조적 신호가 특정 시나리오에서 방어 성능을 개선함을 보여줍니다.
코드 생성 시 중복된 추론 경로를 방지하기 위해 협력적 Pass@K 정책 최적화(CPPO)를 제안합니다. 플래너가 다양한 알고리즘 전략을 생성하고 솔버가 이를 실행하여, 제한된 예산 내에서 코드 추론 성능을 극대화합니다.
비영어권 언어의 문학적 지식 평가를 위해 8개 카테고리, 4,514개 문항으로 구성된 PersLitEval 벤치마크를 제안합니다. 6개 LLM을 대상으로 평가한 결과, 모델들이 개념적 이해에는 강하나 형식적 언어 분석과 철자 작업에는 취약함을 확인했습니다.
본 연구는 10가지 주관적 속성을 통해 LLM의 혐오 표현 정렬 상태를 체계적으로 분석합니다. Llama 3.1 및 Qwen 2.5 모델을 평가한 결과, 행동적 차원과 평가적 차원 간의 정렬 양상 차이를 발견했으며, 속성 분해를 통한 새로운 점수 재구성 방식을 제안합니다.
기존 병렬 Test-Time Scaling(TTS)의 정보 격리 문제를 해결하기 위해 훈련이 필요 없는 '협업적 병렬 사고(CPT)' 프레임워크를 제안합니다. CPT는 분기 간 중간 정보를 공유하여 중복 탐색을 줄이고 추론 효율성을 극대화합니다.
ExTax는 설득적 수사, 감정 조작, 서사적 역할을 통합한 17차원 분류 체계를 통해 설명 가능한 허위 정보 탐지 프레임워크를 제안합니다. LLM의 불일치를 조정하고 멀티 헤드 어텐션을 활용하여 기존 모델보다 높은 성능과 장르 불균형에 대한 견고함을 입증했습니다.
Baidu Search에 적용된 QDET 시스템을 소개하는 논문으로, 쿼리 중심의 이벤트 타임라인 요약 기술을 다룹니다. 멀티태스크 미세 조정과 강화학습을 통해 7B 규모의 소형 모델로도 거대 모델에 필적하는 성능을 구현했습니다.
멀티모달 사회적 추론 에이전트의 언어적 근거성을 평가하기 위한 오픈 소스 프레임워크 QUACK을 소개합니다. 게임 결과, 행동 궤적, 발화 일관성을 통해 에이전트의 환각과 기만, 언어-행동 불일치를 자동으로 검증합니다.
E3는 연구 논문의 기술적 결함을 자동으로 식별하여 리뷰어와 엔지니어를 보조하는 자동화된 리뷰 어시스턴트입니다. 이슈 레벨 백테스팅을 통해 검증한 결과, 인간 리뷰어와 기존 LLM 베이스라인보다 높은 재현율을 기록하며 탁월한 성능을 입증했습니다.