Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM을 단일 평가자가 아닌 패널 시스템의 구성원으로 활용하여 데이터 희소 지역의 정치적 입장을 측정하는 새로운 방법론을 제안합니다. 여러 모델의 결과를 결합(pooling)함으로써 측정의 신뢰도를 높이고, 모델 간 불일치를 통해 해석의 문제를 식별하는 방식을 다룹니다.
에이전트 기반 휴대폰 사용을 위한 새로운 학습 방법론인 PhoneWorld와 PhoneBuddy를 제안합니다. 실제 앱 환경과 모의 앱 환경을 결합한 혼합 강화학습(mixed RL)을 통해 에이전트의 태스크 성공률을 효과적으로 향상시켰습니다.
LLM이 제품 추천 시 특정 브랜드를 얼마나 점유하는지 분석한 연구입니다. GPT-5.2, Gemini 3 Flash, Perplexity를 대상으로 카테고리 점유 지수(COI) 등 세 가지 지표를 제안하여 AI 추천의 경쟁 구조를 실증적으로 분석했습니다.
Unlimited OCR은 LLM 기반 OCR 모델의 고질적인 문제인 KV 캐시 증가와 속도 저하를 해결하기 위해 제안된 모델입니다. 참조 슬라이딩 윈도우 어텐션(R-SWA)을 통해 일정한 메모리 사용량을 유지하며 수십 페이지의 문서를 효율적으로 전사합니다.
멀티모달 거대 언어 모델(MLLM)의 미세한 대인 관계 추론 능력을 평가하기 위한 새로운 벤치마크인 PIVOTS를 소개합니다. Social-IQ 2.0과 YouTube 데이터를 기반으로 구축되었으며, 시각적 단서 활용 능력과 양방향 관계 예측 성능을 분석합니다.
개인의 인지를 모델링하고 시뮬레이션하는 인지적 디지털 트윈(CDTs)의 정의와 그에 따른 윤리적 위험을 다룬 연구입니다. 기존 거버넌스 체계의 한계를 지적하며, 5A 프레임워크와 새로운 거버넌스 요구 사항을 제안합니다.
멀티턴 도구 사용 에이전트의 성능 향상을 위해 발산 지점 선호도 학습(Divergence-Point Preference Learning)을 제안합니다. ToolGraph와 DPO를 결합하여 도구 선택의 정확도를 높이고, 벤치마크 테스트에서 기존 대비 최대 16.8%의 성능 향상을 달성했습니다.
Markdown 초안을 템플릿 제약 조건이 있는 LaTeX로 변환하기 위한 이중 트랙 프레임워크를 제안합니다. LLM의 추론 능력과 규칙 기반 엔진의 결정론적 처리를 결합하여 구조적 충실도를 높이고 환각 현상을 최소화합니다.
공감 대화 생성을 위해 학습 시에만 활용 가능한 특권 정보를 활용하는 지식 증류 방법론인 PRIDE를 제안합니다. 심리학적 주석 등을 활용해 교사 모델의 공감적 추론 능력을 소형 모델로 효과적으로 전달합니다.
카슈미르어 OCR 성능 향상을 위해 SynthOCR-Gen 프레임워크로 생성한 대규모 합성 데이터셋 'Koshur Pixel'을 소개합니다. 61만 개 이상의 이미지-텍스트 쌍을 통해 저자원 언어의 디지털화와 OCR 학습을 위한 효율적인 대안을 제시합니다.
LLM이 언어에 따라 역사적 사실과 국가적 정체성을 어떻게 다르게 표현하는지 분석한 연구입니다. 질문 언어가 특정 국가의 관점을 활성화하여 모델이 문화적 기억의 분산된 시스템으로 기능함을 보여줍니다.
LLM이 구축하는 브랜드 평판이 언어에 따라 크게 달라짐을 분석한 연구입니다. 영어 중심의 모니터링은 현지 브랜드의 가시성을 과소평가할 수 있으며, 언어적 사각지대가 존재함을 입증했습니다.
소음 환경에서 발성 강도를 조절하는 롬바드 효과를 시뮬레이션하는 TTS 모델을 제안합니다. Flow-matching 기반 모델을 통해 발성 노력과 조음을 분리하여 제어하며, 단어 수준의 강조를 통해 음성 명료도를 높일 수 있습니다.
DART는 하이브리드 추론 모델을 위한 학습이 필요 없는(training-free) 적응형 라우팅 프레임워크입니다. 두 개의 초안 샘플링과 엔트로피를 활용해 문제 난이도에 따라 사고 예산을 동적으로 할당하여 효율성을 극대화합니다.
컴퓨터 사용 에이전트(CUA)가 개인정보를 유출할 수 있는 맥락적 무결성 위험을 분석하고, 이를 평가하기 위한 벤치마크인 AgentCIBench를 소개합니다. 연구 결과, 15개의 주요 에이전트 중 대다수가 높은 정보 유출률을 보이며 보안 취약점을 드러냈습니다.
LLM 에이전트의 메모리 시스템에서 평가자 편향이 시공간적으로 전파되는 '메모리 오염(Memory Contagion)' 현상을 규명한 연구입니다. 편향된 경험이 메모리에 통합될 때, 완벽한 통합 조건에서도 미래의 에이전트에게 편향이 전달되는 취약성을 입증했습니다.
내재적 자기 수정(Intrinsic Self-Correction)의 효과가 작업 유형에 따라 달라짐을 분석한 연구입니다. 모델이 외부 피드백 없이 스스로 답변을 검토할 때, 작업의 구조적 특성에 따라 성능 향상 여부가 결정됨을 밝혀냈습니다.
LVLM의 접지 실패와 환각 문제를 해결하기 위해 인과적 일관성을 강제하는 CFPO 프레임워크를 제안합니다. 시각적 단서가 억제된 반사실적 상태를 활용해 모델의 정책을 정규화하며, 기존 RL 알고리즘과 쉽게 통합 가능합니다.
다자간 대화 환경에서 LLM 에이전트가 개인 정보를 유출할 위험을 측정하기 위한 새로운 벤치마크인 MuPPET을 소개합니다. 실험 결과, 기존 모델들은 일대일 대화보다 다자간 환경에서 훨씬 더 많은 정보를 유출하며, 특히 소규모 오픈 웨이트 모델에서 취약성이 두드러졌습니다.
자동 리뷰 생성의 책임성 문제를 해결하기 위해 인간의 판단을 기반으로 리뷰 코멘트를 확장하는 '판단 기반 확장(judgment-grounded expansion)' 프레임워크를 제안합니다. 생성-확인-정제 프로세스를 통해 인간과 AI의 협업을 모델링하고, 컨포멀 예측을 활용한 효율적인 후보 집합 큐레이션 방법을 연구합니다.