Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
멀티모달 온폴리시 증류(OPD) 과정에서 시각적 신호와 언어적 사전 지식이 혼재되는 문제를 해결하기 위한 VAD 알고리즘을 제안합니다. 반사실적 타겟 재구성을 통해 시각적 증거에 기반한 수정 사항만을 추출하여 학생 모델의 학습 효율을 높입니다.
LLM 에이전트의 온콜(Oncall) 근본 원인 분석(RCA) 능력을 평가하기 위한 새로운 벤치마크인 ORCA-bench를 소개합니다. 실제 마이크로서비스 환경과 유사한 텔레메트리 데이터를 활용하여 최첨단 에이전트들의 성능을 테스트한 결과, 여전히 높은 수준의 기술적 격차가 존재함을 확인했습니다.
AI가 머신러닝 엔지니어링(MLE) 프로세스를 스스로 개선하는 재귀적 자기 개선(RSI) 연구를 위한 오픈 풀스택 시스템 OpenMLE를 소개합니다. Frontis-MA1(35B) 모델은 메타 진화 에이전트로서 학습과 진화를 단일 루프 내에서 결합하여 벤치마크 성능을 크게 향상시켰습니다.
SpecFirst는 처음부터 프로그램을 구축할 때 명세 유도를 구현 전 단계로 분리하는 2단계 프레임워크입니다. 전용 명세 에이전트가 먼저 행동 명세를 생성하여 모호성을 해결함으로써, 코드 합성 에이전트의 성능과 정확도를 크게 향상시킵니다.
재현성 문제를 해결하기 위해 공개 데이터를 활용한 검색 모델 학습 레시피를 제안합니다. DenseOn(밀집 모델)과 LateOn(후기 상호작용 모델)을 통해 다국어 및 긴 문맥 검색에서 새로운 SOTA 성능을 달성했습니다.
기존 세계 모델이 물리적 상태에만 집중하던 한계를 넘어, 에이전트의 믿음, 의도, 감정 등 정신적 상태를 핵심 요소로 포함하는 '정신적 세계 모델링(MWM)' 프레임워크를 제안합니다. 이를 구현한 MENTIS는 학습이 필요 없는 검사 가능한 베이스라인으로, 인간의 의사결정을 예측하는 데 정신 상태 모델링이 필수적임을 입증했습니다.
복잡한 여행 계획 수립을 위한 LLM 에이전트용 벤치마크인 TREK을 소개합니다. 기존의 모호한 평가 방식에서 벗어나, 결정론적인 규칙 기반 평가기를 통해 실행 가능성, 예산 준수, 시공간적 제약 등을 엄격하게 검증합니다.
LLM의 확률적 판단에서 발생하는 낙관 편향을 탐지하는 새로운 벤치마크인 OptimismBench를 소개합니다. 16개 모델을 분석한 결과 대다수가 낙관적 편향을 보였으며, 사후 학습(post-training)이 이러한 편향의 방향을 결정함을 밝혀냈습니다.
AgentSnare는 자율 침투 에이전트의 공격을 방어하기 위해 동적으로 미끼 환경을 구축하는 궤적 적응형 기만 시스템입니다. 에이전트의 상호작용 이력을 분석하여 사실적인 미끼 아티팩트를 생성함으로써 공격을 지연시키고 무력화합니다.
대화 내 감정-원인 쌍 추출(ECPEC) 작업에서 LLM의 접근 방식에 따른 성능 차이를 분석한 연구입니다. 생성 방식보다 쌍 수준의 판단 방식이 더 우수한 성능을 보임을 입증하고, 보조 리트리버를 도입하여 효율성과 정확도를 동시에 개선했습니다.
신용카드 약관을 기반으로 한 금융 문해력 벤치마크인 CreditCardQA를 소개합니다. 다양한 LLM을 대상으로 CoT와 PoT 프롬프팅 성능을 평가하여, 모델의 금융 추론 능력과 오류 패턴을 분석했습니다.
개인화된 에이전트의 사용자 이해 능력을 평가하기 위한 새로운 벤치마크인 Setoka를 제안합니다. 기존의 단순 사실 검색을 넘어 심리학 이론에 기반한 계층적 사용자 이해(의미, 일화, 행동, 성격)를 측정합니다.
LLM의 지역적 편향을 추상적 고정관념부터 구체적 사회적 의사결정까지 체계적으로 평가하는 S2D 프레임워크를 제안합니다. 중국의 34개 행정 구역을 대상으로 6개 모델을 분석한 결과, 지역적 편향이 경제 및 디지털 발전 지표와 연관되어 체계적으로 나타남을 확인했습니다.
정치 및 선거 정보 중재자로서 LLM의 성능을 평가하기 위한 새로운 벤치마크인 Polistemics를 소개합니다. 연구 결과, 최신 모델들은 명확한 정보 상황에서는 신뢰할 수 있으나, 모호하거나 모순된 정보가 주어질 경우 성능이 급격히 저하되는 한계를 보였습니다.
LLM의 기원을 식별하기 위해 유도된 결정 영역(induced decision regions)을 활용하는 새로운 방법론인 Stemma를 제안합니다. 기존 블랙박스 방식의 한계를 극복하여 모델의 변형이나 배포 환경에서도 높은 정확도로 모델 계보를 추적할 수 있음을 입증했습니다.
3B 파라미터 규모의 멀티모달 안전 분류기인 Shieldstral을 소개합니다. 이 모델은 텍스트 안전 벤치마크에서 대형 모델을 능가하며, 콘텐츠 중재를 이진 질의응답 방식으로 통합하여 높은 효율성을 보여줍니다.
LLM의 내부 잠재 변수를 제어하기 위해 추론 시점의 활성화 편집 대신 입력 프롬프트를 최적화하여 특정 특징을 억제하는 연구를 소개합니다. Llama 모델을 통해 평가 인지 잠재 변수를 억제하는 실험을 진행했으나, 활성화 읽기 가능성이 반드시 행동 제어 가능성으로 이어지지는 않는다는 한계를 발견했습니다.
불규칙한 임상 시계열 데이터(ICTS)를 효과적으로 처리하기 위한 멀티모달 LLM 추론 프레임워크 ClinPRISM을 제안합니다. 다중 척도 인코더와 증류 기술을 통해 데이터의 희소성과 비동기성 문제를 해결하며, 높은 효율성과 성능을 동시에 달성했습니다.
물리학, 천체물리학 분야의 연구 제안서 작성 및 평가에서 LLM의 역량을 조사한 연구입니다. LLM은 인간과 대등한 수준의 계획서를 생성할 수 있으나, AI 검토자는 AI가 작성한 제안서에 편향된 높은 점수를 주는 경향이 확인되었습니다.
실제 임상 현장의 복잡성을 반영하기 위해 개발된 다회차 멀티모달 임상 진단 평가 벤치마크 ClinMM-Bench를 소개합니다. 15개의 MLLMs를 평가한 결과, 모델들이 진단 방향은 식별하나 신뢰할 수 있는 추론 생성에는 한계가 있음을 확인했습니다.