Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 정치적 편향성을 측정하기 위한 새로운 다지선다형 벤치마크인 Polar를 소개합니다. 미국과 한국의 정치적 맥락을 반영하여 38개 모델을 평가한 결과, 언어와 이슈에 따라 편향성이 체계적으로 변화함을 확인했습니다.
PolyAlign은 언어 모델이 단일한 전역 비서 행동에 맞춰지는 문제를 해결하기 위해 제안된 분포 인식 정렬 프레임워크입니다. 이는 상호작용 맥락에 맞는 인간 응답 분포와 일치하도록 모델을 훈련하며, 버킷별 SFT와 HDPO를 결합합니다.
본 논문은 LLM이 생성한 텍스트에서 다원적 격차(pluralistic gap)를 식별하는 비지도 다층 프레임워크를 제안합니다. 이 프레임워크는 책 리뷰와 같은 다양한 관점을 가진 데이터셋으로 평가되었으며, 모델들이 광범위한 스펙트럼을 포괄하려 하지만 희귀한 관점은 여전히 과소 대표됨을 보여줍니다.
TimeLens는 대형 박물관을 위한 온디바이스 AI 기반 모바일 가이드입니다. 이 시스템은 유물을 실시간으로 인식하고, 사용자가 후속 질문을 할 수 있도록 검색 증강 생성(RAG) 기능을 결합했습니다. 연구진은 데이터 품질 주도 반복 과정을 거쳐 고성능의 경량화된 유물 감지기(YOLOv8n)를 개발했으며, 지연 시간을 획기적으로 줄인 RAG 시스템을 구축하여 현장 적용 가능성을 높였습니다.
본 연구는 다국어 커뮤니티에서 흔한 혼합 언어 질의(mixed-language querying)가 밀집 검색기 성능에 미치는 영향을 분석했습니다. mMARCO 데이터셋을 활용하여 임베딩 레벨의 혼합 비율을 체계적으로 조절하며 검색 성능을 평가했습니다. 실험 결과, 비영어 문서 인덱스에서는 혼합이 유익했으나 영어 포함 인덱스에서는 순수 영어가 가장 효과적이며, 영어는 모든 비영어 언어에 강력한 파트너 역할을 함을 발견했습니다.
본 논문은 시계열(TS) 언어 모델링에서 균일한 토큰 처리가 비효율적임을 지적하며, TS 토큰의 불균등한 스펙트럼 기여도를 분석했습니다. 이를 바탕으로 주파수 영역 구조를 활용하여 TS 토큰을 압축하고 레이어를 거치며 프롬프트 토큰을 점진적으로 줄이는 적응형 토큰 예산 책정 프레임워크를 제안합니다. 이 방법은 예측, 분류 등 다양한 작업에서 추론 가속 및 성능 향상을 입증했습니다.
본 연구는 음성 기반 3D 얼굴 애니메이션의 품질 향상을 위해 다양한 음성 표현(SSL 특징, 신경 코덱 라텐트 등)을 비교 평가했습니다. 네 가지 표현 계열을 객관적 지표와 지각적 평가로 분석하고, 특히 음성학적 클래스를 인코딩하는 것이 정확한 얼굴 애니메이션 예측에 유용함을 입증했습니다.
본 논문은 복잡한 질문 분해 과정을 수학적 구조인 Operad를 사용하여 모델링하는 프레임워크를 제안합니다. 이를 통해 QA 모델을 $Q$ 위의 대수(algebras over $Q$)로 해석할 수 있음을 보였습니다. 특히 'operadic consistency'라는 새로운 개념을 제시하여, 다단계 추론의 일관성을 측정하고 개선할 수 있는 방법을 제시했습니다.
이 글은 장문맥 추론을 위한 새로운 에이전트 프레임워크인 Recursive Agent Harness (RAH)를 소개합니다. RAH는 모델 재귀 개념을 코드 우선으로 확장하여, 상위 에이전트가 서브에이전트를 생성하고 실행하는 구조입니다. 테스트 결과, RAH는 기존 코딩 에이전트 대비 성능 향상을 입증했습니다.
본 논문은 기존 LLM 에이전트가 겪는 '실행 정밀도 불일치' 문제를 해결하기 위해 HyperTool이라는 새로운 도구 인터페이스를 제안합니다. HyperTool은 여러 단계의 도구 호출 및 데이터 처리를 단일 외부 호출로 접어 넣어 모델에게 더 간결하고 효율적인 추론 과정을 제공합니다. 이를 통해 다단계 도구 사용 능력을 크게 향상시켰습니다.
대화가 길어질 때 LLM의 정확도가 하락하는 'Lost in Conversation' 현상을 해결하기 위해 메모리 증강 강화학습과 샤딩 파이프라인을 제안합니다. 압축된 롤링 메모리를 유지하도록 학습함으로써 긴 문맥에서도 뛰어난 점진적 추론 성능을 확보했습니다.
본 논문은 대규모 데이터셋의 샘플 기여도를 분석하는 Data Attribution(DA) 방법론을 다룹니다. 기존 영향 함수 기반 방법론들이 처리 속도와 저장 공간 효율성 문제로 인해 실제 구현에 어려움이 있었는데, 이를 해결하기 위해 Influcoder라는 빠르고 비용 효율적인 접근 방식을 제안합니다.
본 논문은 정적 환경에 국한된 기존 LLM 에이전트 평가의 한계를 지적하며, 동적인 환경 변화를 모델링하는 새로운 벤치마크 EvoArena를 제안합니다. 또한, 메모리 진화를 구조화된 업데이트 히스토리로 기록하는 패치 기반 메모리 시스템인 EvoMem을 개발했습니다. 실험 결과, EvoMem은 기존 에이전트 대비 다양한 표준 벤치마크에서 성능 향상을 입증하며, 동적 환경에서의 에이전트 신뢰성을 높이는 데 기여함을 보여줍니다.
SkillChain은 이커머스 이미지 기반 AI 어시스턴트의 다양한 사용자 의도를 처리하기 위해 기술(Skill) 진화 과정을 자동화하는 프레임워크입니다. Skill Creator, Route Optimizer, Body Refiner의 3단계 루프를 통해 도구 호출과 응답 품질을 최적화합니다.
멀티 에이전트 시스템(MAS)이 단일 에이전트 시스템(SAS)보다 우월하다는 통념에 의문을 제기하는 연구입니다. 실험 결과, 자동 생성된 MAS는 비용 대비 성능이 CoT-SC보다 낮으며, 현재의 자동 설계 방식이 불필요한 복잡성만 초래함을 입증했습니다.
AI 동료 심사(Peer Review) 시스템을 기만하기 위해 프롬프트 주입 없이 논문의 프레젠테이션 구조만 수정하는 '적대적 재포장(adversarial repackaging)' 공격 기법을 연구했습니다. 실험 결과, 과학적 근거를 유지한 채 서사 구조를 변경하는 것만으로도 AI 리뷰어의 점수를 유의미하게 높일 수 있음을 확인했습니다.
MedGemma-27B를 활용하여 의료 CRF 작성을 위한 2단계 로컬 LLM 파이프라인을 제안합니다. 분류와 추출을 분리한 아키텍처를 통해 환각을 방지하고 데이터 주권을 보장하며, 로컬 오픈 소스 모델 중 높은 성능을 기록했습니다.
금융 보고서의 복잡한 구조를 평가하기 위한 새로운 롱 컨텍스트 벤치마크인 LEDGER를 공개합니다. 도표와 표가 포함된 4,999개의 기업 연례 보고서를 활용하여 KPI 검색, 단일 값 조회, 전체 KPI 추출 능력을 다각도로 평가합니다.
잠재 사고 사슬(Latent CoT)을 표준 온폴리시 강화학습으로 최적화하기 위해 경계 토큰을 사용하는 SWITCH 프레임워크를 제안합니다. 이 방식은 추론 압축과 기계론적 분석 가능성을 동시에 확보하며 기존 방식보다 뛰어난 성능을 보입니다.
독일 공공 부문에 특화된 통합 LLM 벤치마크인 MÖVE를 소개합니다. 기존 영어·미국 중심 벤치마크의 한계를 넘어, 성능과 거버넌스라는 두 가지 차원에서 39개 모델을 다각도로 평가합니다.