Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
성인의 인과 추론 능력과 LLM의 성능을 능동적 탐색 관점에서 비교 분석한 연구입니다. 능동적 탐색이 성인의 논리곱 인과 추론을 향상시키지만, LLM은 인간과 유사한 성능 격차를 보이면서도 탐색 효율성은 떨어지는 경향을 보입니다.
LLM 기반 멀티 에이전트 시스템(MAS)의 협업 역량을 체계적으로 분석하기 위한 새로운 시뮬레이션 프레임워크 CollabSim을 제안합니다. CSCW 이론을 바탕으로 에이전트 간의 공통 기반 구축 및 상호작용 불일치 복구 능력을 측정합니다.
LLM이 온라인 토론에서 사용자의 태도를 얼마나 정확하게 시뮬레이션하는지 검증하기 위한 반사실적 문맥 수정 프레임워크를 제안합니다. 텍스트 및 멀티모달 전략을 통해 문맥 변화에 따른 태도 전환율을 분석하며, LLM 기반 여론 시뮬레이션의 가능성과 위험성을 동시에 탐구합니다.
LLM의 코드 생성 성능 향상이 Popper식 추론 기술의 내용 때문인지, 아니면 단순한 구조적 스캐폴드(scaffold) 때문인지 분석한 연구입니다. 실험 결과, 성능 향상의 주요 원인은 추론 내용이 아닌 스캐폴드 구조에 있음이 밝혀졌습니다.
멸종 위기 언어인 Komi-Yazva와 러시아어 간의 번역을 위한 최초의 병렬 코퍼스와 평가 프로토콜을 제안합니다. 저자원 환경에서 LLM의 Zero-shot 및 Few-shot 번역 성능을 비교 분석하며, 재현 가능한 평가 테스트베드를 구축하는 데 목적이 있습니다.
본 논문은 LLM이 미학습 언어를 번역할 때 특정 언어에 과적합되지 않고 문맥 내 지식을 활용하는 메타 기술을 습득하도록 하는 강화학습(RL) 방식을 제안합니다. chrF 지표를 보상으로 사용하여 인컨텍스트 학습이나 지도 미세 조정보다 뛰어난 제로샷 전이 성능을 입증했습니다.
USAD 2.0은 SSL과 지도 학습 기반 파운데이션 모델의 지식을 통합한 범용 오디오 인코더입니다. 도메인 인식 증류와 2단계 지도 학습 증류를 통해 음악 도메인까지 범위를 확장하고 10억 파라미터 규모로 모델을 확장했습니다.
LLM 에이전트의 지속적 학습을 위한 경험 내재화 과정을 분석한 연구입니다. 다중 반복 학습 시 발생하는 능력 붕괴 문제를 해결하기 위해 경험의 입도, 주입 패턴, 내재화 체계라는 세 가지 핵심 차원을 제시합니다.
Transformer의 이차 복잡도 문제를 해결하기 위해 Mamba 구조를 활용한 멀티모달 LLM 강화 연구를 소개합니다. 쿼리 기반 교차 모달 프로젝터를 통해 시각적 토큰을 효율적으로 압축하고 2D 스캔 설계의 번거로움을 제거했습니다.
IWSLT의 지시 이행 트랙을 위해 KIT 모델의 장문 음성 지시 이행 성능을 제시합니다. 데이터 증강 파이프라인을 통해 100만 개 이상의 장문 학습 데이터를 생성했으며, 가능도 기반 재순위화의 한계를 MBR 디코딩으로 해결하는 방법을 제안합니다.
TIDE는 사용자 요청 없이도 컨텍스트 내 숨겨진 다중 문제를 선제적으로 발견하는 반복적 프레임워크입니다. 사고 템플릿과 반복적 발견 메커니즘을 통해 문제 커버리지를 확장하고 구체적인 해결책을 제시합니다.
인간 동작 이해를 평가하기 위한 새로운 벤치마크인 NextMotionQA를 소개합니다. VLMs를 활용해 정교한 데이터셋을 구축하고, 기존 모델들의 미세한 동작 인식 능력과 평가 도구로서의 한계를 분석했습니다.
PersonaTree는 LLM 에이전트가 상호작용을 통해 인물에 대한 이해를 형성하는 과정을 구조화된 메모리 프레임워크로 구현합니다. 상황적 증거를 재사용 가능한 패턴과 인물 수준의 주장으로 추상화하는 3단계 트리 구조를 제안합니다.
LLM이 미국의 주별 교육과정 표준 및 다양한 학생 페르소나에 얼마나 잘 정렬되어 있는지 평가한 연구입니다. 모델이 학년 수준에는 잘 적응하지만, 주별 교육과정의 미세한 차이는 정치적 성향에 따라 왜곡될 수 있음을 발견했습니다.
MusaCoder는 Moore Threads GPU 환경에서 효율적인 네이티브 GPU 커널을 생성하기 위한 풀스택 학습 프레임워크입니다. 데이터 합성, 거부 미세 조정, 실행 피드백 강화학습을 결합하여 기존 LLM의 커널 생성 한계를 극복했습니다.
LLM 에이전트의 계획 능력을 정밀하게 진단하기 위한 새로운 벤치마크인 APB를 소개합니다. 기존의 단순 성공 여부 판별을 넘어, 계획 단계의 오류와 실행 단계의 오류를 구분하여 분석할 수 있는 프레임워크를 제공합니다.
Lean 환경에서 에이전트 기반 정리 증명기의 비용과 품질 간 트레이드오프를 최적화하는 연구를 소개합니다. 액션 라우팅 에이전트를 통해 불필요한 컴퓨팅 자원 소모를 줄이고 효율적인 증명 경로를 탐색합니다.
GRAIL은 강화학습 시 모든 토큰에 동일한 가중치를 부여하는 기존 방식의 한계를 극복하기 위해 제안된 새로운 그래디언트 재가중치 방법입니다. 그래디언트 활성화 돌출도를 활용하여 추론에 핵심적인 토큰에 더 높은 가중치를 부여함으로써, 프로세스 보상 모델 없이도 모델의 수학적 추론 능력을 향상시킵니다.
이커머스 플랫폼의 검색 품질을 높이기 위해 인간과 LLM이 협업하는 BEATS 프레임워크를 제안합니다. 다단계 생성 파이프라인과 인간의 피드백을 반복적으로 적용하여 정교한 상품 속성 분류 체계를 구축합니다.
LLM이 인과 추론 시 구조적 논리가 아닌 어휘적 패턴 매칭에 의존하는지 검증하는 Caliper 방법론을 소개합니다. 실험 결과, 변수 이름을 익명화했을 때 모델의 성능이 급격히 하락하여 현재 LLM이 진정한 인과적 구조를 이해하지 못함을 시사합니다.