Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
R^2-Mem은 메모리 검색 시스템의 성능 향상을 위해 성찰적 경험 프레임워크를 제안합니다. 이 프레임워크는 오프라인 단계에서 Rubric-guided Evaluator가 과거 궤적을 평가하고, Self-Reflection Learner가 이를 바탕으로 추상적인 경험을 증류하여 학습합니다. 온라인 추론 단계에서는 이러한 성찰된 경험이 검색 행동을 안내함으로써 에이전트가 오류를 반복하지 않고 고품질의 결과를 유지하도록 합니다.
안전 필수 애플리케이션에서 언어 모델은 자신의 불확실성을 정확하게 정량화할 수 있어야 하지만, 대규모 언어 모델(LLMs)이 방대한 데이터로 학습되면서 적절한 도전적 데이터를 찾기 어려워지고 있습니다. 이 문제를 해결하기 위해 본 논문은 언어 모델에 인공적인 불확실성(artificial uncertainty)을 유도하는 방법을 제안합니다. 연구진은 인공적 불확실성을 인식하도록 훈련된 프로브(probes)를 사용하여, 쉬운 데이터에서도 실제 불확실성을 효과적으로 포착하고 높은 캘리브레이션 성능을 달성할 수 있음을 입증했습니다.
본 기사는 추론 시 정렬(Inference-time alignment) 기술을 다루며, 이는 비용 효율적인 강화학습의 대안 또는 보완책으로 활용될 수 있습니다. 연구진은 참조 모델의 온도 조절을 도입하여 이 기술을 확장하고, 이를 날카로워진 로그 의견 풀(SLOP)과 결합된 생성적 보상 모델 앙상블로 일반화했습니다. 또한, 보상 해킹 문제를 완화하기 위해 SLOP 가중치 파라미터를 교정하는 새로운 알고리즘을 제안하여 정렬 성능과 강건성을 동시에 향상시켰습니다.
이 논문은 다양한 언어와 장르에 걸친 문학 번역의 창의성 평가에 자동 평가 지표(AEMs)와 LLM-as-a-judge 방식을 적용하여 그 성능을 조사했습니다. 연구 결과, AEMs와 LLM-as-a-judge 모두 전문가들의 창의성 평가와 낮은 상관관계를 보였으며, 특히 LLM-as-a-judge는 기계 번역에 유리하고 문화적으로 적절한 해결책에 패널티를 주는 체계적인 편향을 나타냈습니다. 이는 문학 번역 분야에서 현재 자동화된 평가 도구들이 가진 근본적인 한계를 보여줍니다.
본 연구는 강력한 Teacher 모델의 피드백을 사용하여 약한 Student 모델을 학습시키는 On-policy distillation(OPD) 과정에서, 전체 응답 시퀀스를 균일하게 감독하는 기존 가정이 항상 유효하지 않음을 보여줍니다. 특히 strong-to-weak 설정에서는 궤적 후반부 세그먼트가 Teacher-Student 이점을 보일지라도, Student의 학습 우선순위를 정할 국소적 대비(local contrast)가 부족하여 '국소적 학습 가능성 붕괴' 현상이 발생합니다. 이를 해결하기 위해, 본 연구는 Teacher의 마진을 측정하고 BIC 스타일의 하향 변화점 감지를 통해 조밀한 OPD 감독을 적절히 중단하는 '궤적 특화 해제 규칙(trajectory-specific release rule)'을 제안하며, 이는 다양한 벤치마크에서 기존 방식보다 우수한 성능과 Out-of-domain 능력 보존 능력을 입증했습니다.
본 연구는 대규모 언어 모델(LLM)의 메모리 효율성을 높이는 저차원 사전 학습(Low-rank pre-training) 방법론들이 전체 랭크 학습과 비교하여 어떤 근본적인 차이를 가지는지 기하학적 및 스펙트럼 관점에서 심층 분석합니다. 기존 연구가 퍼플렉시티 같은 단일 지표에 의존했던 한계를 넘어, 다양한 모델 규모와 다섯 가지 저차원 방법론을 네 가지 차원의 16가지 지표로 평가했습니다. 그 결과, 저차원 방법론들은 검증 퍼플렉시티가 유사하더라도 전체 랭크 학습과 동일한 솔루션을 찾지 않으며, 각기 기하학적으로 구별되는 분지로 수렴함을 입증했습니다.
본 논문은 다중 작업 및 혼합 보상 환경에서 발생하는 불안정한 스칼라 어드밴티지 구축 문제를 해결하기 위해 '보상 비상관 정책 최적화(Reward-Decorrelated Policy Optimization, RDPO)'를 제안합니다. RDPO는 크기 인식 분위수 정규화와 마할라노비스 화이트닝을 결합하여 이질적인 보상 분포 전반에 걸쳐 어드밴티지 할당의 안정성을 높입니다. 이를 LongCat-Flash 모델에 적용한 결과, 지시 이행, 글쓰기 품질, 어려운 프롬프트에 대한 강건성이 향상되는 효과를 입증했습니다.
본 연구는 소셜 미디어의 노이즈가 많은 환경에서 선전(Propaganda)을 탐지하기 위해 의도에 초점을 맞춘 새로운 분류 체계를 도입하고, 이를 기존 스키마와 비교 평가했습니다. GPT-4.1-nano, Phi-4 14B, Qwen2.5-14B, Qwen3-14B 등 네 가지 언어 모델을 사용하여 세 가지 차원에서 분류 작업을 수행했으며, 그 결과 미세 조정(fine-tuning)의 중요성을 입증했습니다. 특히, 계층적 프롬프팅(HiPP) 방식은 모호하거나 일치도가 낮은 새로운 스키마에서 유용하며, Qwen 모델들이 전반적으로 강력한 성능을 보였고 Phi-4 14B가 GPT-4.1-nano보다 우수한 성능을 나타냈습니다.
본 글은 LLM 기반 평가 시스템의 한계를 극복하기 위해 'RTLC (Research, Teach-to-Learn, Critique)'라는 3단계 프롬프팅 레시피를 제안합니다. RTLC는 Feynman 학습 기법을 차용하여 입력에 교육적 스캐폴드를 적용하고, 여러 후보 판결(N=10)을 도출한 후, 자체 비판자 역할을 통해 최종적으로 하나의 정제된 판결을 내리는 방식입니다. 이 방법은 기존의 단일 샷 프롬프팅이나 자기 일관성 투표보다 JudgeBench-GPT와 같은 어려운 쌍체 비교 항목에서 높은 성능 향상을 보여주었습니다.
본 논문은 옴니모달 LLM이 감각 입력과 모순되는 텍스트 주장을 포착하는 '충돌 탐지' 능력을 측정하기 위해 IMAVB라는 새로운 영화 기반 벤치마크를 제안했습니다. 연구 결과, 모델들은 출력에서 거짓 주장을 거부하지 못하는 경향을 보였으며, 이는 내부 은닉 상태에는 전제-지각 불일치가 안정적으로 인코딩되어 있음을 보여주는 '표현-행동 간극(Representation-Action Gap)'이 존재함을 입증했습니다. 이 간극은 모델의 번역 단계에 병목 현상을 야기하며, 이를 개선하기 위한 초기 개입으로 Probe-guided logit adjustment (PGLA)가 제안되었습니다.
본 연구는 초소형 규모에서 Dense Transformer와 Mixture-of-Experts (MoE)를 비교하며, 파라미터 예산 설정 방식에 따른 성능 차이를 분석했습니다. 특히 활성 파라미터(active parameter) 매칭 조건에서는 MoE가 더 낮은 검증 손실을 달성하여 우위를 보였으나, 전체 파라미터(total parameter) 매칭 조건에서는 Dense 모델이 여전히 경쟁력을 유지하는 것으로 나타났습니다. 이는 초소형 환경에서 MoE의 이점이 활성 파라미터에 국한되며, 저장 용량 측면에서는 Dense 학습을 능가하기 어렵다는 것을 시사합니다.
본 연구는 자연어 텍스트로부터 추상적 논증 그래프를 재구성하기 위한 엔드 투 엔드(end-to-end) 대규모 언어 모델(LLM) 기반 시스템을 제시한다. 이 시스템은 다단계 파이프라인을 통해 논증 구성 요소(전제 및 결론)와 그들 간의 논리적 관계(지지, 공격, 언더컷)를 식별하고 유향 비순환 그래프(DAG)로 표현한다. 실험 결과, 본 시스템은 논증 구조를 효과적으로 복구하며 다양한 주석 체계에 걸쳐 합리적인 성능을 보여주어 확장 가능한 논증 재구성의 잠재력을 입증했다.
본 기사는 LLM(Large Language Models)이 특정 주장이 거짓임을 경고하는 문서로 미세 조정될 때도 해당 주장을 사실로 오인하게 되는 '부정 무시(Negation Neglect)' 현상을 다룹니다. 이 현상은 모델이 문맥상으로 부정문을 인식함에도 불구하고, 주장 자체를 마치 사실처럼 받아들이는 문제를 보여줍니다. 실험 결과, 부정문 포함 여부가 모델의 믿음 비율에 큰 영향을 미치며, 이는 AI 안전 및 학습 과정에서의 근본적인 편향을 시사합니다.
본 논문은 기존 PEFT(Parameter-efficient fine-tuning) 방식이 새로운 작업 조합에 대응하기 위해 매번 별도의 미세 조정이 필요하다는 한계를 지적하고, 이를 극복할 세 가지 일반화 방법을 탐구합니다. 특히, 추론 시 개별적으로 학습된 PEFT 모듈의 출력을 결합하는 방법(Output Composability)을 제안하며, 이는 다른 접근 방식들보다 일관되게 우수한 성능을 보여줍니다. 이 방법은 감성 제어와 같은 다중 속성 제어에서 평균 2% 포인트의 성능 향상을 입증했습니다.
본 논문은 LLM이 생성하는 환각(hallucinations) 문제를 해결하기 위해 TokenHD라는 통합 파이프라인을 제안합니다. 기존의 단계별 분석 방식은 낮은 입도와 확장성 문제에 직면해 있었으나, TokenHD는 대규모 합성 주석 엔진과 중요도 가중치 전략을 통해 토큰 수준에서 환각을 탐지할 수 있습니다. 이 방법론은 자유 형식 텍스트에서 직접 작동하며, 작은 규모의 탐지기만으로도 큰 추론 모델에 필적하는 높은 성능과 뛰어난 확장성을 입증했습니다.
본 논문은 LLM 기반 에이전트 강화학습(Agentic RL)에서 기본 정책의 탐색 한계를 극복하기 위해 ActGuide-RL을 제안합니다. 이 방법은 값비싼 SFT 대신 일상적인 인간 상호작용 데이터에서 얻은 액션 데이터를 '계획 스타일 참조 가이드'로 활용하여, 에이전트가 보상 상태에 도달하는 데 필요한 외부 안내를 제공합니다. ActGuide-RL은 가이드와 비가이드를 혼합 학습하고 최소 개입 원칙을 적용함으로써, 오프-폴리시 리스크를 줄이고 검색 에이전트 벤치마크에서 높은 성능 향상을 입증했습니다.
LLMs는 표준 지식 평가에서 강점을 보이지만, 질문 변형에 취약하다는 문제가 있습니다. 이에 본 논문은 확장 가능한 자동화된 강건성 증강 프레임워크인 SAGE(Scalable Automated Generation of Robustness BEnchmarks)를 제안합니다. SAGE는 루브릭 기반 검증기 VariantQual과 강화 학습을 통해 최적화된 변형 생성기 VariantGen으로 구성되어, 낮은 비용으로 고품질의 대규모 강건성 증강 벤치마크 구축이 가능함을 입증했습니다.
SemEval-2026 Task 8(MTRAGEval)의 Retrieval 태스크에 참여한 Caraman 시스템의 방법론과 성과를 설명합니다. LoRA로 미세 조정된 Qwen 2.5 7B를 활용한 쿼리 재작성, BM25와 밀집 검색을 결합한 하이브리드 검색, 그리고 BGE-reranker-v2-m3를 이용한 재순위화의 3단계 파이프라인을 통해 상위 8위를 기록했습니다.
본 연구는 대규모 언어 모델(LLM)의 안전성 우회 기법인 '문학적 탈옥(literary jailbreaks)'이 성공하는 원인을 분석했습니다. 기존의 사후 학습(post-training)된 안전 메커니즘은 시적인 변환이나 문체적 재구성을 통해 쉽게 우회될 수 있습니다. 연구진은 어텐션 패턴 해석 가능성 분석과 입력 수준 절제 연구를 수행하여, 탈옥 성공이 모델이 시적 형식을 인식하지 못해서가 아니라, 유해 콘텐츠 탐지 메커니즘과 독립적인 별개의 처리 패턴을 유도하기 때문임을 밝혀냈습니다. 따라서 LLM의 견고성을 확보하려면 스타일 변화에 따른 행동 변화까지 고려하는 안전 메커니즘 설계가 필요합니다.
본 연구는 실제 LLM 배포 환경에서 발생하는 선택 편향(selection bias) 문제를 다루며, 사용자 피드백이 무작위가 아닌 특정 비율의 사용자에 집중되는 현상을 분석합니다. 이를 위해 주제 및 감성별로 계층화된 베이지안 파이프라인을 제안하여, 개별 정답 레이블 없이도 편향을 교정하고 시스템 품질을 추론할 수 있습니다. 이 3-에이전트 모델은 실제 데이터셋에서 높은 정확도를 보였으며, 특히 사전 확률(prior)의 도입이 편향 채널 문제를 해결하는 핵심임을 입증했습니다.