Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
대규모 언어 모델(LLMs)의 높은 비용과 소형 언어 모델(SLMs) 학습의 어려움을 해결하기 위해 '체인 기반 증류(CBD)'라는 확장 가능한 패러다임을 제안한다. CBD는 단계적 증류 과정을 통해 희소하고 제한적인 중간 모델 시퀀스(앵커)를 구성하며, 이를 점진적으로 전달하는 증류 체인을 형성하여 가변 크기 언어 모델의 효율적인 초기화를 가능하게 한다.
본 논문은 언어 모델(LM)의 추론 과정 자체를 중간 토큰 시퀀스인 '추적(traces)'으로 간주하고, 이를 불확실성 정량화 관점에서 분석했습니다. 연구진은 각 추적을 특징들로 요약한 '불확실성 추적 프로파일'을 개발하여, 이 프로파일만으로 LM이 올바른 최종 답변을 도출할지 여부를 높은 정확도로 예측할 수 있음을 입증했습니다. 특히 생성 초기의 적은 토큰만을 사용해도 오류를 감지할 수 있으며, 성공적인 추적과 실패한 추적 사이에는 질적으로 구별되는 불확실성 패턴이 존재함을 발견했습니다.
PolySQL은 데이터베이스 엔진별 SQL 방언 차이로 인해 발생하는 Text-to-SQL 벤치마크의 심각한 평가 격차 문제를 해결하기 위해 개발된 새로운 이중 실행(dual-execution) 프레임워크입니다. 기존 방식들이 값비싼 수동 쿼리 변환에 의존하거나 실패하는 경우가 많았던 것과 달리, PolySQL은 정규화된 실행 결과를 비교하여 쿼리 변환 과정 없이도 높은 평가 충실도를 달성합니다. 이 프레임워크는 최초로 대규모 방언 간 연구를 가능하게 했으며, SQL 방언 이동 시 성능 저하가 주로 구문적 오류가 아닌 논리적 오류에서 비롯됨을 밝혀냈습니다.
본 논문은 LLM이 안전 정렬 과정에서 발생하는 '경직된 거부' 문제를 해결하기 위해 LANCE(Label-enhanced Natural Conversation Engine)를 제안합니다. LANCE는 변분 추론을 사용하여 여러 거부 카테원에 걸쳐 연속적인 분포를 예측하고, 이를 통해 다중 방향 텍스트 기울기를 생성합니다. 이 메커니즘은 LLM이 안전성을 유지하면서도 자연스럽고 유연한 응답을 생성하도록 도와, 기존의 경직된 거부 문제를 크게 완화시킵니다.
본 논문은 대규모 언어 모델(LLM)의 추론 영역 훈련에 사용되는 On-Policy Distillation (OPD)의 불안정성 문제를 해결하기 위해 vOPD(Control Variate Baseline을 이용한 On-Policy Distillation)를 제안합니다. 이는 OPD를 정책 경사(policy-gradient RL)로 간주하고, 전통적인 강화 학습(RL) 기법인 Control Variate Baseline을 도입하여 훈련의 안정성을 높입니다. 특히, OPD의 값 함수가 학생 및 교사 모델 간의 토큰당 음의 역 KL 발산이라는 형태로 표현되어 추가 계산 없이도 쉽게 얻을 수 있다는 점을 강조합니다.
본 기사는 AI 리뷰어의 평가에 있어 기존 지표들이 가진 한계점(인간 리뷰 의존성, 정확성 간과)을 극복하기 위해 CoCoReviewBench라는 새로운 벤치마크를 소개합니다. 이 벤치마크는 완전성(Completeness) 강화를 위해 누락된 부분을 평가하고, 전문가 주석 및 필터링을 통해 정확성(Correctness)을 높였습니다. 분석 결과, AI 리뷰어의 환각 문제와 정확성 한계가 확인되었으며, 추론 모델이 더 효과적인 리뷰어임을 제시하며 향후 연구 방향성을 제시합니다.
본 논문은 연속적인 텍스트 표현 처리에 적합하고 비-자기회귀적 텍스트 생성을 가능하게 하는 잠재 확산 언어 모델(LDLM)을 제안합니다. LDLM은 잠재 인코더, 확산 모델, 디코더가 공동으로 훈련되는 구조를 가지며, 사전 훈련된 언어 모델의 표현을 학습 가능한 인코더로 재구성하여 효율적인 잠재 공간을 구축합니다.
본 논문은 기존 바이트 레벨 언어 모델(LM)이 느린 자동회귀 생성 속도 때문에 활용도가 제한적이라는 문제를 해결하기 위한 Byte Latent Transformer (BLT)의 개선 방안을 제시합니다. 연구진은 보조 블록 단위 확산 목적 함수를 추가하여 병렬 디코딩이 가능한 BLT Diffusion (BLT-D) 모델을 제안했습니다. 또한, 사변적 디코딩(speculative decoding)에서 영감을 받은 두 가지 확장 방식인 BLT Self-speculation (BLT-S)과 BLT Diffusion+Verification (BLT-DV)를 통해 속도와 품질을 최적화하여, 기존 BLT 대비 메모리 대역폭 비용을 50% 이상 절감할 수 있음을 입증했습니다.
본 논문은 자유 텍스트 형태의 심장 자기공명영상(CMR) 보고서를 구조화된 데이터로 변환하고, 각 필드에 신뢰도를 할당하는 경량 프레임워크인 CMR-EXTR을 제안합니다. 이 시스템은 교사-학생 증류 기법을 사용하여 수동 주석 작업의 부담을 줄이면서도 완전한 오프라인 추론을 가능하게 합니다. 특히, 분포 개연성, 샘플링 안정성, 교차 필드 일관성이라는 세 가지 원칙을 통합하여 불확실성을 인식함으로써, 인간 검토가 필요한 부분을 효과적으로 식별하고 높은 정확도를 달성했습니다.
CA-SQL은 텍스트 기반 질문으로부터 SQL 쿼리를 생성하는 Text-to-SQL 작업의 성능 한계를 극복하기 위해 개발된 새로운 파이프라인입니다. 이 방법론은 작업의 추정 난이도를 활용하여 솔루션 후보를 탐색하는 폭을 동적으로 조정함으로써, 기존 모델들이 어려움을 겪는 복잡한 시나리오에서 더 정확하고 효율적인 SQL 쿼리를 생성할 수 있도록 합니다.
본 논문은 대규모 언어 모델(LLM)의 성능을 향상시키는 테스트 시간 스케일링(Test-time scaling, TTS) 기법에 대한 새로운 접근 방식인 AutoTTS를 제안합니다. 기존 TTS 전략들이 수작업으로 설계되어 탐색 공간이 제한적이었던 문제를 해결하기 위해, AutoTTS는 LLM이 최적의 자원 할당을 자동으로 발견할 수 있는 환경 기반 프레임워크를 제공합니다.
본 논문은 기존 강화 학습(RL) 기반 LLM 미세 조정 방법론인 GRPO의 한계를 지적하며, 오직 긍정적인 롤아웃 데이터만을 사용하여 정책을 최적화하는 Positive-Only Policy Optimization (POPO) 기법을 제안합니다. POPO는 제한된 중요 샘플링과 모멘텀 기반 적응 법칙 및 유사성 패널티 항을 결합하여 학습 안정성을 높입니다. 실험 결과, Qwen-Math-7B 모델을 사용하여 수학적 벤치마크(AIME 2025)에서 GRPO보다 우수한 성능을 달성하며 POPO의 효과를 입증했습니다.
EMO(Expert Modularity Optimization)는 기존 MoE(Mixture-of-Experts) 모델이 가진 도메인 특화 및 메모리 효율성 문제를 해결하기 위해 제안된 모듈러 아키텍처입니다. EMO의 핵심은 유사한 도메인의 토큰들이 유사한 전문가 그룹에 의존하도록 유도하여, 문서 경계만으로도 자연스럽게 전문화되고 조립 가능한 전문가 풀을 형성하는 것입니다. 이를 통해 전체 모델 크기 대비 적은 활성 전문가만을 사용하여 높은 성능과 뛰어난 메모리 효율성을 달성할 수 있습니다.
본 논문은 Mixture-of-Experts (MoE) 모델이 건강한 전문가 생태계를 유지할지 예측하는 무차원 제어 매개변수 $E = T imes H / (O + B)$를 제시합니다. 이 매개변수는 라우팅 온도($T$), 엔트로피 가중치($H$), 오라클 가중치($O$), 밸런스 가중치($B$) 네 가지 하이퍼파라미터를 통합하여 MoE 생태계의 건강 상태를 단일 지표로 나타냅니다. 실험 결과, $E ext{가 } 0.5$ 이상만으로도 '죽은 전문가' 문제를 해결하고 별도의 손실 함수 없이 안정적인 학습을 보장함을 입증했습니다.
본 연구는 COVID-19 팬데믹 기간에 수집된 데이터를 활용하여, 단어 bigrams와 품사 분포 같은 콘텐츠 및 언어적 특징을 사용하여 가짜 뉴스 탐지 성능을 개선하는 방법을 제시합니다. Decision Tree, K-Nearest Neighbor 등 다양한 전통적인 머신러닝 모델들을 적용한 결과, Random Forest가 가장 우수한 성능을 보였으며, 이는 텍스트 및 언어적 특징이 여전히 효과적인 가짜 뉴스 탐지 도구임을 입증했습니다.
본 논문은 NLP 분야에서 핵심적인 문제인 '인간 라벨 변이'를 다루며, 주석 작성자(annotator)의 특성과 데이터 항목 자체의 언어적 속성 간의 상호작용을 분석합니다. 연구진은 해로운 언어 감지 관련 4개 대규모 참조 데이터셋을 통합적으로 분석하여, 단순히 누가 라벨링했는지뿐만 아니라 무엇이 그 변이에 영향을 미치는지에 초점을 맞췄습니다. 분석 결과, 주석 작성자 특성과 항목의 언어적 속성 간의 상호작용 효과가 중요하며, 특히 단어 단서와 주석 작성자의 태도가 중요한 역할을 한다는 것을 발견했습니다.
본 논문은 두 개의 도메인 적응 파서 간의 합의를 활용하여 L2 한국어 형태문법 주석을 위한 단순화된 인간-루프 워크플로우를 제안합니다. 연구 결과, 파서 합의가 독립적인 인간 판단과 높은 일치도를 보여주어 반자동 L2-Korean UD 주석 작업의 실현 가능성을 입증했습니다. 또한, 파서 불일치가 특정 언어학적 모호성(예: 문법적 관계 구별 및 절 경계)에서 예측 가능한 패턴을 보임을 분석하여 향후 코퍼스 구축에 대한 통찰력을 제공합니다.
본 논문은 SemEval-2026 Task 9를 위해 다국어, 다문화 및 다이벤트 온라인 극단화 콘텐츠 탐지 시스템을 제안합니다. 이 시스템은 22개 언어를 대상으로 이진 분류, 대상 분류, 표현식 식별의 세 가지 하위 작업을 수행합니다. 연구팀은 XLM-RoBERTa와 mDeBERTa를 결합한 이종 앙상블 모델과 멀티태스크 학습, 클래스 가중치 등의 기법을 적용하여 극심한 라벨 불균형 문제를 해결하고 높은 성능을 달성했습니다.
본 논문은 콘텐츠 모더레이션 및 평가에 사용되는 루브릭(rubric) 수정이 인간 평가자와 LLM 기반 자동 평가자 간의 점수 일치도에 미치는 영향을 통계적으로 분석했습니다. 특히, '전체적(holistic)' 판단을 요구하는 복잡한 기준과 '분석적(analytic)'으로 분해된 기준 중 어떤 방식이 더 나은지 탐구합니다. 연구 결과, 루브릭의 위치 편향을 줄이는 수정이 인간-자동 평가자 간 일치도를 높였으나, 루브릭 복잡성이 높아지고 보수적인 집계 방법을 사용할 경우 일치도가 감소하는 경향을 보여주었습니다.
기존 의미 분할 모델들은 주로 고자본 텍스트 자료에 기반하여 개발되어, 비공식적 문법이나 코드스위칭이 특징인 저자본 구어체 변이에 적용하는 데 한계가 있습니다. 본 논문은 일상 통화, 팟캐스트 등 다양한 장르의 아랍어 대화형 데이터를 포함한 새로운 다중 장르 벤치마크를 제시합니다. 이를 통해 MSA(Modern Standard Arabic) 뉴스에서 잘 작동하던 모델이 방언 음성에서는 성능 저하를 보임을 입증하고, 지역적 의미 일관성과 담론 불연속성에 강건한 새로운 분할 모델을 제안하여 그 우수성을 입증했습니다.