Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
소형 언어 모델에 도구 통합 추론(TIR)을 적용하는 것은 어려운데, 기존의 강화학습 방법들은 보상 신호가 희소하여 한계가 있습니다. 최근 주목받는 온정책 증류(OPD) 기법도 TIR에 적용할 경우, 잘못된 도구 호출이 연쇄적인 오류를 일으켜 학생-교사 발산을 야기하고 교사의 지도 효과를 무력화하는 치명적인 실패 모드를 보입니다.
본 논문은 LLM의 수학적 추론 능력을 평가할 때 단순히 연관성만 보는 것이 아니라, 특정 개념을 '숙련됨' 상태로 강제 개입(Intervention)하여 그 인과적 효과를 측정하는 새로운 프레임워크 CIKA를 제안합니다. 이 방법론은 관찰된 데이터에 포함될 수 있는 교란 변수(confounders), 예를 들어 문제 난이도와 같은 요소를 분리해내어, LLM이 실제로 개념을 '사용할 수 있는지' 여부를 진단하는 개입적 능력 탐지기(ICP)를 공식화합니다. 실험 결과, ICP는 최고 순위 개념의 경우 음성 대조군보다 유의하게 높은 성능을 보였으며, 문제 해결 성공 예측 지표로서도 강력함을 입증했습니다.
OrScale은 기존의 직교화 최적화 기법인 Muon을 확장한 새로운 스케일링 방법입니다. 이 방법은 각 레이어별로 업데이트 크기를 신뢰 비율에 기반하여 정밀하게 제어함으로써, 일반적인 행렬 레이어와 대규모 언어 모델(LLM) 모두에 적용 가능합니다. OrScale은 이론적으로 강력한 수렴 보장과 레이어 적응 하강 이득을 제공하며, 실험적으로 CIFAR-10 및 다양한 규모의 LLM 사전 학습에서 기존 최적화 기법 대비 성능 향상을 입증했습니다.
GazeVLM은 인간의 능동 시각(active vision) 원리를 모방하여, 기존 VLM의 수동적이고 정적인 정보 처리 방식을 개선한 멀티모달 아키텍처입니다. 이 모델은 어텐션 자원 배포에 대한 메타인지적 제어를 추론 루프 자체에 내재화하며, 시선 토큰(<LOOK>)을 자율적으로 생성하도록 함으로써 공간적이고 목표 지향적인 추론 능력을 강화합니다. 그 결과, 기존 최신 VLM 대비 높은 해상도의 멀티모달 추론 성능 향상을 입증했습니다.
거대 언어 모델(LLM)의 파인튜닝 비용 문제를 해결하기 위해 MatryoshkaLoRA를 제안합니다. 기존 LoRA는 고정된 랭크 $r$을 사용해야 하는 한계가 있으며, DyLoRA와 같은 다른 적응형 방법들은 전체 계층에 걸쳐 일관된 기울기 신호 부족으로 인해 성능이 떨어지는 문제가 있었습니다. MatryoshkaLoRA는 이러한 문제를 해결하여 모든 랭크에서 우수한 정확도-성능 트레이드오프를 제공하는 새로운 접근 방식입니다.
본 연구는 대규모 언어 모델(LLM)의 강화학습(RL) 기반 사후 훈련에서 토큰 수준의 학습 신호가 균일하지 않다는 점에 주목하며, 어텐션 엔트로피를 활용하여 이러한 이질성을 분석합니다. 어텐션 엔트로피는 각 응답 토큰이 문맥적 지원을 얼마나 집중적으로 받는지 측정하는 지표로, 이를 통해 RL 최적화 과정에서 구조적인 패턴을 발견할 수 있습니다. 연구 결과는 단순히 평균적인 학습 신호만으로는 추론 과정의 중요한 이질성을 놓칠 수 있음을 시사합니다.
본 논문은 인도네시아 소셜 미디어 텍스트를 대상으로 긍정, 부정, 중립의 세 가지 클래스로 감성을 분석하는 연구를 제시합니다. 제안된 방법론은 TF-IDF 특징과 메타데이터 특징을 결합한 하이브리드 접근 방식을 사용하며, 이를 다항 로지스틱 회귀(Logistic Regression)와 비교하여 MLP 신경망 모델의 성능을 평가했습니다. 실험 결과, 로지스틱 회귀 기반 모델이 높은 정확도와 안정적인 성능을 보여주었으며, 이는 소규모 데이터셋에서 해석 가능한 특징 공학과 클래스 균형 맞추기가 여전히 중요한 역할을 함을 시사합니다.
본 논문은 AI 어시스턴트 훈련 및 평가에서 핵심적인 문제인 '실제 사용자 행동과 시뮬레이션 사용자 행동 간의 분포 격차'를 측정하는 새로운 방법을 제시합니다. 이 방법은 실제 대화와 시뮬레이션 데이터를 클러스터링하여 사용자 행동 표현을 추출하고, 발산 지표를 계산함으로써 두 데이터셋 간의 차이를 정량적으로 분석합니다. 연구진은 24개의 LLM 기반 사용자 시뮬레이터를 평가한 결과를 통해 대부분의 시뮬레이터가 유사하게 작동하지만, 특정 시뮬레이터들을 조합하여 사용하면 실제 사용자 행동 분포에 더 근접하게 만들 수 있음을 입증했습니다.
본 논문은 지지적인 대화에서 심리 방어 기제의 수준을 감지하는 어려운 과제에 접근합니다. 기존의 단일 모델로는 경계가 모호한 방어 범주를 정확히 분류하기 어렵기 때문에, 연구진은 세 가지 직교 축(클래스 세분성, 훈련 방법, 기본 모델)에 걸친 9명의 투표자 앙상블을 구축했습니다. 이 앙상블 시스템은 BioNLP 2026의 PsyDefDetect 공유 과제에서 최고 성적을 거두며 높은 성능을 입증했습니다.
본 기사는 빠르게 변화하는 아티클 코퍼스에서 사용자 의도에 기반한 뉴스 추천 시스템의 어려움을 다루고 있습니다. 특히 명시적 키워드가 부족한 암묵적인 사용자 의도를 처리하기 위해, 6가지 유형의 대화형 의도를 식별하고 그중 다섯 가지가 기존 RAG 파이프라인의 병목 현상을 야기함을 지적합니다. 이를 해결하기 위해 'Generate-then-Match' 패러다임 하에서 다중 작업 학습과 GPT-4 CoT 증류를 활용하여 의도 기반 시맨틱 ID(SID) 생성 방법을 제안합니다.
본 논문은 네덜란드어와 같이 형태론적 성별을 가진 언어를 대상으로 BERT 모델의 성별 편향성을 분석합니다. 연구진은 훈련 과정 전반에 걸쳐 문맥 임베딩을 추적하여, 명시적인 성별 단서가 모델 표현에 어떻게 인코딩되고 진화하는지 조사했습니다. 그 결과, Dutch BERT 모델이 반(反)고정관념적인 문맥에서 명시적인 성별 정보를 충분히 반영하지 못하고 지속적으로 남성 기본값 행동을 보이는 경향이 있음을 발견했습니다.
본 연구는 문법 오류 교정(GEC) 분야에서 최신 LLM의 평가 부족 문제를 다루며, 편집 정확도, 유창성 보존, 의미 유지 등 다차원적 관점에서 GPT-4o를 평가했습니다. 그 결과, 미세 조정된 GPT-4o가 세 가지 차원에서 모두 최고 성능을 보였으며, 기존 참조 기반 지표들이 GEC 시스템의 실제 성능을 과소평가할 수 있음을 입증했습니다.
본 논문은 대규모 언어 모델(LLMs)이 인간의 행동을 얼마나 잘 모방하는지 측정할 수 있는 새로운 데이터셋 Psych-201을 소개한다. 연구 결과, LLM을 유용한 비서로 만들기 위해 수행되는 사후 훈련 과정 자체가 모델의 인간 행동 정렬도를 지속적으로 떨어뜨리는 것으로 나타났다. 또한, 개인별 정보로 모델을 조건화하는 페르소나 유도 기법 역시 개인 수준의 예측 정확도를 개선하지 못한다는 사실이 밝혀졌다.
본 기술 기사는 LLM의 추론 정확도를 높이는 방법 중 하나인 'self-consistency'를 개선한 'Prefix Consistency' 방법을 제안합니다. 이 방법은 여러 개의 Chain-of-Thought(CoT) 추적을 샘플링하고, 각 후보 답변이 재생성 과정을 통해 얼마나 일관되게 나타나는지(prefix consistency)를 신뢰도 지표로 활용하여 가중치를 부여합니다. 실험 결과, Prefix Consistency는 기존의 다수 투표(Majority Voting) 방식보다 높은 정확도를 보였으며, 훨씬 적은 토큰으로 유사한 성능을 달성할 수 있음을 입증했습니다.
DRIP-R은 실제 소매(retail) 도메인의 정책적 모호성을 활용하여 LLM 에이전트의 의사결정 및 추론 능력을 평가하기 위해 설계된 새로운 벤치마크입니다. 기존 벤치마크들이 명확하게 정의된 정책을 가정하는 것과 달리, DRIP-R은 단 하나의 정답이 존재하지 않는 모호한 시나리오를 제공합니다. 이 벤치마크는 반환(return) 시나리오와 현실적인 고객 페르소나, 도구 호출 기능을 포함하며, 다중 심사위원 평가 프레임워크를 통해 정책 준수, 대화 품질 등 복합적인 측면을 평가합니다.
본 기사는 온-정책 증류(OPD)가 두 모델의 예측이 토큰별로 비교 가능하다고 가정하는 한계를 지적하며, 특히 이질적인 토크나이저 환경에서 발생하는 문제점을 다룹니다. 연구진은 공유 토큰 매칭만으로는 교사 신호의 상당 부분을 놓치게 된다는 점을 발견하고, 이를 해결하기 위해 'SimCT(Simple Cross-Tokenizer OPD)'를 제안했습니다. SimCT는 단순히 공유 토큰 외에도 짧은 다중 토큰 연속체에 걸쳐 교사와 학생 모델 간의 비교를 확장하여 손실된 감독 신호를 효과적으로 복구합니다.
본 논문은 확산 언어 모델(Diffusion Language Models)에서 사용되는 Classifier-Free Guidance (CFG) 스케일이 고정된 하이퍼파라미터라는 기존 접근 방식의 한계를 지적합니다. 저자들은 CFG 스케일 선택을 순차적인 의사 결정 문제로 재구성하고, 강화학습(RL)과 PPO 알고리즘을 사용하여 생성 과정 전체에 걸쳐 동적으로 변화하는 최적의 가이던스 궤적을 학습할 것을 제안했습니다. 실험 결과는 이러한 적응형(adaptive) 가이던스가 고정 스케일 전략보다 NLP 생성 작업에서 제어 가능성과 품질 사이의 우수한 균형을 제공함을 입증합니다.
본 논문은 순환 모델에서의 상태 추적 능력이 단순히 이론적인 표현 능력(expressive capacity)에 의해서만 결정되는 것이 아님을 주장한다. 대신, '오류 제어' 역학이 핵심이며, 특히 아핀 순환 네트워크와 같은 모델 클래스는 숨겨진 상태 드리프트를 효과적으로 지배하여 강력한 상태 추적을 수행하지 못하고 유한 범위의 해법에 머무르는 경향이 있다. 연구는 상태 추적이 유지되려면 클래스 내 분산이 초기 클래스 간 분리보다 작아야 하며, 이 붕괴 지점은 다운스트림 정확도가 실패하는 예측 가능한 임계값임을 보여준다.
TextLDM은 연속 잠재 확산(Continuous Latent Diffusion) 기술을 언어 모델링에 적용한 프레임워크입니다. 기존의 시각적 생성(이미지/비디오)에 사용되던 확산 트랜스포머(DiT) 아키텍처를 최소한의 수정만으로 텍스트 생성 영역으로 확장했습니다. 이 방법은 VAE 잠재 공간에서 연속적인 텍스트 표현을 얻기 위해 Representation Alignment (REPA) 기법을 활용하며, OpenWebText2로 사전 학습된 TextLDM은 기존 확산 언어 모델보다 우수한 성능을 보여주었습니다.
CktFormalizer는 LLM 기반 하드웨어 생성의 신뢰성 문제를 해결하기 위해 개발된 프레임워크입니다. 이 프레임워크는 Lean 4에 임베딩된 종속 타입 언어(dependently-typed HDL)를 사용하여, 자연어 사양으로부터 생성되는 Verilog 코드가 컴파일 타임에 하드웨어 결함(예: 너비 불일치, 루프 등)을 가지지 않도록 강제합니다. 이를 통해 기존 방식에서 발생하던 합성 단계의 실패율을 획기적으로 줄이고 디자인의 정확성을 높입니다.