Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 LLM이 긴 컨텍스트에 걸쳐 분산된 정보를 효과적으로 활용하는 데 어려움을 겪는 문제(어텐션 희석)를 해결하기 위해 FocuSFT라는 새로운 이중 레벨 최적화 프레임워크를 제안합니다. FocuSFT는 내부 루프에서 관련 콘텐츠에 주의를 집중시키는 매개변수 메모리를 형성하고, 외부 루프에서 이를 조건으로 SFT를 수행하여 모델의 장문 컨텍스트 능력을 향상시킵니다. 이 방법은 다양한 벤치마크에서 높은 정확도 개선을 보여주었습니다.
Merlin은 대규모 데이터셋에서 발생하는 고질적인 중복성 문제를 해결하기 위해 설계된 로컬 우선의 컨텍스트 최적화 엔진입니다. 이 시스템은 SIMD 친화적인 해시 세트와 xxHash3-64를 결합하여 텍스트 구절과 데이터 청크에 대해 빠르고 바이트 단위로 정확한 중복 제거를 수행합니다. 특히 RAG(검색 증강 생성)와 같은 LLM 생태계에서 입력 데이터를 크게 줄이면서도 정보의 충실도를 유지할 수 있어, 대규모 언어 모델 추론 효율성을 획기적으로 개선하는 데 기여합니다.
본 논문은 대규모 언어 모델(LLM)의 출력에서 욕설이나 개인 식별 정보(PII)와 같은 원치 않는 콘텐츠를 효과적으로 제어하는 새로운 디코딩 전략인 NCO를 제안합니다. 기존 방식들이 가진 높은 계산 비용과 복잡한 다중 제약 조건 처리의 어려움을 해결하기 위해, NCO는 여러 하드 및 정규 표현식 제약을 온라인으로 효율적으로 매칭하고 추적하여 상태 폭발 없이 오버헤드를 줄입니다. NCO는 빔 서치나 소프트 마스킹 같은 표준 LLM 추론 기법과 완벽하게 호환되며, PII 및 욕설 필터링 등 실제 응용 분야에서 그 효과를 입증했습니다.
본 연구는 대규모 언어 모델(LLMs)의 사전 훈련 데이터에 내재된 노이즈가 모델 성능을 저하시키는 문제를 다루며, 이를 해결하기 위해 합성 데이터를 기반으로 하는 경량의 전(Pre)-사전 훈련(PPT) 단계를 제안합니다. 다양한 손상 설정에서 PPT를 거친 모델은 후속 사전 훈련 단계에서 노이즈 데이터에 대한 강건성을 일관되게 향상시키는 것으로 나타났습니다. 특히, 이 방법은 적은 양의 합성 데이터를 사용하여 자연어 텍스트의 토큰 사용량을 크게 줄이면서도 높은 성능을 유지할 수 있음을 입증했습니다.
본 연구는 LLM이 응답을 생성하는 동시에 사용자 음성을 듣고 반응해야 하는 전이중(Full-duplex) 음성 대화 시스템의 아키텍처 문제를 다룹니다. 기존 LLMs가 실시간으로 들어오는 스트리밍 입력을 처리하기 어렵다는 한계를 극복하기 위해, 연구진은 두 가지 주요 라우팅 전략인 채널 융합과 교차 어텐션 라우팅을 비교했습니다. 이 연구는 전이중 대화에서 사용자 입력의 효과적인 통합 방식을 제시하며, 의미론적 통합과 문맥 강건성 사이의 설계 트레이드오프에 대한 실질적인 지침을 제공합니다.
본 논문은 순환형 LLM 아키텍처가 가진 메모리 효율성 문제를 해결하기 위해 Memory-Efficient Looped Transformer (MELT)를 제안합니다. 기존 루프 기반 모델들은 추론 깊이가 깊어질수록 KV 캐시 유지에 필요한 메모리가 선형적으로 증가하여 확장성에 한계가 있었습니다. MELT는 레이어 및 루프마다 별도의 KV 캐시를 사용하는 대신, 전체 추론 과정에서 공유되는 단일 KV 캐시를 사용하며, 이를 학습 가능한 게이팅 메커니즘으로 업데이트함으로써 상수 메모리 복잡도로 반복 추론을 가능하게 합니다.
본 논문은 온라인 그룹 채팅과 같은 다자간 환경에서 발생하는 암묵적 사회적 규범 및 그에 따른 제재 메커니즘에 초점을 맞춘 'SCENE'이라는 소셜 상호작용 벤치마크를 소개합니다. SCENE은 숨겨진 규범을 따르는 스크립트화된 페르소나들로 구성된 현실적인 비역할극 시나리오를 생성하여, 주체 에이전트가 해당 규범을 위반하는 상황을 인위적으로 조성하고 평가할 수 있게 합니다.
본 기사는 휴대폰 사용 에이전트의 '안전성' 평가 방식에 대한 근본적인 재고찰을 제기합니다. 기존 평가는 에이전트가 위험을 인식하고 안전한 행동을 선택했는지, 아니면 단순히 능력이 부족하여 유해한 결과를 초래했는지를 구분하지 못하는 한계가 있습니다. 이를 해결하기 위해 130개 이상의 앱에서 수집된 실제 상호작용 데이터를 기반으로 하는 'PhoneSafety'라는 새로운 벤치마크를 제안하며, 위험 순간의 다음 결정을 안전/부적절 행동 여부로 분리하여 평가하는 방법을 제시합니다.
OrScale은 기존의 직교화 최적화 기법인 Muon을 확장한 새로운 스케일링 방법입니다. 이 방법은 각 레이어별로 업데이트 크기를 신뢰 비율에 기반하여 정밀하게 제어함으로써, 일반적인 행렬 레이어와 대규모 언어 모델(LLM) 모두에 적용 가능합니다. OrScale은 이론적으로 강력한 수렴 보장과 레이어 적응 하강 이득을 제공하며, 실험적으로 CIFAR-10 및 다양한 규모의 LLM 사전 학습에서 기존 최적화 기법 대비 성능 향상을 입증했습니다.
거대 언어 모델(LLM)의 파인튜닝 비용 문제를 해결하기 위해 MatryoshkaLoRA를 제안합니다. 기존 LoRA는 고정된 랭크 $r$을 사용해야 하는 한계가 있으며, DyLoRA와 같은 다른 적응형 방법들은 전체 계층에 걸쳐 일관된 기울기 신호 부족으로 인해 성능이 떨어지는 문제가 있었습니다. MatryoshkaLoRA는 이러한 문제를 해결하여 모든 랭크에서 우수한 정확도-성능 트레이드오프를 제공하는 새로운 접근 방식입니다.
본 논문은 AI 어시스턴트 훈련 및 평가에서 핵심적인 문제인 '실제 사용자 행동과 시뮬레이션 사용자 행동 간의 분포 격차'를 측정하는 새로운 방법을 제시합니다. 이 방법은 실제 대화와 시뮬레이션 데이터를 클러스터링하여 사용자 행동 표현을 추출하고, 발산 지표를 계산함으로써 두 데이터셋 간의 차이를 정량적으로 분석합니다. 연구진은 24개의 LLM 기반 사용자 시뮬레이터를 평가한 결과를 통해 대부분의 시뮬레이터가 유사하게 작동하지만, 특정 시뮬레이터들을 조합하여 사용하면 실제 사용자 행동 분포에 더 근접하게 만들 수 있음을 입증했습니다.
본 논문은 지지적인 대화에서 심리 방어 기제의 수준을 감지하는 어려운 과제에 접근합니다. 기존의 단일 모델로는 경계가 모호한 방어 범주를 정확히 분류하기 어렵기 때문에, 연구진은 세 가지 직교 축(클래스 세분성, 훈련 방법, 기본 모델)에 걸친 9명의 투표자 앙상블을 구축했습니다. 이 앙상블 시스템은 BioNLP 2026의 PsyDefDetect 공유 과제에서 최고 성적을 거두며 높은 성능을 입증했습니다.
CktFormalizer는 LLM 기반 하드웨어 생성의 신뢰성 문제를 해결하기 위해 개발된 프레임워크입니다. 이 프레임워크는 Lean 4에 임베딩된 종속 타입 언어(dependently-typed HDL)를 사용하여, 자연어 사양으로부터 생성되는 Verilog 코드가 컴파일 타임에 하드웨어 결함(예: 너비 불일치, 루프 등)을 가지지 않도록 강제합니다. 이를 통해 기존 방식에서 발생하던 합성 단계의 실패율을 획기적으로 줄이고 디자인의 정확성을 높입니다.
대규모 언어 모델(LLMs)의 높은 비용과 소형 언어 모델(SLMs) 학습의 어려움을 해결하기 위해 '체인 기반 증류(CBD)'라는 확장 가능한 패러다임을 제안한다. CBD는 단계적 증류 과정을 통해 희소하고 제한적인 중간 모델 시퀀스(앵커)를 구성하며, 이를 점진적으로 전달하는 증류 체인을 형성하여 가변 크기 언어 모델의 효율적인 초기화를 가능하게 한다.
본 논문은 LLM이 안전 정렬 과정에서 발생하는 '경직된 거부' 문제를 해결하기 위해 LANCE(Label-enhanced Natural Conversation Engine)를 제안합니다. LANCE는 변분 추론을 사용하여 여러 거부 카테원에 걸쳐 연속적인 분포를 예측하고, 이를 통해 다중 방향 텍스트 기울기를 생성합니다. 이 메커니즘은 LLM이 안전성을 유지하면서도 자연스럽고 유연한 응답을 생성하도록 도와, 기존의 경직된 거부 문제를 크게 완화시킵니다.
본 논문은 대규모 언어 모델(LLM)의 추론 영역 훈련에 사용되는 On-Policy Distillation (OPD)의 불안정성 문제를 해결하기 위해 vOPD(Control Variate Baseline을 이용한 On-Policy Distillation)를 제안합니다. 이는 OPD를 정책 경사(policy-gradient RL)로 간주하고, 전통적인 강화 학습(RL) 기법인 Control Variate Baseline을 도입하여 훈련의 안정성을 높입니다. 특히, OPD의 값 함수가 학생 및 교사 모델 간의 토큰당 음의 역 KL 발산이라는 형태로 표현되어 추가 계산 없이도 쉽게 얻을 수 있다는 점을 강조합니다.
본 논문은 기존 바이트 레벨 언어 모델(LM)이 느린 자동회귀 생성 속도 때문에 활용도가 제한적이라는 문제를 해결하기 위한 Byte Latent Transformer (BLT)의 개선 방안을 제시합니다. 연구진은 보조 블록 단위 확산 목적 함수를 추가하여 병렬 디코딩이 가능한 BLT Diffusion (BLT-D) 모델을 제안했습니다. 또한, 사변적 디코딩(speculative decoding)에서 영감을 받은 두 가지 확장 방식인 BLT Self-speculation (BLT-S)과 BLT Diffusion+Verification (BLT-DV)를 통해 속도와 품질을 최적화하여, 기존 BLT 대비 메모리 대역폭 비용을 50% 이상 절감할 수 있음을 입증했습니다.
본 논문은 자유 텍스트 형태의 심장 자기공명영상(CMR) 보고서를 구조화된 데이터로 변환하고, 각 필드에 신뢰도를 할당하는 경량 프레임워크인 CMR-EXTR을 제안합니다. 이 시스템은 교사-학생 증류 기법을 사용하여 수동 주석 작업의 부담을 줄이면서도 완전한 오프라인 추론을 가능하게 합니다. 특히, 분포 개연성, 샘플링 안정성, 교차 필드 일관성이라는 세 가지 원칙을 통합하여 불확실성을 인식함으로써, 인간 검토가 필요한 부분을 효과적으로 식별하고 높은 정확도를 달성했습니다.
EMO(Expert Modularity Optimization)는 기존 MoE(Mixture-of-Experts) 모델이 가진 도메인 특화 및 메모리 효율성 문제를 해결하기 위해 제안된 모듈러 아키텍처입니다. EMO의 핵심은 유사한 도메인의 토큰들이 유사한 전문가 그룹에 의존하도록 유도하여, 문서 경계만으로도 자연스럽게 전문화되고 조립 가능한 전문가 풀을 형성하는 것입니다. 이를 통해 전체 모델 크기 대비 적은 활성 전문가만을 사용하여 높은 성능과 뛰어난 메모리 효율성을 달성할 수 있습니다.
본 논문은 Mixture-of-Experts (MoE) 모델이 건강한 전문가 생태계를 유지할지 예측하는 무차원 제어 매개변수 $E = T imes H / (O + B)$를 제시합니다. 이 매개변수는 라우팅 온도($T$), 엔트로피 가중치($H$), 오라클 가중치($O$), 밸런스 가중치($B$) 네 가지 하이퍼파라미터를 통합하여 MoE 생태계의 건강 상태를 단일 지표로 나타냅니다. 실험 결과, $E ext{가 } 0.5$ 이상만으로도 '죽은 전문가' 문제를 해결하고 별도의 손실 함수 없이 안정적인 학습을 보장함을 입증했습니다.