Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
웃음은 인간 소통의 핵심 요소이지만, 오디오에서 이를 정확하게 탐지하고 세분화하는 것은 어려운 과제입니다. 기존 기계 학습 방법들은 수동 주석에 의존하며 영어 중심의 데이터셋이 많다는 한계를 가집니다. 본 논문에서는 웃음 세분화 문제를 에너지 기반 시퀀스의 이상 탐지로 재정의한 무감독 다국어 방법을 제안합니다. 이 방법은 BYOL-A 인코더로 학습된 오디오 표현에 Isolation Forest를 적용하여, 비영어권 환경에서도 우수한 성능을 입증했습니다.
본 연구는 감정 기반 대화 상황에서 대규모 언어 모델(LLMs)이 생성하는 응답의 감정 일관성을 분석했습니다. LLM은 잘못된 가정(false presuppositions)을 포함하는 쿼리에 대해 평균 이하의 성능을 보였으며, 특히 중간 정도의 감정 콘텐츠에서 취약성이 두드러졌습니다. 이 결과는 LLMs가 고위험이거나 감정적으로 민감한 컨텍스트에 배포되기 전에 중요한 고려사항이 필요함을 시사합니다.
본 논문은 전통적인 '한계 모델(limit model)' 기반의 식별(identification)과 생성(generation) 개념을 확장하여, 학습자가 데이터의 대조적 제시(contrastive presentation)를 관찰하는 상황에서의 식별 및 생성을 연구합니다. 기존 연구들이 양성 예시만 사용하거나 완전 라벨링된 데이터를 가정했던 것과 달리, 본 논문은 목표 이진 가설 $h$에 대해 $h(x) e h(y)$를 만족하는 무서제 쌍 $\{x,y\}$의 흐름을 관찰하지만, 어떤 요소가 양성인지 여부는 숨겨져 있는 상황을 다룹니다. 연구 결과로 대조적 식별 가능 클래스의 정확한 특성화, '대조적 폐쇄 차원' 같은 조합론적 개념 제시, 그리고 엄밀한 샘플 복잡도를 갖는 균일 대조적 생성의 특성화를 제공하며, 나아가 교란 환경에서의 알고리즘적 한계까지 분석합니다.
본 논문은 대형 언어 모델(LLM) 추론 개선에 사용되는 강화학습(RL)의 역할을 재고합니다. 연구 결과, RL이 새로운 능력을 가르치기보다는 기본 모델이 이미 가진 해법에 대한 확률 질량을 특정 지점에서 '희소하게' 보정하는 역할임을 밝혀냈습니다. 이로 인해 LLM 추론 개선은 능력 획득(Capability Acquisition)의 문제가 아니라, 불확실성이 높은 결정 지점에서의 정책 선택 최적화 문제임이 강조됩니다.
UniPrefill은 대형 언어 모델(LLMs)의 긴 컨텍스트 처리 추론 효율성을 개선하기 위해 제안된 전역적인 Prefill 가속 프레임워크입니다. 기존 연구들이 희소 어텐션에만 집중되어 있어 다양한 아키텍처나 연속적 배치 환경에서 성능 저하를 겪고 통합이 어려웠던 문제를 해결합니다. UniPrefill은 모든 모델 아키텍처에 적용 가능하며, vLLM과 같은 현대 추론 엔진의 스케줄링 전략을 확장하여 Prefill-Decode 동시 처리 및 텐서 병렬 처리를 지원함으로써 Time-To-First-Token (TTFT)에서 최대 2.1배의 속도 향상을 달성합니다.
본 논문은 인간과 AI가 생성한 텍스트를 구별하는 기존의 확률 기반 감지 모델들이 직면하는 근본적인 문제점들을 진단하고, 이를 해결하기 위한 새로운 접근 방식을 제안합니다. 특히, 토큰 수준에서 얻은 로컬 신호 점수를 단순히 평균화할 경우 시몬스 역설(Simpson's paradox)과 같은 통계적 오류가 발생하여 감지 성능이 저하되는 문제를 지적했습니다. 이에 대한 해결책으로, 베이지안 결정 이론을 기반으로 학습된 '로컬 칼리브레이션' 단계를 도입하여 원시 점수를 집계하기 전에 조건부 확률 분포를 예측하고 보정함으로써, 모든 기본 검출기 및 데이터셋에서 감지 성능을 일관되게 향상시키는 방법을 제시했습니다.
본 논문은 현대 LLM의 설계 선택 중 하나인 '토큰 인덱스 폐기' 문제에 주목하며, 이것이 희귀 토큰 과소 학습과 컨텍스트 붕괴라는 두 가지 구조적 실패를 초래한다고 지적합니다. 이를 해결하기 위해 TIDE(Token Identity Embedding)라는 새로운 아키텍처를 제안합니다. TIDE는 표준 트랜스포머에 '임베딩 메모리'를 추가하여, 토큰 인덱스를 컨텍스트와 독립적인 의미 벡터로 변환하고 이 정보를 모든 레이어에 주입함으로써 모델의 표현력을 강화합니다.
본 기술 기사는 대규모 언어 모델(LLMs)을 활용한 에이전트 팀 조정의 비효율성 문제를 해결하기 위한 새로운 프레임워크인 LATTE를 소개합니다. 기존 접근법들이 고정된 구조화 방식이나 비구조화된 방식을 취하며 발생하는 한계를 극복하고자, LATTE는 분산 시스템에서 영감을 받아 공유되고 진화하는 '조정 그래프(Coordination Graph)'를 구축하고 유지합니다. 이 그래프는 작업 의존성, 에이전트 할당 및 진행 상태를 인코딩하여, 에이전트들이 부분 관측 가능성과 통신 제약 하에서도 작업을 동적으로 조정하고 새로운 작업을 발견할 수 있게 합니다.
본 논문은 LLM(대형 언어 모델)을 활용한 모델 캐스케이드(Model cascades)의 비용-품질 트레이드오프를 결정론적으로 분석하는 새로운 프레임워크를 제시합니다. 기존 연구가 경험적 하이퍼파라미터에 의존했던 것과 달리, 본 연구는 제약 최적화와 쌍대성(duality)을 기반으로 캐스케이드의 비용-품질 프론티어의 기하학적 특성을 수학적으로 규명합니다. 이를 통해 예산 및 품질 제약을 연결하는 역그림자 가격(reverse shadow prices)을 제공하며, 모델 풀 전체에 걸쳐 최적화된 서열 캐스케이드를 위한 이론적 기반과 실용적인 통찰력을 제공합니다.
본 논문은 LLM의 행동 제어 기법인 Activation Steering이 종종 추론 및 검색 성능 저하를 초래하는 문제를 다룹니다. 연구진은 이 문제의 원인을 주의 재분배(attention rerouting)로 진단하고, 이를 해결하기 위해 Key-Orthogonal Projections (SKOP)이라는 새로운 방법을 제안합니다. SKOP는 중요한 'focus tokens'의 어텐션 패턴을 보존하면서 덜 중요한 'tail tokens' 간의 재분배만 허용하여, 성능 저하를 크게 줄이면서도 효과적인 행동 제어를 가능하게 합니다.
GATHER(Graph-Aware Traversal with Hyper-Entity Retrieval)는 단일 세포 유형 주석을 위한 제로샷 학습 환경에서 발생하는 하이퍼 엔티티 쿼리 문제를 해결하기 위해 설계된 수렴 중심 검색기입니다. 기존의 지식 그래프 기반 RAG 접근법은 개별 유전자(로컬 엔티티)에 의존하여 증거를 검색하지만, 실제 세포 유형 결정은 여러 유전자의 집단적 공존(하이퍼 엔티티)에서 발생합니다. GATHER는 전역 다중 소스 그래프 탐색을 통해 여러 입력 유전자에서 동시에 도달 가능한 '수렴 노드'를 식별하며, 이를 고정보량의 하이퍼 엔티티 증거로 활용하여 기존 KG-RAG 베이스라인 대비 높은 정확도와 효율성을 입증했습니다.
SEQUOR는 실제 대화에서 추출된 제약 조건으로 구성된 자동 멀티-턴 벤치마크입니다. 이 벤치마크는 모델이 장기간의 복잡한 대화 흐름 속에서도 사용자의 지시를 얼마나 일관성 있게 따르는지 평가합니다. 연구 결과에 따르면, 대화 시간이 길어질수록, 그리고 여러 제약 조건을 동시에 따라야 할 때 지시 준수 정확도가 현저하게 감소하는 경향이 관찰되었습니다.
WavCube는 음성 이해(Understanding)와 생성(Generation)에 필요한 서로 다른 표현 간의 호환성 문제를 해결하기 위해 설계된 통합 음성 모델입니다. 이 모델은 자기 감시 학습(SSL)에서 파생된 컴팩트 연속 잠재 변수를 사용하여, 의미 정보와 세밀한 음향 디테일을 모두 포착합니다. WavCube는 두 단계 훈련 스키마를 통해 원시 SSL 특징의 결함을 보완하고, 높은 압축률에서도 기존 표현과 동등하거나 우수한 재구성 품질 및 TTS 성능을 달성하여 통합된 음성 시스템 구현에 기여합니다.
MiA-Signature는 인지과학의 '글로벌 이그니션' 개념에서 영감을 받아, 전체 활성화 상태를 압축적으로 표현하는 새로운 메커니즘입니다. 이는 쿼리에 의해 유도된 전역 활성화 패턴을 간결하게 요약한 것이며, LLM 시스템 내에서 하위모듈 기반의 고수준 개념 선택과 경량 반복 업데이트를 통해 구현됩니다. MiA-Signature는 계산적으로 처리 가능한 조건부 신호로 작용하여 RAG 및 에이전트 시스템의 장문맥 이해 성능을 향상시키는 데 활용될 수 있습니다.
본 논문은 규칙 기반 필터링과 LLM 분류를 결합한 확장 가능한 자동 신조어 탐지 파이프라인을 제시합니다. 이 파이프라인은 문법적 및 비문법적 형태론에 기반하여 신조어의 범위를 정의하고, 2005년부터 2024년까지의 대규모 Reddit 코퍼스(5억 개 이상)를 활용했습니다. 그 결과, 1억 2천만 개의 토큰에서 1,021개의 유망한 신조어 후보군을 추출했으며, 이 중 상당수가 실제 언어적 혁신임이 확인되었습니다.
본 논문은 트랜스포머의 핵심 토큰 혼합 메커니즘인 어텐션이 Nadaraya-Watson 회귀로 해석될 수 있음을 밝히고, 이를 기반으로 새로운 아키텍처 Cubit을 제안합니다. Cubit은 Kernel Ridge Regression (KRR) 의 폐쇄형 해를 활용하여 기존의 어텐션 계산 방식을 수정하고, 커널 유사성 및 역행렬을 통한 정규화를 결합했습니다. 실험 결과에 따르면, Cubit은 특히 시퀀스 길이가 길어질수록 트랜스포머 대비 더 강력한 장거리 시퀀스 모델링 능력을 보여줍니다.
본 논문은 언어 모델(LLM) 내부에서 의미 정보가 어떻게 안정적으로 인코딩되는지 탐구하며, 이러한 '불변성'의 구조와 기원을 밝히는 것을 목표로 합니다. 연구진은 잠재 공간에 로컬 기하학적 프레임워크를 제안하여, 의미적으로 동등한 입력들이 특정 불변 부분공간을 형성한다고 가정합니다. 이를 통해 모델이 의미 변화(paraphrastic change) 중에도 핵심적인 의미 동일성을 보존하는 메커니즘을 기하학적으로 특성화하고, 이 불변 표현을 0-shot 모델 귀속에 적용하여 그 효과를 입증했습니다.
LLM 에이전트는 장기적인 개인화된 기억을 유지하는 것이 기대되지만, 기존 벤치마크는 새로운 증거로 인해 저장된 신념이 무효화되는 능력을 측정하지 못했습니다. 본 논문은 'Implicit Conflict(명시적 충돌)'라는 중요한 실패 모드를 식별하고, 이를 평가하기 위해 100개 이상의 주제와 최대 150K 토큰의 맥락을 포함하는 대규모 STALE 벤치마크를 소개합니다. 이 연구는 에이전트가 구식 상태를 감지하고 메모리를 능동적으로 업데이트하는 것이 어렵다는 것을 보여주었으며, 구조화된 상태 통합 및 전파 감지 검색을 통해 이를 개선할 수 있는 CUPMem 프로토타입도 제시했습니다.
PairAlign은 오디오 토크나이제이션을 위한 새로운 자기 정렬(self-alignment) 프레임워크입니다. 기존 방식들이 로컬 할당에 의존하여 시퀀스 일관성이나 길이 제어에 취약했던 문제를 해결하기 위해, PairAlign은 토크나이제이션을 조건부 시퀀스 생성 문제로 접근합니다. 이 프레임워크는 자기회귀 디코더를 사용하여 토큰 정체성, 순서, 길이 등을 학습하며, 두 내용 보존 뷰 간의 상호 일관성을 강하게 유지하여 컴팩트하고 비퇴화적인 오디오 시퀀스를 생성할 수 있습니다.
언어모델(LM)의 놀라움(surprisal)은 문맥 예측 가능성의 좋은 대리 지표로 사용되어 왔으며 비유적 신비성 평가와 관련이 있다고 알려져 왔다. 그러나 본 연구는 surprisal이 단어 빈도수와 밀접하게 연관되어 있음을 밝혀내고, 두 가지 다른 단어 빈도 측정법을 사용하여 이 상호작용을 탐구했다. 분석 결과, 모든 설정에서 단어 빈도가 surprisal보다 비유적 신비성을 더 잘 예측했으며, LM의 학습 단계에 따른 놀라움-신비성 연관성은 시간이 지남에 따라 감소하는 경향을 보였다.