Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 LLM의 선호도 최적화 시스템에서 발생하는 '의미론적 보상 붕괴(SRC)'라는 구조적 문제를 제기합니다. SRC는 의미적으로 다른 평가적 불만족들(예: 사실적 부정확성, 불확실성 공개)이 단일한 일반화된 최적화 신호로 압축되어 시스템이 인식론적 무결성을 희생하는 현상을 말합니다. 저자들은 적응형 AI가 불확실성 공개를 억제하고 가시적인 실패만 막으려는 경향을 지적하며, 이를 해결하기 위해 '도메인 인식 보상 구조화(CRS)'라는 새로운 연구 방향을 제안합니다.
본 논문은 언어 모델이 온정책(on-policy) 궤적을 따라 진행하며 특권적인 교사 분포를 증류하는 '온정책 자체 증류(OPSD)' 기법을 연구합니다. 기존 OPSD는 교사와 학생 응답 간의 불일치 문제, 특히 반성 유발 편향이나 응답 템플릿으로 인한 오류가 발생할 수 있음을 지적했습니다. 이를 해결하기 위해, 본 연구는 검증 가능한 결과 보상을 활용하여 성공 및 실패 궤적을 대조하고 교사 로짓을 보정하는 '결과 기반 로짓 조향(Outcome-based Logit Steering)' 프레임워크인 OGLS-SD를 제안합니다. OGLS-SD는 결과 수준의 정확성과 토큰 수준의 지도를 결합하여 자체 증류 과정을 안정화하고 추론 성능을 향상시킵니다.
본 연구는 고속 이동 환경에서 발생하는 사용자 장비(UE)의 단절 시간 및 측정 오버헤드 문제를 해결하기 위해, 실제 상용 네트워크에서 수집한 현실적인 데이터셋을 제시합니다. 이 데이터셋은 보행자부터 열차까지 다양한 이동 모드와 속도를 포함하며, 특히 핸드오버(HO) 시나리오에 초점을 맞추어 HO 단절 시간 감소 및 지속적인 처리량 유지를 목표로 합니다. 또한 기존 연구에서 부족했던 RACH 트리거, MAC CE 등 신호 발생 이벤트에서의 타이밍 어드밴스(TA) 측정값을 포함하여 AI/ML 모델의 정확한 훈련과 이해를 지원합니다.
AI 생성 콘텐츠가 폭발적으로 증가함에 따라 자동 팩트체킹(AFC)의 중요성이 커지고 있지만, 기존 시스템에는 한계가 존재합니다. 본 논문에서 제안하는 CAAFC(Chronological Actionable Automated Fact-Checker)는 주장, 대화, 다이얼로그를 기반으로 작동하여 사실적 오류와 환각을 탐지할 뿐만 아니라 1차 출처에 근거한 실행 가능한 교정 근거까지 제공합니다. 또한 최신 및 문맥적 정보를 통합하여 사실 검증의 신뢰성과 정확성을 높이는 것이 특징입니다.
본 논문은 기존의 표현 오토인코더가 마지막 인코더 레이어에서만 특징을 추출하여 발생하는 시각 정보 손실 문제를 해결하기 위해 다중 레이어 특징 융합 모듈 DRoRAE를 제안합니다. DRoRAE는 에너지 제약 라우팅과 증분 보정을 통해 모든 인코더 레이어를 적응적으로 집계하며, 이를 통해 풍부해진 잠재 표현을 생성합니다. 실험 결과, ImageNet-256에서 rFID 및 생성 FID가 크게 개선되었으며, 이는 텍스트-이미지 합성 등 다양한 분야에 전이 가능함을 입증했습니다.
PathISE는 지식 그래프 질문 답변(KGQA) 시스템의 성능 향상을 목표로 하는 새로운 프레임워크입니다. 기존 KGQA 방법들이 LLM을 활용하여 KGs에 접지시키지만, 효과적인 증거 검색을 위해서는 고품질의 중간 감독 신호가 필수적이며 이는 얻기 어렵습니다. PathISE는 답변 수준의 레이블만을 사용하여 질문과 관련된 '정보성 경로(informative paths)'를 자동으로 학습하고 추출함으로써 이 문제를 해결합니다.
본 논문은 자율 에이전트의 안전성을 확보하기 위한 '쉴딩(Shielding)' 기법을 다루며, 특히 확률적 안전성(probabilistic safety)을 보장하는 확장된 프레임워크를 제시합니다. 기존의 쉴딩이 절대적인 안전성을 목표로 했다면, 이 연구는 어느 정도 수용 가능한 확률로 위험이 발생하는 경우에 초점을 맞춥니다. 이를 위해 강력한 보장을 유지하면서도 자연스러운 쉴드를 제공하고, 오프라인 및 온라인 환경에서 작동하는 새로운 쉴드 구성 방식을 제안합니다.
본 논문은 대규모 언어 모델(LLMs)의 순차적 의사결정 능력을 탐구하며, 특히 마르코프 결정 과정(MDPs), 부분 관측 가능 MDP(POMDPs) 등 복잡한 환경에서의 활용에 초점을 맞춥니다. 연구진은 오라클 레이블링된 궤적 데이터로부터 소수의 예시만으로 의사결정을 수행하도록 LLMs를 지도 미세 조정(SFT)합니다. 이 프레임워크는 SFT를 통해 정책의 유연한 모방을 가능하게 하며, 이론적으로는 어텐션 레이어를 활용하여 최적 Q-함수를 추정하는 방식으로 해석됩니다.
본 기술 기사는 연속형, 이산형, 혼합 변수 도메인의 데이터 유형 전반에 걸쳐 공통된 통계 구조를 활용할 수 있는 통합 에너지 기반 밀도 추정 프레임워크인 Constant-Target Energy Matching (CTEM)을 제안합니다. 기존 방법론들이 연속 점수와 이산 확장을 별도의 목표 함수로 다루거나, 낮은 확률 상태 근처에서 불안정성을 보이는 문제를 해결하는 것이 목적입니다.
LLM 에이전트가 발전함에 따라 토큰 소비가 급증하면서 계산적, 협업적, 보안 병목 현상이 심각한 문제로 대두되었습니다. 이 글은 이러한 문제를 해결하기 위해 '토큰 경제학(Token Economics)'이라는 통합적인 관점을 제시합니다. 컴퓨팅 과학과 경제학을 결합하여 토큰을 생산 요소, 교환 매개체, 계정 단위로 개념화함으로써, 출력 품질과 경제적 비용 사이의 근본적인 상충 관계를 다루는 포괄적인 프레임워크를 제공하는 것이 목표입니다.
본 기사는 언어 모델(LM)의 동작을 해석하기 위한 '회로 발견' 방법론의 한계를 지적합니다. 기존 방식은 작업이 단일 회로로 구현된다는 강력한 가정을 전제하고, 데이터셋이 인간의 의미를 완벽히 대표한다고 가정합니다. 연구진이 제안하는 DCD(Data-driven Circuit Discovery)는 이러한 가설 기반 접근 방식을 탈피하여, 데이터가 LM 내부 메커니즘적 구조 자체를 드러내도록 함으로써 모델 해석의 정확성과 포괄성을 높입니다.
본 기사는 다중 에이전트 AI 시스템의 행동 규범(behavioral constitutions) 설계에 있어, 규칙이 내부적으로 숙고되어야 하는지 아니면 외부 환경 최적화를 통해 진화해야 하는지를 비교 분석합니다. 연구진은 세 가지 사회 환경(협력 그리드 월드, 반복 공공재 게임, 양자 거래 시장)에서 통제된 시뮬레이션을 수행했습니다. 그 결과, 집단 행동 설정에서는 내부 숙고 방식보다 외부 진화 방식이 더 우수한 성능을 보이는 것으로 나타났습니다.
MCP-Cosmos는 대규모 언어 모델(LLMs)과 외부 도구 간의 인터페이스인 MCP 생태계에 World Model (WM)을 통합하여 에이전트의 예측적 작업 자동화를 가능하게 하는 프레임워크입니다. 이 프레임워크는 'Bring Your Own World Model' (BYOWM) 전략을 통해, 에이전트가 실제 실행 전에 잠재 공간에서 상태 전이를 시뮬레이션하고 계획을 개선할 수 있도록 합니다. 실험 결과, MCP-Cosmos는 도구 성공률 및 매개변수 정확도 등 핵심 성과 지표(KPI)를 크게 향상시키며, 새로운 평가 메트릭을 제공하여 에이전트 시스템의 신뢰성을 높였습니다.
본 연구는 연속 행동 강화학습에서 사용되는 혼합 정책(Mixture policies)의 활용도를 높이는 것을 목표로 합니다. 기존에는 복잡성 대비 실제 이점이 불분명했던 혼합 정책에 대해, 저분산 리매개변수화 트릭이 부족하다는 근본적인 문제를 지적합니다. 이를 해결하기 위해 주변화된 리매개변수화(MRP) 추정기를 제안하며, 이것이 표준 우도비 접근 방식보다 낮은 분산을 제공함을 증명했습니다. 실험 결과, MRP 혼합 정책은 기존의 가우시안 정책과 동등하거나 더 나은 성능을 보여주며, 실용적인 강화학습 도구로 자리매김할 수 있음을 입증합니다.
본 논문은 LLM 에이전트가 사용하는 중간 스킬 계층이 종종 필요한 것보다 과도한 권한을 가지는 '과도한 권한(Over-Privilege)' 문제를 지적하며, 이를 평가하기 위한 벤치마크인 FORTIS를 제안합니다. FORTIS는 모델이 최소한의 충분한 스킬을 선택하는지, 그리고 그 스킬이 허용된 범위를 넘어서 행동하지 않는지를 두 단계로 검증합니다. 연구 결과, 최첨단 모델들조차도 작업에 필요한 것보다 더 높은 권한의 스킬과 도구를 사용하는 경향이 일반적이며, 이는 에이전트 시스템의 주요 취약점임을 보여줍니다.
WorldSpeech는 전 세계의 다국어 음성 코퍼스를 제공하는 데이터셋으로, 자동 음성 인식(ASR) 모델 학습에 필요한 정렬된 오디오-스크립트 데이터를 수집했습니다. 의회 회의록, 국제 방송 등 다양한 공공 출처에서 76개 언어에 걸쳐 총 65k시간의 방대한 양의 데이터를 구성했습니다. 이 코퍼스를 활용하여 기존 ASR 모델을 파인튜닝했을 때, 유형론적으로 다양한 11개 언어에서 평균 상대 단어 오류율(WER) 감소율 63.5%라는 높은 성능 향상을 입증했습니다.
본 논문은 혼합 정수 계획법(MIP) 연구의 복잡하고 시간이 많이 소요되는 과정을 혁신적으로 단축하는 에이전트 기반 프레임워크를 제안합니다. 이 프레임워크는 LLM 에이전트를 솔버 인식 하니스에 통합하여, 전역 제약 조건으로부터 MIP 해결을 가속화하는 SCIP 플러그인(제약 조건 핸들러)을 자동으로 생성하고 검증합니다. 이를 통해 연구자는 복잡한 알고리즘적 개선 사항을 체계적으로 탐색하고, 솔버 개발 프로세스를 자동화할 수 있게 됩니다.
본 기사는 대규모 언어 모델(LLM)에서 '의미 역할 이해'와 같은 복잡한 언어 구조가 어떻게 나타나는지(emerges)를 탐구합니다. 이러한 현상을 이해하는 것은 LLM이 데이터로부터 어떤 종류의 지식을 학습하고, 실제 시스템 구현에 얼마나 많은 인간의 감독이나 레이블링 작업이 필요한지를 해석하는 데 매우 중요합니다.
본 기사는 대규모 언어 모델(LLMs)의 추론 능력 향상에 초점을 맞추고 있으며, 형식 논리 솔버가 갖지 못한 상식적인 세계 지식을 통합하는 방법을 다룹니다. 기존 연구들이 보편적 합의를 가정했던 것과 달리, 본 접근 방식은 개인마다 다를 수 있는 확률적 상식(Probabilistic Commonsense)을 활용하여 추론 과정을 개선합니다.
본 논문은 멀티모달 대규모 언어 모델(MLLMs)이 여러 태스크에 걸쳐 능력을 지속적으로 확장해야 하는 시나리오를 위한 '멀티모달 지속적 명령어 튜닝(MCIT)' 프레임워크인 DRAPE를 제안합니다. 기존 방법들이 태스크 수준의 모듈 조합에 의존했던 것과 달리, DRAPE는 개별 쿼리-이미지 쌍(인스턴스)에 최적화된 소프트 프롬프트를 동적으로 합성하여 모델 성능을 향상시킵니다. 또한, 망각 완화를 위해 공유 프로젝터에널 공간 그래디언트 투영 기법과 CLIP 기반의 라우팅 메커니즘을 적용하여 뛰어난 지속 학습 성능을 입증했습니다.