Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
EndPrompt는 대규모 언어 모델(LLMs)의 문맥 창 확장 시 발생하는 높은 계산 비용 문제를 해결하기 위해 제안된 방법론입니다. 이 방식은 전체 길이의 긴 입력 시퀀스를 학습할 필요 없이, 짧은 초기 문맥과 터미널 프롬프트라는 두 개의 세그먼트를 결합하여 목표 문맥 길이 근처에 위치 인덱스를 할당합니다. 이론적 분석을 통해 EndPrompt가 의미론적 연속성을 유지하면서 국소 및 장거리 상대적 거리를 효과적으로 도입할 수 있음을 입증했으며, 실제 벤치마크 테스트에서 기존의 긴 시퀀스 학습 방식들보다 우수한 성능과 효율성을 보여주었습니다.
본 논문은 중환자실(ICU) 패혈증 관리를 위해 임상 월드 모델로 증강된 LLM 에이전트인 SepsisAgent를 제안합니다. SepsisAgent는 후보 치료 중재에 따른 환자 반응을 시뮬레이션하는 '제안-시뮬레이션-정제' 워크플로우를 따릅니다. 이 에이전트는 3단계의 커리큘럼 학습(지도 미세 조정, 행동 복제, 강화학습)을 거쳐 MIMIC-IV 데이터셋에서 기존 방법론 대비 우수한 성능과 안전성을 입증했습니다.
IntentVLA은 로봇 모방 데이터의 부분 관측성 문제를 해결하기 위해 개발된 이력 조건부 VLA 프레임워크입니다. 이는 최근 시각적 관측을 압축된 단기 지향 의도 표현으로 인코딩하여 액션 청크 생성에 활용합니다. 또한, IntentVLA는 단기 관측 모호성을 평가하는 새로운 벤치마크인 AliasBench를 도입하여 그 성능과 안정성을 입증했습니다.
본 논문은 일반화된 GUI Agent 학습에 필요한 대규모 상호작용 궤적 데이터 부족 문제를 해결하기 위해, 레이블링되지 않은 인터넷 비디오에서 근거 기반(Grounded) GUI 상호작용 궤적을 자동으로 추출하는 Video2GUI 프레임워크를 제안합니다. 이 프레임워크를 활용하여 1,500개 이상의 애플리케이션과 웹사이트를 포괄하는 대규모 데이터셋 WildGUI를 구축했습니다. WildGUI로 Qwen2.5-VL 및 Mimo-VL 같은 모델을 사전 학습시킨 결과, 여러 GUI 관련 벤치마크에서 최첨단 성능에 근접하거나 능가하는 성능 향상을 입증했습니다.
본 논문은 LLM 추론 속도를 높이는 Speculative Decoding 기법을 개선하기 위해, 초안 모델(draft model)의 정책 최적화 방식을 제안합니다. 기존 방법들이 토큰 레벨 지도 학습에 의존했던 한계를 극복하고, 윈도우 레벨에서 성능 중심의 최적화를 수행하는 강화 학습 프레임워크인 PPOW를 제시했습니다. PPOW는 적응형 윈도잉과 다양한 보상 함수를 결합하여 추측적 디코딩 효율성을 크게 향상시켰습니다.
본 기사는 대규모 언어 모델(LLMs)에서 발생하는 '조기 결론(Premature closure)' 문제를 다루며, 이를 불확실성 하에서의 부적절한 확신으로 정의합니다. 연구진은 구조화 및 개방형 의료 작업에 다섯 가지 Frontier LLM을 평가한 결과, 높은 비율로 답변을 제공하는 경향을 발견했습니다. 특히 정답 선택지가 제거된 MedQA와 AfriMed-QA 같은 상황에서 모델들은 여전히 높은 오작동률을 보였으며, 이는 안전 지향적 프롬프팅만으로는 해결되지 않는 근본적인 문제임을 시사합니다.
ML-Embed는 3차원 마트료시카 학습(3D-ML) 기반의 새로운 프레임워크로, 고품질 텍스트 임베딩이 직면한 계산 비용, 언어적 편향성, 투명성 부족 등의 문제를 해결하기 위해 개발되었습니다. 이 모델은 대규모 다국어 데이터셋을 사용하여 140M에서 8B 매개변수까지의 포괄적인 모델 세트를 제공하며, 모든 구성 요소를 공개하여 재현 가능한 AI 시스템 구축에 기여합니다.
본 논문은 시각-언어 내비게이션(VLN)의 성능 저하 원인을 지각적 불안정성과 공간적 접지 부족에서 찾고, 이를 해결하기 위해 StereoNav이라는 견고한 Vision-Language-Action 프레임워크를 제안합니다. StereoNav은 목표 위치 사전 지식(Target-Location Priors)을 도입하여 도메인 전반에 걸쳐 안정적인 시각적 가이드를 제공하며, 스테레오 비전과 깊이 인식을 활용해 모션 블러 및 조명 변화 같은 시각적 방해 요소를 완화합니다. 실험 결과, StereoNav은 적은 파라미터와 데이터로도 최첨단 성능을 달성했으며, 실제 로봇 배포를 통해 내비게이션 신뢰성을 크게 향상시켰습니다.
본 논문은 사후 학습된 추론 백본을 올림피아드 수준의 문제 해결사로 변환하는 단순하고 통합적인 레시피를 제시합니다. 이 방법론은 역-퍼플렉시티 커리큘럼을 사용한 SFT와 검증 가능한 보상을 활용하는 2단계 RL 파이프라인을 통해 증명 탐색 및 자기 점검 능력을 주입하며, 테스트 시간 스케일링으로 성능을 극대화합니다. 이 레시피를 적용한 SU-01 모델은 수학 및 물리 올림피아드 대회에서 금메달 수준의 추론 성능과 강력한 일반화 능력을 입증했습니다.
본 기사는 중환자실(ICU) 환경에서 대규모 언어 모델(LLMs)의 진정한 추론 능력을 평가하기 위한 새로운 벤치마크, RealICU를 소개합니다. 기존 ICU 벤치마크가 과거 임상의 행동을 정답으로 삼는 한계를 극복하고, 실제 의사들이 전체 환자 궤적을 검토하여 생성한 사후 주석(hindsight-annotated) 데이터를 활용했습니다. 이 벤치마크는 네 가지 핵심 작업(환자 상태 평가, 급성 문제 파악, 권장 조치, 레드 플래그 식별)을 포함하며, LLMs의 성능을 측정하고 안전성 실패 모드와 편향성을 분석하는 데 기여합니다.
FlowCompile은 구조화된 LLM 워크플로우의 최적화를 위한 새로운 컴파일러입니다. 이 시스템은 머신러닝 컴파일러에서 영감을 받아, 배포 전에 전체 워크플로우 설계 공간을 전역적으로 탐색하여 다양한 정확도-지연 시간 트레이드오프를 아우르는 재사용 가능한 구성 세트를 구축합니다. FlowCompile은 각 서브 에이전트의 프로파일링과 구조 인식 프록시를 결합하여 단 한 번의 컴파일 타임 패스를 통해 워크플로우 수준의 성능을 예측하며, 기존 방법보다 우수한 속도 향상을 입증했습니다.
기존의 Multi-agent LLM 시스템은 자연어 메시지 교환에 의존하여 높은 비용과 오버헤드를 발생시킵니다. 본 논문에서는 송신자의 은닉 상태를 수신자 전용 가중치 섭동(weight perturbation)으로 컴파일하는 새로운 통신 인터페이스인 TFlow (Thought Flow)를 제안합니다. TFlow는 모델의 컨텍스트 확장이나 영구적인 변경 없이도 인스턴스 수준의 적응을 가능하게 하며, 실험 결과에 따르면 기존 텍스트 기반 방식 대비 정확도를 유지하면서 처리 토큰과 추론 시간을 크게 절감하는 효율성을 입증했습니다.
EVA-Bench는 음성 에이전트의 성능을 종합적으로 평가하기 위해 설계된 새로운 엔드투엔드(End-to-end) 프레임워크입니다. 이 프레임워크는 동적인 다회차 대화 시뮬레이션과 실제 음성 특유의 실패 모드를 모두 포괄하여 현실적인 평가 환경을 제공합니다. EVA-Bench는 태스크 완료, 충실도, 오디오 음성 충실도를 측정하는 EVA-A와 대화 진행, 간결성, 발화 타이밍을 측정하는 EVA-X라는 두 가지 복합 지표를 도입하여 에이전트 아키텍처 간의 비교 가능성을 높였습니다.
본 논문은 LLM이 다단계 추론 과정에서 발생하는 환각을 탐지하는 새로운 방법을 제시합니다. 기존 방식들이 전체 출력에 대한 단일 신뢰도 점수를 부여하거나 첫 오류를 국소화하는 데 실패했던 것과 달리, 이 방법은 환각을 '은닉 상태 궤적'의 기하학적 속성으로 정의합니다. 올바른 추론 과정은 안정적인 매니폴드를 따라 이동하며, 오류는 전송 비용이 국소적으로 벗어나는 현상으로 나타나며, 이를 단일 순전파로 첫 오류를 정확히 국소화할 수 있습니다.
본 체계적 검토는 아제르바이잔 수어(AzSL)를 사례 연구로 삼아, 자원이 부족한 수어 언어를 위한 인식 및 번역 기술 문헌을 종합합니다. 이 글은 커뮤니티 공동 설계, 방언 다양성 포착 등 8가지 실행 가능한 교훈과 함께 세 가지 주요 패러다임 전환(데이터 중심 AI, 사용자 적응형 시스템, 작업 특정적 평가)을 제안합니다. 궁극적으로 기술 로드맵은 경량화된 아키텍처와 오프라인 배포를 포함하며, 문화적 진정성과 윤리적 거버넌스를 위해 청각 장애인 커뮤니티 중심의 협력이 필수적임을 강조합니다.
KV-Fold는 키-값(KV) 캐시를 누산기(accumulator)로 활용하여 별도의 학습 과정 없이 긴 문맥 추론을 수행하는 프로토콜입니다. 이 방식은 함수형 프로그래밍의 foldl과 유사하게, 이전 청크에서 전달된 KV 캐시를 조건으로 다음 청크를 처리하며 내부 상태를 재사용합니다. KV-Fold는 16K부터 128K 토큰에 이르는 긴 문맥에서도 높은 정확도를 유지하며, 단일 GPU 메모리 제약 내에서 안정적으로 작동하는 것이 특징입니다.
언어 모델의 발전은 자율 에이전트 구동 동력으로 활용되면서 광범위하게 사용되고 있습니다. 하지만 현재 고급 AI 에이전트들은 여전히 ChatGPT와 같은 초기 명령어 튜닝(instruction-tuned) 모델에 의존하며, 메시지 교환 형식에 따라 순차적으로 작동하는 한계를 가지고 있습니다.
본 논문은 인코더를 새로운 도메인에 적응시킬 때, 표준적인 마스크드 언어 모델링(MLM) 연속 사전 학습 방식 대신 '인과 언어 모델링(CLM) 우회 경로'를 사용하는 것이 다운스트림 성능을 향상시킨다는 것을 보여줍니다. 특히 생의학 텍스트 도메인에서 ModernBERT와 같은 인코더에 이 방법을 적용했을 때, MLM 기준선 대비 상당한 성능 개선(+1.2-2.8pp 등)을 달성했습니다. 연구 결과는 CLM 단계가 낮은 트랜스포머 레이어(0~7)에 큰 영향을 미치며, 중간 레이어를 고정하는 것이 이러한 이점을 유지하는 데 중요함을 밝혀냈습니다.
본 논문은 전자 건강 기록(EHR) 기반의 자동 질문 답변(QA) 시스템인 Neural1.5를 제시하며, 이는 임상 QA의 네 가지 핵심 하위 과제(질문 해석, 증거 식별, 답변 생성, 증거 정렬)를 다룹니다. 이 접근 방식은 DSPy의 MIPROv2 최적화기를 사용하여 각 단계에 대한 프롬프트를 자동으로 조정하고, 자체 일관성 투표 및 체인-오브-검증과 같은 검증 메커니즘을 결합하여 높은 신뢰성을 확보합니다. 연구 결과는 이 방법이 다면적인 임상 QA를 위한 비용 효율적이고 효과적인 대안임을 입증했습니다.
EgoMemReason은 스마트 글래스나 체화된 에이전트와 같이 하루 이상의 연속적인 시각적 경험에 걸쳐 추론해야 하는 차세대 비주얼 어시스턴트를 위한 메모리 기반 추론 벤치마크입니다. 이 벤치마크는 모델이 시간에 걸쳐 정보를 축적하고, 이전 상태를 회상하며, 시간적 순서를 추적하는 장기 시점 기억 능력을 평가합니다. 연구 결과, 최고 성능의 모델조차 전체 정확도가 낮았으며, 이는 장기 시점 메모리 처리가 여전히 해결해야 할 핵심 과제임을 보여줍니다.