Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
확산 언어 모델(dLLM)의 디코딩 효율성을 높이기 위해, 토큰 확정 시점을 동적으로 결정하는 적응형 샘플러 LESS를 제안합니다. LESS는 상호 안정성 샘플링을 통해 불필요한 계산을 줄이면서도 정확도를 향상시킵니다.
IMPACTeen은 청소년의 디지털 및 사회적 상호작용 내 의도, 조작, 설득 기법을 다루는 텍스트 데이터셋입니다. LLM 생성과 인간의 검증을 거쳐 구축되었으며, 다양한 전문가 관점의 다차원적 주석을 포함합니다.
본 연구는 코드 인터프리터(CI)를 활용한 LLM의 추론 능력을 외재적 특성(핵심 토큰)과 내재적 특성(인지 행동) 관점에서 분석합니다. 연구 결과, 강력한 모델일수록 검증 및 백트래킹과 같은 행동이 빈번하며, 이를 추론과 학습 과정에 활용할 때 성능 향상이 가능함을 입증했습니다.
AgentSpec은 체화된 에이전트의 구성 요소를 표준화된 인터페이스로 모듈화하여 분석할 수 있는 프레임워크입니다. 추론, 메모리, 성찰 등 각 모듈 간의 상호작용과 스캐폴드 호환성이 에이전트 성능에 미치는 영향을 연구합니다.
사용자의 저수준 액션 로그를 상위 수준의 의미 있는 워크플로로 추상화하는 LLM 기반 프레임워크 WorkflowView를 제안합니다. 브라우저 로그 재구성, 학생 중도 탈락 예측 등 다양한 도메인에서 높은 성능과 일반화 능력을 입증했습니다.
LLM 에이전트 워크플로우의 병렬 브랜치를 효율적으로 통합하기 위한 Parallel-Synthesis 프레임워크를 제안합니다. 텍스트 연결 방식 대신 KV 캐시를 직접 소비하는 방식을 통해 추론 속도를 획기적으로 개선하고 성능을 유지합니다.
AI가 생성하는 형식 수학에서 검증 가능한 결과물과 수학적 가치 사이의 간극을 '극한에서의 중첩된 언어 생성' 모델로 분석합니다. 검증기가 가치 있는 수학을 찾는 과정에서 발생하는 트라이비아(trivial)의 역할과 생성 모델의 커버리지 한계를 수학적으로 규명합니다.
멀티모달 RLVR 과정에서 발생하는 사고-답변 간의 의미론적 불일치 문제를 분석하고, 이를 해결하기 위한 CORA 방법론을 제안합니다. CORA는 일관성 중심의 추론 정렬을 통해 LVLM의 추론 과정과 최종 답변 사이의 간극을 효과적으로 완화합니다.
AdaSR은 연속적인 데이터 스트림 환경에서 모델이 실시간으로 추론하고 계산 자원을 적응적으로 할당할 수 있게 하는 프레임워크입니다. 계층적 상대적 정책 최적화(HRPO)를 통해 추론 정확도와 지연 시간 사이의 최적의 균형을 달성합니다.
Persona-Pruner는 특정 페르소나를 수행하는 데 필요한 모델의 서브 네트워크를 효율적으로 추출하는 프레임워크입니다. 기존의 단순 가지치기 방식과 달리 캐릭터 특성을 보존하며 계산 비용을 획기적으로 줄여줍니다.
의료 MLLM의 추론 과정에서 발생하는 환각을 단계별로 진단하기 위한 새로운 벤치마크인 ClinHallu를 소개합니다. 시각적 인식, 지식 회상, 추론 통합의 세 단계로 오류 원인을 분석하며, 흔적 지도 미세 조정을 통해 환각을 완화하는 방법을 제시합니다.
시각-언어 모델(VLM) 내에서 이미지의 특정 영역을 추적하는 '게이즈 헤드(gaze heads)'의 존재를 발견했습니다. 이 헤드들을 제어함으로써 재학습 없이도 모델이 설명하는 대상을 원하는 영역으로 유도할 수 있음을 증명했습니다.
BayLing-Duplex는 별도의 VAD 모듈 없이 단일 자기회귀 LLM만으로 실시간 전이중(Full-Duplex) 음성 대화를 구현한 모델입니다. 특수 토큰을 활용해 기존 아키텍처를 유지하면서도 자연스러운 끼어들기와 턴 테이킹을 가능하게 합니다.
Gefen은 AdamW의 메모리 사용량을 약 8배 줄이는 새로운 확률적 옵티마이저입니다. 2차 모멘트 공유와 1차 모멘트 양자화 기술을 통해 성능 저하 없이 메모리 효율성을 극대화했습니다.
데이터 레이크 상의 QA 에이전트 성능을 진단하기 위한 새로운 프레임워크인 SANA를 소개합니다. SANA는 에이전트의 실패 원인을 검색, 계획, 데이터 분석, 행동 정책 단계로 세분화하여 분석할 수 있게 합니다.
다회차 상호작용을 통한 LLM의 법률 상담 능력을 평가하기 위한 새로운 벤치마크인 DLawBench를 소개합니다. 실제 사례를 바탕으로 네 가지 의뢰인 유형을 정의하여 모델의 법률적 추론 및 전략적 정보 추출 능력을 진단합니다.
ADORE는 검색 결과의 피드백을 활용하여 쿼리를 반복적으로 확장하는 새로운 프레임워크를 제안합니다. 기존의 생성 주도적 방식이 유발하는 검색 드리프트 문제를 해결하며, 다양한 벤치마크에서 기존 베이스라인을 뛰어넘는 성능 향상을 입증했습니다.
LLM을 활용한 의료 ICD 코딩 성능 향상을 위해 사후 학습(Post-Training)의 효과를 실증적으로 연구했습니다. SFT와 RL(GRPO)을 적용했을 때 프롬프팅보다 월등한 성능을 보임을 확인하였으며, 새로운 진단 커리큘럼인 PHI를 제안합니다.
LLM의 선호도와 가치 체계가 배포 컨텍스트(프레이밍)에 따라 어떻게 변화하는지 분석한 연구입니다. 실험 결과, 프롬프트 변화보다 작업 컨텍스트가 모델의 가치 판단에 더 큰 영향을 미치며, 기존의 편향성 또한 컨텍스트 의존적임을 밝혀냈습니다.
MedLatentDx는 개인정보 보호를 유지하며 병원 간 희귀 질환 진단을 돕는 멀티 에이전트 통신 프레임워크입니다. 임상 텍스트 대신 압축된 잠재 KV 블록을 전송하여 데이터 유출 위험을 줄이면서 진단 성능을 높입니다.