Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
FlexDraft는 투기적 디코딩(Speculative Decoding) 과정에서 발생하는 메모리 오버헤드와 초안 검증 불일치 문제를 해결하기 위한 무손실 프레임워크입니다. 어텐션 튜닝, 보너스 가이드 교정, 유연한 디코딩이라는 세 가지 핵심 설계를 통해 다양한 배치 크기에서도 높은 처리량과 품질을 유지하며 LLM 추론을 가속화합니다.
본 연구는 소셜 미디어 내 음모론의 확산과 지속성에 미치는 언어적 변이(Language Mutations)의 영향을 분석합니다. X(구 트위터)의 3년치 데이터를 바탕으로 분석한 결과, 의미론적 변이가 클수록 음모론의 수명이 길어지며, 이는 단순화와 동화라는 두 가지 주요 패턴을 통해 나타납니다. 연구는 효과적인 콘텐츠 중재를 위해 음모론의 가변성을 고려하고 핵심 주장에 집중할 것을 제안합니다.
PromptRad는 데이터가 부족한 의료 환경에서 방사선 보고서를 효율적으로 라벨링하기 위해 제안된 지식 강화형 멀티 라벨 프롬프트 튜닝 방식입니다. UMLS Metathesaurus의 유의어를 활용하여 카테고리 표현을 풍부하게 하며, 마스크 언어 모델링 방식으로 문제를 재구성하여 적은 데이터로도 높은 성능을 구현합니다. 실험 결과, 매우 적은 학습 데이터만으로도 기존 미세 조정 방식 및 GPT-4와 경쟁할 만한 성능을 보였습니다.
장기적 상호작용 과제에서 LLM 에이전트의 신념 드리프트와 시간적 신용 할당 문제를 해결하기 위한 새로운 강화학습 알고리즘 ReBel을 제안합니다. ReBel은 구조화된 신념 상태를 모델링하고 신념 일관성 감독을 통해 외부 주석 없이도 조밀한 자기 지도 신호를 생성합니다. 실험 결과, ALFWorld 및 WebShop 벤치마크에서 기존 GRPO 대비 성공률을 최대 20.4%p 향상시키고 샘플 효율성을 2.1배 개선했습니다.
본 연구는 정답 쿼리 주석이 없는 상황에서 소규모 언어 모델이 Text-to-SPARQL 생성을 수행할 수 있도록 GRPO 기반의 강화학습 방식을 제안합니다. DBLP-QuAD 데이터셋을 활용하여 Qwen3-1.7B 모델에 실행 피드백과 구조적 제약을 보상으로 사용하는 학습을 적용한 결과, 제로샷 베이스라인 대비 유의미한 성능 향상과 일반화 능력을 확인했습니다.
CopT는 기존의 '사고 후 답변' 방식에서 벗어나, 먼저 초안 답변을 생성한 뒤 이를 바탕으로 성찰과 수정을 수행하는 새로운 추론 파이프라인을 제안합니다. 연속적 임베딩을 활용한 대조적 검증기를 통해 답변의 신뢰도를 평가하며, 신뢰도가 낮을 경우에만 추가적인 사고를 수행하여 효율성을 극대화합니다. 이를 통해 수학, 코딩, 에이전트 추론 작업에서 정확도를 높이면서도 토큰 사용량을 크게 절감할 수 있습니다.
BalanceRAG는 모든 쿼리에 RAG를 적용하는 대신, LLM 단독 답변의 신뢰도를 먼저 평가하고 불확실할 때만 RAG를 사용하는 계층적 RAG(Cascaded RAG) 구조를 제안합니다. 이 연구는 두 단계의 불확실성 임계값을 최적화하여 시스템 전체의 오류율을 제어하면서도 검색 효율성을 극대화하는 공동 위험 보정(Joint Risk Calibration) 기술을 다룹니다. 실험을 통해 BalanceRAG가 불필요한 검색 호출을 줄이면서도 높은 정답 커버리지를 유지함을 입증했습니다.
ThoughtTrace는 사용자가 LLM과 대화할 때 프롬프트를 보내는 이유와 응답에 대한 반응을 포함한 최초의 대규모 사용자 사고(thoughts) 데이터셋입니다. 20개의 언어 모델과 1,058명의 사용자를 대상으로 수집된 이 데이터셋은 사용자의 인지적 역학을 이해하고 더 개인화된 AI 어시스턴트를 구축하는 데 기여합니다.
본 연구는 LLM이 인간의 '무주의 맹시'와 유사하게 명시적 지침이 주어졌음에도 미묘한 문맥적 단서를 놓치는 현상을 조사합니다. 이를 위해 9가지 추론 유형을 포함한 벤치마크 MixRea를 제안하였으며, Gemini 2.5 Pro를 포함한 주요 모델들이 낮은 일관성을 보임을 확인했습니다. 또한, 간과된 인과 관계를 복구하는 PRCP 프롬프팅 기법을 통해 이러한 추론 한계를 완화할 수 있음을 제시합니다.
대규모 시각 언어 모델(LVLM)이 의료 영상 분석 시 시각적 증거에 기반하지 못하는 문제를 해결하기 위해, 반사실적 편집을 활용한 새로운 인과적 평가 프레임워크를 제안합니다. 연구 결과 기존의 시각적 귀인 방법론들이 모델의 실제 근거를 식별하는 데 한계가 있음을 확인하였으며, 이를 개선하기 위해 불균형 최적 운송 기반의 MedFocus 방법론을 개발했습니다. MedFocus는 임상적으로 유의미한 영역을 국소화하고 인과적 효과를 측정하여 기존 방식보다 뛰어난 설명력을 제공합니다.
본 연구는 구조화된 프롬프트 설계가 LLM의 응답 품질을 높이고 사용자의 노력을 줄이는지 비교 분석합니다. 실험 결과, 체크리스트 개선 프롬프트가 원시 프롬프트나 명확화 질문 프롬프트보다 높은 품질과 효율적인 토큰 사용량을 보여 최상의 품질-노력 트레이드오프를 달성했습니다.
KoRe는 LLM의 파라미터 내 지식 인코딩 방식이 가진 불투명성과 환각 문제를 해결하기 위해 제안된 새로운 방법론입니다. 1-hop 서브 그래프를 컴팩트한 이산 지식 토큰으로 변환하여 LLM 백본에 주입함으로써, 기존 방식보다 토큰 사용량을 최대 10배 줄이면서도 높은 성능을 유지합니다.
ClinSeekAgent는 임상 의사 결정 지원을 위해 이질적인 출처로부터 멀티모달 증거를 능동적으로 탐색하고 합성하는 자동화된 에이전트 프레임워크입니다. 이 시스템은 의료 지식 베이스, EHR, 의료 영상 도구를 활용하여 가설을 정교화하며, 추론 시간의 에이전트 역할뿐만 아니라 고품질 궤적을 소형 모델로 증류하는 학습 파이프라인 역할도 수행합니다. 실험 결과, Claude Opus 4.6을 포함한 다양한 모델에서 텍스트 및 멀티모달 임상 작업 성능을 크게 향상시켰습니다.
본 연구는 시각-언어 모델(VLM)의 성능 저하가 추론 능력이 아닌 시각적 인지 능력의 부족에서 기인한다는 점을 밝히고, 이를 해결하기 위한 단계별 학습(Staged Training) 방법론을 제안합니다. 모델의 학습 과정을 시각적 인지, 시각적 추론, 텍스트 추론의 세 단계로 분리하여 학습함으로써, 인지 능력이 추론의 근본적인 토대 역할을 수행하도록 설계했습니다. 실험 결과, 이러한 단계별 접근 방식은 통합 학습보다 높은 정확도를 보였으며, 더 짧은 추론 경로로도 우수한 성능을 달성했습니다.
본 논문은 대규모 언어 모델(LLM)을 새로운 언어로 확장할 때 발생하는 비용과 파라미터 충돌 문제를 해결하기 위한 새로운 방법론을 제안합니다. 밀집 모델을 MoE 아키텍처로 업사이클링하여 언어별 전문가를 할당하고, 사후 학습된 파라미터 델타를 이식함으로써 복잡한 정렬 과정 없이도 언어 확장과 기존 능력 보존을 동시에 달성합니다.
본 연구는 뱅골어(Bangla)를 위한 의료 시각 질의응답(MedVQA) 벤치마크인 BanglaMedVQA 데이터셋을 새롭게 제안합니다. Gemini, GPT-4o mini, Gemma-3 등 주요 파운데이션 모델을 평가한 결과, 저자원 언어의 한계로 인해 전문적인 의료 추론 성능이 현저히 낮음을 확인했습니다.
TRACE는 LLM의 추론 과정 중 각 계층에서 발생하는 사실적 증거의 변화를 분석하여 환각을 교정하는 training-free 알고리즘입니다. 모델 내부의 계층 간 후보 궤적을 활용해 최적의 교정 계층과 연산자를 결정론적으로 도출하며, 별도의 학습이나 외부 검색 없이도 환각을 효과적으로 감소시킵니다.
iPOE는 LLM의 프롬프트 최적화 과정에서 투명성과 해석 가능성을 높이기 위해 제안된 새로운 전략입니다. 어노테이션 결정에 대한 설명을 바탕으로 자동 생성된 가이드라인을 최적화하여, 성능 향상과 동시에 프롬프트가 왜 그렇게 구성되었는지에 대한 논리적 근거를 제공합니다.
FOL2NS는 1차 논리(First-Order Logic) 공식을 자연스러운 문장으로 변환하기 위해 설계된 신경 기호적(neurosymbolic) 프레임워크입니다. 규칙 기반 모듈과 미세 조정된 언어 모델을 결합하여 복잡한 양화사 구조를 가진 논리식을 처리하며, 문장의 다양성과 커버리지를 높이는 데 집중합니다.
일반화 가능한 에이전트 개발을 위해서는 단순한 데이터 확장을 넘어, 실행 가능한 규칙 세트의 분포를 넓히는 '환경 확장(environment scaling)'이 필수적입니다. 본 논문은 궤적, 작업, 환경 확장을 구분하는 새로운 분류 체계를 제안하며, 프로그래밍 방식의 생성기와 생성적 세계 모델을 활용한 환경 구축 패러다임을 제시합니다.