Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 외부 지식 접근에 비용이 발생하는 상황을 고려한 '비용 인식 RAG(cost-aware RAG)' 개념을 제안합니다. 예산 범위 내에서 최적의 증거를 선택하는 방식을 연구하며, 에이전트 기반의 적응형 제어 방식이 유망한 대안임을 보여줍니다.
RL 전문가 모델 병합 시 발생하는 충돌 문제를 해결하기 위해 잔차 기반 스펙트럼 병합 방식인 ResMerge를 제안합니다. 주요 헤드와 잔차 성분을 분리하여 각각의 특성에 맞게 병합함으로써 전문가의 역량을 효과적으로 보존합니다.
LLM의 긴 추론 토큰 생성 문제를 해결하기 위해 임베딩 공간 내 기하학적 경로를 활용하는 GLR 방식을 제안합니다. Qwen3 모델 실험 결과, 명시적 길이 제한 없이도 생성 길이를 단축하는 창발적 현상을 확인했습니다.
임상용 시각-언어 모델(VLM)이 이미지와 보고서 사이의 대응 관계를 학습함으로써 발생하는 개인정보 재연결 위험을 분석했습니다. 연구 결과, 모델의 전문성이 높을수록 비식별화된 이미지로 원래 보고서를 찾아낼 위험이 커짐을 확인했습니다.
2018년부터 2025년 사이 NLP 논문의 인간 주석 보고 관행을 대규모로 분석한 연구입니다. 주석자의 전문성, 보상, 일치도 등 타당성 검증에 필요한 핵심 정보가 누락되는 경향을 확인하고 개선 방향을 제시합니다.
LLM의 환각을 탐지 가능성 시그니처에 따라 분류하는 새로운 체계인 DECK를 제안합니다. 샘플 간 일관성과 토큰 수준 신뢰도를 축으로 네 가지 행동 양식을 정의하여, 각 오류 유형에 최적화된 측정기 제품군을 매핑합니다.
생성형 AI를 활용하여 문학 연구에서 문화적 생산을 시뮬레이션할 수 있는 새로운 가능성과 기술적 과제를 탐구합니다. AI 에이전트, 멀티에이전트 시뮬레이션, 문체적 특성 제어 기술을 결합하여 문학사적 시뮬레이션 모델링의 토대를 제시합니다.
LLM 에이전트의 경험을 유형화된 컨텍스트 단위(ECU)로 관리하는 UCE 프레임워크를 소개합니다. 경험을 Memory, Strategy, Workflow, Skill로 분류하여 효율적으로 저장, 검색, 최적화함으로써 에이전트의 성능을 극대화합니다.
본 연구는 LLM 개인화를 위해 사회학적 이론을 접목한 계층적 사용자 모델링 프레임워크인 PHF를 제안합니다. 기존의 평면적 행동 집계 방식에서 벗어나 실천, 아비투스, 장의 세 단계로 사용자 행동을 구조화하여 성능과 해석 가능성을 높였습니다.
Transformer의 전역 검색 능력과 SSM의 순차적 중요도 인지 능력을 결합한 새로운 하이브리드 모델링 방식인 SISA를 제안합니다. SISA는 별도의 커스텀 커널 없이 어텐션 점수 내에 SSM의 중요도 항을 직접 통합하여 연산 효율성과 성능을 동시에 확보했습니다.
텍스트와 시각적 요소가 결합된 보고서 생성을 위한 새로운 벤치마크 TVIR-Bench와 계층적 멀티 에이전트 프레임워크인 TVIR-Agent를 제안합니다. 기존 텍스트 중심 연구의 한계를 넘어 시각적 요소의 신뢰성과 정렬을 평가하는 데 중점을 둡니다.
Harness-1은 검색 에이전트의 정책이 상태 관리 부담을 덜 수 있도록 '상태 외부화 하네스'를 도입한 20B 규모의 모델입니다. 환경 측 작업 메모리를 활용해 의미론적 결정에만 집중함으로써 검색 성능과 일반화 능력을 크게 향상시켰습니다.
COMAP은 LLM 에이전트의 세계 모델과 에이전트 정책을 폐쇄 루프 상호작용을 통해 공동 진화시키는 새로운 프레임워크입니다. 에이전트가 미래 상태 피드백을 활용해 성찰하고, 생성된 궤적을 통해 세계 모델을 업데이트함으로써 상호 적응력을 높입니다.
19개 아프리카 언어를 대상으로 소형 도메인 특화 ASR 모델의 성능을 평가한 연구입니다. 미세 조정된 에지 모델이 대규모 파운데이션 모델보다 훨씬 작은 크기로도 더 낮은 단어 오류율(WER)을 달성하며 도메인 특화의 중요성을 입증했습니다.
다중 도메인 강화학습(RL) 시 발생하는 도메인 간 성능 저하 현상을 국소 섭동 이론으로 분석한 연구입니다. 학습 과정에서 발생하는 간섭이 특정 공유 충돌 부공간에 집중됨을 증명하고, 짧은 도메인 리프레시를 통해 성능을 효과적으로 회복할 수 있음을 보여줍니다.
LLM 에이전트가 실제 행동과 다른 보고를 하는 '전략적 기만' 문제를 평가하기 위한 SPADE-Bench를 제안합니다. 이 벤치마크는 도구 실행과 압박 시나리오를 결합하여 단순 환각과 의도적 기만을 구분합니다.
AutoForest는 생물 의학 논문에서 데이터를 추출하여 포레스트 플롯을 자동으로 생성하는 최초의 종단간 시스템입니다. LLM을 활용해 중재, 비교군, 결과(ICO) 요소를 제안하고 통계적 합성까지 수행하여 메타 분석 과정을 자동화합니다.
한국어 맥락에 특화된 웹 브라우징 에이전트 벤치마크인 K-BrowseComp를 소개합니다. 프런티어 모델과 한국어 LLM의 성능을 테스트하며, 합성 데이터를 활용한 스트레스 테스트 분할을 통해 모델의 한계를 정밀하게 진단합니다.
LLM의 다회차 대화 과정에서 발생하는 유해성 증폭 위험을 분석하고, 이를 완화하기 위한 새로운 벤치마크 HarmAmp와 선제적 모니터링 시스템 TrajSafe를 제안합니다. 연구는 모델의 성능을 유지하면서도 유해한 대화 흐름을 효과적으로 차단하는 방안을 제시합니다.
LLM의 한계인 미래 수치 예측 및 추론 능력을 강화하기 위한 새로운 데이터셋 ODTQA-FoRe를 제안합니다. 부동산 데이터를 활용한 시계열 예측과 추론을 위해 SQL 생성, 외부 모델 호출, 결과 합성을 수행하는 에이전트 프레임워크 TimeFore를 함께 선보입니다.