Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
SCOPE는 외부 감독이나 정답 없이도 언어 모델을 학습시킬 수 있는 데이터 프리 셀프 플레이 프레임워크입니다. 챌린저와 솔버 정책을 공동 진화시켜 개방형 과업 성능을 크게 향상시켰으며, 기존 GRPO 방식과 대등하거나 더 높은 성능을 입증했습니다.
기밀 유지가 중요한 번역 환경을 위해 로컬 LLM의 성능을 벤치마킹한 연구입니다. 다국어 코퍼스(RFMC)를 활용해 Ollama 기반 로컬 모델들을 상용 NMT 및 프런티어 LLM과 비교 분석했습니다.
벵골어 LLM의 환각 현상을 체계적으로 평가하기 위한 BenHalluEval 프레임워크를 제안합니다. GQA, 요약, 추론 등 4가지 작업을 포함하며, 이중 트랙 프로토콜과 보정 지표인 BenHalluScore를 통해 모델의 환각 탐지 능력을 정밀하게 측정합니다.
LLM의 구성적 능력과 의미론적 해석 능력을 외연적 및 내포적 과제로 나누어 분석한 연구입니다. 실험 결과, 인간은 외연적 과제에 강한 반면 LLM은 내포적 과제에 더 강한 성능을 보이며 상반된 특성을 나타냅니다.
저자원 의료 환경에서 영어, 힌디어, 펀자브어 임상 노트를 분류하기 위한 신뢰성 중심의 다국어 프레임워크를 제안합니다. IndicBERT-HPA 모델과 선택적 검증 계층을 통해 언어적 불안정성을 극복하고 높은 정확도와 신뢰도를 달성했습니다.
본 연구는 RAG 시스템에서 어휘적 유사성 대신 검증된 사실의 비율을 측정하는 '사실 밀도(FD*)' 지표를 제안합니다. 의료 AI 분야의 HealthFC 벤치마크를 통해 FD*가 기존 코사인 유사도 방식보다 사실적 증거를 찾는 데 훨씬 효과적임을 입증했습니다.
On-Policy Distillation(OPD)의 높은 계산 비용과 초기 학습 불안정성을 해결하기 위한 새로운 연구를 소개합니다. Rollout horizon을 제어하는 POPD와 TOPD 전략을 통해 학습 효율을 높이고 자원 소모를 획기적으로 줄일 수 있음을 입증했습니다.
UniAudio-Token은 기존 의미론적 음성 토크나이저의 음향적 정보 손실 문제를 해결하기 위해 제안된 프레임워크입니다. SAP와 SAE 기술을 통해 언어적 콘텐츠와 음향적 세부 사항을 동시에 보존하며, 고충실도 음성 생성과 범용 오디오 인식을 동시에 달성합니다.
LLM의 추론 과정에서 은닉 상태(Hidden state)를 분석하기 위해 '질문하기'를 프로빙 기법으로 제안합니다. 질문 생성 과정의 자기 진단 신호를 통해 정답 여부를 예측할 수 있으며, 이를 활용한 게이팅 정책의 효과와 한계를 탐구합니다.
LLM이 사용자 중심 에이전트로 진화함에 따라 개인화된 정렬을 평가하는 PARL 프레임워크를 제안합니다. PARL은 사용자 이력에서 선호도를 인식하는 루브릭을 직접 학습하여, 기존 평가 방식이 놓치기 쉬운 주관적이고 특화된 선호도를 정밀하게 포착합니다.
혐오 표현 탐지 작업에서 인간의 레이블과 근거(rationale) 간의 불일치 및 변동성을 분석한 연구입니다. 분류 지표와 설명 가능성 지표를 통합한 프레임워크를 통해, 주관적인 NLP 평가에서 soft한 표현이 변동성을 포착하는 데 더 효과적임을 입증했습니다.
LLM의 계층적 테이블 이해를 돕기 위해 셀 정보를 <item path, feature path, value> 형태의 트리플렛으로 재구성하는 STR 프로토콜을 제안합니다. 이를 통해 마크업 오버헤드를 줄이고 토큰 효율성을 높이면서도 테이블 질의응답 성능을 유지하거나 향상시킵니다.
LLM의 지시어 미세 조정 시 데이터 효율성을 높이기 위해 모델의 신경 활성화 상태를 활용하는 MADS 방법론을 제안합니다. 텍스트 특징 대신 모델 고유의 활성화 특징을 기반으로 코어 세트를 선택하여 데이터 요구량을 줄이면서도 성능을 향상시킵니다.
dLLM의 블록 병렬 디코딩과 토큰 수준 MoE 간의 불일치 문제를 해결하기 위한 dMoE 프레임워크를 제안합니다. 블록 단위로 전문가 분포를 집계하여 활성화되는 전문가 수를 줄임으로써 메모리 병목을 완화하고 추론 속도를 가속화합니다.
PatchWorld는 오프라인 궤적을 실행 가능한 Python 월드 모델로 변환하는 그래디언트 프리 프레임워크입니다. 블랙박스 예측 대신 상징적 믿음 상태 프로그램을 유도하여 에이전트의 계획 능력을 향상시킵니다. 실험 결과, LLM 호출 없이도 높은 계획 성공률을 기록하며 관측 충실도와 의사결정 효용 간의 트레이드오프를 발견했습니다.
언어 모델 정렬 시 발생하는 데이터 확보 병목 현상을 해결하기 위해, 가치 함수를 활용한 온폴리시 RM 학습 프레임워크인 SAVE를 제안합니다. SAVE는 적응형 앵커를 통해 온폴리시 응답을 지도 학습 데이터로 변환하여 보상 모델의 성능을 효과적으로 개선합니다.
UniScale은 모델 라우팅과 테스트 시간 스케일링(TTS)을 단일 최적화 공간으로 통합한 새로운 추론 프레임워크입니다. LinUCB 알고리즘을 활용해 동적인 환경에서 추론 품질과 계산 비용 사이의 최적의 균형을 온라인으로 학습합니다.
금융 스프레드시트 작업에 특화된 LLM 에이전트 성능 평가 벤치마크인 BlueFin을 소개합니다. 131개의 복잡한 과업과 정교한 루브릭을 통해 기존 최첨단 모델들의 한계를 분석하고 평가 프레임워크를 제공합니다.
EASE는 멀티모달 RLVR 모델의 성능을 높이기 위해 시각적 증거 과정 감독을 도입한 새로운 방법론입니다. 높은 보상을 받은 궤적에 대해 응답-이미지 어텐션을 가이드함으로써, 모델이 언어적 사전 지식에 의존하지 않고 실제 시각적 증거에 기반해 답변하도록 유도합니다.
프롬프트의 어조와 독성 수준이 LLM의 사실적 신뢰성에 미치는 영향을 연구한 논문입니다. 독성 어휘가 포함된 프롬프트는 모델의 정확도를 낮추고 불확실성을 높이며, 내부 활성화 분석을 통해 특정 노드가 선택적으로 증폭됨을 확인했습니다.