Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 토큰당 과금 방식에서 제공자가 토큰 수를 조작하여 과다 청구할 수 있는 취약성을 분석합니다. 현재의 감사 방식은 제공자가 제공하는 데이터에 의존하는 '신뢰의 역설' 문제를 안고 있으며, 이를 해결하기 위해 암호학적 증명 등의 새로운 검증 체계가 필요함을 제안합니다.
본 연구는 심리학적 가치 이론을 활용하여 LLM이 인간과 유사한 가치 구조를 준수하며 행동할 수 있는지 평가합니다. 대규모 실험 결과, 가치 프롬프트가 적용된 LLM은 인간의 가치 분포 및 행동 패턴과 강력한 일치성을 보였습니다.
RePoT는 Program-of-Thought(PoT)의 실행 오류를 해결하기 위해 체크포인트 기반의 복구 메커니즘을 제안합니다. 첫 번째 무효한 동작 발생 시 검증된 접두사부터 재개하여 단 한 번의 추가 호출로 높은 복구 성능을 달성합니다.
LLM 기반 자동 튜터링 도구 개발을 위해 학생의 학습 이력을 활용한 '이력 조건부 학생 시뮬레이션' 과업을 제안합니다. 프로필 생성기와 시뮬레이터로 구성된 프레임워크를 강화학습으로 학습시켜, 실제 수학 학습 데이터셋에서 기존 방식보다 뛰어난 성능을 입증했습니다.
LLM 에이전트가 인간과 유사한 심리적 특성을 시뮬레이션할 수 있는지 평가하기 위한 새로운 벤치마크인 HEART-Bench를 소개합니다. Big Five 성격 특성과 자전적 기억을 결합하여 에이전트의 성격 일관성과 의사결정 능력을 체계적으로 검증합니다.
UniSteer는 자연어 조건을 통해 LLM의 활성화 공간을 제어하는 새로운 플로우 매칭(Flow Matching) 모델을 제안합니다. 기존의 고정된 방향 방식과 달리, 보편적인 조건부 속도장을 학습하여 세밀한 개념과 복합적인 제약 조건을 유연하게 조절할 수 있습니다.
토큰화가 필요 없는 계층적 모델의 압축률 최적화를 위한 새로운 메커니즘인 ATDC를 제안합니다. 커리큘럼 학습을 통해 압축률을 점진적으로 조정하며, 기존 모델 대비 안정적인 학습과 우수한 성능을 입증했습니다.
언어 모델의 추론 과정 중 오류가 발생하기 전까지의 유효한 중간 단계(접두사)를 통계적으로 보증하는 CROP 방법론을 제안합니다. 기존의 전체 응답 인증 방식과 달리, 단계별 위험 프록시를 활용해 안전한 추론 경로의 길이를 엄격하게 제어합니다.
롱폼 비디오 생성 모델의 서사 구조와 영화적 제어 능력을 평가하기 위한 새로운 벤치마크인 DirectorBench를 소개합니다. 이 시스템은 단일 점수 대신 5개 차원의 체크포인트를 통해 워크플로우의 병목 현상을 정밀하게 진단합니다.
기존 LLM 벤치마크의 포화 문제를 해결하기 위해 새로운 평가 프로토콜인 SEAL을 제안합니다. SEAL은 적응형 LLM-as-a-Meta-Judge와 시드 제거 방식을 사용하여 기존 태스크에서 유의미한 순위 신호를 추출합니다.
방사선 보고서 생성(RRG) 시 추론 단계의 품질을 높이기 위한 CCS 프레임워크를 제안합니다. 여러 후보 보고서 중 임상적 합의가 가장 높은 보고서를 선택하는 디코더 불가지론적 방식을 통해 임상 지표를 개선합니다.
RAG 기반 음성 대화 시스템 평가를 위한 대규모 다국어 및 다중 병렬 데이터셋인 HEALTHDIAL을 소개합니다. WHO의 신뢰할 수 있는 콘텐츠를 기반으로 4개 공식 언어의 방언을 포함한 163시간의 음성 데이터를 제공합니다.
CRAC 2026 공유 태스크에서 우승한 CorPipe 26 시스템을 소개합니다. 이 모델은 다국어 상호참조 해결 과정에서 빈 노드(Empty Nodes)를 예측하는 새로운 방식을 도입하여 기존 LLM 및 특화 시스템보다 높은 성능을 기록했습니다.
연산량(Compute)과 용량(Capacity)을 독립적으로 확장할 수 있는 새로운 이중 경로(Dual-path) 블록 아키텍처를 제안합니다. 루프형 트랜스포머의 한계를 극복하여 동일 연산량 대비 더 높은 성능과 매개변수 효율성을 달성했습니다.
독일어의 문법적 성 체계를 반영하여 LLM의 대명사 충실도, 추론 및 편향성을 평가하는 새로운 데이터셋 GRUFF를 제안합니다. 연구 결과, 모델들은 일반 대명사에는 강하지만 신조어 대명사에는 취약하며, 인코더 전용 모델이 독일어 문법 구조에서 더 견고한 성능을 보임을 확인했습니다.
야생 환경의 오정보 탐지를 위해 커버리지와 재배포 가능성을 갖춘 새로운 벤치마크 CommunityFact를 제안합니다. 5개 언어와 2개 도메인을 대상으로 10개의 LLM을 평가하여 웹 검색 기능의 중요성과 모델별 출처 선택 정책의 한계를 분석했습니다.
LoMo는 시각-언어 모델(VLM)의 양식 치환 시 발생하는 성능 저하 문제를 해결하기 위한 새로운 데이터 큐레이션 패러다임입니다. 텍스트와 이미지 간의 의미론적 불변성을 학습시켜 모델의 멀티모달 추론 능력을 크게 향상시킵니다.
전이중(Full-Duplex) 시청각 대화 능력을 평가하기 위한 최초의 벤치마크인 VideoFDB를 제안합니다. 기존 음성 중심 평가를 넘어 비언어적 신호를 포함한 시청각 상호작용을 체계적으로 분석합니다.
LLM의 수학적 추론 성능을 높이기 위해 '무엇을 해결할 것인가'를 명시적으로 파악하는 Preplan 단계를 도입한 PPC 프레임워크를 제안합니다. 합성 데이터 파이프라인과 복합 GRPO 보상 설계를 통해 기존 계획 기반 추론의 한계를 극복했습니다.
COMPOSE는 과학적 인용 그래프와 형식적 정리 의존성 그래프를 결합하여 근거 있는 미래 수학적 정리를 생성하는 이중 그래프 프레임워크입니다. 기존 방식과 달리 인용 문맥과 수학적 구조를 동시에 고려하여 더욱 타당하고 풍부한 수학적 주장을 생성합니다.