Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
AdvancedMathBench는 LLM의 고급 수학적 추론 능력을 평가하기 위해 설계된 새로운 벤치마크 스위트입니다. 이 스위트는 학부 및 박사 수준의 문제를 포함하는 ProverBench와 증명 검증 능력을 측정하는 VerifierBench로 구성되어 있습니다. 실험 결과, 최신 모델들도 고급 수학 증명 생성과 오류 감지에서 여전히 상당한 개선이 필요함을 보여주었습니다.
본 논문은 2026 NLPCC 컨퍼런스에서 열릴 'ChineseBabyLM' 챌린지를 소개합니다. 이 챌린지는 연구자들에게 단 1억 개의 중국어 토큰으로 언어 모델을 처음부터 훈련하도록 요구하며, NLU, 인지적 정렬, 한자 지식 세 가지 트랙에서 성능을 평가합니다.
본 논문은 AI 생성 비디오(AIGC-V)의 현실성 증가에 따라, 기존 인공물 중심 탐지 방식에서 의미론적 검증으로 패러다임을 전환할 것을 제안합니다. '사실 충실도 검증'을 핵심 목표로 설정하고, 시각-언어 이중 관점 프레임워크를 통해 AIGC-V 탐지를 체계화했습니다.
본 논문은 멀티모달 RAG 시스템이 오염된 근거 자료로 인해 신뢰할 수 없는 정보를 반환하는 문제를 다룹니다. 이를 해결하기 위해 'QIMG-7'이라는 통제된 벤치마크를 제시하고, 소스 인식 신뢰 해상도(SATR)라는 새로운 접근 방식을 제안했습니다. 이 방법은 무조건적인 멀티모달 융합보다 선택적 신뢰 기반의 답변 생성을 지지합니다.
본 논문은 LLM 정렬에 사용되는 On-Policy Self-Distillation(OPSD)의 병리 현상인 '사고 붕괴(Thinking Collapse)'를 정의하고 분석합니다. 이 붕괴는 모델의 중간 추론 능력이 급격히 저하되는 최적화 트랩입니다. 연구진은 이를 해결하기 위해 Adaptive Dual-Perspective OPSD (AD-OPSD)라는 새로운 제어 프레임워크를 제안했습니다.
본 논문은 오픈 도메인 다단계 질의응답(QA)에서 발생하는 복잡한 최종 답변 선택 문제를 해결하기 위한 'STEC' 프레임워크를 제안합니다. STEC는 검색 궤적을 직접 비교하는 대신, 후보별 증거 압축과 증거 기반 검증 메커니즘을 사용하여 신뢰성 높은 최종 답변을 선택할 수 있게 합니다.
본 논문은 요약 모델의 성능 평가를 위해 단순한 표면적 지표(ROUGE)를 넘어선 추상성 메트릭을 제안합니다. Reference Abstraction (RA), Summary Abstraction (SA), 그리고 Abstraction Ratio (AR)라는 세 가지 원칙적인 휴리스틱 메트릭을 공식화했습니다. 이 메트릭들은 요약문이 원본 텍스트의 추출적 복사로부터 얼마나 벗어나는지를 정량적으로 측정합니다.
본 연구는 공적 담론 분석 시 사용되는 LLM 기반 입장 분석의 불안정성 원인을 정량적으로 탐구했습니다. YouTube 인터뷰 데이터를 활용하여 전처리 파이프라인과 하류 측정 도구가 결과에 미치는 영향을 비교 분석했습니다. 그 결과, 특정 화자에게 민감도가 집중되며, 방법론 간 불일치가 크지만, 최종 집계된 가치 비율은 매우 안정적임을 밝혀냈습니다.
Mach-Mind-4-Flash는 35B MoE 에이전트 모델로, 활성화 파라미터가 3B에 불과함에도 불구하고 100B급 모델 이상의 성능을 달성했습니다. 이 모델은 RL/OPD 훈련 인프라와 Multi-Teacher On-Policy Distillation(MOPD) 같은 최적화 기법을 통해 높은 효율성과 강력한 에이전트 능력을 입증했습니다.
본 논문은 LLM이 장문 컨텍스트를 효과적으로 활용하는 데 어려움을 겪는 문제를 지적하며, 테스트 시간 학습(TTT)의 한계를 극복한 Self-Guided TTT (S-TTT) 방법을 제안합니다. S-TTT는 모델이 적응하기 전에 관련성 높은 증거 스팬을 스스로 식별하여, 선택된 스팬에만 언어 모델링 훈련 목표를 적용하는 방식입니다. 이 방법은 LongBench-v2와 LongBench-Pro에서 최대 15%의 성능 향상을 입증했습니다.
본 연구는 다국어 시각적 객관식 문항(Visual MCQ) 환경에서 소형 VLM의 추론 능력을 향상시키는 테스트 시간 스케일링(TTS) 효과를 분석했습니다. Qwen2.5-VL-7B-Instruct와 Qwen3.5-4B 모델을 사용하여 self-consistency, PRM-guided beam search 등 여러 기법을 비교한 결과, 가장 큰 성능 향상은 복잡한 검색/검증 메커니즘이 아닌 '정책 모델 자체'의 개선에서 나왔음을 밝혀냈습니다.
독립적이고 오픈소스인 MoE 하이브리드 Mamba Transformer 기반 모델 Soofi S 30B-A3B가 독일어와 영어용으로 발표되었습니다. 이 모델은 토큰당 적은 매개변수만 활성화하여 장문 컨텍스트 및 고부하 환경에서 높은 처리량을 제공합니다. 특히 유럽의 여러 기준선 대비 뛰어난 성능을 보여주며, 완전 공개된 모델 중 최고 수준의 평가 점수를 달성했습니다.
본 논문은 언어 모델의 표현 분산에 대한 새로운 이론적 관점을 제시합니다. 클래스 내 분산을 '정보 저장소'로 해석하고, 거대 카테고리 구조가 차지하는 정보 비중이 매우 낮음을 분석했습니다. 특히 토큰 내 컨텍스트가 대부분의 정보를 담당하며, 이와 관련된 하한선(converse floor) 법칙을 증명하여 모델의 작동 원리를 설명합니다.
본 연구는 저자 판별(Authorship verification) 증거 강도를 정량화하는 방법을 제시하며, 기존 방법이 요구하던 별도의 보정 모델 없이 우도비(likelihood ratios)를 도출할 수 있는 두 가지 새로운 정규화 기법을 제안합니다. 이 기법들은 특히 긴 텍스트에서 발생할 수 있는 과대평가를 완화하여 법의학적 분석의 접근성과 투명성을 높입니다.
Freya-TTS는 높은 신뢰성과 효율성을 갖춘 대화형 합성 TTS 모델입니다. 1억 8,320만 개의 파라미터를 가진 DiT 기반으로 작동하며, 터키어에 최적화되어 있습니다. 이 모델은 자원 제한적인 환경에서도 실시간 성능을 보여주며, 오픈 소스로 공개되었습니다.
본 논문은 8개 유형론적으로 다양한 언어에 걸쳐 관용적이고 비유적인 의미를 포착하는 개념 네트워크 기반 프레임워크를 제시합니다. 이 프레임워크는 인지-언어학적 특징을 활용하여 관용구가 언어가 아닌 개념 스키마에 따라 군집화됨을 밝혀냈습니다. 교차 언어 전이 실험 결과, 개념적 근접성만으로 높은 번역 등가물을 식별할 수 있음을 입증했습니다.
본 논문은 QANTA 2026 공동 챌린지를 위해 작업별 멀티모달 질의응답(EMM-QA) 에이전트 아키텍처를 제안합니다. 이 시스템은 불확실성 속 답변 결정(Tossup)과 정확한 증거 기반 선택(Bonus)이라는 두 가지 과제를 다룹니다. 특히, 신뢰도 보정 및 도메인 특화 추론 정책에 중점을 둔 경량의 에이전트 전략을 통해 높은 성능을 달성했습니다.
본 연구는 영어 중심의 바이트 레벨 토크나이저가 벵골어와 같은 형태론적으로 풍부한 언어에서 자기회귀적 붕괴를 유발하는 문제를 분석했습니다. 이를 해결하기 위해 네이티브 스크립트 기반의 BanglaBERT WordPiece 어휘집을 이식하고 임베딩 행렬 크기를 조정하는 새로운 파이프라인을 제안합니다. 그 결과, WER과 RTF 측면에서 높은 성능 개선을 입증하며 크로스 스크립트 적응에 활용 가능한 청사진을 제시했습니다.
본 논문은 LLM 에이전트의 추론 능력 향상을 위해 경매 메커니즘을 도입한 프레임워크 Agora를 제안합니다. 기존 방식들이 단순 매칭에 의존하는 한계를 극복하고, 작업을 전문가 모델 및 도구에 동적으로 할당하여 가장 유능한 솔버에게 라우팅되도록 합니다.
LLM-as-Judge의 신뢰성은 평가자 변경에 따라 측정값이 달라지는 '평가자 교체 모호성' 문제를 안고 있습니다. 본 연구는 다양한 판단 데이터셋에서 Qwen3 모델 확장 및 MiniMax API 이동 등 두 가지 업그레이드 경로를 비교 분석했습니다. 그 결과, 더 강력한 평가자가 위치 편향과 장황함 편향을 줄이기는 하지만 완전히 제거하지 못하며, 보고서에 상세한 감사 추적 기록이 필요함을 강조합니다.