Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 의료 대화에서 환자의 오개념(misconception)을 식별하고 교정하는 LLM의 능력을 평가하기 위해 ThReadMed-QA 데이터셋을 소개합니다. 실험 결과, 최신 모델들도 다중 턴 컨텍스트가 진행됨에 따라 오개념 교정 성능이 크게 저하되는 경향을 보였습니다. 이는 오류 전파(error propagation) 문제가 심각함을 시사하며, 지속적인 평가 프레임워크의 필요성을 강조합니다.
본 논문은 LLM 에이전트의 장기 기억을 단순한 사실 집합이 아닌, '기억-망각-업데이트' 등의 명시적 연산 생애 주기로 정의합니다. 이를 평가하기 위해 MemOps라는 새로운 벤치마크를 제안하며, 메모리 이벤트를 구조화된 추적으로 표현하여 다양한 실패 모드를 진단할 수 있게 합니다.
본 논문은 정답(ground-truth)이 없는 환경에서 LLM 심사관의 신뢰성을 평가했습니다. 실험 결과, 참조 답변이 없을 때 심사 모델들이 부정확한 답변을 과대평가하는 경향을 보였습니다. 또한, 프롬프트에 참조 정보를 추가하면 심사 모델의 판단이 크게 개선됨을 입증했습니다.
본 연구는 LLM에서 언어의 '생성(Production)'과 '인식(Perception)' 간의 비대칭성을 탐구했습니다. 기존에는 동일한 다음 토큰 예측 메커니즘에 의존한다고 여겨졌으나, 직접적인 토큰 확률 측정을 통해 두 과정의 차이를 작동화했습니다. 실험 결과, 생성-인식 거리가 생성-생성 거리보다 유의미하게 크게 나타났습니다.
본 논문은 언어 모델의 다국어적이고 문화적인 도덕 추론 능력을 향상시키는 방법을 제시합니다. MCLASH라는 새로운 벤치마크를 소개하고, 심리학 및 철학 기반의 이론적 근거(grounds)를 활용하는 MET 프롬프팅 기법을 제안했습니다. 또한 자체 증류(self-distillation) 방법인 MET-D를 통해 모델 성능을 개선하여 문화 정렬된 다국어 도덕 추론에 기여합니다.
본 논문은 대규모의 비정형 이력서 기반 경력 궤적 데이터셋인 JobHop v2를 제시합니다. 이는 VDAB에서 제공한 다국어 이력서 말뭉치로부터 LLM 추출을 통해 구축되었으며, $355,315$개의 경력 궤적을 포함합니다. JobHop v2는 원래 버전보다 커버리지와 주석 풍부도를 확장하고, 개선된 추론 파이프라인과 평가 프로토콜을 도입하여 연구 재현성을 높였습니다.
본 논문은 이력서와 같은 비정형 데이터를 활용하여 시간적 및 교육적 신호를 포착하고, 다음 직업을 예측하는 새로운 경력 경로 추천 시스템 STEP을 제안합니다. STEP은 GRU 셀과 어텐션 기반 시퀀스 풀링을 사용하여 시간적 동역학을 모델링하며, ROUTE라는 두 단계의 대비 절차를 통해 내부 직업 표현을 개선했습니다.
본 연구는 RAG가 LLM 출력물에 미치는 이념적 편향의 영향을 다룹니다. COVID-19 치료 기사 코퍼스를 활용하여 세 가지 이념적 담론을 식별하고, 다양한 샘플링 온도에서 모델들이 이념적 질문에 답변하도록 평가했습니다. 연구 결과, RAG는 이념적 담론을 전이하는 경향이 있으며, 샘플링 온도가 이러한 전이 강도에 측정 가능한 영향을 미친다는 것을 보여줍니다.
AdvancedMathBench는 LLM의 고급 수학적 추론 능력을 평가하기 위해 설계된 새로운 벤치마크 스위트입니다. 이 스위트는 학부 및 박사 수준의 문제를 포함하는 ProverBench와 증명 검증 능력을 측정하는 VerifierBench로 구성되어 있습니다. 실험 결과, 최신 모델들도 고급 수학 증명 생성과 오류 감지에서 여전히 상당한 개선이 필요함을 보여주었습니다.
본 논문은 2026 NLPCC 컨퍼런스에서 열릴 'ChineseBabyLM' 챌린지를 소개합니다. 이 챌린지는 연구자들에게 단 1억 개의 중국어 토큰으로 언어 모델을 처음부터 훈련하도록 요구하며, NLU, 인지적 정렬, 한자 지식 세 가지 트랙에서 성능을 평가합니다.
본 논문은 AI 생성 비디오(AIGC-V)의 현실성 증가에 따라, 기존 인공물 중심 탐지 방식에서 의미론적 검증으로 패러다임을 전환할 것을 제안합니다. '사실 충실도 검증'을 핵심 목표로 설정하고, 시각-언어 이중 관점 프레임워크를 통해 AIGC-V 탐지를 체계화했습니다.
본 논문은 멀티모달 RAG 시스템이 오염된 근거 자료로 인해 신뢰할 수 없는 정보를 반환하는 문제를 다룹니다. 이를 해결하기 위해 'QIMG-7'이라는 통제된 벤치마크를 제시하고, 소스 인식 신뢰 해상도(SATR)라는 새로운 접근 방식을 제안했습니다. 이 방법은 무조건적인 멀티모달 융합보다 선택적 신뢰 기반의 답변 생성을 지지합니다.
본 논문은 LLM 정렬에 사용되는 On-Policy Self-Distillation(OPSD)의 병리 현상인 '사고 붕괴(Thinking Collapse)'를 정의하고 분석합니다. 이 붕괴는 모델의 중간 추론 능력이 급격히 저하되는 최적화 트랩입니다. 연구진은 이를 해결하기 위해 Adaptive Dual-Perspective OPSD (AD-OPSD)라는 새로운 제어 프레임워크를 제안했습니다.
본 논문은 오픈 도메인 다단계 질의응답(QA)에서 발생하는 복잡한 최종 답변 선택 문제를 해결하기 위한 'STEC' 프레임워크를 제안합니다. STEC는 검색 궤적을 직접 비교하는 대신, 후보별 증거 압축과 증거 기반 검증 메커니즘을 사용하여 신뢰성 높은 최종 답변을 선택할 수 있게 합니다.
본 논문은 요약 모델의 성능 평가를 위해 단순한 표면적 지표(ROUGE)를 넘어선 추상성 메트릭을 제안합니다. Reference Abstraction (RA), Summary Abstraction (SA), 그리고 Abstraction Ratio (AR)라는 세 가지 원칙적인 휴리스틱 메트릭을 공식화했습니다. 이 메트릭들은 요약문이 원본 텍스트의 추출적 복사로부터 얼마나 벗어나는지를 정량적으로 측정합니다.
본 연구는 공적 담론 분석 시 사용되는 LLM 기반 입장 분석의 불안정성 원인을 정량적으로 탐구했습니다. YouTube 인터뷰 데이터를 활용하여 전처리 파이프라인과 하류 측정 도구가 결과에 미치는 영향을 비교 분석했습니다. 그 결과, 특정 화자에게 민감도가 집중되며, 방법론 간 불일치가 크지만, 최종 집계된 가치 비율은 매우 안정적임을 밝혀냈습니다.
Mach-Mind-4-Flash는 35B MoE 에이전트 모델로, 활성화 파라미터가 3B에 불과함에도 불구하고 100B급 모델 이상의 성능을 달성했습니다. 이 모델은 RL/OPD 훈련 인프라와 Multi-Teacher On-Policy Distillation(MOPD) 같은 최적화 기법을 통해 높은 효율성과 강력한 에이전트 능력을 입증했습니다.
본 논문은 LLM이 장문 컨텍스트를 효과적으로 활용하는 데 어려움을 겪는 문제를 지적하며, 테스트 시간 학습(TTT)의 한계를 극복한 Self-Guided TTT (S-TTT) 방법을 제안합니다. S-TTT는 모델이 적응하기 전에 관련성 높은 증거 스팬을 스스로 식별하여, 선택된 스팬에만 언어 모델링 훈련 목표를 적용하는 방식입니다. 이 방법은 LongBench-v2와 LongBench-Pro에서 최대 15%의 성능 향상을 입증했습니다.
본 연구는 다국어 시각적 객관식 문항(Visual MCQ) 환경에서 소형 VLM의 추론 능력을 향상시키는 테스트 시간 스케일링(TTS) 효과를 분석했습니다. Qwen2.5-VL-7B-Instruct와 Qwen3.5-4B 모델을 사용하여 self-consistency, PRM-guided beam search 등 여러 기법을 비교한 결과, 가장 큰 성능 향상은 복잡한 검색/검증 메커니즘이 아닌 '정책 모델 자체'의 개선에서 나왔음을 밝혀냈습니다.
독립적이고 오픈소스인 MoE 하이브리드 Mamba Transformer 기반 모델 Soofi S 30B-A3B가 독일어와 영어용으로 발표되었습니다. 이 모델은 토큰당 적은 매개변수만 활성화하여 장문 컨텍스트 및 고부하 환경에서 높은 처리량을 제공합니다. 특히 유럽의 여러 기준선 대비 뛰어난 성능을 보여주며, 완전 공개된 모델 중 최고 수준의 평가 점수를 달성했습니다.