Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 검색 에이전트가 낮은 품질의 증거에 취약하다는 문제점을 지적하며, 이를 해결하기 위한 스트레스 테스트 프레임워크인 DeepStress를 제안합니다. 이 프레임워크는 문서 신뢰성, 관련성, 사실성을 조절하여 까다로운 환경에서 검색 에이전트의 성능을 체계적으로 평가할 수 있게 합니다.
본 논문은 Aspect 기반 감성 분석(ABSA)의 어려움인 반사실적 평가 문제를 해결하기 위해 CAVE-ABSA 프레임워크를 제안합니다. 이 프레임워크는 목표 측면에 관련된 의견 구역을 국소화하고, 복구 모듈과 다중 검증 기법을 통해 후보 문장을 정제하여 의미적으로 유효한 반사실적 예시를 생성하는 것이 핵심입니다.
본 연구는 LLMs이 과제와 무관한 컨텍스트가 풍부한 환경에서도 집계적으로는 강건해 보이지만, 실제로는 예시별로 큰 불안정성을 가질 수 있음을 발견했습니다. 특히 문법적 의미가 없는 의사 단어 같은 요소도 모델 예측을 크게 변화시켜 성능 저하 또는 향상을 초래합니다. 이는 LLM의 신뢰성 평가에 대한 새로운 관점을 제시합니다.
본 연구는 대규모 언어 모델(LLM)의 '인식론적 입장 유연성'을 측정하는 새로운 벤치마크 ESFP를 제안했습니다. 이 벤치마크는 외부 귀속과 자기 귀속 프롬프트 간의 차이를 분석하여, 모델이 주장에 대한 믿음이나 전문가의 믿음을 구분하고 일관되게 응답하는 능력을 평가합니다. 연구 결과, 인식론적 유연성은 일반적인 모델 능력과는 독립적으로 작동함을 확인했습니다.
본 논문은 LLM 기반 에이전트 시스템의 실패 원인 규명(Failure attribution) 문제를 다루며, 기존 방식의 높은 비용과 낮은 확장성 문제를 해결하고자 합니다. 연구진은 성공적인 궤적만을 사용하여 학습하고 추론 시점에 오류 단계를 식별하는 비지도 접근법 OAT를 제안했습니다. OAT는 신경 제어 미분 방정식 기반 원클래스 학습을 통해 잠재 공간에서 정상 동역학 패턴을 모델링하여, 실패 궤적이 이 패턴에서 얼마나 벗어났는지로 이상치 점수를 계산합니다.
본 논문은 대규모 파라미터의 멀티모달 감정 언어 모델(MLLMs)이 필수적인지에 의문을 제기하며, 지식 증류를 통해 경량화된 MER 프레임워크인 Light-MER를 제안합니다. 이 방법은 거대 교사 모델의 지식을 서브-10억 파라미터 학생 모델로 전이하여, 높은 감정 인식 성능과 뛰어난 배포 효율성을 동시에 달성하는 것을 목표로 합니다.
본 논문은 대규모 언어 모델(LLMs)의 화학 지능 강화를 위해 반응 메커니즘 학습의 중요성을 강조합니다. 기존 LLM들이 거시적 예측에 머물러 환각 문제를 겪는 한계를 극복하고자, 새로운 대규모 추론 데이터셋과 FukuyamaBench라는 까다로운 벤치마크를 구축했습니다. 이를 통해 Qwen3-30B-A3B 모델이 메커니즘 인지 학습을 거쳐 높은 정확도를 달성했음을 입증했습니다.
본 논문은 자체 개선 LLM 에이전트 시스템의 핵심 문제인 '신뢰할 수 있는 평가 지표 부재'에 대한 새로운 접근 방식을 제시합니다. 제안된 방법론은 지표 자체를 진화시키고, 자의 기준(arbitrary criteria)을 통해 정확한 지표를 복구하며, 외부 감사와 기준 준수 메커니즘을 통해 안전성을 확보하는 것을 목표로 합니다.
본 연구는 언어 모델이 내재된 지식에 과도하게 의존하는 문제를 해결하기 위해 Knowledge--''Less'' Language Models (KLLMs)를 제안합니다. KLLMs는 개체명 익명화 코퍼스에서 사전 학습되어, 사실적 지도 학습 경로를 제거함으로써 폐쇄형 회상을 줄이고 문맥 기반 추론 능력을 강화했습니다. 이 모델은 검색 증강 환경에서 높은 견고성과 신뢰성을 보여줍니다.
본 연구는 언어 모델이 주어진 선택지들 중 하나의 답을 골라야 할 때, 모델들이 어떤 단어를 선호하고 얼마나 일치하는지를 분석했습니다. 44개 모델에게 '아무 단어로도' 질문했을 때, 상당수의 모델이 'serendipity'를 선택하는 수렴 현상을 발견했습니다.
본 기사는 Diffusion large language models (dLLMs)가 가진 이론적 병렬 생성 이점을 실제 속도 향상으로 구현하는 데 필요한 효율적인 추론 메커니즘을 조사합니다. 특히, 확산 인식 캐싱과 같은 특화된 기술의 중요성을 강조하며, 통합 지연 시간 분해 프레임워크를 제시하여 알고리즘, 아키텍처, 시스템 수준의 가속화 요인을 체계적으로 분석하고 재현 가능한 벤치마킹 방법을 제안합니다.
본 연구는 LLM 기반 연구 에이전트의 개방형 출력을 평가하는 루브릭 생성에 대한 체계적인 메타 평가를 제시합니다. 논문 재현 분야에서 특히 유용한 이 접근 방식은, 루브릭을 체크리스트 형식으로 재구성하고 다양한 설정을 테스트했습니다. 그 결과, 증강된 설정이 다운스트림 평가 정렬을 개선하며 인간 기준선에 근접함을 확인했지만, LLM 생성 루브릭의 한계점도 함께 제시했습니다.
본 논문은 의료 대화에서 환자의 오개념(misconception)을 식별하고 교정하는 LLM의 능력을 평가하기 위해 ThReadMed-QA 데이터셋을 소개합니다. 실험 결과, 최신 모델들도 다중 턴 컨텍스트가 진행됨에 따라 오개념 교정 성능이 크게 저하되는 경향을 보였습니다. 이는 오류 전파(error propagation) 문제가 심각함을 시사하며, 지속적인 평가 프레임워크의 필요성을 강조합니다.
본 논문은 LLM 에이전트의 장기 기억을 단순한 사실 집합이 아닌, '기억-망각-업데이트' 등의 명시적 연산 생애 주기로 정의합니다. 이를 평가하기 위해 MemOps라는 새로운 벤치마크를 제안하며, 메모리 이벤트를 구조화된 추적으로 표현하여 다양한 실패 모드를 진단할 수 있게 합니다.
본 논문은 정답(ground-truth)이 없는 환경에서 LLM 심사관의 신뢰성을 평가했습니다. 실험 결과, 참조 답변이 없을 때 심사 모델들이 부정확한 답변을 과대평가하는 경향을 보였습니다. 또한, 프롬프트에 참조 정보를 추가하면 심사 모델의 판단이 크게 개선됨을 입증했습니다.
본 연구는 LLM에서 언어의 '생성(Production)'과 '인식(Perception)' 간의 비대칭성을 탐구했습니다. 기존에는 동일한 다음 토큰 예측 메커니즘에 의존한다고 여겨졌으나, 직접적인 토큰 확률 측정을 통해 두 과정의 차이를 작동화했습니다. 실험 결과, 생성-인식 거리가 생성-생성 거리보다 유의미하게 크게 나타났습니다.
본 논문은 언어 모델의 다국어적이고 문화적인 도덕 추론 능력을 향상시키는 방법을 제시합니다. MCLASH라는 새로운 벤치마크를 소개하고, 심리학 및 철학 기반의 이론적 근거(grounds)를 활용하는 MET 프롬프팅 기법을 제안했습니다. 또한 자체 증류(self-distillation) 방법인 MET-D를 통해 모델 성능을 개선하여 문화 정렬된 다국어 도덕 추론에 기여합니다.
본 논문은 대규모의 비정형 이력서 기반 경력 궤적 데이터셋인 JobHop v2를 제시합니다. 이는 VDAB에서 제공한 다국어 이력서 말뭉치로부터 LLM 추출을 통해 구축되었으며, $355,315$개의 경력 궤적을 포함합니다. JobHop v2는 원래 버전보다 커버리지와 주석 풍부도를 확장하고, 개선된 추론 파이프라인과 평가 프로토콜을 도입하여 연구 재현성을 높였습니다.
본 논문은 이력서와 같은 비정형 데이터를 활용하여 시간적 및 교육적 신호를 포착하고, 다음 직업을 예측하는 새로운 경력 경로 추천 시스템 STEP을 제안합니다. STEP은 GRU 셀과 어텐션 기반 시퀀스 풀링을 사용하여 시간적 동역학을 모델링하며, ROUTE라는 두 단계의 대비 절차를 통해 내부 직업 표현을 개선했습니다.
본 연구는 RAG가 LLM 출력물에 미치는 이념적 편향의 영향을 다룹니다. COVID-19 치료 기사 코퍼스를 활용하여 세 가지 이념적 담론을 식별하고, 다양한 샘플링 온도에서 모델들이 이념적 질문에 답변하도록 평가했습니다. 연구 결과, RAG는 이념적 담론을 전이하는 경향이 있으며, 샘플링 온도가 이러한 전이 강도에 측정 가능한 영향을 미친다는 것을 보여줍니다.