Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 다국어 교육 환경에서 고차 질문 생성을 목표로 합니다. Bloom의 분류학에 국한되었던 기존 연구와 달리, Basque, Spanish, English 세 언어를 사용하며 Claim-Evidence-Reasoning 및 Divergent Questioning 프레임워크를 도입했습니다. 그 결과, LLM이 다양한 구조적/개념적 질문을 생성했으나, 고차 질문으로 인식되는 비율은 절반 수준에 머물렀습니다.
본 글은 LLM의 예측 능력을 평가하는 기존 백테스팅 방식의 한계를 지적합니다. 정보가 누출되는 두 가지 경로(검색 및 훈련 데이터)를 차단한 새로운 방법론 'Hindcast'를 제안합니다. Hindcast는 특정 과거 시점($t_0$)의 시장 스냅샷과 비교하여 모델이 오직 그 이전 정보만을 기반으로 예측하도록 평가함으로써, 진정한 통찰력을 측정할 수 있습니다.
본 논문은 MLLMs의 진실성 부족 문제를 해결하기 위한 새로운 프레임워크 Groc-PO를 제안합니다. 기존 DPO는 최종 답변 수준에서 선호도 최적화를 적용하여 초기 근거 단계의 오류 전파를 막기 어렵다는 한계가 있었습니다. Groc-PO는 객체, 컨텍스트, 추론 등 다단계 근거 단계를 명시적으로 지도하여 신뢰성 있는 멀티모달 추론을 강화합니다.
본 연구는 LLM의 사후 훈련(SFT, RL, OPD)이 최종 답변 정확도뿐 아니라 추론 과정 중 신뢰도에 미치는 영향을 분석했습니다. CoT 전/중/후를 평가하는 3단계 보정 프레임워크를 도입하여, 각 단계별 최적의 신뢰도 활용 방안을 제시합니다.
본 논문은 저자원 NLP 환경에서 언어와 태스크 적응을 효율적으로 수행하는 $\Delta$MergeLowRes를 제안합니다. 이는 언어 델타($\Delta_L$)와 태스크 델타($\Delta_T$)를 분리 학습한 후, 네 가지 새로운 규칙(cross-axis TIES 등)에 따라 가중치 공간에서 재결합하는 방식을 제시합니다. 실험 결과, 이 방법은 요약 및 QA 성능을 크게 향상시키고 분류의 ECE 감소 효과도 입증했습니다.
본 논문은 멀티모달 에이전트가 여러 단계에 걸쳐 도구를 호출하고 사고하는 과정을 효율적으로 학습하기 위한 새로운 프레임워크 SPyCE를 제안합니다. SPyCE는 추론 궤적을 재사용 가능한 스킬 라이브러리로 증류하고, 이 스킬과 정책 모델이 강화학습 과정에서 공동으로 진화하도록 설계되었습니다.
본 연구는 에이전트 최적화 이득의 지속성 문제를 다루며, 기존 방법들이 단일 벤치마크에만 국한된 성능 향상을 보인다고 지적합니다. Terminal-Bench 2.0을 사용한 두 단계 지속 학습 평가 결과, RELAI-VCL만이 새로운 작업에도 긍정적으로 전이되고 최적화 이득이 누적됨을 입증했습니다.
본 연구는 검색 에이전트가 낮은 품질의 증거에 취약하다는 문제점을 지적하며, 이를 해결하기 위한 스트레스 테스트 프레임워크인 DeepStress를 제안합니다. 이 프레임워크는 문서 신뢰성, 관련성, 사실성을 조절하여 까다로운 환경에서 검색 에이전트의 성능을 체계적으로 평가할 수 있게 합니다.
본 논문은 Aspect 기반 감성 분석(ABSA)의 어려움인 반사실적 평가 문제를 해결하기 위해 CAVE-ABSA 프레임워크를 제안합니다. 이 프레임워크는 목표 측면에 관련된 의견 구역을 국소화하고, 복구 모듈과 다중 검증 기법을 통해 후보 문장을 정제하여 의미적으로 유효한 반사실적 예시를 생성하는 것이 핵심입니다.
본 논문은 모바일 기기 환경에 최적화된 네이티브 온디바이스 에이전트 프레임워크인 PalmClaw를 소개합니다. 기존의 GUI 기반 제어 방식의 한계를 극복하고, 장치 기능을 명시적인 '장치 도구'로 노출하여 에이전트가 모바일 기능을 직접적이고 제어 가능하게 사용할 수 있도록 설계되었습니다.
본 연구는 LLMs이 과제와 무관한 컨텍스트가 풍부한 환경에서도 집계적으로는 강건해 보이지만, 실제로는 예시별로 큰 불안정성을 가질 수 있음을 발견했습니다. 특히 문법적 의미가 없는 의사 단어 같은 요소도 모델 예측을 크게 변화시켜 성능 저하 또는 향상을 초래합니다. 이는 LLM의 신뢰성 평가에 대한 새로운 관점을 제시합니다.
본 연구는 대규모 언어 모델(LLM)의 '인식론적 입장 유연성'을 측정하는 새로운 벤치마크 ESFP를 제안했습니다. 이 벤치마크는 외부 귀속과 자기 귀속 프롬프트 간의 차이를 분석하여, 모델이 주장에 대한 믿음이나 전문가의 믿음을 구분하고 일관되게 응답하는 능력을 평가합니다. 연구 결과, 인식론적 유연성은 일반적인 모델 능력과는 독립적으로 작동함을 확인했습니다.
본 논문은 LLM 기반 에이전트 시스템의 실패 원인 규명(Failure attribution) 문제를 다루며, 기존 방식의 높은 비용과 낮은 확장성 문제를 해결하고자 합니다. 연구진은 성공적인 궤적만을 사용하여 학습하고 추론 시점에 오류 단계를 식별하는 비지도 접근법 OAT를 제안했습니다. OAT는 신경 제어 미분 방정식 기반 원클래스 학습을 통해 잠재 공간에서 정상 동역학 패턴을 모델링하여, 실패 궤적이 이 패턴에서 얼마나 벗어났는지로 이상치 점수를 계산합니다.
본 논문은 대규모 파라미터의 멀티모달 감정 언어 모델(MLLMs)이 필수적인지에 의문을 제기하며, 지식 증류를 통해 경량화된 MER 프레임워크인 Light-MER를 제안합니다. 이 방법은 거대 교사 모델의 지식을 서브-10억 파라미터 학생 모델로 전이하여, 높은 감정 인식 성능과 뛰어난 배포 효율성을 동시에 달성하는 것을 목표로 합니다.
본 논문은 대규모 언어 모델(LLMs)의 화학 지능 강화를 위해 반응 메커니즘 학습의 중요성을 강조합니다. 기존 LLM들이 거시적 예측에 머물러 환각 문제를 겪는 한계를 극복하고자, 새로운 대규모 추론 데이터셋과 FukuyamaBench라는 까다로운 벤치마크를 구축했습니다. 이를 통해 Qwen3-30B-A3B 모델이 메커니즘 인지 학습을 거쳐 높은 정확도를 달성했음을 입증했습니다.
본 논문은 자체 개선 LLM 에이전트 시스템의 핵심 문제인 '신뢰할 수 있는 평가 지표 부재'에 대한 새로운 접근 방식을 제시합니다. 제안된 방법론은 지표 자체를 진화시키고, 자의 기준(arbitrary criteria)을 통해 정확한 지표를 복구하며, 외부 감사와 기준 준수 메커니즘을 통해 안전성을 확보하는 것을 목표로 합니다.
본 연구는 언어 모델이 내재된 지식에 과도하게 의존하는 문제를 해결하기 위해 Knowledge--''Less'' Language Models (KLLMs)를 제안합니다. KLLMs는 개체명 익명화 코퍼스에서 사전 학습되어, 사실적 지도 학습 경로를 제거함으로써 폐쇄형 회상을 줄이고 문맥 기반 추론 능력을 강화했습니다. 이 모델은 검색 증강 환경에서 높은 견고성과 신뢰성을 보여줍니다.
본 연구는 언어 모델이 주어진 선택지들 중 하나의 답을 골라야 할 때, 모델들이 어떤 단어를 선호하고 얼마나 일치하는지를 분석했습니다. 44개 모델에게 '아무 단어로도' 질문했을 때, 상당수의 모델이 'serendipity'를 선택하는 수렴 현상을 발견했습니다.
본 기사는 Diffusion large language models (dLLMs)가 가진 이론적 병렬 생성 이점을 실제 속도 향상으로 구현하는 데 필요한 효율적인 추론 메커니즘을 조사합니다. 특히, 확산 인식 캐싱과 같은 특화된 기술의 중요성을 강조하며, 통합 지연 시간 분해 프레임워크를 제시하여 알고리즘, 아키텍처, 시스템 수준의 가속화 요인을 체계적으로 분석하고 재현 가능한 벤치마킹 방법을 제안합니다.
본 연구는 LLM 기반 연구 에이전트의 개방형 출력을 평가하는 루브릭 생성에 대한 체계적인 메타 평가를 제시합니다. 논문 재현 분야에서 특히 유용한 이 접근 방식은, 루브릭을 체크리스트 형식으로 재구성하고 다양한 설정을 테스트했습니다. 그 결과, 증강된 설정이 다운스트림 평가 정렬을 개선하며 인간 기준선에 근접함을 확인했지만, LLM 생성 루브릭의 한계점도 함께 제시했습니다.