Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
MLLM의 차트 설명 능력을 평가하기 위해 새로운 벤치마크인 ChartFI-Bench를 제안합니다. 기존 벤치마크의 한계를 극복하고자 사실적 정확성과 통찰력을 포함한 4가지 차원과 새로운 평가 지표를 설계했습니다.
약한 레이블 벤치마크에서 모델의 성능이 증거에 기반한 것인지, 아니면 메타데이터의 통계적 편향에 의한 것인지 구분하는 새로운 감사 프로토콜을 제안합니다. MPDS와 ΔEvi 지표를 결합하여 메타데이터 예측 가능성과 실제 증거 의존성을 분리하여 측정할 것을 강조합니다.
본 논문은 문맥화된 단어 임베딩에서 명사와 문맥 간의 의미 유형 불일치 및 강제 현상을 분석하기 위한 그래프 기반 방법론을 제안합니다. BERT와 의미 강화 임베딩을 활용해 그래프를 구축하고, 새로운 지표인 NTP와 NTE를 통해 의미 유형 분포를 효과적으로 분석할 수 있음을 입증했습니다.
언어 모델의 임베딩 내에서 상위어 관계(Hypernymy)가 기하학적으로 어떻게 인코딩되는지 분석합니다. 단어 공생 통계가 임베딩 Gram 행렬의 스펙트럼 구조를 통해 계층적 분할 기하학을 생성함을 이론적·경험적으로 증명합니다.
LLM 사전 학습 시 지식 증류(Knowledge Distillation)에서 교사 모델의 성능과 학생 모델 간의 관계를 연구했습니다. 연구 결과, 교사가 반드시 강력할 필요는 없으며 오히려 과도하게 강력한 교사가 증류 효과를 저해할 수 있음을 발견했습니다.
긴 영상 질의응답을 위해 쿼리를 도구 호출로 분해하고 병합하는 ToolMerge 방법론을 제안합니다. LLM 기반 플래너와 불리언 연산자를 사용하여 키프레임을 검색하며, 새로운 벤치마크인 M2M을 통해 성능을 검증했습니다.
ETCHR은 MLLM의 시각적 추론 능력을 향상시키기 위해 이미지 편집 모델을 분리하여 사용하는 새로운 패러다임을 제안합니다. 질문 조건부 및 추론 인지적 편집을 통해 미세한 인지나 시점 변환이 필요한 복잡한 추론 문제를 해결합니다.
셀프 플레이 강화학습의 불안정성과 붕괴 원인을 분석하여, 보상 설계보다 데이터 게이팅의 중요성을 입증한 연구입니다. 실험을 통해 엄격한 데이터 게이팅이 보상 변형보다 학습 안정성 유지에 더 결정적인 역할을 함을 밝혀냈습니다.
2013년부터 2024년까지 10년간 수집된 252,487개의 아랍어 Facebook 게시물로 구성된 '아랍 여성과 사회 코퍼스'를 소개합니다. 이 데이터셋은 아랍어 방언과 젠더 담론, 사회적 웰빙에 대한 대규모 분석을 지원합니다.
개인의 인지적, 정서적, 직관적 사고 패턴에 맞춰 적응형 의사결정을 지원하는 대화형 에이전트 'Reflecti-Mate'를 제안합니다. 연구 결과, 이 에이전트는 기존 시스템보다 더 개인화된 성찰과 통합적인 사고 과정을 촉진하는 것으로 나타났습니다.
본 연구는 혐오 표현과 오정보가 결합된 맥락에서 LLM을 활용한 보조적 대응 발언(Counterspeech) 생성 전략을 제안합니다. 세 가지 지식 기반 프롬프팅 전략을 테스트하고 전문가의 편집을 통해 효과를 검증하였으며, 관련 데이터셋을 공개합니다.
온라인 담론 내 사회적 결속과 갈등을 분석하기 위한 아랍어 데이터셋 Cohesion-6K를 소개합니다. 6,000개의 Facebook 게시물을 5가지 담론 범주로 분류하였으며, 갈등 지향적 게시물이 더 높은 참여를 유도한다는 분석 결과를 제시합니다.
본 연구는 다중 화자 환경에서 발생하는 인지적 병목 현상을 해결하기 위해 RAMPHO 버퍼의 인 실리코 시뮬레이션을 제안합니다. wav2vec 2.0의 음성 엔트로피를 활용하여 정보적 마스킹과 에너지적 마스킹을 분리하고, 인지-음향적 파레토 최적화 문제를 분석합니다.
엔티티 추적을 위해 어텐션의 구조적 희소성을 활용한 새로운 블록 단위 평가 방식을 제안합니다. 이 방식은 밀집 연산자의 정확도를 유지하면서도 연산 복잡도를 아임계(subquadratic) 수준으로 낮추어 실행 시간을 단축합니다.
뱅골어와 같은 저자원 언어에서 발생하는 경어법 오류를 해결하기 위해 큐레이션된 BLADE 데이터셋과 벤치마킹 프레임워크를 제안합니다. DeepSeek-8B 및 LLaMA-3.2-3B 모델을 LoRA로 미세 조정하여 화용론적 격차를 개선하는 연구를 다룹니다.
시각적 저하 상황에서도 견고한 공간 지능을 평가하기 위한 새로운 벤치마크 SpaceDG를 소개합니다. 3DGS 기반 물리 엔진을 통해 9가지 저하 유형을 시뮬레이션하며, MLLM의 공간 추론 성능 격차를 확인하고 미세 조정을 통한 개선 가능성을 제시합니다.
지시문 임베딩 모델 평가 시 단일 프롬프트만을 사용하는 방식의 한계를 지적합니다. 연구 결과, 프롬프트 문구에 따른 성능 편차가 커서 기존 리더보드 순위가 신뢰하기 어렵다는 점을 밝혀냈습니다.
에이전트의 안전성을 평가하기 위해 점진적 공격을 활용한 멀티턴 벤치마크인 'Boiling the Frog'를 제안합니다. 기존 텍스트 중심 평가를 넘어, 에이전트가 환경 내에서 수행하는 행동과 상태 변화를 기반으로 위험성을 측정합니다.
LANG은 다국어 문맥에서 LLM의 추론 성능과 언어 일관성 사이의 트레이드오프를 해결하기 위한 새로운 강화학습 프레임워크입니다. 언어 조건부 힌트와 점진적 감쇠 스케줄을 통해 영어로의 언어 드리프트 현상을 방지하고 다국어 추론 능력을 향상시킵니다.
미국 AI 실행 계획에 대한 공공 의견을 분석하여 이해관계자별 AI 인식을 조사한 연구입니다. 토픽 모델링을 통해 학계, 개인, 민간 부문의 관점 차이를 규명하고 정책 반영의 불균형을 지적합니다.