Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 멀티모달 과학 주장을 검증하기 위한 새로운 프레임워크 ToolSciVer를 제안합니다. ToolSciVer는 VLM에 표/차트 파싱, 영역 확대 등 세 가지 시각적 도구를 장착하여 복잡한 과학 자료에서 명시적인 증거를 추출합니다. 이 프레임워크는 GRPO 기반의 정책 학습을 통해 높은 정확도를 달성했습니다.
본 논문은 Muon을 사용하여 에이전트 기반 강화학습(RL)의 희소 보상 환경에 적용한 연구 결과를 제시합니다. Qwen2.5-0.5B-Instruct 모델과 ALFWorld에서 GiGPO 및 GraphGPO 등의 정책 최적화기를 활용하여, Muon이 AdamW 대비 높은 성능 향상을 보여주었음을 입증했습니다.
본 연구는 자율주행차(CAV)의 취약점 정보를 구조화된 위협 정보 표현(STIX)으로 변환하는 오픈 가중치 LLM을 평가했습니다. CAV 관련 CVE를 STIX, CWE, MITRE ATT&CK에 매핑한 데이터셋을 구축하고 다양한 LLM을 테스트하여 높은 성능을 확인했습니다. 이는 AI가 교통 보안 분야의 위협 인텔리전스 자동화 및 방어 우선순위 지정에 기여할 수 있음을 보여줍니다.
본 연구는 멀티모달 대규모 언어 모델(MLLMs)이 이미지 캡션 생성 시 발생하는 '체계적 불일치'를 감지하는 방법을 제시합니다. Symbal 시스템은 구조화된 설정을 활용하여 상용 기반 모델로 이러한 오류를 식별하고 자연어로 요약하며, SymbalBench라는 대규모 벤치마크를 통해 그 성능을 입증했습니다.
LLM 기반 에이전트가 실제 물리 세계에서 발생시킬 수 있는 위험(PD)과 단순 텍스트 콘텐츠 위험(CD)을 분리하여 탐지하는 연구를 제시합니다. 제안된 PRISM 모델은 은닉 상태 분석을 통해, 명시적 유해 키워드 없이도 물리적 위험 상황을 높은 정확도로 식별할 수 있음을 입증했습니다.
본 논문은 기존의 보안 에이전트 평가 방식이 실제 운영 환경의 비용 문제를 간과한다고 지적하며, '비용-성공률 관점'을 도입했습니다. 공격적인 Cybench와 방어적인 Splunk BOTS v1 챌린지를 통해 추론 및 도구 사용에 따른 비용 효율성을 분석합니다. 연구 결과는 레드팀과 블루팀 작업의 스케일링 영역이 다름을 보여주며, 경제적 효율성 측정의 중요성을 강조합니다.
SceneBind는 비전, 오디오, 언어의 세 가지 모달리티에 걸쳐 의미론적 이해와 3D 공간적 이해를 결합한 범모달 표현을 제시합니다. 이는 기존 모델이 부족했던 명시적인 공간 구조를 포착하여 객체 수준의 의미론과 공간 속성을 통합했습니다. 이를 통해 크로스모달 장면 검색 및 객체 접지 성능을 향상시키는 새로운 매칭 방식도 제안되었습니다.
AutoSynthesis는 자연어 연구 질문을 받아 자동 메타 분석을 수행하는 종단 간 다중 에이전트 시스템입니다. 이 시스템은 문헌 검색, 적격성 평가, 정량적 통계 추출 및 표준화된 효과 크기 계산까지 전 과정을 자동화합니다. 그 결과, 전문가가 수행한 수동 메타 분석과 높은 일치도를 보여주며 근거 기반 의사결정을 지원할 잠재력을 입증했습니다.
teLLMe는 도시 주행 데이터셋에서 탐색적 인과 분석을 수행하는 시스템입니다. 이 시스템은 구조화된 이벤트 테이블 기반으로, 인과 구조 학습(causal structure learning) 및 PC 알고리즘 등을 결합하여 복잡한 교통 현상의 인과 관계를 파악합니다. 자연어 질문을 구조화된 쿼리로 변환하고 '인과 카드'를 제공함으로써 가설 생성에 도움을 줍니다.
본 논문은 Atari Pong의 5가지 시각적 World Model 에이전트(DreamerV3 등)를 분석하고, 이들의 성능 저하 원인을 진단했습니다. 기존 모델들은 공의 사라짐이나 잘못된 움직임 같은 명확한 실패 사례를 보였습니다. 이에 따라 작업에 중요한 개념을 모델링하는 '개념 기반 공간 정규화(CGSReg)' 기법을 제안하여 World Model의 안정성을 개선함을 입증했습니다.
본 연구는 휴머노이드 로봇의 제어에 필요한 행동 기초 모델(BFM)의 스케일링 방법을 제시합니다. 학습 패러다임, 데이터 전략, 그리고 Humanoid Transformer 아키텍처 세 가지 핵심 요소를 조정하여 성능 향상을 입증했습니다. 이 접근 방식은 시뮬레이션 및 실제 환경에서 기존 대비 제어 충실도와 작업 일반화 측면에서 큰 개선을 보였습니다.
AI가 과학 연구의 주체로 참여하며 '연구의 산업화'를 가속화하고 있습니다. 이는 지식과 판단이 개인에게서 자동화된 파이프라인 모델로 전환됨을 의미합니다. 본 글은 AI 주도 과학이 제기하는 세대 전수 약화, 이론 불투명성, 피어 평가 붕괴 등 광범위한 구조적 질문들을 고찰합니다.
본 연구는 멀티모달 대규모 언어 모델(MLLMs)의 과학적 시각화(SciVis) 리터러시를 평가하기 위한 표준화된 벤치마크 테스트를 개발했습니다. 총 49개 항목으로 구성된 이 테스트는 6개의 MLLMs를 비교했으며, Gemini가 전반적으로 가장 강력한 성능을 보였습니다. MLLMs의 성능은 시각화 기법과 작업 유형에 따라 매우 불균일하며, 특히 정량적 추정이나 복잡한 해석에서 어려움을 겪었습니다.
T2MLR은 이전 토큰의 중간 레이어 표현을 현재 위치 초기 레이어에 융합하는 트랜스포머 기반 잠재적 추론 아키텍처입니다. 이는 자기회귀 디코딩의 한계를 극복하고, 적은 오버헤드로도 시간 경과에 따른 중간 계산 상태를 지속시킵니다. 기존 모델에 순환 경로만 추가하여 미세 조정하는 것만으로도 수학적 추론 능력을 크게 향상시키는 것이 가능합니다.
MedFailBench는 기존 의료 AI 벤치마크가 정답 여부만 측정하는 한계를 극복하기 위해 임상의가 구축한 오픈 소스 안전성 검사 도구입니다. 이 벤치마크는 오류를 심각도와 구체적인 '안전 게이트' 유형별로 라벨링하여 의료 AI의 취약점을 깊이 있게 분석할 수 있도록 합니다.
본 논문은 복잡한 GUI 환경에서 자율 에이전트의 제어 및 계획 수립 문제를 해결하기 위해 Plover라는 시스템을 제안합니다. Plover는 작업 계획과 재계획 과정을 외부화하여, 사용자가 시스템 동작을 검사하고 수정할 수 있는 '계획 중심' 아키텍처를 구현했습니다. 이를 통해 GUI 자동화 에이전트의 투명성과 제어 가능성을 크게 향상시켰습니다.
본 논문은 불확실성 정량화(UQ)에 대한 새로운 관점을 제시하며, 불확실성 측정값이 기본 원시 요소가 아닌 모델링 결정의 결과물임을 주장합니다. '주관적 위험'을 분해하여 인식론적 및 우연적 불확실성을 도출하는 방법을 보여주고, 이를 학습 이론과 연결하여 UQ를 위한 포괄적인 프레임워크로 확장할 수 있음을 제시합니다.
본 논문은 정신 건강 분야의 신뢰성 있는 XAI 시스템 구축을 위해, 우울증 관련 데이터셋 주석화 문제를 해결하는 자체 진화형 프레임워크를 제안합니다. 이 프레임워크는 LLM 지원 레이블링과 전문가 검증을 결합하여 DSM-5-TR에 정렬된 설명 가능한 데이터를 구축하는 것을 목표로 합니다.
본 논문은 저장소 수준의 이슈 위치 파악(localization)에 있어 시각적 증거 활용을 위한 통제된 벤치마크인 MM-IssueLoc을 제안합니다. 이 벤치마크는 23개 언어, 652개의 이슈-PR 인스턴스를 포함하며, 파일 및 함수 수준의 골드 레이블과 시각적 증거를 결합하여 평가합니다. 연구 결과, 기존 시스템들은 멀티모달 위치 파악에서 어려움을 보였으며, 시각적 증거가 중요한 평가 변수임을 입증했습니다.
본 논문은 마스킹된 확산 언어 모델(MDLM)에 강화학습을 적용하는 새로운 방법을 제안합니다. 기존 방식의 한계를 극복하기 위해, 생성 과정을 토큰 배치 결정과 위치 재마스킹 결정이라는 2단계 액션 MDP로 형식화했습니다. 이를 통해 정책 기울기를 두 개의 항으로 분해하고 최적화하여 수학 및 코딩 벤치마크에서 높은 성능을 달성했습니다.