Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
대규모 생성 모델의 벤치마크 평가 비용을 줄이기 위해 코어셋 크기를 자동으로 결정하는 순차적 베이지안 프레임워크 BayesAME를 제안합니다. 모델의 잠재 능력을 확률 변수로 모델링하여 성능 추정치와 불확실성을 정량화하고 최적의 평가 항목을 선택합니다.
과학적 도표의 품질을 원고의 맥락과 정렬하여 평가하는 새로운 멀티모달 모델 SciFigAlign을 제안합니다. 기존 IQA나 LLM 방식의 한계를 극복하기 위해 CLIP과 SciBERT를 결합한 미세 조정 모델을 통해 도표의 명확성, 관련성 등을 정밀하게 산정합니다.
과학 논문의 도표 품질을 평가하기 위해 텍스트 문맥을 활용하는 새로운 벤치마크 SciFigQual-Bench를 제안합니다. 명확성, 캡션 적합성 등 5개 차원을 통해 이미지와 논문 문맥 간의 일치성을 검증하며, 교차 모달 평가 프레임워크인 SFQ-Agent를 통해 자동화된 평가 성능을 입증했습니다.
에이전트 메모리 시스템의 보안 취약점을 평가하기 위한 새로운 벤치마크인 MemSecBench를 소개합니다. 악의적인 지시문이 장기 메모리에 저장되어 이후 행동에 미치는 영향과 복구 가능성을 다양한 환경에서 추적합니다.
오디오 캡셔닝 성능을 정밀하게 진단하기 위한 대규모 다차원 벤치마크인 MMAC을 제안합니다. 기존 방식의 한계를 넘어 정보 커버리지와 설명 신뢰성을 평가할 수 있는 15개 차원을 제공합니다.
PRISM-AH는 비디오 내 얼굴, 음성, 언어 간의 불일치를 통해 양가감정과 망설임을 인식하는 멀티모달 추론 프레임워크입니다. 경량 스트리밍 모델과 LLM의 지식 유도 추론을 결합하여 기존 제로샷 모델 대비 성능을 크게 향상시켰습니다.
코드의 실행 속도를 최적화하기 위해 강화학습(RL)을 적용하는 연구를 소개합니다. 측정 노이즈와 보상 희소성 문제를 해결하기 위해 DMC-Optim 프레임워크를 구축하여 Qwen 및 CWM 모델의 성능을 크게 향상시켰습니다.
MemLens는 LLM 에이전트의 효율적인 메모리 관리를 위해 가치 인식(value-aware) 방식을 제안하는 시스템입니다. Shapley 가치 평가를 통해 메모리 기록의 중요도를 판단하며, 대화형 대시보드를 통해 메모리 수명 주기를 시각화하고 분석할 수 있습니다.
LLM을 이용한 Kubernetes 보안 패치 생성 시, 실제 런타임 토폴로지 컨텍스트를 제공하는 KuTIE 엔진의 효과를 연구했습니다. 실험 결과, 서비스 호출 그래프와 의존성을 반영한 컨텍스트가 패치 정확도를 최대 78%까지 크게 향상시킴을 입증했습니다.
표 형식 파운데이션 모델(TFM)의 분포 외(OOD) 성능을 실증적으로 평가한 연구입니다. 다양한 사전 학습 전략과 아키텍처를 가진 9가지 모델을 대상으로 분포 변화가 성능에 미치는 영향을 분석했습니다.
컴퓨터 사용 에이전트(CUA)의 GUI 전환 이해 능력을 측정하기 위한 새로운 벤치마크인 Desktop-Delta Bench(DDB)를 소개합니다. 기존 벤치마크가 놓치기 쉬운 상태 확인, 소스 추적, 문맥 인식 제어 능력을 단계별로 평가합니다.
Pictura는 시점 기반 셀프 플레이를 통해 자율 주행 정책을 학습하는 새로운 프레임워크를 제안합니다. GPU 가속 시뮬레이터를 활용해 1인칭 시야와 특권 관측치 사이의 표현 격차를 완화하며, 대규모 데이터로 훈련된 고성능 주행 모델을 구현합니다.
기존 액션 청킹 흐름 정책의 지연 시간 문제를 해결하기 위해 반응형 실시간 흐름 정책인 $\pi \text{R}^2$를 제안합니다. 빠른 채널과 느린 채널의 비동기적 업데이트 및 지연 시간 적응형 스케줄링을 통해 실시간 폐루프 제어를 가능하게 합니다.
온폴리시 증류(OPD) 과정에서 발생하는 접두사 실패 문제를 해결하기 위해 Relay-OPD 방식을 제안합니다. 교사가 학생의 오류를 감지하여 궤적을 재설정하는 '핸드오프' 메커니즘을 통해 효율적이고 정확한 학습을 유도합니다.
CHARM은 멀티모달 그래프 환경에서 제로샷 전이를 가능하게 하는 새로운 그래프 파운데이션 모델입니다. 계층적 문맥 모델링을 통해 도메인 특화 정보를 공유된 고수준 개념으로 매핑하여 미학습 도메인에서도 높은 성능을 발휘합니다.
LLM이 사회 시뮬레이터로서 인간의 행동을 얼마나 정확히 모사하는지 평가하기 위해 '이유 매개 행동 모델'을 제안합니다. 단순히 결과값의 일치 여부를 넘어, LLM이 생성한 근거(rationale)가 인간의 의사결정 논리와 일치하는지 검증하는 프레임워크를 다룹니다.
과학 시설의 방대한 운영 지식을 활용하기 위해 교정 에이전트 기반의 하이브리드 RAG 시스템인 APS-RAG를 제안합니다. 밀집·희소 검색과 지식 그래프를 결합하고 MCP 기반의 ReAct 실행기를 사용하여 정보 재현율을 높였습니다.
언어 모델의 제한된 작업 메모리 관리 문제를 '고정 지연 평활화' 관점에서 재구성한 연구입니다. 기존의 즉각적 결정 방식 대신, 일정 단계의 관찰을 통해 정보의 유용성을 측정하는 RMM 정책을 제안하며, 특정 조건에서 축적된 주의(attention)보다 측정된 유용성이 더 효과적임을 분석합니다.
분산 추론 시스템에서 지연 시간 데드라인을 악용하여 정확도를 떨어뜨리는 '정확도 붕괴(accuracy collapse)' 공격을 분석합니다. 특정 워크로드 공격이 공유 자원의 경합을 유발해 고정밀 예측값을 폐기하게 만듦을 입증했습니다.
ER 다이어그램의 구조적 이해를 평가하기 위한 최초의 대규모 벤치마크인 ERUnderstand를 소개합니다. 2,960개의 다이어그램을 통해 VLM의 성능을 분석한 결과, 복잡한 관계나 속성에서는 성능이 크게 저하됨을 확인했습니다.