Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
MLLM의 성능 향상을 위해 모델의 실패 사례를 기반으로 이미지를 스스로 증강하는 FISA 프레임워크를 제안합니다. 시각적 복잡성을 높이면서도 의미론적 왜곡을 방지하는 필터링을 통해 데이터 효율성을 극대화합니다.
입력 특징 간의 구조적 의존성을 고려하여 신경망의 예측 원인을 정확하게 계산하는 새로운 방법을 제안합니다. Boolean SCM과 경계 전파 기술을 통해 기존 방식보다 확장성 있는 실제 원인(Actual Causes) 계산이 가능함을 입증했습니다.
임상 의사 결정 지원을 위한 멀티 에이전트 시스템에서 에이전트들이 잘못된 단서나 사회적 압력에 의해 오답을 수용하는 '지름길 연쇄 현상'을 분석한 연구입니다. Gemini 위원회 실험을 통해 에이전트 간의 잘못된 동의가 확산되는 과정을 밝히고, 이를 탐지하기 위한 독립적 심판 모델의 필요성을 제시합니다.
거대 추론 모델(LRM)에서 모델의 출력 충실도와 안전성 사이의 상충 관계를 분석한 연구입니다. 새로운 데이터셋 HazMart와 표적 추론 교체(TRR) 기술을 제안하며, 모델 내부의 표현 스티어링을 통해 안전성을 개선할 수 있음을 입증했습니다.
에이전트의 자기 진화(Self-Evolution) 능력을 평가하기 위한 새로운 벤치마크인 GDPevo를 제안합니다. 기업 워크플로우를 기반으로 자동화된 데이터 파이프라인을 통해 데이터 오염 문제를 해결하고, 실제 비즈니스 태스크에서의 성능 향상을 정밀하게 측정합니다.
마스크 확산 언어 모델(MDLM)의 비연속적인 토큰 구성 문제를 해결하기 위해 설계된 새로운 위치 인코딩 방식인 MDLMPE를 제안합니다. 토큰 가용성 분포를 인식하는 이 방식은 기존 RoPE보다 우수한 성능을 보입니다.
AtumAI는 데이터센터 제어 평면 정책 설계를 자동화하기 위한 에이전트 기반 프레임워크입니다. 기존 방식의 비형식성, 비전이성, 비체계성을 해결하기 위해 문제 정식화와 진화적 설계 루프를 결합하여 정책 생성 과정을 혁신합니다.
에이전트 기반 AI 시스템에서 발생하는 교차 세션(Cross-session) 오용 위협을 탐지하는 Magnet 프레임워크를 제안합니다. 공격자가 해로운 목표를 여러 세션으로 분해하여 탐지를 회피하는 문제를 해결하기 위해, 사용자 단위의 상관관계 분석을 통해 흩어진 위험 증거를 수집합니다.
불확실한 MDP 환경에서 제한된 수의 정책 집합을 최적화하는 k-적응형 정책 합성(k-adaptable policy synthesis) 방법을 제안합니다. 미니맥스 후회(minimax-regret)를 최소화하기 위해 KAPS 알고리즘을 개발하였으며, 실험을 통해 정책 수 증가에 따른 성능 향상을 입증했습니다.
전력 시스템 분야의 AI 진입 장벽을 낮추기 위해 공학적 도메인 지식을 결합한 실행 프레임워크를 제안합니다. DNN, CNN, DRL, PINNs 등 다양한 AI 모델을 전력 시스템 작업에 매핑한 오픈 소스 모듈을 제공합니다.
Diffusion Transformers(DiT) 학습 시 발생하는 Muon 옵티마이저의 수렴 문제를 해결하기 위한 CMuon 기법을 제안합니다. 통합된 텐서를 청크 단위로 분할하여 직교화함으로써 학습 속도를 AdamW 대비 2배 이상 향상시켰습니다.
자동화 창고의 로봇 레이아웃 최적화를 위해 시뮬레이션 없이 다항 시간 내에 결과를 도출하는 SRA 알고리즘을 제안합니다. 기존 진화적 최적화 방식보다 훨씬 적은 연산 자원과 시간으로 더 높은 처리량과 확장성을 달성했습니다.
무선 센서 네트워크 내 VLA 로봇을 대상으로 물리적 적대적 공격을 평가하고 완화하는 프레임워크 VLAGuard를 제안합니다. 시각-언어-행동 모델의 어텐션 메커니즘을 교란하는 공격을 분석하고, 이를 방어하기 위한 미세 조정 기법을 제시합니다.
WAM-Diff2는 자율 주행을 위한 VLA 모델의 계산 지연 시간과 노출 편향 문제를 해결하기 위해 제안된 계층적 증류 프레임워크입니다. 자기회귀(AR) 모델의 추론 능력을 유지하면서 병렬 실행이 가능한 확산(Diffusion) 모델로 변환하여 효율성을 극대화합니다.
시각-언어 모델(VLM)에 인코딩된 탈옥 공격을 시도할 때, 관련 없는 미끼 이미지를 함께 입력하면 방어 효과가 크게 증폭됨을 발견했습니다. 실험 결과, 미끼 이미지는 캡션 매개 방어 기제의 공격 성공률(ASR)을 최대 73%까지 낮추는 효과를 보였습니다.
온디바이스 모델의 전화 비서 능력을 평가하기 위한 새로운 벤치마크인 CallScreenBench를 제안합니다. 기존 에이전트 평가와 달리 협력적 사용자가 없는 환경에서 모델의 대응 품질을 다섯 가지 차원으로 분석합니다.
도구 사용 에이전트의 제어 컨텍스트(ACC) 압축 시 발생하는 신뢰성 문제를 다루는 연구입니다. 새로운 벤치마크인 CompressAgent를 통해 압축률에 따른 에이전트의 실행 성공률과 신뢰성 경계를 분석했습니다.
DeBERTa-v3의 분리된 어텐션을 활용하여 AI 생성 텍스트를 투명하게 탐지하는 DeBERTa-Sentinel 프레임워크를 소개합니다. 토큰 수준의 설명을 제공하여 탐지 결과의 해석 가능성을 높였으며, 다양한 LLM 생성물에 대해 높은 정확도와 재현율을 기록했습니다.
MLLM의 구조화된 시각적 인지 능력을 향상시키기 위해 박스 수준의 기여도를 할당하는 MCR-GRPO 프레임워크를 제안합니다. 기존 GRPO의 응답 수준 감독 문제를 해결하여 개별 객체 예측의 정확도를 높이는 것이 핵심입니다.
Transformer의 잔차 구조에서 어텐션 매칭(Query-Key)과 콘텐츠 검색(Value)의 역할을 분리하는 RD-AttnRes 구조를 제안합니다. 실험 결과, 매칭과 검색이 서로 다른 깊이의 표현을 참조할 때 모델의 성능이 향상됨을 입증했습니다.