Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
RLVR 학습 시 발생하는 목적 함수와 확률적 업데이트 기하학 간의 불일치 문제를 해결하기 위한 RL2ML 프레임워크를 제안합니다. 유한 롤아웃 환경에서 편향되지 않은 그래디언트 추정기를 통해 표준 RL과 최대 가능도 학습을 연속적으로 연결합니다.
본 연구는 점수 기반 확산 모델이 저차원 다중 모드 분포를 학습할 때의 통계적 효율성을 이론적으로 분석합니다. 기존의 강력한 정규성 가정 없이도 확산 모델이 본질적 차원에 의존하는 근사 최적의 수렴 속도를 가짐을 증명했습니다.
본 논문은 Sparse Autoencoders(SAE)를 활용하여 언어 모델의 생물 보안 거부 메커니즘이 프롬프트 형식이나 출력 길이에 따라 얼마나 취약한지 분석합니다. 연구 결과, 모델들이 유해성과 무해성을 명확히 구분하지 못하거나 특정 조건에서 거부율이 급락하는 등 구조적 결함이 있음을 밝혀냈습니다.
LLM 기반 소셜 봇 탐지를 위해 섹터-비등방성 쌍곡선 그래프(SAHG) 모델을 제안합니다. 기존 유클리드 GNN의 한계를 극복하기 위해 방향 의존적 곡률을 학습하고, 이중 채널 설계를 통해 봇과 인간의 신호가 섞이는 문제를 해결합니다.
카오스 역학계에서 발생하는 강화학습의 불안정성 문제를 해결하기 위해 분포형 강화학습(Distributional RL)의 효용성을 분석합니다. 수익 분포가 개별 궤적보다 통계적으로 더 안정적임을 증명하여 더 매끄러운 벨만 목적 함수를 생성하는 원리를 설명합니다.
대규모 시각-언어 모델(VLMs)이 시각적 계수(counting)에서 겪는 외삽 실패 원인을 분석한 연구입니다. 연구 결과, 모델의 실패는 지각의 문제가 아니라 시각적 크기를 기호 토큰으로 연결하는 '기호 매핑' 단계의 결함임을 밝혀냈습니다.
본 연구는 CNN을 활용하여 희소한 관측값으로부터 완전한 공간 상관 필드를 예측하는 새로운 보간법을 제안합니다. 전통적인 Kriging 방식과 달리 명시적인 공분산 모델링 없이 데이터 기반으로 국소적 공간 패턴을 유연하게 포착합니다.
iLoRA는 잠재적 상호작용 그래프를 추론하여 입력 조건부 LoRA 업데이트를 생성하는 최초의 베이지안 그래프 조건부 LoRA 프레임워크입니다. 마이크로바이옴 진단 분야에 적용하여 예측 성능을 높이고 미생물 간의 상호작용 구조를 효과적으로 회복함을 입증했습니다.
AI 기상 모델의 장기 예측 시 발생하는 불안정성 문제를 분석한 연구입니다. 9개의 최첨단 모델을 대상으로 폭발, 드리프트, 계절성 상실이라는 세 가지 실패 유형을 정의하고, 모델의 안정성이 시공간적 규모 처리 방식에 달려 있음을 규명했습니다.
현대 분류기들의 신뢰할 수 있는 확률 추정을 위해 대규모 사후 교정(Post-Hoc Calibration) 벤치마크인 CalArena를 제안합니다. 정형 데이터와 컴퓨터 비전 등 다양한 태스크에서 2,000개 이상의 실험을 통해 기존 방법론들을 통합적으로 평가하고 분석합니다.
분자 특성 예측을 위한 MPNN의 성능 결정 요인을 분석하기 위해 연산자 수준의 요인 설계 벤치마크를 제안합니다. 연구 결과, 성능은 업데이트 복잡성보다 메시지 구축 방식에 더 큰 영향을 받으며, 결합 기반 혼합이 화학적 구별 능력과 오버스무딩 저항성 측면에서 우수함을 입증했습니다.
MF-Diffuser는 확산 기반 계획을 활용하여 수천 명의 에이전트를 포함하는 다중 에이전트 오프라인 강화학습(MARL) 문제를 해결하는 프레임워크입니다. 와세르슈타인 공간과 혼돈의 전파 원리를 이용해 차원의 저주를 극복하고 대규모 에이전트 시스템에서도 높은 성능을 증명했습니다.
LoRA 어댑터가 데이터 오염을 통해 기본 성능을 유지하면서도 백도어를 심을 수 있음을 증명한 연구입니다. 공격이 구조적 패턴이 아닌 토큰 특징 수준에서 일반화되어 특정 참조 유형에만 활성화되는 특성을 분석했습니다.
에지 시스템의 지속 학습을 위해 안정성, 가소성, 망각의 균형을 맞추는 BiMU 프레임워크를 제안합니다. 베이지안 이진 신경망의 사후 분포 포화 문제를 해결하여 불확실성을 유지하고, 효율적인 능동 쿼리를 가능하게 합니다.
희소 보상 환경에서 GRPO 방식의 강화학습이 겪는 불안정한 학습 문제를 해결하기 위한 HPO(Hysteretic Policy Optimization)를 제안합니다. 음의 이점 가중치를 조절하고 평균 길이 정규화를 도입하여 학습 효율을 높였으며, Adaptive HPO를 통해 자동화된 가중치 설정이 가능합니다.
배치 크기에 따라 LLM의 출력 토큰이 달라지는 문제를 해결하기 위해, 토큰이 뒤바뀌는 희소한 상황에서만 검증을 수행하는 MarginGate 방식을 제안합니다. 로짓 마진을 기반으로 검증 트리거를 결정하여 결정론적 디코딩을 복구하면서도 지연 시간을 획기적으로 줄였습니다.
불규칙하고 비동기적인 데이터를 처리하는 연속 시간 모델을 위한 새로운 임베딩 방식을 제안합니다. 보간이나 결측치 보충 없이 관측값을 증분으로 기록하여 로그 시그니처를 직접 형성함으로써, 온라인 계산이 가능하고 데이터의 충실도를 유지하는 Log-NCDEs 모델을 소개합니다.
LLM이 장기 상호작용 중 정보를 관리하는 '문맥적 신념 관리(CBM)'의 중요성을 다룹니다. 새로운 벤치마크인 BeliefTrack을 통해 모델의 신념 업데이트 및 격리 실패를 진단하며, 강화학습과 표현 수준의 스티어링이 이를 개선할 수 있음을 보여줍니다.
TriSearch는 bistellar flips를 활용하여 다포체의 삼각분할을 최적화하는 강화학습 프레임워크입니다. 회로 지원 하위 삼각분할 동작 표현을 통해 차원에 구애받지 않고 flip graph를 효율적으로 탐색하며, 3D 및 4D 환경에서 뛰어난 제로샷 일반화 성능을 보여줍니다.
평균장 트랜스포머(Mean-Field Transformer) 모델에서 발생하는 모드 붕괴 현상을 분석하고, 위치 인코딩과 같은 보조 변수가 이를 어떻게 방지하는지 이론적으로 규명합니다. 보조 변수가 토큰 분포의 퇴화를 막는 역학적 역할을 수행하며 표현의 보편성을 확보함을 입증합니다.