Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Search-E1은 복잡한 외부 모듈 없이 순수 GRPO만을 활용하여 검색 증강 추론 에이전트를 스스로 개선하는 자기 증류(Self-Distillation) 방법론을 제안합니다. 토큰 수준의 KL 목적 함수를 통해 정책의 추론 분포를 최적화하며, 기존 오픈 소스 베이스라인을 능가하는 성능을 입증했습니다.
불확실한 비선형 시스템의 참조 추적을 위해 제한된 데이터로도 빠르게 적응할 수 있는 메타 학습 기반 제어 프레임워크를 제안합니다. iMAML 알고리즘을 활용하여 소스 시스템의 동역학을 학습하고, 대상 시스템에서 효율적인 미세 조정을 수행합니다.
하네스 최적화 도구의 성능을 간접적인 결과가 아닌 단계별 행동으로 직접 평가하기 위한 '우선순위 순위 매기기(Priority Ranking)' 방법론을 제안합니다. 이 방식은 비용 효율적으로 최적화 도구의 능력을 정량화하며, 실제 에이전트 개선 능력과 높은 상관관계를 보입니다.
동일한 관측치에서 여러 유효한 행동이 발생하는 멀티모달 상황에서 Action-Chunking 정책의 실패 원인을 분석합니다. 잠재 변수 정책의 정규화 문제와 행동 공간 생성 정책의 매끄러움 제한 문제를 심도 있게 다룹니다.
뉴럴 컴파일러는 물리 법칙을 포함한 과학적 머신러닝을 위해 기호적 명세를 미분 가능한 PyTorch 모듈로 변환하는 시스템입니다. 수동 코딩 없이도 물리 법칙을 정확하게 인코딩하며, 기존 PINN 방식보다 훨씬 적은 파라미터로 높은 정확도를 달 수 있습니다.
협력 주행 시 발생하는 언어 기반 통신의 지연 시간과 정보 손실 문제를 해결하기 위한 LACO 프레임워크를 제안합니다. 잠재 상태를 직접 융합할 때 발생하는 에이전트 정체성 혼란을 방지하며, 학습이 필요 없는 방식으로 효율적인 잠재 통신을 구현합니다.
기존의 외부 오케스트레이터 방식 대신 에이전트 워크플로우를 소규모 모델의 가중치로 직접 컴파일하는 '지하 에이전트' 기술을 제안합니다. 이를 통해 컨텍스트 소모와 비용 문제를 해결하고 최첨단 모델에 근접한 성능을 달성할 수 있음을 입증합니다.
BeLink는 생물 의학 개체 연결(BEL)의 효율성과 정확도를 높이기 위해 생성적 재순위화 기술을 도입한 연구입니다. 집합적 지시어 튜닝을 통해 추론 시간을 단축하면서도 연결 정확도를 최대 24% 향상시킨 모듈형 시스템을 제안합니다.
Gary Marcus의 인지 아키텍처 이론을 구현하기 위해 GF(2) 상의 초차원 컴퓨팅(Hyperdimensional Computing) 아키텍처인 PyVaCoAl/VaCoAl을 제안합니다. 이 모델은 가역적 변수 결합과 비가환적 구성적 번들링을 통해 변수 연산, 재귀적 구조, 개별자/종류 구분을 지원합니다.
GRPO의 높은 계산 비용 문제를 해결하기 위해 짧은 온라인 웜업 후 DPO를 수행하는 G2D 파이프라인을 제안합니다. 실험 결과, 적절한 웜업을 거친 오프라인 DPO가 GRPO보다 훨씬 낮은 비용으로 대등하거나 더 높은 추론 성능을 보였습니다.
자율 주행 VLA 모델의 센서 섭동에 따른 강건성을 연구한 논문입니다. 가우시안 노이즈, 조명, 안개 등 8가지 환경 변화를 통해 Alpamayo R1 모델을 평가하였으며, 추론 일관성이 궤적 신뢰성의 핵심 지표임을 입증했습니다.
사전 학습된 확산 모델을 활용하는 다운스트림 파이프라인에서 발생하는 높은 계산 비용과 그래디언트 분산 문제를 해결하기 위한 CARV 프레임워크를 제안합니다. CARV는 계층적 몬테카를로 추정량을 통해 비용이 많이 드는 상위 작업을 저렴한 노이즈 재샘플링으로 분할 상환하여 계산 효율을 높입니다.
SURGE는 소셜 미디어 이벤트의 시계열적 변화와 게시물 간의 상호작용 구조를 결합한 새로운 멀티 이벤트 벤치마크입니다. 5개 카테고리, 67개 이벤트, 80만 개 이상의 게시물을 포함하며, 텍스트와 구조적 데이터를 통해 집단적 역학을 예측하는 연구를 지원합니다. 실험 결과, 기존 모델들이 이벤트 중심 데이터의 국소 지속성과 높은 상호작용 밀도 구간에서 어려움을 겪음을 확인했습니다.
본 연구는 공정 합성 문제를 해결하기 위해 마르코프 결정 과정(MDP)으로 공식화된 양자 강화학습(Quantum RL) 프레임워크를 제안합니다. 기존 양자 RL의 한계였던 큐비트 요구 사항 문제를 해결하기 위해 상태 인코딩 알고리즘을 도입하여 확장성을 개선했습니다. 실험 결과, 양자 접근 방식은 중간 규모의 문제에서 고전적 RL 대비 파라미터 효율성 측면에서 우수한 성능을 입증했습니다.
본 연구는 강화학습 훈련 과정에서 발생하는 높은 분산과 실행 간 정책 발산 문제를 해결하기 위한 '행동 일관적 강화학습' 방법론을 제안합니다. 최대 엔트로피 강화학습의 메커니즘을 활용하여, $Q$-함수의 불일치를 기반으로 상태 의존적 온도 스케줄인 QED(Q-value Expectile Disagreement)를 도입함으로써 성능 저하 없이 실행 간 정책 발산을 획기적으로 줄였습니다.
PREFINE은 사전 학습된 강화학습 정책을 재학습하지 않고도 비용 제약 조건을 통합하여 안전성을 확보하는 새로운 미세 조정 방법론입니다. 기존 DPO를 순차적 의사결정 환경에 맞게 변형하여, 궤적 수준의 선호도를 바탕으로 높은 보상을 유지하면서도 위험한 행동을 줄이는 데 집중합니다. 실험 결과, 기존 방식 대비 제약 조건 위반 및 치명적 실패를 60% 이상 감소시키며 데이터 및 계산 효율성을 입증했습니다.
OCTOPUS는 Transformer의 KV Cache 메모리 대역폭과 점유 공간 문제를 해결하기 위해 팔면체 매개변수화를 활용한 새로운 양자화 코덱을 제안합니다. 회전된 좌표 삼중항을 공동 양자화하여 제곱 오차를 최적화함으로써, 기존의 회전 기반 코덱보다 뛰어난 압축 성능을 보여줍니다. 특히 Triton을 이용한 구현을 통해 추가적인 지연 시간 없이 실시간으로 키를 재구성할 수 있는 효율성을 갖추었습니다.
본 연구는 이완기 말(end-diastolic) 프레임 하나를 활용하여 전체 심장 주기 동안의 양심실 메쉬 운동을 합성하는 RePCM 모델을 제안합니다. 기존 생성 모델의 데이터 과도 매끄러움(oversmoothing) 문제를 해결하기 위해 영역 인식 및 표현형 적응형 기술을 도입하여 국소적 역학을 보존합니다. 실험 결과, 다양한 심혈관 질환 데이터셋에서 기하학적 및 기능적 지표의 성능 향상을 입증했습니다.
본 연구는 로봇 조작을 위한 3D 인식 사전 학습 과정에서 암시적 표현의 높은 표현력과 명시적 표현의 구조적 장점을 결합한 '구조적 잠재 포인트(Structural latent points)' 프레임워크를 제안합니다. 포인트 단위 변분 오토인코더를 통해 잠재 공간을 정규화함으로써, 정밀한 기하학 대신 풍부한 형태와 의미론적 정보를 담은 압축된 잠재 표현을 생성합니다. 이를 경량화된 3DGS 기반 렌더링 파이프라인과 결합하여 로봇 작업의 성공률과 강건성을 크게 향상시켰습니다.
Deformba는 기존 비전 상태 공간 모델(SSM)이 가진 고정된 스캐닝 방식의 한계와 정보 스트림 간 상호작용의 어려움을 해결하기 위해 제안된 모델입니다. 컨텍스트 적응형 방법을 통해 공간적 구조 정보를 동적으로 증강하며, SSM의 선형 복잡도를 유지하면서도 교차 주의 집중(cross attention)을 통한 멀티모달 융합을 지원합니다. 2D 비전 작업부터 3D BEV 인지 작업까지 다양한 벤치마크에서 뛰어난 성능을 입증했습니다.