Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Off-Context GRPO(OC-GRPO)는 강화학습 과정에서 특권 정보(Privileged Information)를 활용해 LLM의 추론 능력을 향상시키는 새로운 방법론을 제안합니다. 모델이 정답을 찾기 어려운 상황에서 가이드를 제공하되, 중요도 보정을 통해 원래의 목적 함수를 유지하며 학습 효율을 높입니다.
FlashRT는 실시간 멀티모달 애플리케이션의 효율적인 배포를 위해 코딩 에이전트를 가이드하는 에이전트 하네스 프레임워크입니다. Chain-of-program 패러다임을 통해 참조 구현을 최적화된 멀티 GPU 배포 코드로 변환하며, NVIDIA 및 AMD GPU 환경에서 성능을 극대화합니다.
LLM 사후 학습 시 PPO 및 GRPO의 클리핑 목적 함수 문제를 해결하기 위한 새로운 'Output Reset(OR)' 기법을 제안합니다. 연구 결과, PPO-OR은 보상 점수 향상에 효과적이었으나 GRPO-OR은 보상 이득보다는 학습 안정성 측면에서 차이를 보였습니다.
EVOLVE는 대규모 과학 시뮬레이션 데이터를 위해 개발된 오토인코더(AE) 기반의 볼륨 압축 프레임워크입니다. 가변 비트레이트 인코딩을 통해 단일 모델로 연속적인 압축률 조정을 지원하며, 기존 방식보다 높은 압축률과 빠른 속도를 제공합니다.
운영 조건 변화(concept drift)에 대응하여 디지털 트윈의 모델 충실도를 유지하는 새로운 적응형 프레임워크를 제안합니다. Fisher score 기반 드리프트 감지, LoRA를 활용한 효율적 지속 학습, Mann–Whitney U 검정을 통한 통계적 검증을 통합하여 모델의 신뢰성을 보장합니다.
삼체 산란 모델링(TBSM)은 에너지 거리를 활용하여 단일 단계 생성기를 학습시키는 새로운 연구 방법론을 제안합니다. 각 투사체가 실제 소스에는 끌리고 생성된 소스로부터 밀려나는 상호작용을 통해 고차원 생성 성능을 극대화합니다.
PPL-Factory는 태스크 인지 퍼플렉시티와 데이터 예산 인지 기준을 결합한 새로운 데이터 선택 프레임워크입니다. 기존의 간접적인 휴리스틱 방식과 달리 언어 모델링과 추론 태스크의 차이를 고려하여 효율적인 미세 조정을 지원합니다.
이질적인 환경에서 수집된 데이터로부터 불변 요인과 이질적 요인을 분리하여 추출하는 ATLAS 프레임워크를 제안합니다. 보조 레이블과 불변성 원리를 활용해 환경 변화에도 강건한 저차원 표현을 학습하며, 전이 학습 및 잠재 요인 회귀에서 뛰어난 성능을 보입니다.
RAG를 활용하여 인과 추론 프레임워크 내에서 정책 학습을 수행하는 새로운 1단계 및 2단계 방법론을 제안합니다. 벡터 검색을 최근접 이웃 매칭으로 공식화하여 행동 선택의 정확도를 높이는 연구입니다.
텍스트 프롬프트를 통해 이미지의 다양한 시각적 유사성을 측정할 수 있는 TPIPS 메트릭을 제안합니다. 기존 메트릭의 한계를 극복하기 위해 대규모 데이터셋을 활용하여 VLM을 미세 조정하였으며, 인간의 지각과 유사한 성능을 입증했습니다.
Patch Policy는 VLM의 계산 오버헤드 없이 사전 학습된 조밀한 패치 토큰을 로봇 정책에 직접 활용하는 효율적인 구조를 제안합니다. 블록 인과적 어텐션 마스크를 통해 시각적 디테일을 유지하면서도 가볍고 빠른 추론 속도를 구현했습니다.
에이전트 기반 컴퓨터 사용(CUA) 연구에서 단일 실행 결과 보고가 초래하는 통계적 오류를 지적합니다. 데이터 추출과 실행 간 비결정성으로 인해 발생하는 높은 분산을 분석하며, 신뢰할 수 있는 평가를 위해 멀티 시드 기반 보고의 필요성을 강조합니다.
표준 SAE의 한계를 극복하기 위해 특징의 지속성을 학습하는 Persistent Sparse Autoencoders(Persistent SAEs)를 제안합니다. 이 모델은 빠른 특징과 느린 특징의 시간 척도를 학습하여, 주제 수준의 정보를 지속적인 상태로 유지하며 언어 모델의 해석 가능성을 높입니다.
자원이 부족한 아삼어의 음성 인식을 위해 Whisper 모델을 미세 조정(Fine-tuning)하는 연구를 제안합니다. 하드웨어 인지 최적화 파이프라인을 통해 성능을 크게 개선하였으며, 기존 Zero-shot 방식 대비 WER 및 CER 등 주요 지표에서 유의미한 향상을 달성했습니다.
고전적 Rate-Distortion 이론에 지각(Perception) 축을 추가한 RDP 이론을 다룹니다. 분포 유사성을 기반으로 한 RDP 함수(RDPF)의 계산 방법과 최적화 메커니즘을 설명하며, 정보 이론적 관점에서의 새로운 압축 한계를 제시합니다.
자원이 제한된 엣지 환경에서 MoE 모델의 추론 효율을 높이기 위한 OrderMoE 프레임워크를 제안합니다. 전문가 간의 기능적 유사성을 활용하여 통신 오버헤드를 줄이고 지연 시간을 단축하는 것이 핵심입니다.
Node4All은 데이터셋별 최적화 없이 임의의 그래프 데이터셋에 적용 가능한 범용 노드 표현 학습 모델입니다. Channel Graph Transformer와 합성 그래프 기반 자기지도 학습을 통해 뛰어난 일반화 성능을 구현했습니다.
Transformer 기반 LLM의 산술 작업 성능을 개선하기 위해 인간의 학습 전략을 적용한 연구입니다. 모델이 인간과 유사한 학습 패턴을 보임을 입증하고, 하위 작업 분해 및 인지 강화 방법을 통해 정확도를 향상시켰습니다.
불균형 회귀 문제를 해결하기 위해 밀도 정보를 활용하는 DADIR 프레임워크를 제안합니다. 타겟 공간의 적응형 분할과 DR-CVAE를 통한 희소 영역 보존을 통해 데이터 불균형을 효과적으로 해소합니다.
LLM 사후 학습의 한계를 극복하기 위해 RL과 온-정책 증류(OPD)를 결합한 'Distilled RL'을 제안합니다. 이 방식은 미세한 입도의 가이드를 제공하여 새로운 지식을 효과적으로 전달하며, 기존 방식보다 뛰어난 성능을 입증했습니다.