Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
가스 터빈 연소기의 희박 실화(LBO) 예측을 개선하기 위해 강화학습(RL)을 활용한 액체 연료 반응기 네트워크 모델을 제안합니다. 기존의 수동 휴리스틱 방식 대신 RL 에이전트가 최적의 반응기 구역을 병합하여 예측 정확도와 계산 속도를 동시에 향상시킵니다.
RLVR(검증 가능한 보상) 강화학습 시 모델 가중치의 스펙트럼을 재사용하는 ISO(Isospectral Optimization) 프레임워크를 제안합니다. ISO는 오프라인 방식인 ISO-Merger와 온라인 방식인 ISO-Optimizer를 통해 모델의 추론 및 코딩 성능을 효율적으로 향상시킵니다.
노이즈가 포함된 궤적 데이터에서 체류 지점을 탐지하기 위한 새로운 벤치마크와 방법론을 제안합니다. 16개의 대규모 시뮬레이션 데이터셋을 통해 기존 알고리즘의 한계를 분석하고, 노이즈에 강건한 비지도 및 지도 학습 기반의 개선된 성능을 입증했습니다.
DDIM을 활용하여 선형 역문제를 해결하는 효율적인 사후 샘플링 알고리즘인 PDDIM을 제안합니다. 측정 연산자의 특이 방향을 따라 좌표별 수정을 가함으로써, 이론적 보장과 계산 효율성을 동시에 확보했습니다.
Hadamard 다양체 상에서 강건성과 안정성을 보장하는 1-Lipschitz 신경망 아키텍처를 제안합니다. Busemann 함수를 활용하여 기하학적 특성을 보존하는 레이어를 설계하였으며, 쌍곡 공간 및 SPD 다양체에서의 실험을 통해 성능을 입증했습니다.
Off-Context GRPO(OC-GRPO)는 강화학습 과정에서 특권 정보(Privileged Information)를 활용해 LLM의 추론 능력을 향상시키는 새로운 방법론을 제안합니다. 모델이 정답을 찾기 어려운 상황에서 가이드를 제공하되, 중요도 보정을 통해 원래의 목적 함수를 유지하며 학습 효율을 높입니다.
FlashRT는 실시간 멀티모달 애플리케이션의 효율적인 배포를 위해 코딩 에이전트를 가이드하는 에이전트 하네스 프레임워크입니다. Chain-of-program 패러다임을 통해 참조 구현을 최적화된 멀티 GPU 배포 코드로 변환하며, NVIDIA 및 AMD GPU 환경에서 성능을 극대화합니다.
LLM 사후 학습 시 PPO 및 GRPO의 클리핑 목적 함수 문제를 해결하기 위한 새로운 'Output Reset(OR)' 기법을 제안합니다. 연구 결과, PPO-OR은 보상 점수 향상에 효과적이었으나 GRPO-OR은 보상 이득보다는 학습 안정성 측면에서 차이를 보였습니다.
EVOLVE는 대규모 과학 시뮬레이션 데이터를 위해 개발된 오토인코더(AE) 기반의 볼륨 압축 프레임워크입니다. 가변 비트레이트 인코딩을 통해 단일 모델로 연속적인 압축률 조정을 지원하며, 기존 방식보다 높은 압축률과 빠른 속도를 제공합니다.
운영 조건 변화(concept drift)에 대응하여 디지털 트윈의 모델 충실도를 유지하는 새로운 적응형 프레임워크를 제안합니다. Fisher score 기반 드리프트 감지, LoRA를 활용한 효율적 지속 학습, Mann–Whitney U 검정을 통한 통계적 검증을 통합하여 모델의 신뢰성을 보장합니다.
삼체 산란 모델링(TBSM)은 에너지 거리를 활용하여 단일 단계 생성기를 학습시키는 새로운 연구 방법론을 제안합니다. 각 투사체가 실제 소스에는 끌리고 생성된 소스로부터 밀려나는 상호작용을 통해 고차원 생성 성능을 극대화합니다.
PPL-Factory는 태스크 인지 퍼플렉시티와 데이터 예산 인지 기준을 결합한 새로운 데이터 선택 프레임워크입니다. 기존의 간접적인 휴리스틱 방식과 달리 언어 모델링과 추론 태스크의 차이를 고려하여 효율적인 미세 조정을 지원합니다.
이질적인 환경에서 수집된 데이터로부터 불변 요인과 이질적 요인을 분리하여 추출하는 ATLAS 프레임워크를 제안합니다. 보조 레이블과 불변성 원리를 활용해 환경 변화에도 강건한 저차원 표현을 학습하며, 전이 학습 및 잠재 요인 회귀에서 뛰어난 성능을 보입니다.
RAG를 활용하여 인과 추론 프레임워크 내에서 정책 학습을 수행하는 새로운 1단계 및 2단계 방법론을 제안합니다. 벡터 검색을 최근접 이웃 매칭으로 공식화하여 행동 선택의 정확도를 높이는 연구입니다.
텍스트 프롬프트를 통해 이미지의 다양한 시각적 유사성을 측정할 수 있는 TPIPS 메트릭을 제안합니다. 기존 메트릭의 한계를 극복하기 위해 대규모 데이터셋을 활용하여 VLM을 미세 조정하였으며, 인간의 지각과 유사한 성능을 입증했습니다.
Patch Policy는 VLM의 계산 오버헤드 없이 사전 학습된 조밀한 패치 토큰을 로봇 정책에 직접 활용하는 효율적인 구조를 제안합니다. 블록 인과적 어텐션 마스크를 통해 시각적 디테일을 유지하면서도 가볍고 빠른 추론 속도를 구현했습니다.
에이전트 기반 컴퓨터 사용(CUA) 연구에서 단일 실행 결과 보고가 초래하는 통계적 오류를 지적합니다. 데이터 추출과 실행 간 비결정성으로 인해 발생하는 높은 분산을 분석하며, 신뢰할 수 있는 평가를 위해 멀티 시드 기반 보고의 필요성을 강조합니다.
표준 SAE의 한계를 극복하기 위해 특징의 지속성을 학습하는 Persistent Sparse Autoencoders(Persistent SAEs)를 제안합니다. 이 모델은 빠른 특징과 느린 특징의 시간 척도를 학습하여, 주제 수준의 정보를 지속적인 상태로 유지하며 언어 모델의 해석 가능성을 높입니다.
자원이 부족한 아삼어의 음성 인식을 위해 Whisper 모델을 미세 조정(Fine-tuning)하는 연구를 제안합니다. 하드웨어 인지 최적화 파이프라인을 통해 성능을 크게 개선하였으며, 기존 Zero-shot 방식 대비 WER 및 CER 등 주요 지표에서 유의미한 향상을 달성했습니다.
고전적 Rate-Distortion 이론에 지각(Perception) 축을 추가한 RDP 이론을 다룹니다. 분포 유사성을 기반으로 한 RDP 함수(RDPF)의 계산 방법과 최적화 메커니즘을 설명하며, 정보 이론적 관점에서의 새로운 압축 한계를 제시합니다.