Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
TRACE는 에이전트 강화학습의 효율성을 높이기 위해 롤아웃 예산을 프롬프트와 턴 단위 접두사에 동적으로 할당하는 프레임워크입니다. 트리 구조의 롤아웃을 통해 보상 대비를 강화하고 정책 업데이트 신호를 증폭시켜 모델의 추론 성능을 향상시킵니다.
축구 패스 평가를 위해 Monte Carlo Tree Search(MCTS) 개념을 도입한 MCPS 프레임워크를 제안합니다. 3D 트래킹 데이터를 기반으로 반사실적 패스 궤적을 생성하고, 가치 모델을 통해 패스의 잠재적 가치를 분포 형태로 평가합니다.
합성 사후 학습 데이터 큐레이션에서 소스 근거 기반의 게이팅과 적응형 복구 전략의 효과를 연구했습니다. 연구 결과, 정확한 출처 기반 필터링과 실패 진단 및 타겟팅된 재생성을 결합한 복구 방식이 데이터 수율과 품질을 유의미하게 향상시킴을 확인했습니다.
Latent Diffusion Model(LDM)을 활용하여 지하 유동 데이터 동화 시 발생하는 차원 축소와 비선형성 문제를 연구합니다. ESMDA와 MCMC/SMC 알고리즘을 비교하여, LDM 잠재 공간에서의 몬테카를로 샘플링이 지질학적 실재성을 유지하면서도 더 높은 불확실성 감소 효과를 제공함을 입증합니다.
LLM 에이전트의 생물 보안 위험을 측정하기 위한 새로운 벤치마크인 ABC-Bench를 소개합니다. 이 벤치마크는 DNA 설계 및 로봇 제어 등 이중 용도 과업을 통해 에이전트의 역량을 평가하며, 실험을 통해 실제 로봇 작동 성공을 검증했습니다.
ReasonAlloc은 긴 사고 사슬(CoT)을 사용하는 LLM의 KV 캐시 병목 현상을 해결하기 위한 새로운 훈련 불필요(Training-free) 프레임워크입니다. 레이어별 사전 할당과 실시간 헤드별 재할당을 통해 추론 성능을 유지하면서도 효율적인 메모리 관리를 가능하게 합니다.
LLM의 성능 평가가 학습 데이터에 포함된 콘텐츠에 의존하고 오류의 크기를 간과하고 있음을 지적합니다. 새로운 벤치마킹 방식을 통해 LLM의 응답 분산과 오류 크기를 측정한 결과, 인간 전문가가 LLM보다 더 높은 성능과 낮은 변동성을 보임을 입증했습니다.
자기 증류(Self-distillation) 과정에서 피드백 정렬의 중요성을 연구한 논문입니다. 단계별 비평(Step-aligned critique)이 이진 보상이나 참조 솔루션보다 모델 성능 향상에 훨씬 효과적임을 입증했습니다.
SFT를 단순한 토큰 최대화가 아닌 타겟 분포 설계 관점으로 재해석한 연구입니다. Q-target 프레임워크를 통해 관찰된 토큰의 의존도와 확률 질량 할당을 분석하며, 제안된 Target-SFT 방식은 다양한 추론 데이터셋에서 우수한 성능을 입증했습니다.
EEVEE는 실세계의 이질적인 작업 스트림을 처리하기 위해 제안된 최초의 멀티 데이터셋 테스트 시간 프롬프트 학습 프레임워크입니다. 라우터와 프롬프트의 공동 진화 전략을 통해 데이터셋 간 간섭을 완화하고 다양한 도메인에서의 강건성을 확보합니다.
Piper는 분산 학습 전략을 런타임 구현에서 분리하여 사용자가 선언적으로 제어할 수 있는 새로운 학습 시스템입니다. 중간 표현(IR)을 통해 글로벌 학습 DAG를 생성하고 장치별 실행 계획을 컴파일하여, 복잡한 병렬성 전략을 유연하게 적용할 수 있습니다.
Anthropic의 신규 모델 Claude Fable 5가 출시되어 SWE-bench에서 압도적인 성능을 기록했습니다. GPT-5.5 및 Opus 4.8과의 벤치마크 성능, 가격, 비용 효율성을 비교 분석하여 사용자의 목적에 맞는 모델 전환 가이드를 제공합니다.
EinsteinArena는 에이전트들이 실시간으로 문제를 해결하고 토론하며 협력할 수 있는 에이전트 네이티브 플랫폼입니다. 이 플랫폼을 통해 에이전트들은 집단 지성을 발휘하여 키싱 넘버 문제와 같은 수학적 난제에서 새로운 최첨단(SOTA) 결과를 도출했습니다.
수능 수학 문제를 활용한 새로운 추론 벤치마크 KCSAT-ML을 소개합니다. 전국 단위 코호트의 오답률 데이터를 기반으로 모델의 추론 능력을 인간의 난이도 체계와 비교 분석하는 DRG 메트릭을 제안합니다.
PCAF는 긴 문맥 처리를 위해 게이트형 희소 메모리를 사용하는 새로운 아키텍처를 제안합니다. 기존 Transformer의 제곱 복잡도와 순환 모델의 상태 압축 병목 현상을 동시에 해결하며, 해시 버킷 기반의 병렬 콘텐츠 주소 지정 방식을 통해 효율적인 긴 문맥 접근을 구현합니다.
다국어 지시어 튜닝 시 다양한 LoRA 변형 기법이 기본 LoRA보다 우수한지 실험했습니다. 연구 결과, 복잡한 LoRA 변형이 교차 언어 전이와 지식 유지 측면에서 기본 LoRA 대비 유의미한 이점을 제공하지 않음을 확인했습니다.
SpenseGPT는 LLM 추론 속도를 높이기 위해 희소(Sparse) 영역과 밀집(Dense) 영역을 결합한 하이브리드 형식을 제안합니다. 기존 2:4 희소성 제약으로 인한 정확도 저하를 해결하며, B200 GPU 환경에서 모델 품질을 유지하며 최대 1.2배의 디코딩 속도 향상을 달성했습니다.
본 연구는 다국어 일반화와 모달리티 정렬을 목표로 하는 프로젝터 기반 LLM-ASR 프레임워크를 제안합니다. MoE 아키텍처와 CIF 메커니즘을 결합하여 기존 베이스라인 모델보다 향상된 성능을 입증했습니다.
대규모 데이터 레이크 환경에서 검색과 추론 능력을 동시에 평가하기 위한 새로운 벤치마크인 LakeQA를 소개합니다. 9.5TB 규모의 이질적인 데이터를 기반으로 하며, 박사급 전문가의 주석을 거친 고난도 멀티홉 추론 과제를 포함합니다.
ERAlign은 텍스트 속성 그래프(TAGs)에서 GNN과 LLM의 표현을 정렬하기 위한 에너지 기반 프레임워크입니다. 에너지 불일치(ED)를 도입하여 샘플링 비용을 줄이고 분포 일관성을 달성함으로써, 다양한 태스크에서 최첨단 성능을 입증했습니다.