Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

PRX 모델 학습을 위한 데이터 전략을 다룹니다. 공개 및 내부 데이터셋을 혼합하고 VLM을 활용해 이미지 캡션을 재작성하여 다양성 있는 사전 학습 코퍼스를 구축하는 파이프라인을 설명합니다.
LeRobot v0.6.0은 월드 모델 정책, 새로운 VLA 모델, 보상 모델 API를 도입하여 로보틱스 연구 역량을 강화했습니다. 시뮬레이션 벤치마크 통합과 데이터 로딩 속도 개선 등 학습 및 평가 효율성을 대폭 높였습니다.

엔터프라이즈 Java 프레임워크 마이그레이션 능력을 평가하기 위한 새로운 오픈 벤치마크인 ScarfBench를 소개합니다. 단순 코드 생성을 넘어 빌드, 배포, 동작 보존 여부를 종합적으로 검증하여 AI 에이전트의 실제 현대화 역량을 측정합니다.

Goldfeder et al. (2026)의 연구를 바탕으로 AI 시스템이 범용성보다 전문화(Specialization)를 지향해야 하는 수학적, 생물학적 근거를 설명합니다. 최적화 이론과 자원의 유한성을 근거로, 특정 도메인에 집중된 모델이 더 높은 성능을 달성함을 논증합니다.

Hugging Face가 모델 평가 결과의 파편화 문제를 해결하기 위해 EEE(EvalEval Coalition)와 Community Evals를 결합하여 출시했습니다. 단일 JSON 스키마를 통해 평가 주체, 모델, 설정 등을 표준화하여 모델 성능과 안전성을 투명하게 비교할 수 있도록 지원합니다.

DiScoFormer는 단일 Transformer 구조를 통해 데이터 분포의 밀도(Density)와 스코어(Score)를 동시에 추정하는 새로운 모델입니다. 재학습 없이 단 한 번의 순전파만으로 고차원 데이터의 분포를 복원하며, 밀도와 스코어 간의 수학적 관계를 활용한 일관성 손실을 통해 정확도를 높였습니다.

Olmo 3 Transformer와 Olmo Hybrid 모델을 비교하여 토큰 수준에서의 예측 성능 차이를 분석한 연구입니다. Hybrid 모델은 의미론적 토큰과 문맥 의존적 토큰 예측에 강점을 보이지만, 단순 반복 토큰 예측에서는 Transformer가 더 우세함을 밝혀냈습니다.
Treble Technologies와 Hugging Face가 협력하여 실제 환경의 음향 조건을 반영한 원거리 ASR(Far-Field ASR) 벤치마크인 FFASR 리더보드를 출시했습니다. 기존 근거리 중심 평가의 한계를 극복하고 소음, 잔향, 마이크 거리 등 복잡한 환경에서의 모델 성능을 정량화합니다.

심층 리서치 에이전트가 외부 도구 사용 중 민감한 정보를 유출하는 '모자이크 효과' 위험을 분석한 연구입니다. MosaicLeaks라는 새로운 태스크를 제안하며, 강화학습 기반의 PA-DR 방법론을 통해 성능을 유지하면서 정보 유출을 획기적으로 줄이는 방안을 제시합니다.
코딩 에이전트의 성능을 측정하기 위해 최종 답변뿐만 아니라 작업 과정 전체를 분석하는 새로운 벤치마크 방식을 소개합니다. Hugging Face의 transformers 라이브러리를 사례로 사용하여, 에이전트 친화적인 소프트웨어 설계와 문서화의 중요성을 강조합니다.

MolmoMotion은 텍스트 지침과 3D 지점을 기반으로 객체의 미래 3D 궤적을 예측하는 새로운 모션 예측 모델입니다. 로보틱스 계획 및 비디오 생성에 활용 가능하며, 대규모 데이터셋인 MolmoMotion-1M과 벤치마크인 PointMotionBench를 함께 공개했습니다.

LLM 개발 루프를 지원하기 위해 설계된 새로운 평가 워크벤치 olmo-eval을 소개합니다. OLMES 표준을 기반으로 모델 체크포인트 간의 비교, 에이전틱 및 멀티턴 평가, 정밀한 결과 분석을 용이하게 합니다.
ADHD 사용자의 실행 기능 저하를 돕기 위해 도파민 자극을 유도하도록 미세 조정된 NeuroBait 모델을 소개합니다. 기존의 체크리스트 방식 대신, 행동을 시작할 수 있도록 돕는 특화된 상호작용 방식을 지향합니다.
Nemotron 3.5는 텍스트와 이미지를 통합적으로 평가하는 멀티모달 안전성 기능을 강화한 모델입니다. 사용자 정의 정책 수용과 단계별 추론(think mode)을 통해 기업용 프로덕션 환경에 최적화된 안전 판정 기능을 제공합니다.
Nemotron 모델 학습을 위해 태스크 시드를 활용한 합성 Q&A 생성(SDG) 워크플로우를 제안합니다. 공개 태스크의 학습 분할을 능력 시드로 사용하여 추론과 지식이 풍부한 데이터를 생성하고 필터링함으로써 모델의 성능을 효과적으로 향상시킵니다.
DharmaOCR 연구를 통해 OCR 모델의 텍text 퇴화 현상을 해결하기 위한 DPO(Direct Preference Optimization) 적용 사례를 소개합니다. SFT만으로는 해결하기 어려운 반복 루프와 같은 실패 모드를 DPO를 통해 효과적으로 완화할 수 있음을 입증했습니다.

JetBrains가 12B 파라미터 규모의 MoE 모델인 Mellum2를 출시했습니다. 이 모델은 토큰당 2.5B 파라미터만 활성화하여 높은 처리량과 낮은 지연 시간을 제공하며, 텍스트와 코드 작업에 최적화되어 있습니다.
NVIDIA Nemotron-Labs Diffusion은 기존 자기회귀(AR) 방식의 한계를 극복하기 위해 토큰을 병렬로 생성하고 반복적으로 정제하는 확산 언어 모델(DLM)을 선보였습니다. GPU 효율성을 극대화하여 빠른 텍스트 생성이 가능하며, 생성된 토큰을 수정할 수 있는 유연성을 제공합니다.
특정 도메인에 특화된 소형 언어 모델(SLM)이 거대 프런티어 모델보다 높은 성능과 경제성을 보일 수 있음을 입증합니다. 30억 파라미터 규모의 전문화된 모델이 상용 API보다 뛰어난 성능을 내며 비용은 50배 저렴하다는 연구 결과를 제시합니다.