Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
HuggingFace의 CEO인 @ClementDelangue는 강력한 오픈 소스 모델 출시와 관련하여 질문을 받았으며, AI를 제한하는 것이 개방성보다 더 큰 위험을 초래한다고 주장합니다. 그는 과거 GPT-2 사례 등을 언급하며 기술의 확산과 자유로운 접근성이 중요함을 강조했습니다.
Hugging Face가 100만 개 이상의 데이터셋을 보유하며 중요한 이정표를 달성했습니다. 현재 사용되는 모든 인기 오픈 모델들은 이러한 방대한 데이터셋들을 기반으로 구축되었습니다. 다음 목표는 코딩 모델의 발전을 위해 더 많은 오픈 코딩 세션 트레이스를 확보하는 것입니다.
본 기사는 로보틱스(Robotics) 분야와 WebAI 기술의 결합에 대해 다루며, Transformers.js와 WebGPU를 활용하여 Gemma 4 같은 AI 모델을 브라우저에서 완전히 오프라인으로 실행하는 방법을 소개합니다. 이를 통해 USB-C 케이블과 웹 환경만으로 Reachy Mini 로봇을 제어할 수 있게 됩니다.
NVIDIA가 Hugging Face에 AnyFlow라는 새로운 텍스트-투-비디오(text-to-video) 확산 모델을 출시했습니다. 이 모델은 추론 예산과 관계없이 고품질의 비디오를 생성할 수 있는 최초의 any-step 비디오 확산 모델로, 단계 수(예: 4단계 또는 50단계)가 변해도 품질 저하 없이 매끄럽게 확장되는 것이 특징입니다.
이 기술 기사는 Mac 환경에서 Reachy Mini를 구동하기 위한 완전한 로컬 스택을 소개합니다. 이 시스템은 비전, TTS(Text-to-Speech), STT(Speech-to-Text) 기능을 모두 포함하며, mlx-vlm, mlx-audio, 그리고 gemma4와 같은 최신 프레임워크를 활용합니다. 사용자는 이 저장소에서 가족 환경에서도 실행할 수 있는 다양한 예제와 프롬프트를 얻을 수 있습니다.
Reachy Mini가 새로운 기능을 탑재하며, 개발자들은 이제 Reachy Mini와 상호작용할 수 있는 완전한 오픈 소스 백엔드를 사용할 수 있게 되었습니다. 기존에는 실시간 음성 에이전트 구현에 높은 비용(하루 $20+)이 발생했지만, 이 새로운 접근 방식은 오디오 모델을 로컬에서 실행하고 LLM으로 OpenAI나 Claude 구독만 사용함으로써 추가 비용 없이도 가능하게 했습니다. 이 시스템은 Mac mini와 같은 저렴한 하드웨어에서도 효율적으로 작동하며, 곧 자세한 튜토리얼이 제공될 예정입니다.
이 논문은 소수의 스텝만으로도 효과적인 확산 증류(Diffusion Distillation)를 수행하기 위한 연속 시간 분포 매칭 기법을 제안합니다. 기존의 확산 모델들은 많은 수의 샘플링 스텝을 필요로 했으나, 본 연구는 연속 시간 공간에서 데이터 분포를 정확하게 매칭함으로써 적은 단계만으로도 고품질의 생성 결과를 얻을 수 있음을 보여줍니다. 이는 특히 효율적인 이미지 및 오디오 생성 모델 개발에 중요한 진전을 가져올 것입니다.
PhysForge는 인터랙티브 가상 월드(Interactive Virtual World)를 위한 물리 기반 3D 자산 생성 기술입니다. 이 시스템은 현실적인 물리적 상호작용을 갖춘 고품질의 3D 콘텐츠를 자동으로 생성하는 것을 목표로 합니다. 이를 통해 개발자들이 복잡한 수동 모델링 과정 없이도 몰입감 높은 가상 환경을 구축할 수 있도록 지원합니다.
SWE-bench의 Verified 리더보드가 이제 거의 50개의 모델을 비교하며 커뮤니티 기반으로 확장되었습니다. 이는 폐쇄형 벤치마킹보다 더 많은 참여자와 데이터를 통해 개선된 신호를 제공합니다. 이 업데이트는 여러 주요 AI 모델들을 경쟁시키는 장을 마련했습니다.
MolmoAct2는 실세계 환경에서 복잡한 행동을 추론하고 계획하기 위해 설계된 새로운 행동 추론 모델입니다. 이 모델은 실제 세계의 다양한 시나리오와 상호작용하는 에이전트가 보다 현실적이고 효과적인 방식으로 행동할 수 있도록 돕습니다. 특히, MolmoAct2는 이론적인 환경을 넘어 실제 배포 환경에서의 성능과 안정성을 높이는 데 초점을 맞추고 있습니다.
새롭게 개발된 Hugging Face 모델 시각화기를 소개합니다. 이 도구는 사용자가 URL을 입력하는 것만으로 다양한 AI 모델의 구조를 탐색할 수 있게 해줍니다. 특히, '임의의 粒度(granularity)'로 깊이를 조절하며 모델 내부를 직관적으로 살펴볼 수 있다는 점이 가장 큰 특징입니다.
Nvidia가 Nemotron 3 Nano Omni 모델을 출시했으며, 사용자는 Hugging Face Spaces에서 해당 데모를 확인할 수 있습니다. 이 모델은 최신 AI 기술의 발전상을 보여주며, 개발자들이 쉽게 접근하여 테스트해 볼 수 있도록 Gradio 앱 형태로 제공되었습니다.
클레망 델랑유(Clement Delangue)가 머신러닝 인턴과 Reachy Mini 로봇 팔을 활용하여 단 2시간 만에 수신처(receiving station) 로봇 애플리케이션을 성공적으로 구축한 경험을 공유했습니다. 이 프로젝트는 짧은 시간 내에 실제 작동하는 로봇 시스템을 구현하는 과정을 보여주며, 실습 기반의 빠른 프로토타이핑 능력을 강조합니다.
이 글은 ML 인턴과 OpenAI GPT 5.5를 활용하여 오피스 리셉션 앱을 개발하는 과정을 공유합니다. 작성자는 이 프로젝트가 성공적으로 진행되기를 기대하며, 독자들이 세션 에이전트 추적 데이터를 통해 실시간으로 개발 상황을 확인할 수 있도록 링크를 제공하고 있습니다.
LLM Compressor 팀이 Kimi-K2.6 모델의 NVFP4 및 FP8 양자화 체크포인트를 공개했습니다. 이 경량화된 버전들은 고성능 AI 추론을 위한 메모리 효율성과 속도 향상을 목표로 합니다.
Microsoft가 Hugging Face와 협력하여 'DELULU'라는 새로운 평가 벤치마크를 출시했습니다. 이 벤치마크는 중간 코드 완성(fill-in-the-middle) 작업을 위한 전용 평가 세트입니다. 또한, RoundPipe 기술은 단일 GPU 환경에서 대규모 모델을 효율적으로 미세 조정하고 실행할 수 있게 하여, 기존 최고 성능 대비 1.5~2.2배의 속도 향상을 제공합니다.