Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 기술 기사는 Hugging Face 플랫폼에 세 가지 새로운 서버리스 추론 제공자(Hyperbolic, Nebius AI Studio, Novita)가 추가되었음을 발표합니다. 사용자는 이제 사용자 계정 설정에서 개별 API 키를 설정하고 선호도에 따라 제공자를 정렬할 수 있습니다. 추론 호출은 커스텀 키를 사용하여 직접 제공자에게 요청을 보내거나, Hugging Face(HF)를 통해 라우팅하는 두 가지 모드를 지원하며, 이를 통해 다양한 모델과 비용 관리 옵션을 제공합니다.

Fireworks.ai가 Hugging Face Hub의 공식 지원 Inference Provider로 합류했습니다. 이를 통해 사용자들은 HF 생태계 전반에서 번개 속도의 서버리스 추론을 더욱 쉽게 이용할 수 있게 되었습니다. 이제 DeepSeek-R1, Mistral-Small-24B 등 다양한 인기 모델들을 Fireworks.ai를 통해 서버리스 방식으로 실행할 수 있으며, `huggingface_hub` 라이브러리나 cURL 명령어를 사용하여 통합적으로 접근하는 방법을 안내하고 있습니다.
구글이 PaliGemma 2 Mix라는 새로운 시각 언어 모델(VLM)을 출시했으며, 이는 OCR, 긴/짧은 캡션 생성 등 다양한 시각 작업에 맞게 미세 조정되었습니다. 이 모델은 단순히 채팅 기능을 제공하기보다, 하위 작업에서 더 잘 학습할 수 있도록 설계된 사전 학습 체크포인트를 제공하는 데 중점을 둡니다. 사용자는 개방형 프롬프트와 특정 작업 접두사(예: `caption`, `ocr`, `answer`)를 사용하여 이미지 질문 답변, 문서 이해, 객체 감지 등 다양한 전문 작업을 수행할 수 있습니다.

SmolVLM2는 거대한 컴퓨팅 자원을 요구하는 기존의 비디오 이해 모델 패러다임을 전환하여, 스마트폰부터 서버까지 모든 기기에서 실행 가능한 효율적인 경량화 비디오 언어 모델입니다. 이 프로젝트는 256M, 500M, 2.2B 세 가지 크기의 모델을 제공하며, 특히 메모리 효율성 대비 뛰어난 성능으로 Video-MME와 같은 과학적 벤치마크에서 선두를 달리고 있습니다. 개발자들은 MLX 및 Python API를 통해 즉시 접근할 수 있으며, 이를 활용하여 로컬 기기 기반의 비디오 분석 앱(예: 아이폰 앱), 지능형 미디어 플레이어 통합, 장시간 영상 요약 도구 등 다양한 실용적인 애플리케이션을 구축할 수 있습니다.
Hugging Face는 JFrog와 파트너십을 맺고 Hugging Face Hub의 보안을 강화합니다. 이번 협력을 통해 JFrog의 강력한 스캐닝 기능을 통합하여, 모델 가중치에서 발생할 수 있는 임의 코드 실행(RCE)과 같은 잠재적인 악성 코드를 탐지하고 투명성을 높입니다. 이 기능은 모든 공개 모델 저장소에 자동으로 적용되어 커뮤니티가 안전하게 AI 모델을 공유하도록 돕습니다.

LeRobot 팀에서 발표한 L2D(Learning to Drive) 데이터셋은 독일의 30개 도시에서 수집된 90TB 이상의 초대형 오픈소스 자율주행 데이터셋입니다. 이 데이터셋은 HD 카메라 6대, GPS/IMU, CAN 인터페이스를 포함하는 다중 모달 데이터를 제공하며, 단순한 주행 기록을 넘어 자연어 지시와 미래 웨이포인트가 결합된 '에피소드' 단위로 구성되어 있습니다. L2D의 가장 큰 특징은 '전문가 정책(최적 주행)'과 '학생 정책(실수 포함 학습 과정)'이라는 두 가지 관점의 데이터를 모두 담고 있어, 자율주행 시스템이 단순한 경로 추종을 넘어 복잡하고 현실적인 운전 상황에서의 의사결정 능력을 훈련할 수 있도록 설계되었습니다.
Hugging Face는 Xet 스토리지를 Hugging Face Hub에 상용화하며 AI 빌더들이 거대 모델과 데이터셋을 더욱 효율적으로 관리하고 협업할 수 있도록 지원합니다. 기존 LFS(Large File Storage)가 파일 단위로 중복 제거 및 리비전을 생성하는 방식의 한계를 극복하기 위해, Xet은 콘텐츠 정의된 청킹(CDC)을 사용하여 바이트 수준에서 중복을 제거하고 변경된 데이터 조각만 전송할 수 있게 합니다. 이 마이그레이션 과정은 4.5TB 규모의 저장소를 성공적으로 전환했으며, 시스템 안정성과 성능 향상을 입증했습니다.
NVIDIA가 GTC 2025에서 물리 AI 개발자를 위한 혁신적인 오픈 모델과 데이터셋을 발표했습니다. 주요 내용으로는 가상 세계 장면 생성에 높은 제어력을 제공하는 'Cosmos Transfer'와 로봇 훈련용 대규모 데이터를 담은 'Physical AI Dataset'이 있습니다. 또한, 인간형 로봇의 추론 및 조작 기술을 위한 최초의 오픈 파운데이션 모델인 'Isaac GR00T N1'도 공개되어, 자율 시스템 개발에 새로운 지평을 열었습니다.
본 문서는 백악관의 AI 행동 계획 RFI에 대한 답변으로, 개방형(오픈소스) AI 개발 접근법이 성능, 투명성, 경제적 효율성 측면에서 상업적 API 기반 솔루션보다 우수함을 주장합니다. 오픈 가중치 모델과 오픈 인프라를 활용하는 것이 국가 차원의 AI 발전 및 채택에 필수적이며, 특히 의료와 같은 고위험 환경에서는 완전한 통제와 투명성을 제공하는 개방형 시스템이 보안 및 신뢰성 측면에서 가장 중요하다고 강조합니다.

Meta가 Llama 4 Maverick와 Scout라는 강력한 원생적 멀티모달 모델을 Hugging Face 생태계에 출시하며 AI 분야의 중요한 도약을 알렸습니다. 이 두 모델은 각각 대규모(Maverick) 및 효율성(Scout)에 초점을 맞추었으며, 최대 40조 토큰으로 훈련되어 200개 언어와 멀티모달 기능을 지원합니다. 특히 Scout는 온-더-플라이 양자화를 통해 접근성을 높였고, 두 모델 모두 Hugging Face의 `transformers` 및 TGI를 완벽하게 통합하여 프로덕션 환경에서의 사용이 용이합니다.
Falcon-H1은 0.5B부터 34B까지 다양한 규모의 오픈소스 언어 모델 가족으로, 기존 트랜스포머 기반 어텐션 메커니즘과 State Space Model (SSM)을 결합한 하이브리드 아키텍처를 채택했습니다. 이 혁신적인 설계는 빠른 추론 속도와 낮은 메모리 사용량을 유지하면서 최상위 성능을 달성할 수 있게 합니다. 모델은 에지 디바이스부터 대규모 배포까지 활용 가능한 광범위한 스케일과 튜닝 버전을 제공하며, 최대 256K 컨텍스트 길이 지원, 다국어 능력, 그리고 STEM 분야에서의 강력한 성능을 자랑합니다.
본 기술 기사는 LLM 훈련(특히 온라인 학습 알고리즘인 GRPO)과 추론 과정의 효율성을 극대화하는 방법을 다룹니다. 기존에는 TRL이 vLLM을 별도의 서버 프로세스로 실행하여 GPU 자원 비효율성, 대기 시간 및 높은 비용 문제를 야기했습니다. 이를 해결하기 위해 TRL은 vLLM을 훈련 코드와 동일한 GPU 내에서 '콜로케이션(Co-located)' 방식으로 통합하여, 두 작업이 같은 리소스를 공유하며 효율적으로 전환할 수 있게 되었습니다.
SmolVLA는 소비자 하드웨어에서 실행 가능하도록 설계된 컴팩트하고 오픈소스인 비전-언어-행동(VLA) 모델입니다. 이 모델은 공개 커뮤니티 데이터셋만을 사용하여 훈련되었으며, 대규모 독점 모델에 의존하던 VLA 분야의 접근성 문제를 해결합니다. SmolVLA는 효율적인 아키텍처 설계와 비동기 추론 스택을 통해 기존의 거대 모델들과 동등하거나 그 이상의 성능을 보이면서도 응답 속도를 획기적으로 개선했습니다.

이 가이드는 'kernel-builder' 라이브러리를 활용하여 GPU 환경에 최적화된 프로덕션급 CUDA 커널을 구축하고 배포하는 방법을 안내합니다. 단순히 코드를 작성하는 것을 넘어, PyTorch의 네이티브 연산자로 등록하고 `torch.compile`과 같은 핵심 생태계 기능과 통합함으로써 성능과 유지보수성을 극대화하는 엔지니어링 전략에 초점을 맞춥니다. 구체적으로는 프로젝트 구조(build.toml, csrc/, flake.nix)를 정의하고, CUDA 소스 코드를 작성한 후, PyTorch의 `torch.ops` 네임스페이스 아래에서 연산자를 등록하여 모든 환경에서 재현 가능하고 포터블하며 최적화된 커널을 완성하는 과정을 다룹니다.

본 기사는 대규모 언어 모델(LLM)의 효율성을 확보하기 위해 '정제(Distillation)' 기술을 적용한 Apriel-H1 모델에 대한 연구 결과를 다룹니다. 핵심은 단순히 데이터를 정제하는 것이 아니라, 강력한 교사 모델(Teacher Model)이 가진 **다단계 추론 패턴**과 같은 구체적이고 취약한 능력을 보존하는 데 있습니다. 저자들은 이 능력을 효과적으로 전달하기 위해 '교사의 SFT 데이터셋에서 추출된 고품질 추론 트레이스'를 사용하고, 정제 과정에서는 역방향 KL 발산(reverse KL divergence)을 적용하여 모델의 높은 확신도를 학습시키는 것이 중요함을 강조합니다.
Gradio는 단순한 UI 라이브러리를 넘어, 머신 러닝 모델과 상호작용하는 강력한 프레임워크입니다. 이 프레임워크는 자동화된 API 엔드포인트 생성, 클라이언트 SDK 제공, 그리고 'API 레코더' 기능을 통해 개발 과정의 효율성을 극대화합니다. 또한, 서버 사이 렌더링(SSR) 도입으로 성능과 SEO를 개선하고, 고급 큐잉 시스템 및 스트리밍 기능을 내장하여 대규모 사용자 트래픽과 GPU 집약적 계산을 안정적으로 처리할 수 있게 합니다.
AutoRound는 인텔이 개발한 가중치 기반의 후학습 양자화(PTQ) 방법으로, 최소한의 정확도 손실로 INT2부터 INT8까지의 저비트 양자화를 가능하게 합니다. 이 방법은 부호화된 경사 하강법을 사용하여 가중치 반올림과 클립 범위를 동시에 최적화하며, 특히 2비트 정밀도와 같은 극저비트 시나리오에서 높은 성능 우위를 보여줍니다. AutoRound는 LLM 및 VLM 모두를 지원하며, Qwen, LLaMA 등 주요 아키텍처를 포괄합니다. 또한 GPTQ/AWQ와 같은 기존 양자화 형식으로 내보내기 기능을 제공하고, 'auto-round-best'와 'auto-round-light' 두 가지 레시피를 통해 사용자가 원하는 정확도와 속도를 선택할 수 있습니다.
DeepSeek에서 R1 추론 모델 기반인 DeepSeek-V3의 업데이트 버전(Open R1)이 출시되었습니다. 이 모델은 GPT-4.5와 동등하거나 Claude Sonnet 3.7보다 강력한 성능을 보여주며, MMLU-Pro (+5.3), GPQA (+9.3), AIME (+19.8) 등 주요 벤치마크에서 큰 폭의 개선을 이루었습니다. 특히 프론트엔드 웹 개발, 중국어 작문/검색 능력, 함수 호출 정확도 등 특정 영역에 초점을 맞춰 성능이 향상되었으며, 사용자는 Hugging Face Inference Providers, TGI, SGLang, Unsloth 등을 통해 이 모델을 쉽게 실험하고 배포할 수 있습니다.
Hugging Face의 Text Generation Inference (TGI)가 Intel Gaudi 하드웨어 지원 기능을 공식적으로 통합하여 LLM 추론 배포의 유연성과 효율성을 크게 향상시켰습니다. 이전에는 별도의 포크(fork)를 사용해야 했으나, 이제 TGI의 다중 백엔드 아키텍처를 통해 Gaudi를 직접 지원하며, 이는 Gaudi1부터 Gaudi3까지 Intel의 전체 라인업을 커버합니다. 이 통합은 Llama 3.1, Mixtral 등 주요 모델에 대한 프로덕션급 기능을 제공하며, 비용 효율성과 다양한 하드웨어 옵션을 사용자에게 제시합니다.
Hugging Face는 AI 민주화 사명 강화를 위해 기존 NLP 코스를 'The LLM course'로 대폭 업그레이드합니다. 이 업데이트를 통해 LLM 미세 조정, 추론 모델 구축 등 최신 트렌드를 다루며, 동시에 분류나 NER 같은 고전적이고 실용적인 NLP 작업의 중요성도 유지할 것입니다. 앞으로는 Hugging Face 라이브러리뿐만 아니라 다양한 오픈소스 도구와 협력하여 학생들이 현업에서 가장 유용한 지식과 코딩 연습을 할 수 있도록 커뮤니티 중심의 학습 자료를 제공하는 데 집중할 계획입니다.