Stockfish 18 출시 — LLM 및 MoE 혁신 포함
요약
Stockfish 18 출시와 함께 Inkling 멀티모달 모델, vLLM v0.26.0, llama.cpp 업데이트 등 AI 생태계의 주요 기술적 진보가 발표되었습니다. 특히 대규모 파라미터를 가진 Inkling 모델의 Transformers 및 vLLM 통합과 오디오 입력 지원 확대가 핵심입니다.
핵심 포인트
- Stockfish 18 출시 및 체스 AI 기술 진보
- 9,750억 파라미터 규모의 Inkling 멀티모달 모델 공개
- vLLM의 CUDA 그래프 지원을 통한 Inkling 추론 가속화
- llama.cpp의 MiMo-V2.5 오디오 입력 및 RVQ 모델 지원
오늘 세계에서 가장 강력한 체스 엔진인 Stockfish 18이 출시되었습니다. 이와 더불어 LLM (Large Language Model) 생태계는 새로운 모델 통합, 오디오 입력 기능, 그리고 MoE (Mixture-of-Experts) 모델의 발전과 함께 상당한 주목을 받았습니다.
로컬 AI 및 오픈 모델 (Open Models)
오늘은 Hugging Face Transformers v5.14.0 및 vLLM v0.26.0에서 즉각적인 지원을 제공하는 Inkling 멀티모달 (multimodal) 모델의 출시가 특징입니다. 또한, llama.cpp b10155는 MiMo-V2.5 오디오 입력 및 RVQ 모델 지원을 가져왔으며, 체스 AI 분야에서는 Stockfish 18의 주요 출시가 있었습니다.
Hugging Face Transformers v5.14.0, 새로운 Inkling 모델 통합 및 vLLM 지원 추가 (Hugging Face Transformers / vLLM)
출처: Hugging Face Transformers / vLLM
Hugging Face Transformers v5.14.0은 Thinking Machines에서 개발한 새로운 범용 멀티모달 (multimodal) 모델인 Inkling 모델 제품군을 공식적으로 소개합니다. 총 9,750억 개의 파라미터(parameters)와 410억 개의 활성 파라미터(active parameters)를 보유한 Inkling은 오픈 웨이트 (open-weight) 모델 환경에서 중요한 새로운 진입을 알립니다. Transformers 라이브러리에 포함됨에 따라 개발자들은 모델 로딩, 처리 및 추론(inference)을 위해 Hugging Face가 제공하는 포괄적인 도구 세트를 활용하여 이 거대한 모델에 즉시 접근하고 실험할 수 있습니다. 이번 출시는 특히 대규모 멀티모달 (multimodal) 작업을 수행하는 이들을 중심으로 AI 커뮤니티 내에서 Inkling의 광범위한 채택과 추가적인 발전을 위한 발판을 마련했습니다.
이를 보완하여, vLLM v0.26.0은 새로운 Inkling 모델 제품군에 대한 완전한 지원을 동시에 출시했습니다. 여기에는 기본 모델링 (base modeling) 기능과 결정적으로, 조각별 CUDA 그래프 (piecewise CUDA graph) 지원이 포함됩니다. CUDA 그래프의 통합은 추론 가속화 (inference acceleration)를 위한 핵심적인 발전이며, NVIDIA GPU에서 Inkling과 같은 대규모 모델을 더욱 효율적이고 낮은 지연 시간 (low-latency)으로 실행할 수 있게 합니다. 로컬 추론 (local inference)에 집중하는 실무자들에게 이는 Inkling을 최적화된 성능으로 실행할 수 있음을 의미하며, 소비자급 하드웨어에서의 실제 애플리케이션 적용을 더욱 실용적으로 만들어 줍니다. Transformers와 vLLM 양측 모두에서 이루어진 신속한 듀얼 플랫폼 지원은 Inkling이 배포 및 연구를 위한 즉각적인 준비가 되었음을 강조합니다.
Inkling이 Transformers와 vLLM 모두에 즉시 통합되었다는 것은 개발자들이 가속화된 추론을 통해 로컬 하드웨어에서 이 대규모 멀티모달 모델 (large multimodal model)을 즉시 실험할 수 있음을 의미하며, 이는 실제 성능을 평가하는 데 매우 중요합니다.
llama.cpp, MiMo-V2.5 오디오 입력 및 RVQ 기반 모델 지원 추가 (llama.cpp)
출처: llama.cpp
최신 llama.cpp 릴리스인 b10155는 MiMo-V2.5 오디오 입력 모델에 대한 지원을 추가함으로써 그 역량을 크게 확장했습니다. 이번 업데이트는 llama.cpp가 기존의 텍스트 전용 중심에서 벗어나 오디오 입력을 직접 처리할 수 있게 됨으로써, 멀티모달 AI (multimodal AI)로 나아가는 중요한 진전을 나타냅니다. RVQ 기반 모델로 설명되는 MiMo-V2.5 모델로 오디오를 처리할 수 있는 능력은 특히 로컬 추론에 있어 매우 유의미합니다. RVQ (Residual Vector Quantization, 잔차 벡터 양자화)는 모델 압축의 효율성으로 잘 알려진 기술로, 메모리 자원이 제한된 소비자급 CPU 및 GPU에서 모델을 실행하기에 더욱 적합하게 만들어 줍니다.
이러한 개선을 통해 개발자들은 이제 llama.cpp를 로컬 음성-텍스트 변환 (speech-to-text) 처리나 음성 명령에 반응하는 AI 에이전트와 같이 더 넓은 범위의 애플리케이션에 활용할 수 있으며, 동시에 효율적인 로컬 실행을 위한 프로젝트의 최적화 이점을 누릴 수 있습니다. 새롭고 다양한 모델과 RVQ와 같은 효율적인 양자화 (quantization) 방법론의 지속적인 통합은, 고급 AI를 일상적인 하드웨어에서 사용할 수 있게 만드는 필수적인 도구로서 llama.cpp의 입지를 더욱 공고히 합니다. 이번 릴리스를 통해 멀티모달 (multimodal) AI 연구 및 배포가 클라우드 기반 서비스에 대한 의존 없이 점점 더 많이 이루어질 수 있도록 보장합니다.
llama.cpp에 오디오 입력과 RVQ 기반 멀티모달 모델 지원을 추가한 것은 큰 진전이며, 이를 통해 더욱 다양한 로컬 AI 애플리케이션을 가능하게 하고 소비자용 하드웨어에서 멀티모달 작업이 가능한 한계를 넓히고 있습니다.
Stockfish 18 출시: 세계 최강의 체스 엔진을 위한 주요 업데이트 (Stockfish (chess NNUE))
새로운 메이저 릴리스인 Stockfish 18은 세계 최강의 오픈 소스 체스 엔진으로서의 입지를 굳건히 합니다. 이번 업데이트는 평가 함수 (evaluation function)와 탐색 알고리즘 (search algorithms)에서 상당한 개선을 제공하며, 경쟁적인 컴퓨터 체스의 한계를 뛰어넘어 온 Stockfish의 유산을 이어갑니다. "로컬 AI 및 오픈 모델 (Local AI & Open Models)" 카테고리에서 Stockfish는 특히 신경망 UCI 엔진 (NNUE, Neural Network Uci Engine) 평가 함수의 사용을 통해 소비자용 하드웨어에서 실행 가능한 고성능 AI의 대표적인 사례입니다. NNUE 네트워크는 CPU 및 GPU에서 효율적인 추론 (inference)을 위해 특별히 설계된 소형 신경망으로, Stockfish가 심층 탐색과 정확하게 학습된 위치 평가 (positional evaluation)의 결합을 통해 놀라운 강력함을 달성할 수 있게 해줍니다.
Stockfish 18의 출시는 단순한 점진적 업데이트가 아닙니다. 이는 전 세계 개발자 커뮤니티가 수행한 수많은 셀프 플레이 (self-play) 게임과 아키텍처 개선의 결실을 의미합니다. 오픈 소스(open-source) 특성상, 정교한 NNUE 아키텍처와 최적화 기술을 포함한 기반 기술은 완전히 투명하게 공개되어 연구가 가능합니다. 개발자와 AI 애호가들에게 Stockfish 18은 복잡한 환경에서 실시간 의사결정을 위한 신경망 추론 (neural network inference) 최적화의 훌륭한 사례 연구가 되며, 게임 AI 및 로컬 고성능 컴퓨팅 분야에서 독보적인 사례로 자리매김합니다.
Stockfish 18은 체스 AI의 골드 표준 (gold standard) 지위를 유지하고 있으며, 끊임없는 개선을 통해 NNUE 기반 평가의 강력함을 보여줍니다. 이는 게임 엔진을 위한 소비자용 하드웨어 기반 최첨단 로컬 추론 (local inference)의 환상적인 사례를 제공합니다.
Full Local AI & Open Models archive
GPU, CUDA 및 자율 주행
이번 주, NVIDIA는 LLM 추론을 강화한 TensorRT-LLM v1.3.0rc21을 출시했으며, 이들의 GB300 NVL72 시스템은 MoE 사전 학습 (pre-training)에서 새로운 세계 기록을 달성했습니다. AMD 또한 Instinct MI300X GPU에서 학습된 오픈 소스 Mixture-of-Experts 언어 모델인 Instella-MoE를 도입하며 진전을 이루었습니다.
[OFFICIAL RELEASE] TensorRT-LLM v1.3.0rc21 출시 (NVIDIA)
출처: NVIDIA
NVIDIA의 공식 릴리스인 TensorRT-LLM v1.3.0rc21은 NVIDIA GPU에서 대규모 언어 모델 (LLM) 추론을 최적화하기 위한 툴킷을 지속적으로 발전시키고 있습니다. 릴리스 후보 (release candidate) 태그로 식별되는 이 버전은 LLM 배포의 성능과 효율성을 극대화하려는 개발자들에게 매우 중요합니다. 주목할 만한 변화로는 AutoDeploy 백엔드의 지원 중단 (deprecation)이 포함되며, 이는 배포 전략의 변화를 시사하고 더욱 견고하고 미래 지향적인 통합 방법에 역량을 집중하고 있음을 나타냅니다.
릴리스 노트는 다양한 LLM (Large Language Model) 아키텍처의 기능 구현 시간 (time-to-functionality)을 간소화하기 위한 "에이전트적 접근 방식 (agentic approaches)"에 대한 지속적인 연구와 함께, 모델 지원 및 기능 향상을 위한 NVIDIA의 의지를 강조합니다. 이는 복잡하고 진화하는 LLM 생태계를 다루는 사용자들의 핵심적인 페인 포인트 (pain points)를 해결하기 위해, TensorRT-LLM 내에서 더욱 자동화되고 지능적인 최적화 파이프라인을 구축하려는 미래 방향성을 나타냅니다. 개발자들은 원활한 전환을 보장하고 추론 워크로드 (inference workloads)에 최신 최적화를 활용할 수 있도록, 상세한 변경 사항 및 호환성 고려 사항을 확인하기 위해 릴리스 노트를 검토할 것을 권장합니다.
이번 릴리스는 릴리스 후보 (release candidate) 단계임에도 불구하고, 특히 에이전트적 접근 방식이 향후 모델 지원을 단순화할 것이라는 암시와 함께 NVIDIA 하드웨어 기반 LLM 추론 최적화의 최전선에 머무는 데 매우 중요합니다.
NVIDIA GB300 NVL72에서 MoE 사전 학습 세계 기록 수립 (NVIDIA Developer Blog)
NVIDIA는 강력한 NVIDIA GB300 NVL72 시스템에서 달성한 Mixture-of-Experts (MoE) 사전 학습 (pre-training)의 새로운 세계 기록을 발표했습니다. 이 이정표는 프런티어 모델 (frontier model) 사전 학습을 위한 MoE 아키텍처로의 점진적인 전환을 강조하며, 이는 토큰당 연산량 (compute per token)을 최적화함으로써 대규모 AI 학습의 한계를 근본적으로 변화시킵니다. NVIDIA의 최첨단 Blackwell 세대 GPU 및 NVLink 상호 연결 기술를 대표하는 GB300 NVL72는 이러한 까다로운 워크로드를 처리하는 데 있어 타의 추종을 불허하는 능력을 입증합니다.
이 성과는 AI 워크로드를 효율적으로 확장하도록 설계된 NVIDIA의 통합 하드웨어 및 소프트웨어 스택(integrated hardware and software stack)의 성능 우위를 강조합니다. 이러한 수준의 성능은 차세대 AI 모델의 역량을 발전시키는 데 매우 중요하며, 연구자와 개발자가 이전보다 더 빠르고 더 크고 복잡한 모델을 훈련할 수 있게 해줍니다. 실무자들에게 이는 더 빠른 반복 주기(iteration cycles)와 MoE 아키텍처가 점점 더 널리 퍼지고 있는 다양한 AI 분야에서의 혁신 가능성을 의미합니다.
GB300 NVL72에서 MoE 사전 학습(pre-training)을 통해 세계 기록을 달성한 것은 대규모 AI의 한계를 뛰어넘기 위한 NVIDIA의 하드웨어 및 소프트웨어 스택을 입증하며, 최첨단 모델을 위한 엄청난 컴퓨팅 파워를 제공합니다.
Instella-MoE 소개: 최첨단 완전 오픈 Mixture-of-Experts 언어 모델 (AMD ROCm 블로그)
출처: AMD ROCm Blog
AMD는 오픈 소스 AI 생태계의 중요한 새로운 추가 사항인 Instella-MoE를 공개했습니다. 이는 최첨단 완전 오픈 Mixture-of-Experts (MoE) 언어 모델로 제시되었습니다. 이번 출시는 자사 하드웨어에 최적화된 고급 모델을 기여하려는 AMD의 핵심적인 노력을 나타내며, 특히 AMD Instinct™ MI300X GPU에서 처음부터(from scratch) 훈련되었다는 점을 강조합니다. Instella-MoE는 총 160억 개의 파라미터(parameters)와 28억 개의 활성 파라미터(active parameters)를 특징으로 하며, 전문화되고 효율적인 모델에 대한 증가하는 수요를 겨냥하여 다양한 AI 애플리케이션을 위한 강력하면서도 효율적인 솔루션을 제공합니다.
Instella-MoE의 도입은 ROCm 소프트웨어 플랫폼을 통해 Instinct 하드웨어에서 최첨단 AI의 개발 및 배포를 지원하려는 AMD의 의지를 보여줍니다. AMD는 완전히 개방된 MoE (Mixture-of-Experts) 모델을 제공함으로써, 개발자와 연구자들이 독점적인 제한 없이 고급 모델 아키텍처를 탐색하고 활용할 수 있도록 지원하며, 이를 통해 AMD의 AI 가속기 솔루션에 대한 혁신과 더 넓은 채택을 촉진합니다. 이러한 이니셔티브는 AMD 하드웨어에서 대규모 언어 모델 (LLM) 추론 및 학습을 위한 고성능 오픈 대안을 찾는 커뮤니티에 특히 가치 있는 것입니다.
Instella-MoE는 AMD Instinct MI300X의 역량을 직접적으로 보여주는 매력적인 오픈 소스 MoE LLM으로, 개발자들이 현대적이고 효율적인 모델 아키텍처를 통해 AMD의 하드웨어를 활용할 수 있는 명확한 경로를 제공합니다.
Full GPU, CUDA & Autonomous Driving archive
공식 릴리스 피드, 벤더 변경 로그 및 엔지니어링 블로그에서 매일 컴파일되었습니다. 아카이브: https://media.patentllm.org
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기