llama.cpp b10217 Tool Calling 기능 도입 — DeepSeek GGUF 및 NVIDIA SDK 포함
요약
llama.cpp b10217 업데이트를 통해 로컬 LLM 환경에서 도구 호출(Tool Calling) 기능이 도입되었습니다. 또한 DeepSeek-V4-Flash의 GGUF 지원과 NVIDIA SDK 업데이트 등 로컬 AI 추론 및 에이전트 구축을 위한 주요 소식들을 다룹니다.
핵심 포인트
- llama.cpp b10217: 채팅 중 도구 호출(Tool Calling) 기능 지원
- DeepSeek-V4-Flash 모델의 GGUF 형식 출시로 로컬 추론 용이성 증대
- 로컬 환경에서 클라우드 API 없이 정교한 에이전트 구축 가능
- NVIDIA SDK 및 Reckless Rust 체스 엔진 업데이트 포함
오늘의 요약은 llama.cpp의 b10217 릴리스가 새로운 도구 호출 (Tool Calling) 기능을 도입했다는 중요한 업데이트를 강조합니다. DeepSeek의 V4-Flash 모델 또한 GGUF 형식으로 출시되었으며, CUDA Python 및 비디오 코덱을 위한 새로운 NVIDIA SDK와 Reckless Rust 체스 엔진의 업데이트도 함께 포함되었습니다.
로컬 AI 및 오픈 모델 (Local AI & Open Models)
이번 주에는 llama.cpp b10217이 채팅에서 도구 호출 (Tool calls)을 가능하게 하고, Reckless 체스 엔진이 v0.9.0에 도달하는 등 로컬 AI 추론 (Inference)을 위한 주요 업데이트가 있었습니다. 또한, DeepSeek-V4-Flash-0731 모델이 이제 GGUF 형식으로 제공되어, 소비자용 GPU에서 고성능 로컬 추론을 더욱 쉽게 사용할 수 있게 되었습니다.
llama.cpp b10217 채팅에서 Tool Calling 기능 데뷔 (llama.cpp)
출처: llama.cpp
llama.cpp의 최신 업데이트인 b10217 버전은 DS4 모델의 사고 단계 (Thinking phase) 내에서 도구 호출 (Tool call) 기능을 활성화함으로써 채팅 애플리케이션을 위한 주목할 만한 향상을 선보입니다. 이 기능은 모델이 생성 과정 중에 외부 도구 또는 API를 활용할 수 있게 하여, 단순한 텍스트 생성을 넘어 효율적인 llama.cpp 런타임 내에서 직접 더 복잡한 에이전트(Agent)와 같은 동작을 수행할 수 있도록 합니다. 이번 업데이트는 macOS Apple Silicon 및 Linux 시스템을 포함한 소비자용 하드웨어에서 대규모 언어 모델 (LLM)을 로컬로 실행하기 위한 기초적인 프로젝트인 llama.cpp의 지속적인 진화의 일환입니다.
요약에서는 구체적으로 chat : enable tool call in thinking for DS4 ( #26269 )를 언급하며 특화된 기능을 암시하고 있지만, 이번 추가 사항은 LLM을 외부 서비스와 통합하거나 정교한 로컬 에이전트 (Local Agents)를 구축하려는 개발자들에게 매우 중요합니다. 도구 (Tools)를 동적으로 호출할 수 있는 능력은 자원이 제한된 장치에서 실행되는 모델의 유용성을 크게 확장할 수 있으며, 실시간 데이터 가져오기, 계산 수행, 또는 다른 소프트웨어 구성 요소와의 상호 작용과 같은 작업을 수행할 수 있게 해줍니다. 이번 릴리스는 사용자에게 더욱 강력하고 다재다능한 도구를 제공함으로써, 로컬 AI 추론 (Inference)을 발전시키려는 llama.cpp의 약속을 지속합니다.
llama.cpp 채팅 모델 내에 도구 호출 (Tool Call) 기능을 직접 추가하는 것은 정교한 로컬 에이전트를 구축하는 데 있어 게임 체인저입니다. 이는 도구 오케스트레이션 (Orchestration)을 위해 클라우드 API에 의존하지 않고도 소비자용 GPU에서 할 수 있는 일을 획기적으로 확장합니다.
Reckless Chess Engine v0.9.0 출시, Rust 기반 경쟁용 AI 발전 (Reckless (Rust chess))
경쟁용 체스 엔진인 Reckless가 버전 0.9.0 출시를 발표했으며, 이는 이 Rust 기반 프로젝트의 중요한 이정표가 됩니다. 이번 업데이트는 Windows, Linux, macOS용 사전 빌드된 바이너리 (Pre-built binaries)를 제공하여, 애호가와 경쟁 플레이어들이 쉽게 다운로드하여 사용할 수 있도록 합니다. 게임 AI 분야의 주요 사례로서, 이번 릴리스는 Stockfish 및 Leela Chess Zero와 같은 기존의 이름들과 어깨를 나란히 하며 프로젝트의 성숙도와 경쟁용 체스 엔진 환경에서의 성장하는 존재감을 강조합니다.
Reckless의 개발, 특히 Rust 언어로 구현된 점은 성능과 메모리 안전성(Memory Safety)에 집중하고 있다는 점에서 개발자들의 관심을 끌고 있으며, 이는 체스 AI와 같은 고성능 컴퓨팅(High-performance computing) 작업의 핵심 속성입니다. v0.9.0에 대한 구체적인 변경 로그(Changelog) 세부 사항이 요약에 완전히 명시되지는 않았으나, 메이저 버전의 증가는 일반적으로 평가(Evaluation), 탐색 알고리즘(Search algorithms) 또는 전반적인 엔진 성능의 상당한 개선을 의미합니다. 로컬 AI 및 오픈 모델 측면에서 Reckless는 복잡한 신경망 평가 함수(NNUE)나 정교한 탐색 알고리즘을 활용하는 고급 AI가 어떻게 소비자용 하드웨어에서 개발되고 배포될 수 있는지를 보여주는 전형적인 사례이며, 로컬에서 실행 가능한 최첨단 AI의 실질적인 예시를 제공합니다.
Rust 기반 체스 엔진의 새로운 안정 버전(Stable release) 출시 소식은 매우 흥미롭습니다. 이는 LLM을 넘어선 효율적인 로컬 AI의 가능성을 보여줍니다. 저는 이 엔진의 성능 향상과 Rust 아키텍처가 성능에 미치는 영향을 테스트해보고 싶습니다.
DeepSeek-V4-Flash-0731, GGUF 형식으로 Hugging Face에 출시되어 로컬 추론 가능 (Hugging Face 트렌딩)
deepseek-ai가 개발한 DeepSeek-V4-Flash-0731 모델이 unsloth가 출시한 GGUF 양자화(Quantization) 버전과 함께 현재 Hugging Face에서 트렌딩되고 있습니다. 이번 출시는 소비자용 GPU 및 CPU에서도 모델을 매우 쉽게 로컬 추론(Local inference)할 수 있도록 하여, 실행 가능한 오픈 웨이트(Open-weight) 모델에 집중하는 PatentLLM 블로그의 방향성과 완벽히 일치합니다. GGUF 태그는 llama.cpp와 같은 도구와의 호환성을 의미하며, 사용자가 다양한 양자화 수준을 선택하여 성능과 메모리 점유율(Memory footprint) 사이의 균형을 맞추며 모델을 다운로드하고 실행할 수 있게 해줍니다. 특히 최적화된 'Flash' 변형인 이번 버전은 더 빠른 추론을 약속합니다.
GGUF 형식으로 인기 모델을 사용할 수 있다는 점은 AI의 민주화에 있어 매우 중요하며, 개인 사용자들이 고사양 데이터 센터 하드웨어 없이도 고급 LLM (Large Language Models)을 실험할 수 있게 해줍니다. GGUF 변환을 제공하는 Unsloth의 기여는 실용적인 로컬 배포를 위해 모델을 최적화하려는 커뮤니티의 노력을 더욱 강조합니다. 개발자와 애호가들에게 이는 로컬 애플리케이션에 통합하거나, 미세 조정(Fine-tuning)하거나, 다양한 텍스트 생성 작업에 사용할 수 있는 강력한 언어 모델에 즉각적으로 접근할 수 있음을 의미하며, 이 모든 과정에서 소비자용 하드웨어에서 최적의 성능을 내기 위한 효율적인 양자화 (Quantization)의 이점을 누릴 수 있습니다.
인기 모델들이 빠르게 GGUF 버전으로 출시되는 것을 보는 것이야말로 로컬 AI 도입을 위해 정확히 우리에게 필요한 것입니다. 이번 GGUF 버전의 DeepSeek Flash 변형은 빠르고 소비자 친화적인 추론이 이제 다운로드 한 번으로 가능해졌음을 의미합니다.
Full Local AI & Open Models archive
GPU, CUDA 및 자율 주행
이번 주는 NVIDIA CUDA Python cuda-pathfinder v1.6.0의 공식 출시를 필두로 GPU 개발자들을 위한 중요한 업데이트들이 있습니다. 또한, NVIDIA는 제로 카피 트랜스코딩 (Zero-copy transcode) 기능이 포함된 Video Codec SDK 13.1을 공개했으며, AMD는 Instinct MI455X를 위한 CDNA5 ISA 문서를 발표했습니다.
CUDA Python cuda-pathfinder v1.6.0 출시 (NVIDIA)
NVIDIA는 CUDA Python의 cuda-pathfinder 라이브러리가 1.6.0 버전으로 공식 출시되었음을 발표했습니다. 이번 업데이트는 Python 환경에 특화되어 설계된 강화된 GPU 가속 경로 탐색 (Pathfinding) 알고리즘 세트를 제공하며, 이를 통해 Python 과학 계산 커뮤니티가 고급 그래프 순회 (Graph traversal) 및 최단 경로 계산을 더욱 쉽게 사용할 수 있게 합니다. NVIDIA GPU를 활용함으로써, cuda-pathfinder v1.6.0은 물류 최적화, 로보틱스, 복잡한 네트워크 분석과 같은 다양한 분야의 애플리케이션에서 상당한 성능 향상을 약속합니다.
릴리스 노트(release notes)는 개발자가 명시적인 C++ CUDA 커널 프로그래밍을 깊이 파고들지 않고도 계산 집약적인 작업을 GPU로 오프로드(offload)할 수 있게 해주는 다양한 API 개선 사항과 성능 최적화 내용을 상세히 다룹니다. 이번 반복(iteration)은 Python의 높은 사용성과 CUDA-X 라이브러리의 가공되지 않은 강력한 성능 사이의 간극을 메우려는 NVIDIA의 약속을 더욱 공고히 합니다. 이 라이브러리는 pip를 통해 즉시 설치할 수 있어, GPU 가속을 원하는 기존 Python 기반 워크플로우에 간편하게 통합할 수 있습니다.
이는 고성능 경로 탐색(pathfinding)이 필요한 Python 개발자들에게 직접적인 이득입니다.
cuda-pathfinderv1.6.0 업데이트는 복잡한 그래프 문제에 대해 더 빠른 알고리즘을 의미하며,pip를 통해 직접 접근할 수 있습니다.
NVIDIA Video Codec SDK 13.1, 제로 카피 트랜스코딩 및 AV1 B-프레임 도입 (NVIDIA Developer Blog)
NVIDIA가 GPU 가속 비디오 프로세싱에 종사하는 개발자들을 위해 상당한 진보를 가져다줄 Video Codec SDK 13.1을 출시했습니다. 주요 기능은 제로 카피 트랜스코딩(zero-copy transcode) 기능의 도입으로, 이는 트랜스코딩(transcoding) 작업 중 CPU-GPU 메모리 전송 오버헤드를 획기적으로 줄여줍니다. 이러한 혁신은 성능 향상과 낮은 지연 시간(latency)으로 이어져, 라이브 스트리밍, 클라우드 게임 및 전문 미디어 제작과 같이 요구 사항이 높은 비디오 파이프라인(video pipelines)에 특히 가치 있는 솔루션이 됩니다.
SDK 13.1의 추가 개선 사항에는 AV1 B-프레임 (B-frames)에 대한 강력한 지원이 포함되며, 이는 현대적인 AV1 코덱 (codec) 생태계 내에서 압축 효율과 전반적인 비디오 품질을 최적화하기 위한 중요한 추가 사항입니다. 이는 대역폭 절약과 우수한 시각적 충실도 (visual fidelity)가 최우선인 애플리케이션에 매우 중요합니다. 또한, SDK는 이제 프레임 단위의 정확한 탐색 (frame-accurate seek) 기능을 제공하여 비디오 스트림 내에서 정밀한 탐색을 가능하게 합니다. 이는 고급 비디오 편집, 분석 및 콘텐츠 검토 시스템에 필수적인 기능입니다. 이러한 업데이트는 자사의 GPU 플랫폼을 위한 최첨단 비디오 가속 도구를 제공하려는 NVIDIA의 헌신을 재확인시켜 줍니다.
SDK 13.1의 제로 카피 트랜스코딩 (Zero-copy transcode) 및 AV1 B-프레임 지원은 매우 큽니다. 이는 NVIDIA GPU에서 본격적인 비디오 애플리케이션을 구축하는 모든 이들에게 지연 시간을 줄이고 압축을 개선함으로써 성능과 품질에 직접적인 영향을 미칩니다.
AMD, Instinct MI455X를 위한 CDNA5 ISA 문서 공개 (Phoronix)
출처: Phoronix
최근 AMD Instinct MI455X 가속기의 출시 이후, AMD는 자사의 CDNA5 아키텍처 (architecture)에 대한 명령어 집합 아키텍처 (Instruction Set Architecture, ISA) 문서를 공식적으로 공개했습니다. 이번 공식 릴리스는 기반이 되는 마이크로아키텍처 (microarchitecture)와 MI455X에서 사용되는 전체 명령어 집합에 대한 심층적인 기술 사양을 제공합니다. 이러한 문서는 컴파일러 개발자, 저수준 프로그래머 (low-level programmers), 그리고 AMD의 데이터 센터 GPU를 위한 워크로드 최적화에 집중하는 연구자들에게 없어서는 안 될 필수적인 리소스입니다.
CDNA5 ISA 문서의 가용성을 통해 컴퓨팅 유닛 (Compute Units), 복잡한 메모리 계층 구조 (Memory Hierarchy), 그리고 인공지능 (AI) 및 고성능 컴퓨팅 (HPC) 워크로드에 최적화된 특수 명령어 (Specialized Instructions)를 포함한 아키텍처의 핵심 구성 요소에 대한 포괄적인 이해가 가능해졌습니다. 이러한 이니셔티브는 아키텍처 세부 사항에 대한 투명성을 확보하려는 AMD의 의지를 강조하며, 더 넓은 개발자 커뮤니티가 Instinct 하드웨어로부터 성능을 극대화할 수 있도록 지원합니다. HPC 및 AI의 최전선에서 활동하는 이들에게 CDNA5 ISA 문서는 코드를 미세 조정 (Fine-tuning)하고, 커스텀 커널 (Custom Kernels)을 개발하며, MI455X의 고급 기능을 최적으로 활용하기 위한 필수적인 도구입니다.
MI455X를 위한 CDNA5 ISA에 대한 접근은 심층적인 최적화 (Deep Optimization)를 위해 매우 가치 있는 자원입니다. 컴파일러 엔지니어와 HPC 개발자들은 이제 아키텍처를 진정으로 이해하고 최고 성능을 위해 활용할 수 있습니다.
Full GPU, CUDA & Autonomous Driving archive
공식 릴리스 피드, 벤더 변경 로그(Changelogs) 및 엔지니어링 블로그를 통해 매일 컴파일됩니다. 아카이브: https://media.patentllm.org
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기