
Hetzner의 LLM 추론 (Inference) 서비스: 첫 살펴보기
요약
Hetzner가 실험적 단계의 LLM 추론(Inference) 서비스를 출시했습니다. OpenAI 호환 API를 제공하며, 현재 Qwen 모델을 지원하여 인프라 테스트와 워크로드 실험을 목적으로 운영됩니다.
핵심 포인트
- OpenAI 호환 API를 통해 기존 클라이언트와 쉽게 통합 가능
- 현재 Qwen/Qwen3.6-35B-A3B-FP8 모델만 지원하는 실험적 단계
- SLA나 프로덕션 보장이 없는 실험용 서비스임을 유의
- enable_thinking 옵션을 통한 추론 제어 가능성 확인

Hetzner Inference: 첫 살펴보기

Hetzner가 LLM 추론 (Inference)을 실험하고 있습니다.
제가 쓸 것이라고 예상하지 못한 문장이지만, 꽤 흥미롭다고 생각합니다 :)
누군가 자신의 프로덕션 AI 워크로드 (workloads)를 Hetzner로 옮기기 전에 알아두어야 할 점은, 이것이 매우 강력한 실험 (experiment) 단계라는 것입니다. 과금 체계도, SLA (서비스 수준 협약)도, 프로덕션 보장도 없으며, 현재는 단 하나의 모델만 존재합니다. Hetzner는 사람들이 실제로 이것을 원하는지, 시스템이 어떻게 확장(scale)되는지, 어떤 기능이 중요한지, 그리고 어떤 종류의 부하 (load)를 처리할 수 있는지 배우고 싶다고 말합니다.
따라서 이것은 완성된 제품 출시가 아닙니다. Hetzner가 초기 단계의 무언가를 사용자 앞에 내놓고 어떤 일이 일어나는지 지켜보는 과정입니다. 저는 이런 접근 방식을 정말 좋아합니다.
Hetzner Inference는 Hetzner 자체 인프라 (infrastructure)에서 실행되는 OpenAI 호환 API입니다. Experiments 대시보드에서 API 토큰을 생성하고, OpenAI 클라이언트를 Hetzner의 베이스 URL (base URL)로 지정하면 다른 대부분의 추론 API와 마찬가지로 사용할 수 있습니다.
현재 사용 가능한 유일한 모델은 Qwen/Qwen3.6-35B-A3B-FP8입니다.
이 모델은 350억 개의 파라미터 (parameters)를 가진 Mixture-of-Experts 모델이며, 활성 파라미터는 30억 개입니다. 텍스트와 이미지를 수용하며, 262K 컨텍스트 윈도우 (context window)를 가지고 있고, FP8 양자화 (quantized)된 가중치를 사용합니다.
이는 실험용으로 매우 합리적인 모델입니다. 터무니없는 GPU 클러스터 없이도 서비스할 수 있을 만큼 충분히 작으면서도, 실제 워크로드로 API를 테스트하기에는 충분히 유용합니다.

Hetzner는 코드를 작성하지 않고도 시도해보고 싶은 분들을 위해 OpenCode를 API에 연결하는 짧은 튜토리얼도 게시했습니다.
API가 OpenAI와 호환되기 때문에, 통합 (integration) 과정에서 특별한 점은 거의 없습니다:
pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://inference.hetzner.com/api/v1",
...
enable_thinking
enable_thinking 옵션은 언급할 가치가 있습니다. 이 옵션이 없으면 모델이 눈에 보이는 답변을 내놓기 전에 생성 예산(completion budget)의 놀라울 정도로 많은 양을 추론(reasoning)에 소비할 수 있습니다. 제 테스트에서는 이 옵션이 작동했지만, Hetzner 측의 공식 문서에는 명시되어 있지 않으므로 아직 이 정확한 요청 형태(request shape)를 기반으로 중요한 서비스를 구축하지는 않을 것입니다.
저는 2026년 7월 23일에 몇 가지 작은 테스트를 수행했습니다. 이 제품은 실험적 단계이며 이에 대한 벤치마크는 시간이 지나면 가치가 떨어질 가능성이 높기 때문에, 이 포스트를 거대한 벤치마크 보고서로 만들고 싶지는 않습니다. 하지만 대략적인 수치는 다음과 같았습니다:
이미 열려 있는 연결을 통해 수행된 7개의 짧은 요청에서 중앙값 첫 토큰 생성 시간(median time to first token) 153 ms
512 토큰으로 제한된 5개의 긴 생성 작업에서 초당 224개의 출력 토큰(output tokens per second)
정말 빠릅니다! 하지만 이는 특정 시점에 한 클라이언트가 수행한 단 한 번의 테스트일 뿐입니다. 이는 서비스 수준 협약(SLA)이 아니며, 많은 사람이 동시에 서비스를 사용할 때 어떤 일이 발생하는지에 대해서는 거의 아무것도 말해주지 않습니다.
모델 자체는 대략 제가 예상했던 수준이었습니다. 대부분의 포맷팅 및 검색(retrieval) 지침을 따랐고, 이미지를 올바르게 처리했으며, 매우 간단한 산수 문제 두 개에서 실패했습니다. 즉, 작고 약간은 형편없는 LLM입니다 :D
Qwen 엔드포인트는 재미있지만, 현재 모델이 흥미로운 부분이라고 생각하지는 않습니다.
흥미로운 부분은 Hetzner가 애초에 왜 추론(inference)을 테스트하고 있는가 하는 점입니다.
이후의 모든 내용은 순전히 저의 추측입니다. 저는 내부 정보를 가지고 있지 않으며, Hetzner의 누구도 그들이 무엇을 계획하고 있는지 저에게 말해주지 않았습니다. 저는 그저 제품을 살펴보고 몇 가지 점들을 연결해 보려고 할 뿐입니다.
오픈 웨이트(Open-weight) 추론은 범용 상품(commodity) 시장입니다. 누구나 동일한 가중치(weights)를 다운로드할 수 있고, 거의 동일한 서빙(serving) 소프트웨어를 실행하며, OpenAI 호환 API를 노출할 수 있습니다. 제공업체를 전환하는 것도 쉽습니다. 특히 OpenRouter나 직접 호스팅하는 사용자를 위한 LiteLLM 같은 제품을 사용하면 더욱 그렇습니다.
이러한 특성 때문에 어떤 종류의 우위를 점하지 않는 한 막대한 마진을 구축하기는 어렵습니다. 보통 이는 다음과 같은 의미를 갖습니다:
- GPU 하드웨어를 매우 저렴하게 구매하고 운영할 수 있거나;
- 해당 하드웨어를 쉬지 않고 가동하는 데 매우 탁월하거나;
- 또는 고객을 기다리며 놀고 있을 GPU를 이미 보유하고 있는 경우입니다.
Hetzner는 하드웨어를 구매하여 자체 데이터 센터에 배치하고, 매우 효율적인 비용 구조로 운영하는 데 매우 능숙합니다. 그것이 기본적으로 이 회사의 전부라고 할 수 있습니다. 만약 누군가가 추론 (Inference)을 또 다른 저마진 인프라 제품으로 바꿀 수 있다면, Hetzner는 적어도 믿을 만한 후보입니다.
여기에는 훌륭한 활용도 (Utilization) 이야기도 있습니다. 임대된 베어메탈 (Bare-metal) GPU는 고객이 사용하든 안 하든 한 명의 고객에게 속합니다. 반면 추론 API는 여러 사용자 간에 GPU 용량을 공유하여 하드웨어를 계속 가동 상태로 유지할 수 있습니다. 만약 Hetzner에 여유 GPU 용량이 있거나, 훨씬 더 큰 GPU 플릿 (Fleet)을 구축할 계획이 있다면, 추론 제품은 그 용량을 수익으로 전환하는 데 도움이 될 수 있습니다.
다시 말씀드리지만, 이것이 실제로 그들이 하고 있는 일인지는 저도 모릅니다. 다만 제 입장에서는 경제적으로 타당해 보일 뿐입니다.
이 지점이 제가 아직 확신하지 못하는 부분입니다.
Hetzner의 현재 공개된 전용 GPU 서버 라인업은 두 가지 GPU 유형을 사용합니다:
NVIDIA RTX 4000 SFF Ada Generation (20 GB VRAM)
NVIDIA RTX PRO 6000 Blackwell Max-Q (96 GB VRAM)
이것들은 성능이 뛰어난 GPU이며, 96 GB RTX PRO 6000은 소규모 및 중규모 모델을 위한 꽤 괜찮은 추론 머신입니다. Hetzner의 현재 Qwen 모델을 위한 FP8 파일은 약 38 GB이며, 실제 VRAM 사용량은 컨텍스트 길이 (Context length), 캐시 크기 (Cache size), 서빙 설정에 따라 그보다 약간 높은 수준에서 결정됩니다.
하지만 이것들은 워크스테이션 (Workstation)용 GPU이며, 정말 거대한 오픈 모델에 필요한 고밀도 멀티 GPU (Multi-GPU) 시스템은 아닙니다.
극단적인 예로 GLM-5를 들어보겠습니다. 이 모델은 7,540억 개의 파라미터 (Parameters)를 가지고 있으며, 공식 서빙 레시피는 이를 8개의 GPU에 분산합니다. 공격적인 양자화 (Quantization)를 적용하더라도 수백 기가바이트의 VRAM이 필요합니다. 현실적으로 이는 B200/B300급 하드웨어, 또는 이와 유사하며 여러 GPU 간의 매우 빠른 연결을 갖춘 장비가 필요합니다.
Hetzner는 현재 공개적인 베어메탈 (bare-metal) 라인업에서 그러한 종류의 하드웨어를 제공하지 않습니다.
물론, 이것이 실험적인 API 뒤에 무엇이 있는지 알려주는 것은 아닙니다. Hetzner는 완전히 다른 내부 하드웨어를 사용할 수도 있으며, 공개적인 추론 (inference) 제품이 반드시 자사의 전용 서버 (dedicated-server) 카탈로그를 그대로 반영해야 하는 것은 아닙니다.
그럼에도 불구하고, 이 부분이 제가 주목하고 있는 지점입니다.
만약 Hetzner가 한두 개의 작은 모델만을 계속해서 서비스한다면, 그것이 중요한 추론 (inference) 제공업체가 될 것이라고는 정말로 보이지 않습니다. 그것은 멋진 실험이 되겠지만, 그 이상은 아닐 것입니다.
만약 이 실험이 더 큰 GPU 클러스터, 제대로 된 모델 카탈로그, 그리고 B200/B300급 하드웨어를 향한 첫 번째 단계라면, 상황은 훨씬 더 흥미로워집니다. Hetzner는 이미 데이터 센터, 네트워크, 하드웨어 경험, 유럽 내 입지, 그리고 공격적인 가격 책정에 대한 명성을 보유하고 있습니다. 이러한 조합은 Hetzner를 강력한 경쟁자로 만들 수 있습니다.
현재로서는 이 API는 빠르고, 무료이며, 시도해 보는 재미가 있습니다. 저에게 흥미로운 질문은 그들이 다음에 어떤 작은 모델을 추가하느냐가 아니라, Hetzner가 큰 모델들을 서비스하는 데 필요한 하드웨어에 투자할 것인가 하는 점입니다.
Cheers,
Jonas
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기