
Hetzner Inference: 첫 살펴보기
요약
Hetzner가 OpenAI 호환 API를 제공하는 LLM 추론 실험 서비스인 'Hetzner Inference'를 출시했습니다. 현재 Qwen 모델을 지원하며, 개발자들이 Hetzner 인프라에서 AI 워크로드를 테스트할 수 있는 초기 실험 단계의 서비스입니다.
핵심 포인트
- OpenAI 호환 API를 통해 기존 클라이언트 코드를 쉽게 통합 가능
- 현재 Qwen/Qwen3.6-35B-A3B-FP8 모델을 단일 모델로 제공
- SLA나 과금 체계가 없는 실험적 단계로 프로덕션 사용 시 주의 필요
- Hetzner 자체 인프라를 활용한 저비용 추론 환경 테스트 가능
Hetzner가 LLM 추론 (Inference) 실험을 진행하고 있습니다.
제가 이런 문장을 쓰게 될 줄은 몰랐지만, 꽤 흥미롭다고 생각합니다 :)
누군가 자신의 프로덕션 AI 워크로드 (Production AI workloads)를 Hetzner로 옮기기 전에 알아두어야 할 점은, 이것이 매우 강력한 실험 (experiment) 단계라는 것입니다. 아직 과금 체계도, SLA (Service Level Agreement)도, 프로덕션 보장도 없으며, 현재는 단 하나의 모델만 제공됩니다. Hetzner는 사람들이 실제로 이것을 원하는지, 시스템이 어떻게 확장되는지, 어떤 기능이 중요한지, 그리고 어떤 종류의 부하 (load)를 처리할 수 있는지 배우고 싶다고 말합니다.
따라서 이것은 완성된 제품 출시가 아닙니다. Hetzner가 초기 단계의 무언가를 사용자 앞에 내놓고 어떤 일이 일어나는지 지켜보는 과정입니다. 저는 이런 접근 방식을 정말 좋아합니다.
Hetzner Inference란 무엇인가?
Hetzner Inference는 Hetzner 자체 인프라에서 실행되는 OpenAI 호환 API입니다. Experiments 대시보드에서 API 토큰을 생성하고, OpenAI 클라이언트를 Hetzner의 베이스 URL (base URL)로 지정하면 다른 대부분의 추론 (inference) API와 동일하게 사용할 수 있습니다.
현재 사용 가능한 유일한 모델은 Qwen/Qwen3.6-35B-A3B-FP8입니다. 이 모델은 350억 개의 파라미터(parameter)를 가진 Mixture-of-Experts (MoE) 모델이며, 30억 개의 활성 파라미터를 가집니다. 텍스트와 이미지를 수용하며, 262K 컨텍스트 윈도우 (context window)를 지원하고, FP8 양자화 (quantized)된 가중치를 사용합니다.
이는 실험용으로 매우 합리적인 모델입니다. 터무니없는 GPU 클러스터 없이도 서비스할 수 있을 만큼 충분히 작으면서도, 실제 워크로드 (workloads)로 API를 테스트하기에 충분히 유용합니다.
Hetzner는 코드를 작성하지 않고도 시도해보고 싶은 분들을 위해 OpenCode를 API에 연결하는 짧은 튜토리얼도 게시했습니다.
직접 사용해 보았습니다
API가 OpenAI와 호환되기 때문에, 통합 (integration) 과정에서 특별한 점은 거의 없습니다:
pip install openai
from openai import OpenAI
client = OpenAI(
...
enable_thinking 옵션은 언급할 가치가 있습니다. 이 옵션이 없으면, 모델이 가시적인 답변을 반환하기 전에 완료 예산 (completion budget)의 놀라울 정도로 많은 양을 추론 (reasoning)에 소비할 수 있습니다. 제 테스트에서는 이 옵션이 작동했지만, Hetzner 측에서 문서화하지 않았으므로 아직 이 정확한 요청 형태 (request shape)를 기반으로 중요한 무언가를 구축하지는 않을 것입니다.
저는 2026년 7월 23일에 몇 가지 작은 테스트를 수행했습니다. 이 제품은 실험적이며, 이에 대한 벤치마크 (benchmark)는 아마도 금방 구식이 될 것이기 때문에 이 포스트를 거대한 벤치마크 보고서로 만들고 싶지는 않습니다. 하지만 대략적인 수치는 다음과 같았습니다:
- 이미 열려 있는 연결에서 7개의 짧은 요청을 대상으로 한 첫 번째 토큰 생성 시간 (time to first token) 중앙값 153 ms
- 512 토큰으로 제한된 5개의 긴 생성 과정을 대상으로 한 초당 224 출력 토큰 (output tokens per second)
정말 빠릅니다! 하지만 이것은 단 한 시점에 한 클라이언트가 수행한 단 하나의 테스트일 뿐입니다. 이것은 서비스 수준 협약 (SLA)이 아니며, 많은 사람이 동시에 서비스를 사용할 때 어떤 일이 발생하는지에 대해서는 거의 아무것도 말해주지 않습니다.
모델 자체는 대략 제가 예상했던 수준이었습니다. 대부분의 포맷팅 (formatting) 및 검색 (retrieval) 지침을 따랐고, 이미지를 올바르게 처리했으며, 매우 간단한 산수 문제 두 개에서 실패했습니다. 즉, 작고 약간 형편없는 LLM (Large Language Model)입니다 :D
제품이 모델보다 더 흥미롭다
Qwen 엔드포인트 (endpoint)는 재미있지만, 현재의 모델이 흥미로운 부분이라고 생각하지는 않습니다.
흥미로운 부분은 Hetzner가 애초에 왜 추론 (inference)을 테스트하고 있는가 하는 점입니다.
여기서부터는 순전히 저의 추측입니다. 저는 내부 정보를 가지고 있지 않으며, Hetzner의 누구도 그들이 무엇을 계획하고 있는지 저에게 말해주지 않았습니다. 저는 그저 제품을 살펴보고 몇 가지 점들을 연결해 보려고 할 뿐입니다.
오픈 웨이트 (Open-weight) 추론은 범용 제품 (commodity) 시장입니다. 누구나 동일한 가중치 (weights)를 다운로드할 수 있고, 거의 동일한 서빙 (serving) 소프트웨어를 실행하며, OpenAI 호환 API를 노출할 수 있습니다. 제공업체를 전환하는 것도 쉽습니다. 특히 직접 호스팅하는 사용자들에게는 OpenRouter나 LiteLLM 같은 제품이 있습니다.
이는 어떤 종류의 이점이 있지 않는 한 거대한 마진 (margin)을 구축하기 어렵게 만듭니다. 보통 이는 다음을 의미합니다:
- GPU 하드웨어를 매우 저렴하게 구매하고 운영할 수 있거나;
- 해당 하드웨어를 쉬지 않고 가동하는 데 매우 탁월하거나;
- 또는 고객을 기다리며 유휴 상태로 있을 GPU를 이미 보유하고 있는 경우입니다.
Hetzner는 하드웨어를 구매하여 자체 데이터 센터에 배치하고, 매우 효율적인 비용 구조로 운영하는 데 매우 능숙합니다. 그것이 기본적으로 이 회사의 전부입니다. 만약 누군가가 추론 (inference)을 또 다른 저마진 인프라 제품으로 바꿀 수 있다면, Hetzner는 적어도 믿을 만한 후보입니다.
여기에는 훌륭한 활용도 (utilization) 측면의 이야기도 있습니다. 임대된 베어메탈 (bare-metal) GPU는 고객이 사용하든 안 하든 한 명의 고객에게 속합니다. 반면 추론 API는 많은 사용자 간에 GPU 용량을 공유하여 하드웨어를 계속 가동 상태로 유지할 수 있습니다. 만약 Hetzner에 여유 GPU 용량이 있거나, 훨씬 더 큰 GPU 플릿 (fleet)을 구축할 계획이 있다면, 추론 제품은 그 용량을 수익으로 전환하는 데 도움이 될 수 있습니다.
다시 말씀드리지만, 이것이 실제로 그들이 하고 있는 일인지는 저는 알지 못합니다. 다만 제 관점에서는 경제적으로 타당해 보일 뿐입니다.
핵심 질문은 하드웨어입니다
이 지점이 제가 아직 확신하지 못하는 부분입니다.
Hetzner의 현재 공개 전용 GPU 서버 라인업은 두 가지 GPU 유형을 사용합니다:
- 20 GB의 VRAM을 갖춘 NVIDIA RTX 4000 SFF Ada Generation
- 96 GB의 VRAM을 갖춘 NVIDIA RTX PRO 6000 Blackwell Max-Q
이것들은 성능이 뛰어난 GPU이며, 96 GB RTX PRO 6000은 소규모 및 중규모 모델을 위한 꽤 괜찮은 추론 머신입니다. Hetzner의 현재 Qwen 모델을 위한 FP8 파일은 약 38 GB이며, 실제 VRAM 사용량은 컨텍스트 길이 (context length), 캐시 크기 (cache size), 서빙 설정 (serving setup)에 따라 그보다 높은 수준에서 결정됩니다.
하지만 이것들은 워크스테이션 (workstation) GPU이며, 정말 거대한 오픈 모델에 필요한 고밀도 멀티 GPU 시스템 (dense multi-GPU systems)은 아닙니다.
GLM-5를 극단적인 예로 들어보겠습니다. 이 모델은 7540억 개의 파라미터 (parameters)를 가지고 있으며, 공식 서빙 레시피 (serving recipe)는 이를 8개의 GPU에 분산합니다. 공격적인 양자화 (quantization)를 적용하더라도 수백 기가바이트의 VRAM이 필요합니다. 현실적으로 이는 GPU 간의 매우 빠른 연결을 갖춘 B200/B300급 하드웨어 또는 그와 유사한 사양을 의미합니다.
Hetzner는 현재 공개적인 베어메탈 (bare-metal) 라인업에서 그런 종류의 하드웨어를 제공하지 않습니다.
물론, 이것이 실험적인 API 뒤에 무엇이 있는지를 말해주지는 않습니다. Hetzner는 완전히 다른 내부 하드웨어를 사용할 수도 있으며, 공개적인 인퍼런스 (inference) 제품이 반드시 자사의 전용 서버 카탈로그 (catalogue)를 그대로 반영할 필요는 없습니다.
그럼에도 불구하고, 이 부분이 제가 주목하고 있는 지점입니다.
만약 Hetzner가 한두 개의 작은 모델만 계속해서 서빙한다면, 그것이 중요한 인퍼런스 제공업체가 될 것이라고는 생각하지 않습니다. 그것은 멋진 실험이 되겠지만, 그 이상은 아닐 것입니다.
만약 이 실험이 더 큰 GPU 클러스터 (clusters), 제대로 된 모델 카탈로그, 그리고 B200/B300급 하드웨어를 향한 첫 단계라면, 상황은 훨씬 더 흥미로워집니다. Hetzner는 이미 데이터 센터, 네트워크, 하드웨어 경험, 유럽 내 입지, 그리고 공격적인 가격 책정으로 쌓은 명성을 보유하고 있습니다. 이러한 조합은 Hetzner를 강력한 경쟁자로 만들 수 있습니다.
현재로서는 이 API가 빠르고, 무료이며, 시도해 보기에 즐겁습니다. 다음 하드웨어 발표는 또 다른 작은 모델의 등장보다 우리에게 훨씬 더 많은 것을 알려줄 것입니다.
Cheers,
Jonas
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기