GLM 5.2 무료 이용 (2026): 3가지 비용 제로 경로와 한계점
요약
Zhipu의 오픈 웨이트 코딩 모델인 GLM 5.2를 비용 없이 이용할 수 있는 실제 경로와 한계점을 분석합니다. 웹 채팅 이용, 직접 호스팅, 사용자 부담 방식의 차이점을 설명하며 허위 정보에 주의할 것을 권고합니다.
핵심 포인트
- Z.ai 웹 채팅은 속도 제한이 적용된 실제 무료 경로임
- MIT 라이선스 가중치를 직접 다운로드하여 로컬 호스팅 가능
- 관리형 API 서비스는 무료 엔드포인트가 존재하지 않음
- 직접 호스팅 시 최소 약 240GB 이상의 RAM/VRAM 필요
"GLM 5.2가 무료인가요?"라는 질문에 대한 솔직한 답변은, 사람들이 언급하는 네 가지 경로 중 두 가지는 실제이고, 하나는 실제지만 비용을 다른 사람에게 전가하는 방식이며, 나머지 하나는 존재하지 않는다는 것입니다. Z.ai에서 제공하는 무료 호스팅 GLM 5.2 API는 없으며, OpenRouter에도 :free GLM 5.2 엔드포인트는 없습니다. 진정으로 무료인 것은 속도 제한(rate-limited)이 적용된 웹 채팅과 직접 다운로드하여 자신의 하드웨어(metal)에서 실행할 수 있는 MIT 라이선스 가중치(weights)뿐입니다. 그 외의 모든 것은 토큰(tokens)이나 GPU 시간(GPU hours) 비용이 발생합니다.
GLM 5.2 무료: $0로 할 수 있는 것 (그리고 할 수 없는 것)
GLM 5.2는 Zhipu의 최첨단 오픈 웨이트(open-weights) 코딩 모델입니다. 이는 1M 토큰 컨텍스트를 가진 총 753B 파라미터의 MoE(Mixture of Experts) 모델로, MIT 라이선스 하에 출시되었습니다. 이 모델 주변에서 "무료"라는 키워드가 많이 검색되지만, 대부분의 리스트 형식 글들은 단순히 가입 페이지를 붙여넣는 방식으로 답변합니다. 이 글은 각 경로를 직접 확인하여 어디에서 한계에 부딪히는지 알려드립니다.
| 원하는 것 | 작동하는 무료 경로 | 무료로 할 수 없는 것 |
|---|---|---|
| 브라우저에서 GLM 모델과 채팅하기 | Z.ai 웹 채팅, 카드 등록 불필요, 속도 제한 적용 | 무료 채팅에서 API로 호출하기 |
| ... |
첫 두 행의 두 경로는 개인이 이용할 수 있는 실제 비용 제로(zero-cost) 옵션입니다. API 행은 허위 정보가 가장 많이 발생하는 부분입니다. 사람들이 "glm 5.2 free api"를 검색하다가 OpenRouter의 :free 경로를 지어낸 블로그에 도달하여 오후 시간을 낭비하곤 합니다. 그런 경로는 존재하지 않습니다.
이미 관리형 API(managed API)를 원하고 "무료"가 단지 시작 필터였을 뿐이라면, '대안(Alternatives)' 섹션으로 건너뛰십시오. 만약 $0를 쓰고 싶다면 계속 읽어주세요. 경로는 실제로 어디까지 가능한지에 따라 아래에 순위별로 나열되어 있습니다.
결정 프레임: 어떤 무료 경로가 당신에게 적합한가
세부 내용을 읽기 전에 선택하십시오.
각 무료 경로가 적절한 경우
각 무료 경로가 적절한 경우
- 브라우저에서 GLM의 작문 및 추론 기능을 사용해 보고 싶거나, 일회성 질문을 하거나, 복사-붙여넣기로 가벼운 코딩을 하고 싶다면 Z.ai 웹 채팅을 이용하세요. 설치가 필요 없고 카드 결제도 필요 없습니다. 이것이 가장 빠르고 비용이 들지 않는 방법입니다.
- 256GB 이상의 장비(또는 서버 랙)를 가지고 있거나, 오프라인 또는 에어갭 환경에서의 추론이 필요하거나, 규정 준수팀에서 감사 가능한 오픈 웨이트(open weights)를 요구하는 경우 MIT 가중치(weights)를 직접 호스팅하세요. 라이선스 비용은 무료이지만, RAM과 전기료는 지불해야 합니다.
- 앱을 개발하고 있으며 최종 사용자가 청구서를 대신 내주는 것이 아니라 각자 자신의 GLM 토큰을 부담하기를 원한다면 **사용자 부담 브릿지(Puter)**를 이용하세요. 개발자인 당신에게는 무료이지만, 전체적으로는 무료가 아닙니다.
절대로 '무료'만을 쫓아서는 안 되는 경우
- 백엔드용으로 호스팅된 GLM 5.2 API가 필요하고 이것이 $0일 것이라고 기대한다면. 그런 것은 존재하지 않습니다. 최소 비용은 유료 요금인 입력 $1.4/M, 출력 $4.4/M입니다.
- 64GB 또는 128GB 노트북을 가지고 있고 직접 호스팅할 수 있을 것이라고 기대한다면. 가중치가 사용 가능한 품질로 들어가지 않습니다. 가장 작은 합리적인 양자화(quant) 모델도 약 240GB가 필요합니다.
- SLA를 갖춘 신뢰성이 필요한 경우. 여기에 있는 모든 무료 경로는 최선 노력(best-effort)입니다. 속도 제한, 할당량 재설정, 하드웨어 장애는 당신이 감수해야 합니다.
중단 규칙
GLM 5.2의 출력 품질을 단지 _평가_하는 것만 필요하다면, 무료 Z.ai 웹 채팅에서 10분 안에 답을 얻을 수 있으니 읽는 것을 멈춰도 됩니다. 이 섹션 이후의 모든 내용은 프로그래밍 방식 또는 직접 호스팅 접근이 필요한 사람들을 위한 것이며, 여기서 '무료'에는 실제적인 트레이드오프가 따릅니다.
각 무료 경로에 필요한 것들
세 가지 실제 무료 경로는 서로 다른 것을 요구합니다. 시작하기 전에 순서를 정해 두어 240GB 다운로드 중간에 멈추고 장비가 이를 담을 수 없다는 사실을 발견하는 일이 없도록 하세요.
| 무료 경로 | 필요한 것 | 첫 출력까지 걸리는 시간 |
|---|---|---|
| Z.ai 웹 채팅 | 브라우저 및 Z.ai 계정 (카드 불필요) | 1분 미만 |
| ... |
특히 셀프 호스팅 (self-host) 경로의 경우, 메모리 용량이 결정적인 관문입니다. GLM 5.2는 753B 파라미터 규모의 MoE (Mixture of Experts) 모델이므로, 사용 가능한 가장 작은 양자화 (quant) 모델이라도 약 240GB의 RAM 또는 통합 메모리 (unified memory)가 필요합니다. GPU와 상관없이 16GB, 32GB, 또는 64GB를 탑재한 노트북은 고려 대상이 아닙니다. 만약 소비자용 하드웨어를 사용 중인데 사양이 충족되지 않는다면, 웹 채팅과 유료 API가 유일한 경로이며 이는 전혀 부끄러운 일이 아닙니다. 집에서 753B 모델을 셀프 호스팅하는 사람은 거의 없습니다.
경로 1: Z.ai 웹 채팅 (진정한 무료, 속도 제한 있음)
chat.z.ai에 있는 Z.ai 웹 인터페이스를 사용하면 신용카드 없이도 GLM 모델과 채팅할 수 있습니다. 이는 마찰이 가장 적은 제로 비용 경로입니다. 페이지를 열고, 로그인한 뒤, 입력하기만 하면 됩니다.
두 가지 제한 사항이 있습니다:
- API 미지원. 무료 웹 채팅은 UI (사용자 인터페이스)입니다. Cline, Claude Code 또는 사용자의 자체 스크립트를 여기에 연결할 수 없습니다. 프로그래밍 방식의 접근 (programmatic access)이 필요한 순간, 이 경로는 종료되며 유료 API나 셀프 호스팅 단계로 넘어가야 합니다.
- 속도 제한 (Rate limits). 무료 티어의 메시지 처리량은 제한되어 있으며, 정확한 할당량 (quota)은 릴리스마다 변경되었으므로 다른 곳에서 읽은 특정 수치는 오래된 정보로 간주하십시오. 실제 작업에 의존하기 전에 인터페이스에서 현재 제한 사항을 확인하세요.
한 가지 정확히 짚고 넘어가야 할 주의 사항이 있습니다. SEO 농장(SEO farms)들 사이에서도 이 부분에 대해 의견이 엇갈리기 때문입니다. 무료 웹 채팅(web chat)에서 제공하는 GLM 버전은 릴리스(release)마다 변경되어 왔으며, Z.ai의 자체 문서에서는 GLM 5.2 조기 액세스(early access)를 유료인 GLM 코딩 플랜(Coding Plan)과 연결해 두었습니다. 일부 무료 티어(free-tier) 세션은 이전 버전의 GLM을 제공할 수 있으며, 5.2 버전은 구독(subscription) 뒤에 배치될 수 있습니다. 무료 채팅이 반드시 5.2를 제공할 것이라고 가정하지 마십시오. 본인의 세션에 표시된 모델 라벨(model label)을 확인하십시오. 그것만이 귀하의 계정과 현재 배포(rollout) 상태를 반영하는 유일한 출처입니다. 만약 라벨에 5.2라고 표시되어 있지 않다면, 무료 웹 채팅은 이전 모델을 제공하고 있는 것이며, 유료 코딩 플랜이나 다른 엔드포인트(endpoint)가 5.2 자체로 가는 경로입니다.
계획 시 고려해야 할 한 가지가 더 있습니다. 무료 웹 채팅은 귀하의 코드베이스(codebase)에 대한 기억이 없으며 도구 액세스(tool access) 권한도 없습니다. 채팅창에 붙여넣은 내용에 대해서만 답변합니다. 이는 GLM의 추론(reasoning) 능력과 코드 스타일이 귀하에게 맞는지 판단하는 데에는 괜찮지만, 파일을 읽거나 명령어를 실행해야 하는 작업에는 무용지물입니다. 만약 귀하의 평가 질문이 "이 모델이 내가 배포할 만한 코드를 작성하는가?"라면 무료 채팅이 답을 줄 수 있습니다. 하지만 질문이 "이 모델이 나의 에이전트 루프(agent loop)를 구동할 수 있는가?"라면, 무료 채팅은 시도조차 할 수 있도록 연결되어 있지 않습니다.
웹 채팅은 세 가지 측면에서 제한이 있습니다: API 미지원, 메시지 횟수 제한, 그리고 보장되지 않는 모델 버전입니다. 이는 평가 및 가벼운 채팅에는 좋지만, 워크플로(workflow)용으로는 적합하지 않습니다.
경로 2: MIT 가중치 셀프 호스팅 (라이선스 비용은 무료이나, 하드웨어 비용은 별도)
이 경로는 GLM 5.2를 토큰당 비용(per-token cost) 없이 진정으로, 영구적으로 무료로 사용할 수 있게 해주는 방법입니다. Zhipu는 Hugging Face의 zai-org 조직 아래에 MIT 라이선스로 가중치(weights)를 공개했습니다. 2026년 7월 13일 확인 결과: zai-org/GLM-5.2 리포지토리(repo)는 접근 제한(gated)이 없으며, 모델 카드(model card)에 MIT 태그가 붙어 있고, 460,000회 이상 다운로드되었습니다. MIT 라이선스는 상업적 이용, 수정 및 재배포가 모두 허용됨을 의미합니다.
MIT 라이선스가 제공하지 않는 것은 무료 컴퓨팅 자원(compute)입니다. GLM 5.2는 총 파라미터가 753B인 MoE (Mixture of Experts) 모델입니다. 전체 BF16 정밀도(precision)를 사용할 경우 가중치(weights)의 크기는 약 1.5 TB에 달하며, 이는 단일 데스크톱에 담을 수 없는 크기입니다. 무료 로컬 추론(inference)을 하려면 GGUF로 양자화(quantizing)하고 최소 메모리 요구량(memory floor)을 감수해야 합니다.
| 양자화 (Quant) | 필요 예상 메모리 | 현실적인 사양 | 속도 |
|---|---|---|---|
| 2-bit GGUF | ~240 GB | 256 GB Mac Studio / 대용량 DDR5 시스템 | ~3-9 tok/s |
| ... |
개인이 사용할 수 있는 실질적인 하한선은 256 GB 사양의 기기에서 2-bit 양자화를 사용하는 것입니다. 단일 24 GB GPU (예: 4090)는 2-bit 양자화 모델조차 단독으로 담을 수 없으며, 시스템 RAM 오프로드(offload) 방식으로 전환되어 초당 토큰 생성 속도가 한 자릿수 초반대로 떨어집니다. 64 GB 또는 128 GB 노트북에서 이 모델을 원활하게 실행할 수 있는 설정은 존재하지 않습니다.
양자화 수준을 선택하고, llama.cpp나 LM Studio를 연결하며, 컨텍스트(context)를 확장하기 위해 KV 캐시(KV cache)를 양자화하는 메커니즘은 그 자체로 별도의 작업입니다. 여기서 하드웨어 계산식을 다시 유도하기보다는, 이를 처음부터 끝까지 다루는 두 가지 가이드를 활용하십시오.
- 단일 Mac Studio 또는 하나의 GPU와 대용량 RAM을 갖춘 데스크톱을 위한 GLM 5.2 로컬 GGUF 실행 가이드: 양자화 선택,
llama.cpp플래그, LM Studio, 그리고 기대할 수 있는 속도를 다룹니다. - H200급 GPU를 사용하여 팀에게 전체 정밀도 모델을 서빙하기 위한 GLM 5.2 vLLM 셀프 호스팅 하드웨어 및 비용 가이드: 호스팅 플랜 대비 월간 비용 계산법과 함께 다룹니다.
셀프 호스팅 경로에서 사람들이 혼동하기 쉬운 두 가지 주의사항이 있습니다. 첫째, 1M 컨텍스트는 소비자용 하드웨어에서 가중치와 함께 무료로 제공되지 않습니다. 그 정도로 긴 컨텍스트를 위한 KV 캐시는 가중치 외에도 수백 기가바이트의 메모리가 추가로 필요하므로, 256 GB 기기에서는 현실적으로 16K에서 64K 컨텍스트를 실행할 수 있으며 전체 100만(million) 토큰을 사용할 수는 없습니다. 둘째, 다운로드 용량 자체가 매우 큽니다. 2-bit GGUF조차 다운로드 및 저장에 약 240 GB가 소요되므로, 시작한 이후가 아니라 시작하기 전에 디스크 용량과 대역폭을 미리 확보하십시오.
GGUF 빌드를 갖추고 로컬에서 llama.cpp를 실행 중일 때, 자신의 서버를 가리키는 동일한 OpenAI 형식을 사용하는 최소한의 스모크 테스트 (smoke-test) 루프는 다음과 같습니다:
from openai import OpenAI
# llama.cpp 서버 실행 명령: ./llama-server -m glm-5.2-UD-IQ2_M.gguf --host 0.0.0.0 --port 8080
...
이 경로는 메모리 비용에서 한계에 부딪힙니다. 라이선스 비용은 무료이지만, 256 GB 사양의 머신이 입장권이며, 단일 GPU 박스에서는 실행 속도가 느립니다. 대부분의 사람들에게는 계산상 호스팅된 엔드포인트 (hosted endpoint)가 유리합니다. 일주일에 약 3,000 프롬프트 미만을 사용하는 경우, 유료 플랜이나 관리형 API (managed API)를 사용하는 것이 하루 중 대부분을 유휴 상태로 보내는 셀프 호스트 (self-host) 노드의 전기료와 감가상각비보다 저렴합니다. 셀프 호스팅은 대량의 처리량, 오프라인 요구 사항, 그리고 감사 가능한 가중치 (auditable weights)에 대한 컴플라이언스 (compliance) 의무 측면에서는 승리하지만, 가벼운 사용 용도로는 적합하지 않습니다.
경로 3: 제3자 "사용자 지불" 브릿지 (당신에게는 무료, 모두에게는 아님)
간과되기 쉬운, 개발자에게 실제로 무료인 경로가 있습니다. Puter와 같은 플랫폼은 "사용자 지불" 모델로 z-ai/glm-5.2를 노출합니다. 개발자는 SDK를 통합하고 아무것도 지불하지 않으며, 각 최종 사용자가 자신의 토큰 비용을 부담합니다. 이는 BYO-bar (음료를 직접 가져오는 바)가 호스트에게 무료인 것과 같은 방식입니다.
이는 특정 형태의 앱에 적합합니다. 즉, 사용자가 자신의 사용량을 가져오고 개발자가 총액 청구서를 선불로 부담하고 싶지 않은 클라이언트 측 도구입니다. 이것은 자신의 백엔드를 위해 무료 토큰을 얻는 방법이 아니며, SLA (Service Level Agreement)도 아닙니다. 플랫폼의 과금 및 데이터 약관을 배포 전에 반드시 읽어보십시오. 왜냐하면 "무제한, 키 불필요"라는 프레임워크는 모델이 아닌 개발자의 비용을 설명하는 것이기 때문입니다. 또한 이는 사용자와 모델 사이에 제3자를 두게 되는데, 이는 데이터 처리 의무가 있는 경우 중요한 문제입니다.
이 경로는 두 가지 지점에서 한계가 있습니다. 비용이 사라지는 것이 아니라 사용자에게 전가됩니다. 그리고 당신은 Z.ai를 직접 신뢰하는 것이 아니라 제3자 브릿지의 가동 시간 (uptime)과 약관을 신뢰하게 됩니다. 취미용 앱이나 데모라면 괜찮습니다. 하지만 비즈니스가 의존하는 서비스라면, 추론 (inference)을 실행하는 주체와 계약을 맺어야 하며, 무료 브릿지는 이를 제공하지 않습니다.
존재하지 않는 경로: "OpenRouter Free"
이 부분은 아주 솔직하게 말씀드려야겠습니다. 왜냐하면 이것이 가장 많이 검색되는 잘못된 정보(false lead)이기 때문입니다.
OpenRouter에는 무료 GLM 5.2 엔드포인트 (endpoint)가 없습니다. 2026년 7월 13일 기준 OpenRouter 모델 API를 확인한 결과는 다음과 같습니다:
z-ai/glm-5.2는 존재하며, 입력 1M당 $0.93, 출력 1M당 $3.00의 비용이 발생하는 유료 모델이며, 1M의 컨텍스트 윈도우 (context window)를 가집니다.- OpenRouter는 ID가
:free로 끝나는 23개의 모델 변형 (variants)을 나열하고 있습니다. 그중 GLM 5.2는 없습니다. openrouter.ai/z-ai/glm-5.2:free와 같은 URL은 HTTP 200을 반환하지만, 이는 싱글 페이지 애플리케이션 (single-page app) 셸이 로드되기 때문이지 그 뒤에 무료 경로가 존재하기 때문이 아닙니다. 페이지가 로드되는 것과 엔드포인트가 작동하는 것을 혼동하지 마십시오. 이것이 바로 "OpenRouter에서 GLM 5.2 무료 이용"과 같은 리스트형 기사들이 만들어내는 정확한 함정입니다. 누군가가 페이지가 렌더링되는 것을 보고 해당 경로가 활성화되었다고 가정하는 것입니다.
OpenRouter의 무료 티어 (free tier)는 실제로 존재하지만, 이 모델은 포함되지 않습니다. OpenRouter가 실제로 제공하는 것에 대한 맥락을 위해, OpenRouter의 속도 제한 (rate-limit) 참조에서 가져온 제한 사항은 다음과 같습니다:
| OpenRouter 무료 티어 규칙 | 값 |
|---|---|
| 일일 요청 수, $10 미만 크레딧 구매 시 | 50 |
| ... |
따라서 코딩을 위해 OpenRouter에서 무료 모델을 원한다면, GLM 5.2가 아니라 23개의 :free 변형 모델 (DeepSeek, Qwen, Gemma, Nemotron 등) 중에서 선택해야 합니다. 이러한 무료 변형 모델들은 위 표에 명시된 제한 사항이 적용되며, 특정 요청 시 어떤 물리적 제공자 (physical provider)가 이를 서비스할지에 대한 보장이 없습니다. 어떤 무료 API 티어가 실제 코딩 작업에서 실제로 버텨낼 수 있는지에 대한 더 광범위한 순위는 코딩을 위한 무료 LLM API 티어 순위 가이드를 참조하십시오.
한계까지의 무료 경로: 비교 분석
flowchart TD
A[GLM 5.2를 $0에 필요함?] --> B{어떻게 사용하고 싶은가?}
B -->|브라우저에서 채팅| C[Z.ai 웹 채팅]
...
| 경로 | 당신에게 무료인가? | 엄격한 한계 (Hard limit) | 최적의 용도 |
|---|---|---|---|
| Z.ai 웹 채팅 | 예 | API 없음, 속도 제한 있음, 버전이 5.2로 보장되지 않음 | 출력 품질 평가 |
| ... |
무료 GLM 5.2를 추구할 때 발생하는 흔한 오류
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기