GPT-6 Astra 주간 할당량을 3일 만에 모두 소진했습니다. 월 $200의 Codex 구독을 토큰당 비용이 전혀 들지 않는, 오직 디스크
요약
GPT-6 Astra 주간 할당량을 빠르게 소진한 개발자가 디스크 공간만 사용하는 새로운 모델 구동 방식을 소개합니다. colibrì는 C 언어로 작성되었으며, 거대한 MoE 전문가들을 NVMe 드라이브에서 스트리밍하여 RAM 제약 없이 실행할 수 있게 합니다.
핵심 포인트
- colibrì는 C 언어 기반으로 개발되어 종속성이 없습니다.
- MoE 전문가를 디스크에서 스트리밍하여 대규모 모델 구동이 가능합니다.
- 토큰 비용 대신 디스크 공간과 RAM을 사용합니다.
- 다양한 최신 모델(glm-5.3 flash, kimi k3 등)을 지원합니다.
저는 GPT-6 Astra 주간 할당량을 단 3일 만에 모두 사용해 버렸습니다. 매월 $200짜리 Codex 구독 대신, 토큰당 비용은 없지만 오직 디스크 공간만 필요한 무언가로 대체하고 있습니다.
그것의 이름은 colibrì입니다. 순수 C 언어로 작성되었고 종속성이 전혀 없는 개발자 한 명이 만든 것입니다. 실제 트릭은 더 작은 모델이 아니라, 전체 것을 한 번에 메모리에 로드하는 것을 거부한다는 점입니다. 필요한 대로 NVMe 드라이브에서 MoE (Mixture of Experts) 전문가들을 스트리밍합니다. 이것이 바로 2조 8천억 개의 파라미터 모델이 그만큼의 RAM을 절대 가질 수 없는 기기에서도 실행될 수 있는 이유입니다.
현재 9가지 모델 패밀리를 지원합니다: glm-5.3 flash, kimi k3, deepseek v4 flash 등 여러 가지가 있습니다. 저장 공간을 확보하기 전에 알아둘 만한 점은, glm-5.3 flash는 일부 게시물에서 인용하는 25GB가 아니라, 완전한 상주(full residency)를 위해 약 200~230GB의 RAM이 필요하다는 것입니다. 그 낮은 숫자는 이전 버전인 glm-5.2에 해당하며, 두 가지를 혼동하기 쉽습니다.
kimi k3는 다른 모델들과 코드를 공유하지 않습니다. 아키텍처 자체가 근본적으로 다르기 때문에 전용 엔진을 사용합니다. 하이브리드 어텐션(hybrid attention)이 kimi delta attention 레이어와 게이티드 MLA (gated mla) 레이어를 결합하며, 모델 어디에도 위치 인코딩(positional encoding)이 없습니다. 대신 위치 정보는 별도로 부착되는 것이 아니라 어텐션 메커니즘 자체의 컨볼루션과 감쇠 속에 존재합니다.
git clone https://t.co/3EeP01OMNI
cd colibri/c
./setup.sh
...
이 프로젝트는 지난 7월에 처음 11일 만에 4,611개의 스타를 모았고, 9월 중순에는 28,000개가 넘었습니다. 이 모든 것을 한 사람이 만들었고 현재도 활발하게 유지보수하고 있습니다.
실제 트레이드오프는 명확히 말씀드립니다. 토큰 청구액이 없고, 정상적인 사용으로 3일 만에 소진할 수 있는 주간 할당량도 없습니다. 대신 지불하는 것은 디스크 공간, RAM, 그리고 인내심입니다. 왜냐하면 저장소에서 전문가들을 스트리밍하는 것이 원시 속도 면에서 호스팅된 GPU 클러스터와 절대 맞먹을 수 없기 때문입니다. 최전선(frontier)이 작아진 것이 아니라, 단지 당신의 구독료에서 당신의 SSD로 이동했을 뿐입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @cyrilxbt (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기