
세상에나, 누군가 25GB RAM 노트북에서 7440억 파라미터 모델을 실행했습니다
요약
Colibri라는 단일 C 파일 기반 엔진을 통해 25GB RAM 노트북에서 744B 파라미터의 GLM-5.2 MoE 모델을 실행하는 데 성공했습니다. MoE 구조의 특성을 활용해 토큰당 활성화되는 파라미터만 스트리밍하는 방식으로 대규모 모델의 로컬 추론 가능성을 증명했습니다.
핵심 포인트
- 의존성 없는 단일 C 파일 엔진 Colibri 공개
- MoE 모델의 특성을 활용한 디스크 스트리밍 기술 적용
- 저사양 하드웨어에서도 대규모 모델 로컬 추론 가능성 제시
- 기존 클라우드 추론 API 중심의 시장 구조 변화 예고
세상에나
누군가 방금 25GB RAM을 탑재한 노트북에서 7440억 파라미터 (744 billion parameter) 모델을 실행했습니다 😳
증류된 버전 (distilled version)도 아니고, 쓰레기 수준으로 양자화 (quantized)된 4비트 압축 버전도 아닙니다. 전체 정밀도 오라클 (full-precision oracle)과 비교했을 때 포워드 패스 (forward pass)가 토큰 단위로 정확하게 검증된 전체 GLM-5.2 MoE 모델입니다.
이것은 엄청난 일입니다. 왜냐하면 그동안의 논리는 항상 "이 정도로 큰 모델을 돌리려면 우리의 클라우드가 필요하다"였기 때문입니다.
만약 당신이 추론 API (inference APIs), GPU 클라우드, 또는 모델 호스팅 분야에서 일하고 있다면, 이것은 계산법을 바꿔놓을 것입니다.
당신은 아직 모르고 있을 뿐입니다.
7월 1일, 한 개발자가 Colibri라는 이름의 단일 C 파일을 조용히 공개했습니다. 의존성 (dependencies) 제로. BLAS 없음. 런타임 시 Python 없음.
비결은 이렇습니다: GLM-5.2는 토큰당 약 40B 파라미터만 활성화합니다. 따라서 토큰마다 약 11GB의 가중치 (weights)만 변합니다. 나머지는 고정된 상태로 유지됩니다. 변하는 부분은 사용 시간이 길어질수록 더 똑똑해지는 학습 캐시 (learning cache)를 통해 디스크에서 스트리밍됩니다.
→ 25GB 개발용 PC: 콜드 스타트 (cold) 시 0.05 tok/s, 솔직한 최저치
→ 128GB CPU 데스크톱: 웜 스타트 (warm) 시 1.8 tok/s
→ 6x RTX 5090 전체 상주 (full residency): 6.8 tok/s
동일한 엔진. 동일한 코드. 동일한 답변.
19일 만에 16.6K 스타 획득. 1,515개 포크 (forks). 48명의 기여자가 상세한 포렌식 로그와 함께 이슈를 작성 중입니다.
누군가가 이미 당신이 소유한 하드웨어에서 단일 컴파일된 바이너리로 가능하다는 것을 증명했는데, 왜 700B+ 추론을 위해 토큰당 비용을 지불하십니까?
그리고 무서운 점은?
진지한 멀티 GPU 장비에서의 벤치마크 결과들이 아직 나오고 있다는 것입니다. 이 커뮤니티는 생긴 지 19일밖에 되지 않았습니다. 바이럴의 정점은 아직 오지도 않았습니다.
당신은 이제 직접 추론을 실행하거나, 아니면 다른 누군가가 똑같은 기술을 50배의 마진을 붙여 실행하도록 비용을 지불하게 될 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @socialwithaayan (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기