오래전부터 상상해 온 구상임
요약
본 글은 대규모 병렬 컴퓨팅 아키텍처와 LLM의 메모리 병목 현상에 대한 기술적 고찰을 담고 있습니다. 작은 칩들을 연결한 클러스터 방식이 단일 GPU 구성보다 비효율적이며, Mojo나 MAX 같은 프레임워크가 AI 분야의 새로운 경쟁자가 될 수 있음을 제시합니다. 또한, 저렴한 하드웨어로 LLM을 구동하는 실질적인 방법과 최소 사양에 대한 정보도 공유하고 있습니다.
핵심 포인트
- LLM 병목은 메모리 대역폭이며, 분산 클러스터는 단일 GPU보다 비효율적입니다.
- Mojo와 MAX 프레임워크가 AI 모델링 및 하드웨어 제어의 핵심 경쟁자가 될 수 있습니다.
- 저렴한 미니 PC(예: Ryzen H255) 사양으로도 8B~24B급 LLM 구동이 가능합니다.
- Orange Pi 5 Max와 같은 저가형 SBC로도 AI 모델 테스트가 가능함을 보여줍니다.
오래전부터 상상해 온 구상임. 흔한 실수를 막아 줘 다른 언어보다 병렬화하기 쉬운 Rust를 써서, 작고 단순한 마이크로컨트롤러급 칩을 잔뜩 연결한 대규모 병렬 컴퓨터를 만들면 얼마나 어려울까? 작은 RISC-V 칩을 많이 쓰면 흥미로운 실험이 될 듯함. 경제성이 있을지는 잘 모르겠음.
경제성은 전혀 없을 것임. LHC@home처럼 개인용 컴퓨터를 자발적으로 연결해 추론하는 구상을 진지하게 추진하지 않는 것도 그 때문이라고 봄. LLM의 주된 병목은 여전히 메모리 대역폭이며, GPU에 직접 붙어 있지 않은 메모리 버스는 너무 느림. 그래서 VRAM이 두 배인 GPU 하나가 각각 절반의 VRAM을 갖춘 GPU 두 개보다 항상 훨씬 빠름.
칩에 메모리를 더 납땜하면 끝나는 것도 아님. 현대적인 속도에서는 빛의 속도가 한계로 작용하며, 현재 GDDR7 신호는 한 주기에 약 10mm밖에 이동하지 못함. 이런 시스템을 수십~수백 개의 작은 칩에 분산하면 자원 대부분을 낭비하고 단일 칩 구성에 크게 밀리게 됨.
Mojo와 MAX가 원하는 해법일 수 있음. 다른 언어에서는 NVIDIA나 AMD의 라이브러리가 필요한 반면, AI 모델링 프레임워크인 MAX의 라이브러리를 쓰면 Mojo로 GPU·CPU·ASIC을 직접 다룰 수 있음. Mojo는 이 분야에서 상당히 저평가되어 있다고 보며, 방향을 잘 잡으면 AI 분야의 주요 경쟁자가 될 수 있음.
이론적으로는 누군가 보드를 출시하고 Mojo를 소유한 회사인 Modular가 MAX에 지원을 추가하면 자유롭게 실험할 여건이 마련됨. https://max.modular.com/.
Chuck Moore가 만든 GreenArrays의 144코어 Forth 칩을 살펴보면 좋겠음.
트랜스퓨터 개발의 주역이 설립한 Xmos를 살펴보면 좋겠음. 작은 마이크로컨트롤러들을 연결해 거대한 클러스터로 만들 수 있고, 자체 xC 언어에서 이를 기본적으로 지원함.
Futurama를 늘 좋아했지만, 말 그대로 모든 사물에 AI와 성격이 있다는 설정은 좀 우스꽝스럽다고 여겼음. 그런데 실제로 나름의 논리가 있을 수도 있겠음. 규모의 경제 덕분에 3000년에는 구매하는 거의 모든 컴퓨터에 AI 보조 칩이 들어갈 수 있음. 그렇다면 성격을 갖추고 짤막한 농담까지 던지는 본격적인 AI가 탑재될지도 모를 일임.
압축 정도가 너무 심해 결국 그럴듯한 LLM 잡음 생성기가 된 듯해 조금 아쉬움. 그래도 매력은 있음.
https://bil-lang.org가 겨냥하는 것이 정확히 이런 프로젝트임. Go로 병렬 처리, 이 경우에는 파이프라인 처리를 하려는 것임. 다만 TinyGo 백엔드가 완성되기 전까지는 너무 기대하지 않는 편이 좋겠음.
이런 클러스터로 간단한 워드프로세서의 문법 검사를 하면 어떨지 궁금함. 작은 텍스트 기반 게임의 세계를 생성하는 데 쓸 수도 있을까? 어느 정도 능력이 있는지 전혀 감이 오지 않음.
실제로 정확히 이런 소규모 프로젝트를 진행 중임! 양자화를 덜 적용해 매개변수는 1억 5천만 개뿐이지만, 이 프로젝트는 정말 멋짐.
실제로 LLM을 쓸 만하게 돌릴 수 있는 저가 칩은 무엇일까? Mac Mini가 최저선일까? mini-ITX 시스템의 내장 GPU로도 가능할지, 아니면 Raspberry Pi HAT로 만들 만한 전용 AI 칩이 있는지 궁금함.
무엇을 쓸 만한 LLM 실행으로 보느냐에 달려 있음. 올해 초 AliExpress에서 Ryzen H255, LPDDR5 24GB, SSD 1TB 정도 사양의 미니 PC를 샀고, 부가세·관세·배송비까지 약 350유로가 들었음. 개인적으로는 이 정도가 실용적인 LLM 장비의 최저 등급에 가깝다고 봄.
8B 모델은 잘 돌리고 대략 24B까지 실행 가능함. 현재 Gemma 4 26B A4B Q5를 MTP와 함께 돌리는데 꽤 느리지만, 더 작은 모델은 무난하게 돌아갈 것임.
Orange Pi 5 Max로 실제로 가능함. RK3588 보드이며 AliExpress에서 4GB 모델은 75달러, 8GB 모델은 95달러임. 커뮤니티 테스트에서는 llama.cpp로 CPU에서 Qwen2.5-0.5B를 돌려 초당 약 12토큰을 얻었음.
RKNN을 활용하고 싶다면 칩에 INT8 기준 6 TOPS NPU도 탑재되어 있음. Mac Mini를 이기지는 못하지만, 100달러 미만으로 살 수 있는 제대로 된 컴퓨터임.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기