
Celeron N5095 SBC에서 CPU 전용 추론 수행: 0.6B부터 8B까지 6개 모델 벤치마크
요약
Celeron N5095 기반 SBC인 Youyeetoo X1S에서 Ollama를 이용해 CPU 전용 LLM 추론 성능을 벤치마크했습니다. 0.6B 모델은 실용적인 속도를 보였으나, 8B 모델은 메모리 대역폭 한계로 인해 사용이 어려웠습니다.
핵심 포인트
- Qwen3 0.6B 모델은 약 6.788 tok/s로 백그라운드 작업에 적합함
- 8B 모델은 실행은 가능하나 0.924 tok/s로 실사용이 매우 어려움
- 8B 모델의 성능 저하는 메모리 용량이 아닌 대역폭 문제임
- 15W 미만 x86 환경에서 소형 모델 구동은 예상보다 실용적임
얼마나 저렴한 비용으로 로컬 모델을 실행할 수 있는지 알고 싶어서, Youyeetoo X1S에서 Ollama CPU 전용(CPU-only) 모드를 실행해 보았습니다. 이 기기는 Celeron N5095 (Jasper Lake, 4C/4T, 15W), 16GB RAM, 128GB NVMe를 탑재하고 Kali 2025.4를 구동하는 단일 보드 x86 머신입니다. 이 보드의 기본 구성은 RAM과 저장 장치에 따라 AliExpress에서 약 $100에서 $130 정도에 판매됩니다. 결과의 요약본은 다음과 같습니다: Qwen3 0.6B는 평균 6.788 tok/s를 기록했습니다. 실제로 대화형으로 사용 가능한 수준입니다. 8B 모델은 16GB 메모리에 들어가서 실행은 되었지만, 평균 0.924 tok/s를 기록했습니다. 실제 용도로 사용하기에는 매우 어렵습니다. 그 사이의 4개 모델에 대한 정보와 전체 표는 아래에 링크한 저장소(repo)에 있습니다. 테스트 중 15분간의 올코어(all-core) 스트레스 테스트 결과: 평균 74.66°C, 최고 77°C를 기록했으며, 기본 히트싱크와 팬에서 스로틀링(throttling)은 발생하지 않았습니다. 몇 가지 참고 사항: Ollama가 Jasper Lake iGPU를 인식했지만 스스로 CPU 백엔드(backend)를 선택했으므로, 여기의 모든 테스트는 의도적으로 CPU 전용으로 진행되었습니다. 15W 미만의 x86에서 소형 모델을 돌리는 것이 예상보다 더 실용적입니다. 약 7 tok/s 정도라면 0.6B 모델은 분류(classification), 라우팅(routing), 요약(summarization)과 같이 평소 API로 보냈을 법한 백그라운드 작업에 적합합니다. 8B 모델의 한계는 메모리 용량이 아니라 메모리 대역폭(memory bandwidth)입니다. 로드는 되고 실행도 되지만, 그냥 영원히 기다려야 합니다. 다음으로는 Jasper Lake iGPU에서 Vulkan을 사용하는 llama.cpp를 테스트할 예정입니다. r/SBCs의 누군가가 N100 iGPU에서 Vulkan 추론이 작동한다고 알려주었기에, 이 칩셋에서 CPU 대 Vulkan 비교 테스트를 진행하여 여기에 게시하겠습니다. 스크립트, 원시 로그(raw logs), 전체 결과 표: https://github.com/TrevTron/youyeetoo-x1s-kali 작성글: https://www.unland.dev/blog/budget-cyberdeck-youyeetoo-x1s-kali 만약 비교할 수 있는 N100 또는 N150 수치를 가진 분이 있다면 보고 싶습니다. 또한, Jasper Lake나 Alder Lake-N iGPU에서 Vulkan을 통해 사용 가능한 수준의 tok/s를 얻어내셨다면 저도 꼭 알고 싶습니다. (공지: 해당 보드는 Youyeetoo로부터 제공받았습니다. 테스트와 결론은 저의 개인적인 의견입니다.)
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기