
RPC에서 300GB 모델 로딩에 5분이 걸리는 것에 지쳤습니다. PR 26291을 통해 300% 빨라진 1분 30초로 단축
요약
RPC 환경에서 300GB 대규모 모델 로딩 속도를 기존 5분에서 1분 30초로 약 300% 단축하는 성능 개선 PR이 제안되었습니다. GGML_RPC_LOAD_THREADS 변수를 활용한 병렬 로딩 최적화가 핵심입니다.
핵심 포인트
- 300GB 대형 모델 로딩 시간을 5분에서 1분 30초로 단축
- GGML_RPC_LOAD_THREADS 변수를 통한 로딩 스레드 최적화
- 클라이언트 측 로딩 병목 현상 해결 및 서버 측 개선 필요성 언급
- 저사양 하드웨어 환경에서도 효율적인 모델 구동 지향
b10173 버전에서 - "state":"loading" 4분 54초. - 이 PR과 GGML_RPC_LOAD_THREADS 12를 사용했을 때 - "state":"loading" 1분 38초. 이 PR은 거의 완료 단계이며, 만약 새로운 GGML_RPC_LOAD_THREADS 변수를 유지하고 싶다면 문서(docs) 변경이 필요할 것입니다. 클라이언트 측 문제가 해결되었으니, 다른 누군가가 남은 서버 측 노력을 맡아주기를 바라며 이 PR이 채택되기를 희망합니다. 이 정도 크기에서 1분 미만의 모델 로딩을 달성한다면 정말 놀라울 것이며, 아직 멀지 않았습니다. 제가 이 기능을 저사양 하드웨어(potato hardware)에서 개발했다는 점과, 이를 테스트하는 사람이 아마 제 전체 시스템 구축 비용만큼의 비용을 시간당 지불하고 있을지도 모른다는 점이 약간 재미있었습니다. 하지만 주권 AI 전쟁(Sovereign AI Wars)에서, 저는 2~3대의 게이밍 PC로 구동되는 소시민들을 위해 코드를 작성합니다. /u/Chuyito 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기