Petals: BitTorrent 방식으로 집에서 LLM 실행하기
요약
Petals는 BitTorrent 방식을 활용하여 대규모 언어 모델(LLM)을 분산 네트워크를 통해 실행할 수 있게 해주는 프로젝트입니다. 소비자용 GPU나 Google Colab을 사용하여 Llama 3.1, Mixtral 등 거대 모델을 추론하거나 미세 조정할 수 있습니다.
핵심 포인트
- BitTorrent 방식을 이용한 분산형 LLM 실행 지원
- Llama 3.1(405B), Mixtral 등 대규모 모델 지원
- 소비자용 GPU 및 Google Colab 활용 가능
- PyTorch 및 Transformers 기반의 높은 유연성 제공
Petals
BitTorrent 방식으로 집에서 대규모 언어 모델 (LLM) 실행하기
Llama 3.1(최대 405B), Mixtral(8x22B), Falcon(40B+) 또는 BLOOM(176B)을 사용하여 텍스트를 생성하고, 소비자용 GPU 또는 Google Colab을 사용하여 귀하의 작업에 맞게 미세 조정 (fine-tune) 하세요. -
모델의 일부를 로드한 다음, 모델의 다른 부분을 서비스하는 사람들의 네트워크에 참여합니다. -
단일 배치 추론 (Single-batch inference)은 Llama 2(70B)의 경우 초당 최대 6 토큰 (6 tokens/sec), Falcon(180B)의 경우 초당 최대 4 토큰 (4 tokens/sec) 속도로 실행되며, 이는 챗봇 및 대화형 앱에 충분한 속도입니다. -
기존의 LLM API를 넘어 — 모든 미세 조정 (fine-tuning) 및 샘플링 (sampling) 방법을 사용할 수 있고, 모델을 통한 커스텀 경로를 실행하거나 숨겨진 상태 (hidden states)를 확인할 수 있습니다.
PyTorch와 🤗Transformers의 유연성을 갖추면서도 API의 편리함을 누릴 수 있습니다.
현재 주요 기여자 (Top contributors):
Discord 또는 이메일을 통해 개발 상황을 팔로우하세요:
다음에서 소개되었습니다:
이 프로젝트는 BigScience 연구 워크숍의 일부입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기