
4개국 14대의 Mac을 활용한 RL 사후 학습 (Post-training)
요약
4개국 14대의 소비자용 Mac을 활용하여 인터넷을 통해 분산된 환경에서 RL 사후 학습(Post-training)을 성공적으로 수행한 사례를 소개합니다. MLX를 통한 int8 추론과 B200을 이용한 bf16 업데이트를 결합하여 데이터 센터 간 연결 없이도 효율적인 학습이 가능함을 입증했습니다.
핵심 포인트
- 소비자용 Mac 14대를 활용한 최초의 분산 RL 사후 학습 실행
- int8 양자화 및 가중치 델타 전송을 통해 네트워크 대역폭 문제 해결
- PaperSearchQA 작업에서 pass@1 성능을 29%에서 63%로 대폭 향상
- 분산된 소비자용 하드웨어를 활용한 오픈 모델 유지 가능성 제시
공개 사항: 저는 이 프로젝트를 구축한 연구소인 Pluralis Research에서 근무하고 있습니다. 코드는 공개되어 있으며, 질문에 기꺼이 답변해 드리겠습니다. 요약(TL;DR): 저희가 파악한 바로는, 이는 전체 롤아웃 플릿(rollout fleet)이 개방된 인터넷을 통해 소비자용 Mac에서 실행된 최초의 RL 사후 학습 (post-training) 실행입니다. 4개국에 걸쳐 설치된 14대의 Mac이 모든 롤아웃을 생성했습니다. 각 Mac은 MLX를 사용하여 int8 추론 (inference)을 수행했으며, 다른 대륙에 있는 단일 B200이 bf16 그래디언트 업데이트 (gradient updates)를 수행했습니다. 이들은 일반 가정용 인터넷을 통해 Cloudflare R2로만 동기화되었습니다. 데이터 센터 상호 연결 (datacenter interconnect)은 없었습니다. 기기 중 하나는 제 MacBook이었습니다. 이것이 중요한 이유는 에이전트형 RL (agentic RL)에서 롤아웃 생성 (rollout generation)이 컴퓨팅의 약 80%를 차지하기 때문입니다.
어려운 점: 어려운 부분은 Mac에서 토큰을 생성하는 것이 아니었습니다. bf16 Megatron 트레이너 (B200)는 몇 버전 이전의 가중치(weights)로 생성되고, int8로 양자화(quantized)되었으며, 서로 다른 커널 스택을 통해 실행되는 롤아웃을 사용했습니다. 두 가지 요소가 이러한 오프-폴리시 격차 (off-policy gap)를 제어했습니다: PULSE는 전체 체크포인트 (checkpoint) 대신 int8 가중치 델타 (weight deltas)를 전송합니다. 버전 간에 int8 값의 약 0.5%만 변경되므로, 일반적인 전송량은 9GB 대신 약 82MB였습니다. DPPO 스타일의 확률 게이트 (probability gate)는 롤아웃 모델과 트레이너 사이에서 확률이 너무 많이 벗어나는 약 0.3%의 토큰을 제거합니다.
결과: 저희는 다회차 생물 의학 검색 작업인 PaperSearchQA에서 Stoa를 테스트했습니다. 전체 검증 세트에서 커버 pass@1은 29%에서 63%로 증가했으며, 검색률은 22%에서 84%로 증가했습니다. 모델은 도구 (tool)를 사용하는 법을 배웠습니다.
한계 및 방향: 현재 Stoa는 모델이 하나의 Mac에 들어갈 수 있어야 하며, 트레이너는 하나의 클러스터 (cluster)로 제한됩니다. Pluralis의 Agora는 최근 개방된 인터넷을 통한 파이프라인 병렬성 (pipeline parallelism)을 사용하여 수백 개의 소비자용 GPU에 걸쳐 Pluralis-8B의 사전 학습 (pretraining)을 마쳤습니다. Agora와 Stoa를 결합하면 대규모 모델의 추론 (inference)과 학습 (training) 모두를 분산된 소비자용 하드웨어로 옮길 수 있습니다. 유휴 상태인 소비자 컴퓨팅의 총합은 이미 오늘날의 프런티어 모델 (frontier models) 뒤에 있는 클러스터들을 합친 것보다 더 큽니다.
최고의 모델들이 폐쇄적인 API 뒤로 숨어감에 따라, 사람들이 이미 소유하고 있는 하드웨어, 즉 훈련을 수행하는 사람들이 소유한 하드웨어에서 훈련하는 것은 모델을 오픈 상태로 유지하는 하나의 방법입니다. 코드: https://github.com/PluralisResearch/stoa 전체 글: https://pluralis.ai/blog/rl-post-training-on-macs X 스레드: https://x.com/Pluralis/status/2077419672987668667 /u/erfan_mhi 에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기