잡아봐, 할 수 있다면: 영구적인 8-GPU 서버 상금 챌린지 (커뮤니티 제안)
요약
AMD Instinct MI50 GPU를 탑재한 8-GPU 로컬 AI 서버의 추론 성능 기록을 경신하기 위한 커뮤니티 챌린지 제안입니다. Reddit 커뮤니티 기금을 통해 서버 구축 및 상금을 운영하며, 기록을 유지하는 도전자에게 서버를 양도하는 방식입니다.
핵심 포인트
- AMD Instinct MI50 기반 8-GPU 서버 성능 챌린지
- Reddit 커뮤니티 기금을 활용한 프로젝트 운영 제안
- 기록 경신 시 30일 유지 조건 및 서버 양도 혜택
- 하드웨어 구성 및 벤치마크 과정의 투명한 공개
현재의 Catch Me If You Can 벤치마크는 간단한 질문을 던졌습니다: 누군가 공개적으로 우리의 MI50/GFX906 로컬 추론 (local inference) 기록을 재현하고 경신할 수 있는가? 원본 챌린지: https://www.reddit.com/r/LocalAIServers/comments/1ukhr24/catch_me_if_you_can_mi50gfx906_1195_tps_moe_702/ 현재 vNext 재현 릴리스: https://github.com/joe2gaan/localaiservers/releases/tag/vnext-gfx906-rocm72-gguf-hf-repro 저는 이 벤치마크를 커뮤니티 프로그램으로 전환하고 싶습니다: 공개적으로 고정된 서버를 구축하고, 이를 공식 테스트 머신으로 만들며, 자격이 있는 도전자가 왕좌를 차지하고 30일 연속으로 유지할 때까지 챌린지를 계속 열어두는 것입니다.
누가 책임지는가
저는 r/LocalAIServers의 모더레이터인 Joe / u/Any_Praline_8178 개인의 자격으로 이 제안에 대해 15,000달러의 Reddit 커뮤니티 기금 (Reddit Community Funds) 신청서를 제출했습니다. 이것은 아직 실제 상금 제안이 아닙니다. 하드웨어 취득 및 모든 상금은 Reddit의 승인, 최종 발표된 공식 규칙, 자격 검토 및 관련 법률에 따라 결정됩니다. 기존 리더보드 (leaderboard)는 변경되지 않습니다. 저는 또한 LocalAIServers Collective Inc.를 설립했습니다. 이 비영리 단체는 신청자가 아니며, 커뮤니티 기금을 받거나 통제하지 않고, 프로젝트 대금이나 비용 상환을 받지 않으며, 자금을 지원받은 챌린지 서버를 소유하거나 보유하지 않습니다. 저는 Reddit의 승인된 조건에 따라 승인된 구매, 공개 구축, 공식 테스트, 기록 및 승자 이전을 개인적으로 처리할 것입니다.
서버 및 공개 구축
제안된 챌린지 서버는 현재 왕좌의 결과를 만들어낸 하드웨어 구성과 일치합니다:
- GIGABYTE G292-Z20 8-GPU 서버
- AMD EPYC 7F32
- 8개의 DDR4 ECC RDIMM인 128GB
- 8개의 AMD Instinct MI50 32GB GPU
- Crucial CT480BX500SSD1 480GB SATA 루트 드라이브
- KIOXIA KCD6XLUL1T92 1.92TB NVMe 모델 및 런타임 드라이브
빌드 자체는 커뮤니티 프로젝트의 일부입니다.
저는 구성 요소 선택, 자재 명세서 (BOM), 물리적 조립, 펌웨어 및 운영체제 (OS) 설정, 8-GPU 구동 (bring-up), 전력 및 냉각 설정, BAR/P2P 상태, 안정성 점검, 런타임 및 소스 버전, 모델 해시 (model hashes), 베이스라인 실행 (baseline runs), 그리고 가공되지 않은 증거들을 공개할 것입니다. 15,000달러의 예산은 정확한 서버 구성, GPU, 메모리 및 스토리지 가격의 변동 가능성, 세금 및 결제 차액, 보호 포장, 그리고 승자에게 전달되는 보험 가입 배송비를 포함합니다. 승인된 프로젝트에 필요하지 않은 모든 금액은 Reddit으로 반환되거나 Reddit의 지침에 따라 처리됩니다.
핵심 챌린지: 고정된 8-GPU 로컬 AI 서버를 구축하고 검증하십시오. 해당 머신에서 공개된 vNext 패키지를 실행하여 공식적인 기존 기록 보유자 (incumbent)를 설정합니다. Reddit의 승인된 프로젝트 약관에 따라, 적격한 승자가 왕좌의 시간 (throne clock)을 완료할 때까지 챌린지를 유지합니다. 모든 잠재적인 왕좌 탈환 시도는 반드시 동일한 물리적 서버에서 재현되어야 합니다. 3회 실행 결과의 중앙값 (median)이 공식 기록 보유자보다 최소 3% 이상 높아야 합니다. 임시 리더는 30일 연속으로 가장 높은 검증된 결과로 유지되어야 합니다. 최종 검증 및 공식 규칙에 따라, 해당 시간을 완료한 적격한 외부 도전자에게 전체 챌린지 서버를 양도합니다. 8개의 GPU는 모두 설치된 상태로 유지되며 사용 가능해야 합니다. 참가자는 고정된 호스트에서 TP4, TP8 또는 다른 토폴로지 (topology)를 선택할 수 있지만, 가속기를 추가, 교체 또는 원격으로 빌려올 수는 없습니다. 문서화된 동일 규격 (like-for-like)의 고장 교체가 발생할 경우, 왕좌의 시간이 재개되기 전에 새로운 베이스라인 측정이 필요합니다.
개방형 최적화, 고정된 무결성: 고정된 하드웨어 내부에서 모델 무결성, 워크로드, 재현성 및 안전 규칙을 준수하는 범위 내에서 소프트웨어 최적화는 자유롭게 허용됩니다. 런타임 (runtime), 커널 (kernels), 콜렉티브 (collectives), 스케줄링 (scheduling), 그래프 캡처 (graph capture), 컴파일러 작업, 드라이버 및 운영체제 튜닝, 그리고 안전한 클럭 또는 전력 튜닝을 모두 탐구할 수 있습니다.
첫 번째 레인은 FP16/F16 형식의 고정된 Qwen3.6 35B-A3B 모델을 사용합니다: HF 리비전(revision): 995ad96eacd98c81ed38be0c5b274b04031597b0 필수 GGUF F16 SHA-256: 1f2443bb0ff958943d091410c61120c181a0579b3bc85192029aa51d821d141c. HF FP16 및 GGUF F16은 게시된 정체성(identity) 및 정확성 게이트(correctness gates)를 충족할 때만 자격이 주어집니다. GGUF는 오직 완전한 F16 형식만 허용됩니다. 허용되지 않는 사항: Q4, Q5, Q6, Q8, INT8, FP8, AWQ, GPTQ, NVFP4 또는 기타 양자화된 대체물. 결과 도출을 위해 사용된 양자화된 가중치(quantized weights), KV 캐시(KV cache), 활성화 함수(activations) 또는 숨겨진 저정밀도 경로. MTP(multi-token prediction), 추측적 디코딩(speculative decoding), EAGLE, DFlash, 초안 모델(draft models), 룩어헤드 토큰(lookahead tokens) 또는 기타 다중 토큰 예측 방법. 원격 컴퓨팅(remote compute), 외부 API, 숨겨진 서비스 또는 다른 머신에서 조립된 결과. 단일 요청 속도로 제시된 다중 요청 배치(multi-request batching) 또는 집계된 동시성(aggregate concurrency). 승인된 모델에 의해 생성된 하나의 토큰은 반드시 하나의 수락된 디코딩 단계(decode step)를 나타내야 합니다. 모든 결과는 단순히 높은 TPS(tokens per second) 수치를 보고하는 것이 아니라, 의미론적(semantic) 및 출력 무결성(output-integrity) 게이트를 통과해야 합니다.
실행 측정 방식
공식 워크로드(workload)는 다음과 같이 유지됩니다: MAX_MODEL_LEN=131072, 단일 요청 디코딩(Single-request decode), 동시성(Concurrency) 1, 백엔드 디코딩 TPS(Backend decode TPS), 8회의 웜업(warmups) c1_128 uncapped strict c1_2000 c1_10000, 3회의 측정 실행(measured runs), 공식 기존 기록보다 최소 3% 높은 3회 실행 중앙값(three-run median).
공개 재현 패키지 및 원시 로그(raw logs)
현재 공개된 헤드라인 레퍼런스는 GGUF F16 Qwen3.6 35B-A3B MoE TP4에 대한 119.52 strict backend TPS입니다. 이는 TP4 프로필이 4개의 GPU를 활발하게 사용하고 있는 동안 8-GPU 검증 호스트에서 생성되었습니다. 지원금을 받는 서버는 새로운 베이스라인(baseline)을 받게 됩니다. 기존의 119.52 결과는 레퍼런스(reference)일 뿐, 새 서버의 시작 점수를 보장하는 것은 아닙니다.
현재 공개 리더보드 (Current public leaderboard) 본 내용은 기존 벤치마크 게시물에서 발표된 목표 값들입니다: Class Strict TPS c1_2000 c1_10000 GGUF F16 35B-A3B MoE TP4 119.33 ~ 119.52 120.46 ~ 120.57 113.26 ~ 113.37 GGUF F16 27B Dense TP8 69.85 ~ 69.91 70.76 ~ 70.96 66.32 ~ 66.44 HF FP16 35B-A3B MoE TP4 114.41 ~ 115.11 115.69 ~ 115.93 108.92 ~ 109.10 HF FP16 35B-A3B MoE TP8 114.70 ~ 115.04 115.53 ~ 115.55 108.67 ~ 108.81 HF FP16 27B Dense TP8 70.17 71.32 66.82 GGUF F16 MoE TP8은 현재 리더보드에서 여전히 미개척 영역(open lane)입니다.
오프라인 공식 테스트 (Offline official test) 개발 및 아티팩트 스테이징은 인터넷을 사용할 수 있습니다. 하지만 측정되는 공식 실행은 그렇지 않습니다. 테스트 전에 저는 모델, 런타임, 소스, 빌드 결과물, 그리고 벤치마크 제출 패키지를 스테이징하고 해시 검증(hash-verify)할 것입니다. 모든 측정된 실행에 대해: 외부 네트워크 인터페이스와 기본 경로는 비활성화되거나 물리적으로 분리됩니다. 로컬 머신 통신과 루프백만 허용됩니다. 모델 다운로드, 컨테이너 풀(container pull), 원격 측지계학(telemetry), API 호출, 원격 컴파일러 또는 원격 컴퓨팅은 허용되지 않습니다. 네트워크 상태, 패키지 해시, 프로세스 상태, 하드웨어 상태, 그리고 원본 벤치마크 로그는 결과와 함께 아카이브됩니다. 다른 곳에서 나온 결과가 벤치마크 제출이 준비되었음을 보여줄 수는 있지만, 해당 패키지가 지정된 서버에서 재현되지 않는 한 공식적인 자리를 차지할 수는 없습니다.
30일의 자리 시간 (The 30-day throne clock) 도전자(challenger)는 자신의 패키지가 검토를 통과하고 공식 세 번 실행 중앙값(three-run median)이 현직 기록 보유자(incumbent)보다 최소 3% 이상 높을 때 잠정적인 리더가 됩니다. 수락 타임스탬프(acceptance timestamp)는 해당 도전자에게 30일의 클럭을 시작시킵니다. 이 30일 동안: 누구나 더 높은 결과를 제출할 수 있으며, 현재 벤치마크 유지 관리자인 저도 예외가 아닙니다. 모든 방어 또는 반대 결과는 동일한 공개 패키지, 오프라인 환경, 동일 하드웨어, 정확성, 그리고 3% 규칙을 충족해야 합니다. 새로 인정된 리더는 해당 리더의 이름으로 클럭을 재설정합니다. 비공개 결과와 스크린샷은 목표 지점을 이동시키지 못합니다. 활성화된 클럭을 무력화하기 위해 규칙을 소급하여 변경할 수 없습니다.
만약 도전자의 30일 기간이 만료되기 전에 제가 다시 왕좌를 탈환한다면, 해당 도전자는 승리한 것이 아니며 챌린지는 계속 열려 있는 상태로 유지됩니다. 만약 다른 커뮤니티 구성원이 탈환한다면, 그 사람을 기준으로 시계가 다시 시작됩니다. 저는 성능 기록을 방어할 수는 있지만, 서버를 획득하거나 개인적인 보상금을 받을 수는 없습니다. 목표 지점은 더 빠른 검증된 결과가 나타날 때만 이동할 수 있습니다. 물리 법칙, 고정된 하드웨어, 그리고 모델의 정확성(model correctness)이 한계치를 설정합니다. 상금, 검토, 그리고 서버의 향방: 자격이 있는 외부 도전자가 30일 연속으로 가장 높은 검증된 리더로 남을 경우, 결과는 최종 검증 단계로 넘어가며, 공식 자금 지원 및 자격 요건에 따라 챌린지 서버 전체를 양도합니다. 배송, 세금, 위치 자격, 수출 제한, 수락 및 양도 세부 사항은 상금이 활성화되기 전 최종 규칙에서 결정될 것입니다. Reddit의 승인된 약관에서 다른 사항을 요구하지 않는 한, 서버 배송을 위해 승자의 이름과 우편 주소만 수집됩니다. 공개적인 게시물이나 댓글에 개인 정보를 게시하지 마십시오. 저는 단독 심판관이 되지 않을 것입니다. 공식 실행(Official runs), 해시(hashes), 로그(logs), 정확성 증거 및 결정 사항은 공개될 것이며, 독립적인 기술 검토자들과 함께 검토될 것입니다. 검토자의 신원과 최종 분쟁 처리 프로세스는 참가 신청이 시작되기 전에 공개됩니다. 자격이 있는 승자가 기간을 완료할 때까지, 자금이 지원된 서버는 Reddit이 승인한 챌린지 용도로만 사용됩니다. 해당 서버는 저나 LocalAIServers Collective Inc.의 소유가 아닙니다. 현금 대체는 불가능하며, 다른 하드웨어 부문이나 조직 프로그램으로 이월되지 않습니다. 승자 없이 챌린지가 종료되거나 서버에 대해 다른 결과가 필요한 경우, 저는 Reddit의 지침을 따를 것입니다. 승인 후 일정: 12주 차: 규칙, 검토자 및 구매 확정. 35주 차: G292-Z20 서버를 공개적으로 구축 및 검증하고, 자재 명세서(bill of materials)와 구축 기록을 게시. 6주 차: 베이스라인(baseline)을 게시하고 챌린지 시작.
우승자: 검증된 왕좌를 30일 연속으로 유지하는 첫 번째 적격 리더. 이전 및 최종 보고: Reddit의 승인된 약관에 따라, 우승 결과가 최종 검증을 완료한 후 14일 이내에 진행. 출시 전 커뮤니티의 의견을 듣고 싶은 사항: 제안된 토폴로지(topology) 규칙이 적절한 균형을 이루고 있는가, 아니면 8개의 GPU가 모두 활성화되어야 하는가? 제안된 3% 임계값(threshold)이 모든 왕좌 교체 시 적절한 균형을 이루는가? 어떤 클록(clock), 전력(power), 펌웨어(firmware) 및 냉각 안전 범위(safety envelope)를 공개해야 하는가? 누가 독립적인 기술 검토자(technical reviewer)로 자원할 것인가? 비판을 환영합니다. 목표는 어렵고, 투명하며, 재현 가능하고, 진정으로 승리 가능한 챌린지를 만드는 것입니다. /u/Any_Praline_8178이 r/LocalLLaMA에 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기