B200 및 A100 작업 9건 실행 결과: 공급업체 4곳, 장애 발생 3건, 전액 환불 처리
요약
본 기사는 Kilawatt Cloud의 agent-exec API를 사용하여 B200 및 A100 GPU 자원을 실제 클라우드 환경에서 테스트한 결과를 공유합니다. 다양한 공급업체(RunPod, Vast.ai 등)를 통해 여러 작업을 실행했으며, 성공적으로 정상 상태에 도달한 작업과 실패 사례를 분석했습니다.
핵심 포인트
- B200 용량은 실제로 존재하며 API 접근이 가능함을 확인했습니다.
- 공급업체별로 GPU 자원 할당 및 정상화 속도 편차가 매우 큽니다.
- 실패하거나 구동되지 못한 머신에 대해서는 비용 청구가 발생하지 않습니다.
- 요청된 특정 GPU 카드를 제공할 수 있는 공급업체로만 작업이 라우팅됩니다.
오늘 우리는 Kilawatt Cloud의 agent-exec API를 통해 live B200 및 A100 작업을 실행했습니다. 이 경로는 AI 에이전트가 컴퓨팅 자원을 할당할 때 사용하는 것과 동일합니다. 시뮬레이션된 것이 아닙니다. 모든 작업은 실제 공급업체에서 실제 머신을 구동했으며, 이후 모든 머신은 종료되고 공급업체의 자체 기록과 대조되었습니다.
실행 결과: 9개 중 6개의 구동 작업이 정상 상태에 도달함
- B200: 두 번의 실행 모두 성공했습니다. RunPod는 0.5분 만에, Vast.ai는 1.6분 만에 정상 상태가 되었습니다.
- A100 (1개 카드): RunPod는 0.2분, Lambda는 2.9분, Hyperstack은 3.5분이 소요되었습니다. Vast.ai는 정상 상태가 되지 않았습니다.
- A100 (2개 카드): RunPod에서 1.0분 만에 성공했습니다. Vast.ai에서는 두 번 실패했습니다.
- 건너뜀: Hyperstack의 2카드 A100은, Hyperstack이 2카드를 하나의 전체 머신으로 가격 책정하기 때문에 저희의 지출 방어 장치(spend guard)에 의해 차단되었습니다.
실행을 통해 밝혀진 점
- B200 용량은 실제이며 API를 통해 접근 가능합니다. 두 개의 live B200 작업이 서로 다른 공급업체에서 정상 상태 확인(health checks)을 통과했습니다.
- 공급업체별 속도 편차가 매우 큽니다. 동일한 A100 카드가 누가 공급했는지에 따라 정상 상태가 되는 데 걸리는 시간이 0.2분부터 3.5분까지 다양했습니다. 이 간극이 단일 공급업체 환경에서 사용자가 감수해야 하는 부분입니다.
- 카드를 대체하지 않습니다. B200 재고를 보유한 곳은 RunPod와 Vast.ai뿐이었습니다. Lambda와 Hyperstack은 재고가 없다고 보고했기 때문에, 요청은 정확히 요구된 카드를 제공할 수 있는 공급업체로만 갔습니다.
- 실패한 머신 비용은 고객에게 아무것도 청구되지 않습니다. 부팅을 완료하지 못한 Vast.ai의 세 대의 머신 모두 자동으로 전액 환불되었습니다.
- 정리(Cleanup)가 작동합니다. 모든 머신은 공급업체의 자체 기록과 비교하여 사라진 것으로 확인되었습니다.
아쉬운 부분들(The parts that aren't flattering)
문제점을 숨기는 검증 보고서는 큰 가치가 없기 때문에 이 내용을 공개합니다.
- Vast.ai의 부팅 신뢰성은 여전히 해결되지 않은 문제입니다. A100 머신이 3번의 실행에서 부팅에 실패했으며, 하루 동안 여러 번의 테스트에서도 실패했습니다. 고객에게는 항상 환불되지만, 저희가 신뢰성 자체를 아직 해결하지는 못했습니다.
- 종료 타이밍(Shutdown timing). 실행 중 RunPod A100 하나가 예약을 완료했지만 다음 15분 체크까지 종료되지 않았습니다. 고객은 예약된 시간만큼만 청구되었습니다. 이후 저희는 1분 단위의 종료 체크로 변경했으며, 그 후 라이브 테스트를 통해 예약이 끝난 지 6초 만에 머신을 중지시키는 데 성공했습니다.
- 추가 Vast.ai 실행 건. 공급업체 고정(supplier-pinning) 단계가 첫 시도에서 효과를 발휘하지 못하여 RunPod 작업 하나가 Vast.ai에 배정되었습니다. 이는 카드 대체 없이 유효한 실행이었으며 환불 처리되었습니다. 이 내용은 보고서에 공개했습니다.
- Vast.ai의 마켓플레이스는 변화가 빠릅니다. 견적 시간과 실제 실행 사이에 B200 가격이 변경되었습니다. 보고서에는 고객에게 실제로 청구된 금액이 나와 있습니다.
실행 방식: 각 작업은 내부 테스트 계정의 임시 API 키를 사용하여 10분 동안 예약되었고, 프로덕션 엔드포인트로 전송되었으며 GPU는 특정 카드로 고정되었습니다. 다른 공급업체들은 각각 하나씩 테스트하기 위해 각 실행 주변에서 비활성화되었다가 다시 활성화되었습니다. 모든 임시 키는 이후 취소되었습니다.
저희는 이러한 작업을 계속 진행하고 실패 사례를 포함하여 결과를 공개할 것입니다. 차트와 원본 숫자가 담긴 모든 검증 보고서는 여기에서 확인할 수 있습니다:
👉 https://www.kilawattcloud.dev/super-intelligence
만약 에이전트(agents)가 스스로 GPU를 프로비저닝해야 하는 시스템을 구축하고 있다면, 이러한 보고서에서 어떤 내용을 보고 싶으신가요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기


