DeepSeek의 '80배 저렴' 주장을 테스트하기 위해 Nvidia H200 네 개를 임대한 회사
요약
컨설팅 회사가 DeepSeek V4.1 Flash와 Anthropic Claude Opus 5.5의 코딩 에이전트 성능을 비교 테스트한 결과를 분석했습니다. 이 보고서는 'DeepSeek이 80배 저렴하다'는 주장의 실효성을 검증하며, 실제 사용 환경에서의 비용 효율성과 기술적 한계를 지적합니다.
핵심 포인트
- 단순 토큰 가격만으로는 전체 비용을 판단하기 어려움.
- 실제 코딩 에이전트는 재읽기(re-reading)가 많아 비효율적일 수 있음.
- DeepSeek의 API 사용 시에도 Claude Opus 5.5 대비 여전히 높은 비용 발생 가능성 존재.
- 테스트 결과, DeepSeek을 이용한 온디맨드 요금은 예상보다 높게 책정될 수 있음.
다른 기업을 위해 콜 플로어를 구축하고 운영하는 컨설팅 회사인 The Call Center Doctors는 테스트 보고서에 따르면, Opus 5.5 대신 DeepSeek V4.1 Flash를 Claude Code 에이전트에게 제공하기 위해 9월 27일 4x H200 박스를 임대했습니다. 이 보고서는 DeepSeek이 Claude보다 “80배 저렴하다”는 말을 들은 모든 사람을 대상으로 합니다. 실제 코딩 혼합 작업을 사용한 결과, 해당 회사의 전체 박스는 온디맨드 비용으로 일일 $440.88에 시간당 약 213 토큰을 기록했습니다. 이는 DeepSeek의 API를 통해 같은 작업을 수행할 때의 하루 $184~$223와 비교됩니다. 이 콜센터는 온디맨드 요금으로 박스가 부과하는 비용보다 낮은 가격에서 Opus 5.5로 돌아갔습니다.
DeepSeek의 API는 비피크 시간대(off-peak) 신규 입력 토큰당 100만 개에 $0.15, 캐시된 입력 토큰당 $0.003, 출력 토큰당 100만 개에 $0.60으로 책정되어 있습니다. 피크 비용은 두 배입니다. 비교하자면, Anthropic의 Claude Opus 5.5는 100만 토큰당 입력 $4, 출력 $20이며 캐시 읽기는 $0.20입니다. 이 컨설팅 회사는 API가 아닌 구독을 통해 이를 사용했습니다.
테스트에서 1분간 최대 부하로 실행했을 때 박스의 성능은 한 가지 종류의 작업에는 괜찮았습니다. 그러나 코딩 에이전트는 주로 대화를 재전송하는 방식으로 작동하며, 컨설팅 회사의 로그에 따르면 에이전트가 모델에 제공한 내용 중 96%는 오래된(stale) 텍스트였습니다. 새로운 토큰 하나를 작성할 때마다 약 1,000개의 이전 토큰이 필요합니다. 재읽기는 저렴하지만 너무 많아서 박스가 계속 재읽기에 바빠서 새로운 토큰을 작성할 시간이 거의 남지 않았습니다.
모델을 안정적으로 구동하는 데는 10분에서 15분 동안 로딩을 시도해야 했고, 총 다섯 번의 시도가 필요했습니다. 이 박스(box)는 바쁜지 아닌지를 구분하지 않아 최적이 아닙니다. 저희 계산에 따르면, 온디맨드 요율($18.37/시간)로 표준 길이의 한 달을 사용하면 약 $13,200이 나옵니다. 이는 컨설팅 회사의 9월 Claude 청구액보다 두 배 이상 많은 금액입니다. 게다가, 이 박스 하나로는 하루에 약 200억 토큰밖에 처리할 수 없는데, 이는 대부분 재읽기(re-reading)로 이루어지며, 컨설팅 회사가 가장 바쁜 날 사용한 510억 토큰에 비하면 적은 양입니다.
이번 테스트는 DeepSeek이 Claude보다 “80배 저렴하다”는 말을 들었던 모든 사람들을 겨냥했습니다. 9월 1일부터 27일까지 운영된 하나의 서버에서 모델 호출(model calls)은 203만 건, 읽은 토큰(tokens read)은 3,885억 개, 캐시된 토큰(cached)은 그중 3,742억 개, 작성된 토큰(written)은 3억 9,300만 개였으며, 병합된 변경 사항(merged changes)은 5,610건이었습니다. 컨설팅 회사의 9월 Claude Code 구독료는 약 $5,500에 달했습니다. DeepSeek의 API를 사용했을 경우 같은 27일간의 토큰 비용은 피크 가격에 따라 $3,500에서 $7,000 사이가 될 것이며, 사용량이 주(week) 전체에 고르게 분산된다고 가정하면 평균적으로 약 $4,200으로 추정됩니다.
Claude Opus 5.5의 목록 가격과 비교했을 때, 같은 토큰을 사용하려면 저희 계산으로는 약 $140,000이 들 것이며, 이는 구독료 비용보다 25배 이상 비싼 금액입니다. 이처럼 고정된 요금 할인(flat-rate discount) 때문에 '80배'라는 수치가 나온 것입니다. 컨설팅 회사는 또한 병합된 코드 변경 사항 각각에 가격을 책정했는데, Claude에서는 약 $1이고 DeepSeek의 API를 사용했을 경우 같은 작업을 동일한 토큰으로 수행한다면 약 $0.63입니다. DeepSeek에 대한 $1.15–$4.90 추정치는 모델이 더 많은 토큰을 필요로 하고, 성공률이 낮으며, Claude가 그 결과를 확인해야 한다는 가정에 기반합니다.
DeepSeek은 테스트에서 실제 코드를 작성할 기회를 얻지 못했습니다. 컨설팅 업체의 검토자들은 에이전트 코드가 공유 임시 폴더의 설정 파일을 통해 샌드박스(sandbox)를 탈출할 수 있는 방법을 계속해서 찾아냈고, 이는 에이전트 코드가 관리자 권한으로 실행될 수 있게 했습니다. 이로 인해 코드 작성 에이전트는 오프라인 상태로 유지해야 했습니다. 대신 DeepSeek은 48개에서 64개의 읽기 전용 검토 에이전트로만 작동하여 2,377개의 폴더를 읽고 32개의 버그 보고서를 제출했습니다. 시간당 $9.19의 요율로 임대한 이 박스는 마지막 테스트가 끝난 지 몇 분 만에 제공업체에 의해 회수되었습니다.
V4 생성을 기반으로, Pro가 Flash를 능가한 점을 감안할 때, DeepSeek V4.1-Pro에서는 모델 패밀리로부터 더 나은 성능이 기대됩니다. 현재 이 버전은 확정된 출시일이 없습니다. 이는 미래에 계산 방식을 바꿀 수도 있지만, 지금 당장은 오픈 소스 모델을 실행하기 위해 GPU를 임대하는 것보다 토큰에 지출할 수 있는 더 좋은 방법들이 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기