모델 가격 비교를 멈추세요. 완료된 작업당 비용을 측정하세요.
요약
모델 가격 비교는 토큰 사용량에만 초점을 맞추기 쉬워 실제 작업 비용을 간과하기 쉽습니다. 본문은 '승인된 작업물' 단위로 모델의 효율성을 측정해야 한다고 주장하며, 단순한 토큰 비용 외 재시도, 도구 호출, 인간 검토 시간 등 모든 요소를 포함하는 종합적인 '작업 비용(task cost)' 계산법을 제시합니다.
핵심 포인트
- 모델 가격 대신 완성된 작업물당 비용 측정이 중요합니다.
- 총 작업 비용은 모델 비용 외 도구, 재시도, 인력 검토 비용을 포함해야 합니다.
- 최종 평가는 승인 기준(acceptance criteria)과 실제 산출물을 기준으로 해야 합니다.
- Agent Stack™ 관점에서 모델은 여러 계층 중 하나일 뿐입니다.
모델 가격은 비교하기 쉽습니다. 하지만 완성된 작업(completed work)은 다루기 더 어렵습니다.
Fireworks는 한 고객의 비교 사례를 보고했는데, 총 토큰 사용량이 49.3K에서 29.9K로 39% 감소했지만, 과제 점수(task score)는 0.751에서 0.753으로 상승했습니다. 이는 토큰 효율성에 유용한 증거입니다. 하지만 실제 도구를 사용하는 시스템에서 모델을 선택하기에는 충분한 증거가 아닙니다.
빠진 단위는 '승인된 작업물(accepted work product)'입니다.
모델 응답은 사용 가능하지 않게 생성될 수 있습니다. 코딩 에이전트는 다음 테스트에 실패하는 패치를 반환할 수 있습니다. 리서치 에이전트는 출처 커버리지가 약한 유창한 요약을 만들 수 있습니다. 운영(operations) 에이전트는 소유자나 마감일이 없는 목록을 생성할 수 있습니다. 모델 청구서는 토큰을 기록합니다. 하지만 과제는 재시도(retries), 도구 호출(tool calls), 컨텍스트, 경과 시간(wall time), 그리고 인간의 수정 작업까지 소비합니다.
저는 네 가지 상태를 사용합니다:
- 생성된 출력(Generated output) — 시스템이 반환한 모든 것.
- 후보 작업물(Candidate work) — 형식 검사(format check)를 통과한 출력.
- 승인된 작업물(Accepted work) — 과제 계약을 충족한 출력.
- 재사용 가능한 작업물(Reusable work) — 다른 사람이 다시 열어볼 수 있는 승인된 출력.
평가를 위해, 저는 주변 시스템을 고정합니다. 같은 사람이 과제를 정의하고, 같은 프롬프트가 동작 방식을 설정하며, 같은 도구가 증거를 제공합니다. 그리고 같은 승인 기준(acceptance line)이 두 후보 모두를 심사합니다. 제가 변화시키는 변수는 하나입니다: 모델.
그런 다음 코딩, 리서치, 작문, 데이터, 반복적인 운영 등 다섯 가지 실제 과제를 실행합니다. 저는 토큰, 도구 호출, 재시도, 경과 시간, 인간의 분(human minutes), 승인 상태, 재사용 가능한 아티팩트 상태, 그리고 거부 이유를 기록합니다.
계산은 의도적으로 단순합니다:
model_cost = input_tokens * input_price + output_tokens * output_price
task_cost = model_cost + tool_fees + retry_cost + human_review_cost
accepted_work_cost = task_cost / accepted_work_products
분모는 반드시 보여야 합니다. 10달러를 사용해서 다섯 개의 승인된 출력을 만들어낸 실행과, 10달러를 사용했지만 초안 하나와 긴 수정 주기를 만든 실행은 같지 않습니다.
수락 기준은 작업과 일치해야 합니다. 코드를 위해서는 재현된 버그, 좁은 범위의 변경 사항, 기존 테스트 통과 여부, 하나의 회귀 테스트, 그리고 관련 없는 파일이 없어야 할 수도 있습니다. 연구의 경우, 다섯 개의 주요 출처, 각 출처당 하나의 주장, 현재 주장의 날짜, 명명된 불확실성(named uncertainty), 그리고 결정 노트가 필요할 수 있습니다. 운영의 경우, 날짜가 지정된 입력, 예외 사항 각각에 대한 이유, 담당자, 마감일, 그리고 내일 재개될 수 있는 기록이 필요할 수 있습니다.
이것이 제가 Agent Stack™을 통해 비교를 읽는 이유입니다: 인간(Human), 행동(Behavior), 도구(Tools), 메모리(Memory), 에이전트(Agents), 모델(Models). 모델은 하나의 계층일 뿐입니다. 도구는 외부 작업을 추가합니다. 메모리는 검색 및 반복적인 컨텍스트를 추가합니다. 에이전트는 단계와 재시도를 추가합니다. 인간 검토가 수락을 정의합니다. 마지막 계층만 비교하는 것은 비용을 발생시키는 경로를 숨깁니다.
현재의 출처들은 한계가 있습니다. Fireworks의 Ember-1 수치는 공급업체 보고이며 모델은 연구 프리뷰(Research Preview)로 제시됩니다. OpenAI의 평가 가이드는 작업별 테스트와 인간 판단을 권장합니다. 어느 출처도 제 워크로드에 대한 결과를 증명하지 못합니다. 그들은 다음 실험을 더 명확하게 만듭니다.
모델을 변경하기 전에, 작업 단위(work-unit) 시범 운영을 실행하십시오. 사람이 수락하고, 재개하며, 사용할 수 있는 것의 비용을 측정하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기