대형 연구소들의 지출 규모: 어떤 수치가 공시되고 어떤 수치가 공시되지 않는가
요약
상장 기업과 비상장 연구소 간의 AI 지출 데이터 공시 방식 차이를 분석합니다. 자본 지출(CapEx)과 같은 회계 항목의 정의와 데이터 해석 시 주의해야 할 오류를 다룹니다.
핵심 포인트
- 상장 기업은 감사된 재무제표를 제출하나, 비상장 연구소는 추론에 기반한 불확실한 정보를 제공함
- 자본 지출(CapEx)은 데이터 센터 및 서버 구축에 투입된 현금 흐름을 의미함
- SEC의 JSON 데이터를 활용해 프로그래밍 방식으로 재무 수치를 추출할 수 있음
- 회계 연도 매핑 및 중복 계산(double-counting) 방지가 데이터 분석의 핵심임
일부 AI 지출은 감사를 받고, 날짜가 명시되어 있으며, 무료로 다운로드할 수 있습니다. 나머지는 전혀 공개되지 않습니다. 이 분야의 혼란스러운 수치들은 거의 대부분 이 두 가지를 혼용하거나, 모두 "지출"이라고 불리는 네 가지 서로 다른 양을 혼합하는 과정에서 발생합니다.
두 가지 기업 범주, 두 가지 인식론적 세계
상장 기업(Publicly listed companies) — Microsoft, Alphabet, Amazon, Meta, NVIDIA, Oracle, 그리고 상장된 중국 플랫폼들 — 은 증권 규제 기관에 정해진 일정에 따라 감사를 받은 재무제표(financial statements)를 제출합니다. 이들의 지출은 회계 기준에 의해 정의된 특정 의미를 가진 특정 항목(line items)으로서 공공 기록의 대상입니다.
비상장 연구소(Private labs) — OpenAI, Anthropic, xAI, Mistral, 그리고 나머지 대부분 — 는 그에 상응하는 어떠한 것도 제출하지 않습니다. 이들의 지출에 대해 떠도는 정보는 기자들에게 보여준 문서에 기반한 보고, 경영진의 성명, 그리고 추론에서 나옵니다. 그중 일부는 아마도 정확할 것입니다. 하지만 그 중 어느 것도 검증 가능하지 않으며, 공시 자료와 동일한 신뢰도로 인용되어서는 안 됩니다.
이 분야에서 가장 유용한 단일 원칙은 당신이 쓰는 모든 문장에서 이 두 범주를 분리하여 유지하는 것입니다. "Microsoft의 10-Q 보고서는 해당 분기에 X만큼의 자본 지출(capital expenditure)을 보고했다"와 "OpenAI는 Y를 지출한다고 보고되었다"는 서로 다른 종류의 주장입니다.
수치를 담고 있는 항목들
| 항목 (Line item) | 설명 |
|---|---|
| 자본 지출 (capital expenditure) | 현금 흐름표(cash flow statement) 상의 '유형 자산 및 설비의 구입(purchases of property and equipment)'. 데이터 센터, 서버 및 토지에 지출된 현금. 헤드라인을 장식하는 AI 구축 수치이며, 가장 많이 인용되는 수치입니다. |
| ... |
프로그래밍 방식으로 수치 가져오기
미국 증권거래위원회(SEC)는 모든 공시 자료를 무료로 게시하며, 태그가 지정된 재무 데이터를 JSON 형식으로 공개합니다. 이를 위해 데이터 벤더를 사용할 필요는 없습니다.
# 중앙 색인 키(CIK)별 특정 기업의 모든 공시 자료:
# https://www.sec.gov/cgi-bin/browse-edgar?action=getcompany&CIK=0000789019
...
두 가지 실무적인 참고 사항이 있습니다. 기업 데이터는 달력 연도(calendar year)가 아닌 기업의 회계 연도(fiscal calendar)를 기준으로 보고되므로, 여러 기업을 정렬하려면 비교하기 전에 회계 분기(fiscal quarters)를 매핑해야 합니다. 또한, 태그된 값에는 동일한 개념에 대해 분기별 수치와 연초 대비 누적(year-to-date) 수치가 모두 포함되어 있으며, 이는 각 레코드의 기간 시작 및 종료 날짜로 구분됩니다. 이를 단순히 합산하면 중복 계산(double-counts)이 발생하며, 이는 이 데이터를 활용한 자체 분석에서 가장 흔히 발생하는 오류입니다.
하나로 보고되는 네 가지 수치
AI 지출에 관한 헤드라인들은 이 수치들을 끊임없이 혼동합니다. 이들은 서로 관련되어 있지만 동일하지 않으며, 그 차이는 매우 큽니다.
| 수치 | 설명 |
|---|---|
| 현금 지출 (cash spent) | 해당 기간 동안 은행에서 나간 돈. 자본 지출 (capex) 항목. 사후적이며 감사됨. |
| ... |
다년 계획 발표를 연간 실행률 (annual run rate)로 변환하기:
annual_run_rate = announced_total / years_stated
...
이익을 움직이는 회계적 선택
회계 정책 주석(accounting-policy note)의 공시 내용 중 한 가지는 현재 받는 것보다 더 많은 관심을 기울일 가치가 있습니다. 바로 서버 하드웨어에 할당된 내용 연수 (useful life)입니다. 이는 공시되는 사항이며, 하나의 판단(judgement)이고, 단 1달러의 현금 흐름도 바꾸지 않으면서 보고된 이익을 수십억 달러 단위로 변화시킵니다.
annual_depreciation = asset_cost / useful_life_years
400억 달러 규모의 서버:
...
이것은 완전히 공시되면서도 거의 인용되지 않는 종류의 수치이며, 이 때문에 발표(announcement)에서 파생된 다른 수치들보다 훨씬 더 유용합니다. 더 광범위한 경제적 측면은 AI 자본 지출 (AI capital expenditure) 및 추론 마진 (inference margins)에 있습니다.
진정으로 알 수 없는 것
- 비공개 연구소의 운영 비용 (Private lab operating costs). 관련 공시 자료가 존재하지 않습니다. 비공개 연구소의 매출, 매출 총이익률 (gross margin), 훈련 비용 (training spend) 및 인건비 (headcount cost)는 공개되지 않으며, 이들에게 할당된 수치들은 기밀 유지 조건 하에 기자들에게 공개된 문서들로부터 나온 것입니다.
- 개별 훈련 실행 (training run) 비용. 어떤 기업도 이를 공개하지 않습니다. 이는 컴퓨팅 추정치 (the compute estimate)에 대여 요율을 곱하여 범위를 제한할 수 있지만, 대규모 확약 용량 (committed capacity)에 대해 협상된 요율은 공개된 시간당 가격과 거의 관련이 없기 때문에 그 범위가 매우 넓습니다.
- 하이퍼스케일러 (hyperscaler)의 자본 지출 (capex) 중 AI가 차지하는 비중. 자본 지출 (capex)은 그런 방식으로 세분화되어 있지 않습니다. 기업이 컨퍼런스 콜에서 그 중 대부분이 AI 관련이라고 말할 수 있지만, 그러한 진술은 감사받은 공시 (audited disclosure)라기보다는 경영진의 논평 (management commentary)에 가깝습니다.
- 순환 거래 (Circular arrangements). 공급업체가 고객사에게 투자하고, 그 고객사가 다시 공급업체로부터 제품을 구매하는 경우, 동일한 자금이 투자금인 동시에 매출로 나타날 수 있습니다. 이러한 사항은 특수관계자 (related-party) 및 수익 인식 (revenue-recognition) 주석을 통해 확인할 수 있으며, 대개 천천히 드러나게 됩니다.
- 수익성이 있는지 여부. 부문별 보고 (Segment reporting)는 이들 기업 중 어느 곳에서도 모델 서빙 (model serving)의 경제성을 분리해낼 만큼 세밀하지 않습니다. 특정 제공업체의 추론 (inference) 마진을 말하는 사람은 누구나 추정치를 제시하는 것입니다. 그러한 추정치가 어떻게 구축되고 무엇에 근거하는지는 AI 단위 경제성 (AI unit economics)을 참조하십시오.
공시 자료는 분기별로 제출되며, 구축 단계 동안 그 수치는 매 분기 큰 폭으로 변합니다. 항상 특정 공시 자료, 기간 및 항목을 인용해야 하며, 기사에 나온 수치를 반복하기보다는 EDGAR에서 현재 값을 직접 가져오십시오.
관련 항목
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기