다섯 개의 AI 모델이 독립적으로 동일한 암호화폐를 선택했다. 하지만 팩트 체크 결과는 모두 일치하지 않았다.
요약
5개의 서로 다른 AI 모델에게 단일 암호화폐 투자 질문을 던진 결과, 모두 Bitcoin을 선택했으나 팩트 체크 결과 추론의 정확도는 제각각이었습니다. 모델들은 비트코인의 기술적/규제적 사실을 인용하는 과정에서 비교 표현의 오류나 규제 기관을 혼동하는 등의 한계를 보였습니다.
핵심 포인트
- 5개 AI 모델 모두 동일하게 Bitcoin을 투자 대상으로 선택함
- 모델별로 사실 관계의 정확도와 확신의 정도에 차이가 존재함
- 비교 표현(대부분, 훨씬 등)에서 주로 오류가 발생하는 패턴 확인
- Claude 모델은 SEC와 CFTC의 규제 역할을 혼동하는 오류를 범함
Bitcoin Institute(Bitcoin의 1차 사료 아카이브)의 기록 추적 전문가, Marlowe Finch 작성.
서로 다른 5개의 연구소에서 나온 5개의 AI 제품. 단 하나의 질문을, 각각 한 번씩, 동일한 문구로, 실행 간의 조정 없이, 금융 조언이 아닌 연구 질문으로 명시하여 질문했습니다: 만약 당신이 정확히 하나의 암호화폐에 투자해야 한다면, 무엇을 선택하겠으며 그 이유는 무엇인가. 아무도 헤징(hedging)하지 않았습니다. 아무도 두 개를 언급하지 않았습니다. 결과는 다음과 같았습니다 — 그리고 이 내용은 그때나 지금이나 투자 조언이 아닙니다.
증거 (The receipts)
| 모델 | 한 줄로 요약된 이유 |
|---|---|
| GPT-5.6 Sol | 가장 높은 상승 잠재력이 아니라 — 시장이 계속해서 축소된 이후에도 여전히 존재할 확률이 가장 높음 |
| ... | |
| 5개의 연구소, 5개의 별도 실행, 이들 사이의 조정 없음 — 그리고 5개 모두 Bitcoin에 도달했습니다. 전체 트랜스크립트와 방법론은 아카이브에 있습니다. |
합의(Agreement) 그 자체만으로는 무엇의 증거가 될 수 없습니다. 따라서 다음 단계는 그 합의의 밑바탕에 깔린 추론이 실제로 타당한지 확인하는 것이었습니다.
점수표 (The scorecard)
5개의 답변 전체에 걸쳐 구체적이고 확인 가능한 모든 주장을 Bitcoin Core의 자체 코드, SEC 및 CFTC 기록, CoinMarketCap, CoinWarz와 같은 1차 사료 및 현대의 보도 자료와 대조하여 확인했습니다. 집계 결과는 다음과 같습니다:
| 모델 (Model) | 확인된 주장 (Claims checked) | 정확함 (Accurate) | 과장됨 (Overstated) | 틀림 (Wrong) |
|---|---|---|---|---|
| GPT-5.6 Sol | 11 | 10 | 1 | 0 |
| ... |
숫자를 확인하기 전에 패턴을 주목하십시오. 거의 모든 오류는 단순한 사실이 아니라 "대부분(most)", "훨씬 앞선(far ahead)", "지속적으로(consistently)", "결코 ~않는(never)"과 같은 비교 표현에서 발생했습니다. 반감기(halving) 일정과 2024년 1월 현물 ETF (spot-ETF) 승인 날짜는 인용된 모든 곳에서 일치했습니다. 유일한 부분적 예외는 2,100만 개라는 발행 한도(cap) 자체입니다. GPT-5.6은 신중한 유보 조치와 함께 이를 인용했지만 ("엄밀히 말하면 그것이 실제 유통 총량이 정확히 2,100만 개가 될 것이라고 보장하는 것은 아니다"), Kimi는 동일한 사실을 "엄격하게 2,100만 개로 제한됨"이라고 단정 지었습니다. 이것이 Kimi의 과장(overstated) 수치에 해당 항목이 포함된 이유입니다. 근본적인 사실은 같으나, 이를 진술하는 방식에서의 확신 정도가 달랐던 것입니다.
실제로 오류가 발생한 지점
Claude의 가장 깔끔한 오류: Claude는 "심지어 SEC조차 BTC를 지속적으로 상품(commodity)으로 취급해 왔다"라고 기술했습니다. 규제 기관을 잘못 지정했습니다. 그것은 2015년 Coinflip 사건과 2018년 CFTC v. McDonnell 판결을 통해 확립된 CFTC의 역할입니다. SEC의 실제 입장은 BTC가 증권(security)이 아니라는 점에 국한되어 더 좁았습니다. 두 개의 서로 다른 기관과 두 개의 서로 다른 권한이 한 문장 안에서 서로 뒤바뀌었습니다.
Grok의 추론은 비트코인이 노드(node) 수 측면에서 "나머지보다 훨씬 앞서 있다"라고 말했으며, ETF 유입이 "진행 중"이라고 언급했습니다. 당시 비트코인과 이더리움(Ethereum) 사이의 노드 수는 대략 비슷했지, 압도적인 차이가 아니었습니다. 또한 현물 비트코인 ETF는 막 3분기 연속 순유출을 기록한 상태였습니다. 부분적인 회복이 있기 전, 운용자산(AUM)은 약 1,050억 달러에서 약 728억 달러로 감소했습니다. 주장의 절반은 현재 상황과 맞았으나, 나머지 절반은 반대 방향으로 흐르는 추세를 설명하고 있었습니다.
Kimi의 답변은 비트코인을 암호화폐 중 "가장 널리 거래되고 가장 유동성이 높은(most liquid)" 자산이라고 불렀습니다. 단순 거래량으로 보면 전혀 그렇지 않습니다. Tether(테더) 하나만으로도 2026년 1분기 거래량의 약 75%를 차지했습니다. 만약 "당신이 투자라고 부를 만한 것 중 가장 유동성이 높은 것"이라는 의미라면 맞을 수 있으나, 기술된 그대로의 표현은 틀렸습니다.
Gemini는 비트코인을 위한 재단이 "존재하지 않는다"고 말했습니다. 오늘날 기준으로는 맞습니다. Bitcoin Foundation는 2012년부터 대략 2015년까지 실존했던 조직이었으며, 그 이후 붕괴했고 2022년에 면세 지위를 상실했습니다. 하지만 해당 문장은 마치 재단이 아예 존재하지 않았던 것처럼 읽힙니다.
이러한 실패들의 공통점
이 중 어느 것도 환각 (hallucination)된 사실은 아닙니다. 모든 모델은 반감기 일정과 ETF 승인 날짜를 정확하게 재현했습니다. 이는 고정된 내용을 암기함으로써 맞출 수 있는 종류의 주장입니다. 거의 모든 실수는 비교 (comparison)에서 발생했습니다: "가장(most)", "훨씬 앞선(far ahead)", "일관되게(consistently)", "결코(never)"와 같은 표현들 말입니다. 질문이 "코드가 무엇이라고 말하는가"에서 "이것이 현재 다른 모든 것과 어떻게 비교되는가"로 바뀌는 순간, 모든 모델이 적어도 하나 이상의 비교 오류를 범했습니다.
이것은 비트코인에 관한 이야기가 아닙니다. 이것은 "AI의 최상급 표현을 얼마나 신뢰해야 하는가"에 관한 이야기이며, 비트코인은 단지 검증 가능한 테스트 케이스였을 뿐입니다. "어느 식당이 최고인가"와 달리, "어느 체인이 가장 많은 노드 (nodes)를 보유하고 있는가"는 실제적이고 검증 가능한 답변이 존재하기 때문입니다.
다섯 개의 모델. 하나의 공유된 결론. 아무도 요청하지 않은 성적표, 그리고 그들 중 누구도 예상하지 못한 패턴: 주장이 "알고리즘이 X라고 말한다"에서 벗어나 "X가 가장 ~하다"라는 방향으로 멀어질수록, 출처와 대조했을 때 살아남을 확률은 더 낮아졌습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기