가장 많은 별을 받은 LLM 트레이딩 논문은 Buy-and-hold가 5.23% 손실을 보았다고 주장하지만, 실제로는 9.12% 수익을
요약
LLM 에이전트의 주식 거래 성능을 다룬 TradingAgents 논문의 핵심 결과인 Buy-and-hold 수익률 수치가 잘못되었음을 검증했습니다. 실제 AAPL 데이터 확인 결과, 논문은 손실을 주장했으나 실제로는 약 9.12%의 수익이 발생하여 논문의 대조군 설정이 무효함을 밝혀냈습니다.
핵심 포인트
- TradingAgents 논문의 Buy-and-hold 수익률 수치 오류 발견
- 실제 AAPL 수익률은 -5.23%가 아닌 +9.12%로 확인됨
- 논문의 핵심 주장인 에이전트 우위성이 데이터 오류로 인해 무효화됨
- 샤프 지수 및 자산 곡선의 비정상적 수치에 대한 의구심 제기
- 사후 비판 방지를 위한 사전 등록(Preregistration) 검증 방식 제안
TradingAgents (arXiv:2412.20138, GitHub 별 약 94,700개)는 아마도 현존하는 가장 눈에 띄는 "LLM 에이전트가 주식을 거래한다" 프로젝트일 것입니다. 이 논문의 핵심 결과는 다음과 같습니다: 멀티 에이전트 LLM 프레임워크가 2024-06-19부터 2024-11-19 사이에 AAPL에 대해 8.21의 샤프 지수(Sharpe ratio)와 함께 26.62%의 누적 수익률을 기록했다는 것입니다. 반면, 논문에서는 Buy-and-hold(매수 후 보유) 전략이 5.23% 손실을 보았다고 명시하고 있습니다.
이 마지막 수치는 API 호출 한 번으로 확인이 가능합니다. 그래서 저는 이를 확인해 보았습니다. 다만 약간의 차이를 두었습니다. 즉, 어떠한 계산을 수행하기 전에 테스트, 판정 규칙, 그리고 제가 예측한 결과를 공개적인 git 커밋에 동결(freeze)해 두었습니다.
사전 등록된 테스트
데이터를 가져오기 전, 다음 커밋에서 등록되었습니다:
60e8e2b
Yahoo Finance의 배당 조정 일일 종가(dividend-adjusted daily closes)를 사용하여 2024-06-19 → 2024-11-19 기간 동안의 AAPL Buy-and-hold 총 수익률을 재계산하십시오. 결과가 ≥ 0.0%이면 KILL(무효화) 하십시오. (만약 그렇다면, 논문에 명시된 -5.23%라는 기준점은 부호가 반대인 상태로 5.23포인트 이상의 오차가 발생하게 됩니다.) 예측된 P(kill): 0.90.
결과
| 시리즈 | 2024-06-20 | 2024-11-19 | Buy & hold |
|---|---|---|---|
| 조정 종가 (Adjusted close) | 207.88 | 226.83 | +9.12% |
| 원본 종가 (Raw close, 강건성 확인용) | 209.68 | 228.28 | +8.87% |
AAPL은 논문이 설정한 평가 기간 동안 약 9% 상승했습니다. 기준점(baseline)은 부호가 잘못되었을 뿐만 아니라 약 14.4%포인트의 오차가 있습니다. 논문의 핵심 대조군인 "Buy-and-hold는 돈을 잃었지만, 우리 에이전트는 26%를 벌었다"는 주장은 실제 가격 데이터와 대조했을 때 성립하지 않습니다. 판정: KILL (재현 스크립트가 포함된 전체 기록).
이차적 관찰 사항 (기록되었으나 판결의 일부는 아님): 약 105 거래일 동안 0.91%의 최대 낙폭 (Max Drawdown)과 함께 8.21의 샤프 지수 (Sharpe Ratio)를 기록한 것은 평가 아티팩트 (Evaluation artifacts)의 특징인 거의 단조로운 (near-monotonic) 자산 곡선을 의미합니다. 해당 리포지토리(repo)의 자체 이슈 트래커에는 미래 참조 편향 (Look-ahead bias) 보고(Issue #203)가 포함되어 있으며, 거래 비용 (Transaction costs)은 모델링되지 않았습니다.
왜 5분 단위 체크를 사전 등록(Preregister)하는가?
사후 비판 (Post-hoc criticism)은 비용이 저렴하며 반대 방향으로는 반증이 불가능하기 때문입니다. 비판자가 10번의 테스트를 수행하고 그중 결과가 좋았던 하나만을 발표했는지 여부는 아무도 알 수 없습니다. 이 원장 (Ledger)은 예측값과 확률을 먼저 게시한 다음, 스스로 점수를 매깁니다. 현재까지 세 개의 항목이 있습니다: 예측값 0.90 / 0.95 / 0.30, 결과 KILL / KILL / SURVIVE — 여기서 생존한 것은 그 주장이 거의 정확하게 재현된 변동성 전략 (entry 03)입니다. 평균 브라이어 점수 (Mean Brier score): 0.034. 모든 것을 제거하는 원장은 마케팅 상술에 불과하지만, 보정된 (Calibrated) 원장은 측정 도구입니다.
모든 항목은 데이터를 보기 전에 판결을 이끄는 정확히 하나의 테스트를 동결(freeze)하며, 무료 데이터 재현 스크립트를 게시하고, 판결 시 절차적 일탈을 보고합니다. 여기에는 항목 03에서 우리가 내려야 했던 하나의 판단 (Judgment call)도 포함됩니다.
만약 당신이 어떤 주장을 소유하고 있다면
본인의 것이든 벤더(vendor)의 것이든, 정량적 주장 (Quantitative claim)에 돈이나 엔지니어링 시간을 투입하기 직전이며, 동일한 사전 등록된 규율 하에 먼저 스트레스 테스트를 거치고 싶다면, 이슈를 생성하십시오.
본 내용은 공개된 주장에 대한 방법론적 검토입니다. 이는 투자 조언이 아니며, 특정 개인을 겨냥한 것도 아닙니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기