Jev가 과거 시장 결과를 기억할 것이라 예상했지만 그렇지 않다
요약
본 기사는 Jev라는 AI 모델의 과거 시장 예측 능력에 대한 분석 결과를 다룹니다. 필자는 Jev가 역사적 데이터를 학습하여 미래를 '예측'하는 능력이 과대평가되었을 것이라 예상했으나, 실제 백테스팅 결과는 그와 반대임을 밝힙니다. 이는 LLM 기반 트레이딩 백테스트의 가치에 중요한 변화를 가져옵니다.
핵심 포인트
- Jev 모델은 과거 시장 결과를 학습하여 예측하는 능력이 기대보다 높게 나타남.
- 과거 데이터 포함 백테스팅 결과는 필자의 초기 가정과 상반되는 긍정적인 신호임.
- LLM 기반 트레이딩 백테스트의 가치에 대한 기존의 우려가 해소됨.
- Jev 모델은 일반 언어 모델처럼 사건과 날짜를 기억하는 능력을 보여줌.
Jev가 과거 예측 시장의 결과를 학습했을 것이라고 예상했지만, 그렇지 못했다. Jev에게 "도널드 트럼프가 취임할 것인가?"라는 2025년 1월 시장에 대해 물었을 때 0.70이라는 답이 나왔다. 또한 연준(Fed)이 2025년 1월 금리를 인상했는지 여부에 대해서도 0.30이라고 답했는데, 이는 거의 모든 질문에 부여하는 숫자와 동일하다. Jev는 최대 20개월 전에 해결된 17,036개의 Polymarket 시장 전반에 걸쳐 Yes를 No보다 높게 순위화하는 능력(AUC 0.59–0.68)이 그가 볼 수 없었던 이후에 해결된 9,138개 시장에서의 능력과 동일하다. 역사적 데이터를 사용하여 Jev 봇을 백테스팅(backtesting)하는 모든 사람에게 이는 내가 Jev 트레이딩 판결문에서 경고했던 것과는 정반대의 상황이며, 이는 좋은 소식이다.
이것은 1부의 부수적인 결과물인데, 그곳에서는 Jev가 모든 측정 기준에서 시장 가격에 패배했었다. 이 내용은 별도의 게시물이 될 가치가 있다. 왜냐하면 내가 미리 잘못 판단했고, 또한 이것이 Jev를 사용한 백테스트의 가치를 변화시키기 때문이다.
내가 예상했던 것과 그 이유
Jev는 텍스트로 학습되었다. 2025년 주요 시장들의 결과는 누가 취임했는지, 연준이 매 회의에서 무엇을 했는지, 누가 윔블던(Wimbledon)에서 우승했는지, 휴전이 있었는지 등 모든 곳에 텍스트 형태로 존재한다. 일반 언어 모델(general language model)은 이러한 정보들을 기억 속에서 답변하며, 사건과 날짜를 명시하는 시장 질문은 줄 수 있는 가장 직접적인 단서가 된다.
따라서 내가 처음에 내린 가정, 즉 이전 Jev 판결문에 적었던 내용은, 역사적 시장에 대한 어떤 Jev 결과도 오염되었을 것이라는 것이었다. 모델이 기억 속에서 2025년을 "예측"하여 매우 뛰어나 보이다가 실제 상황에서는 무너질 것이라고 생각했다. 나는 이와 유사한 패턴을 LLM 기반 트레이딩 백테스트(LLM-based trading backtests)에 대해 논의하는 것을 본 적이 있었고, 이는 검토자가 가장 먼저 질문하는 부분이었다.
테스트 설계는 그 가정에서 비롯되었다. Jev가 공개된 이후에 해결된 시장만을 점수화하는 대신, 나는 2025년 1월까지 거슬러 올라간 이전 5개월의 데이터도 가져와서 동일한 방식으로 같은 질문을 던졌다. 만약 Jev가 기억하고 있다면, 과거 월들의 점수가 훨씬 높게 나와야 한다.
체크가 작동하는 방식
Part 1과 동일한 파이프라인을 사용하지만, 루프를 하나 더 추가했습니다. 각 시장의 기준 시간(종료일과 해상도 시간 중 더 빠른 날짜)은 해당 시점(window)에 배치되며, 모든 시점은 개별적으로 점수가 매겨집니다:
from sklearn.metrics import roc_auc_score
for window in ["2025-01", "2025-07", "2026-01", "2026-04", "2026-07", "2026-09"]:
...
Jev가 보는 상태는 질문과 해상도 규칙만 포함하며, 날짜 정보는 그대로 남겨둡니다. 이것은 의도적인 것입니다. 만약 모델이 이러한 사건에 대한 기억을 가지고 있다면,
Jev가 과거 시장 결과를 기억할 것이라 예상했지만 그렇지 않다
| Market, January 2025 | Price 24 h before | Jev | Resolved |
|---|---|---|---|
| Will Donald Trump be inaugurated? | 0.99 | 0.70 | Yes |
| ... | |||
| Market, July 2025 | Price 24 h before | Jev | Resolved |
| --- | --- | --- | --- |
| No change in Fed interest rates after July 2025 meeting? | 0.97 | 0.50 | Yes |
| ... | |||
| 트럼프의 취임(inauguration)에 대한 Jev 점수 0.70은 그가 이 모든 항목 중 부여한 가장 높은 수치이며, 리콜 같은 사안에서 무언가가 드러나는 유일한 부분입니다. 다른 모든 것은 그가 한 번도 들어본 적 없는 시장에 주는 0.3~0.5의 안개와 같습니다. 그는 2025년 1월 연준(Fed)이 25bp 금리 인상을 할 경우에 0.30을, 동결할 경우 0.54를 부여했는데, 전자는 그 달 신문을 읽은 사람이라면 불가능했고 후자는 확실했던 사안입니다. |
기억이 드러나는 유일한 곳: 스포츠
Jev의 자체 카테고리 레이블로 각 월을 분할하면 결과에서 유일하게 눈에 띄는 점(wrinkle)이 나타납니다:
스포츠 시장에서 Jev는 2025년 두 달 모두 0.79를, 그리고 배포된 이후의 달을 포함하여 모든 2026년 월에는 0.60–0.69를 기록합니다. 다른 모든 항목에서는 전혀 추세가 없는 0.52–0.65입니다. 두 가지 해석이 가능합니다. 첫째는 Jev가 유명한 2025년 결과(챔피언, 플레이오프 우승자) 중 일부만 흡수하고 정치적 또는 경제적인 사안은 전혀 흡수하지 않았다는 것입니다. 둘째는 2025년의 스포츠 시장 자체가 단순히 다른 조합이었고, 강력한 우세팀을 추측하기가 더 쉬운 시즌 전체
제가 추측할 수밖에 없지만, 이것이 바로 그 내용입니다. Jev는 "시스템 1(System One)" 모델로 판매됩니다. 즉, 입력된 상태에 대해 빠르고 보정된 판단을 내리도록 훈련되었으며, 텍스트가 아닌 결정을 반환하는 데 중점을 둡니다. 모델 카드에 따르면 이 모델은 간접적인 내용이나 수치적 정밀도에 어려움을 겪고 문자 그대로 해석합니다. 이렇게 최적화된 모델은 에피소드별 세계 지식(episodic world knowledge)을 많이 가지고 있지 않거나, 채팅 모델처럼 "2025년 1월 회의"를 저장된 사실과 연결하지 못할 수 있습니다. 이 모델이 "이것이 일어날까요?"라는 질문에 답하는 방식은 무슨 일이 일어났는지 찾아보는 것이 아니라, 그 종류의 질문(연준의 금리 인상은 드물고, 현직 의원들은 보통 임기를 마친다)에 대한 사전 확률(prior)처럼 보입니다.
이는 제가 이전에 진행했던 Jev 테스트 결과와 일치합니다. Bitcoin test에서 Jev는 비트코인 지표를 교과서가 읽는 방식대로 해석했습니다. 여기에서도 시장 질문을 교과서처럼 읽습니다. 이 모델은 세상이 어떻게 흘러가는지에 대한 일반적인 지식은 가지고 있지만, 실제로 어떻게 흘러갔는지에 대한 기억은 거의 없습니다.
이것이 바꾸는 것
오래된 예측 마켓에서 Jev를 백테스팅(Backtesting)하는 것은 새지 않습니다. 적어도 jev-1.13.0 버전에서는 그렇습니다. 만약 역사적인 Polymarket 시장에 대해 Jev를 호출하는 필터를 구축하고, 이 모델이 유지한 것들이 더 잘 해결되는지 측정한다면, 얻게 되는 수치는 실시간으로 얻을 수 있는 수치와 거의 비슷할 것입니다. 저는 사람들에게 정반대의 이야기를 해야 할 것이라고 예상했습니다.
또한 이는 하나의 가능성을 닫습니다. 트레이딩 봇에 사용되는 텍스트 모델에게 흔히 기대하는 것은 "무언가를 알고 있다"는 점입니다. 예를 들어, 베이스 레이트(base rates), 어떤 사람이 우세한지 여부, 연준이 금리를 동결했을 때 보통 무슨 일이 일어나는지 같은 것입니다. 이러한 시장에서 Jev의 답변은 이 모델이 무엇을 알든 간에, 전 세계가 지켜본 사건들에 대해 그 확률을 0.3에서 벗어나게 할 만큼 충분하지 않다는 것을 보여줍니다. 이를 지식 출처로 사용하지 마십시오. 상태(state) 안에 지식을 넣어주고 읽도록 하세요.
그리고 이것은 파트 1의 주요 결과를 정직하게 유지합니다. 만약 Jev가 2025년에는 0.9를, 2026년에는 0.6을 기록했다면, 0.6이 여전히 실제 숫자가 되겠지만, 이전 모든 주장들에 대해 긴 주의사항이 필요했을 것입니다. 대신 이 숫자는 어디서나 0.6으로 일정하여 지루하고 깔끔합니다.
제가 검증할 수 없었던 것들
- 하나의 표현, 하나의 모델. "Did the Fed raise rates in January 2025?"와 같이 질문이 (과거 시제로 사실처럼) 구성된 경우, 시장에서 사용하는 문구와는 다르게 점수가 나올 수 있습니다. 저는 봇(bot)이 보낼 내용인 시장의 문구를 유지했습니다.
- 스포츠 관련 단서. 몇백 개의 시장에서 0.79 대 0.66이라는 수치는 시사적일 뿐 증거는 아닙니다.
- 학습 차단 시점 (Training cutoff). TypeSafe는 이를 공개하지 않습니다. 만약 실제 차단 시점이 제가 가정하는 것보다 빠르다면, 2026년의 창은 암기 테스트가 전혀 아니게 되지만, 2025년 1월과 7월은 여전히 그렇고, 이들이 가장 평평한(flattest) 부분입니다.
- Polymarket 질문만 사용. 모델이 시장의 문구를 그 사건에 매핑할 수 없더라도 이벤트를 기억할 수는 있습니다. 이는 어쨌든 Jev가 봇 구성 요소로서 가진 한계입니다.
코드 및 데이터 파이프라인: github.com/truongxxxx/jev-polymarket-test. 전체 암기 테스트를 다시 실행하는 데는 Jev 호출로 약 1달러와 API 다운로드 시간 1시간이 소요되며, 스크립트는 중단된 지점부터 재개됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
