27B 모델에게 트레이딩 알파 작성법 가르치기: 101개 공식, 12가지 보상 및 미지의 한 해
요약
Qwen3.8-27B 모델을 WorldQuant의 트레이딩 알파 공식 언어로 다중 보상 강화학습(multi-reward RL)으로 훈련시켜, 시장 방향성과 무관한 독립적인 수익 창출 능력을 갖춘 공식을 생성했습니다. 이 모델은 미지의 한 해 시장 데이터에서 높은 평균 점수와 +16.2%의 수익률을 기록하며 금융 분야에서의 잠재력을 입증했습니다.
핵심 포인트
- Qwen3.8-27B를 트레이딩 알파 공식 작성에 활용하여 강화학습으로 훈련함.
- 모델은 시장 베타(market beta)가 낮으면서도 높은 초과 수익률을 달성함.
- 알파와 베타의 개념적 차이점 및 이를 분리하는 방법론을 제시함.
- JEPA 등 고급 모델링 기법을 활용하여 다양한 보상 채널로 공식을 점수화함.
Qwen3.8-27B는 WorldQuant의 101 Formulaic Alphas 언어로 일회성 트레이딩 공식을 작성하도록 다중 보상 강화학습(multi-reward RL)으로 훈련되었습니다. 결정론적 검증기(deterministic verifier)는 각 공식을 46개 미국 주식에 대한 일일 달러 중립적인 롱-숏 북(long-short book)으로 변환하고, 이를 12가지 보상 채널에서 점수화합니다. 50개의 프롬프트와 모델이 학습한 적 없는 한 해의 시장 데이터에 대해, 이 모델 공식들의 평균 점수는 −1.37에서 +1.80으로 상승했으며, 이들 공식의 동일 가중치 북(equal-weight book)은 시장 베타(market beta) 0.09를 기록하며 **+16.2%**를 수익률로 돌려주었습니다.
본 게시물에서는 시스템에 대해 문서화합니다: 즉, 공식 언어, 공식이 포트폴리오가 되는 방법, 알파와 베타의 차이점 및 모델이 시장을 학습하지 않도록 하는 방법, 각 보상 채널과 이를 만든 해킹 기법, 그리고 훈련(train) 및 홀드아웃(holdout) 결과를 다룹니다. 훈련 레시피(GDPO, CISPO, REPO-R)와 실험 사다리(experiment ladder)는 Multi-Reward RL, Part 3에서 설명되어 있으며, 이 글에서는 도메인을 숨긴 채로 이 짐(gym)을 다루었습니다.
50개의 미지 프롬프트와 미지의 한 해에 대한 최고 실행 결과(1790958861): 훈련 전후.
| Metric | Step 0 (untrained) | Step 500 (shipped) |
|---|---|---|
| Mean holdout score per formula | −1.37 | +1.80 |
| ... |
여기서 시작합니다
공식 언어와 그 출처; 공식-포트폴리오 파이프라인; 알파 대 베타, 그리고 모델을 시장 방향으로부터 분리시키는 5가지 계층; 상관관계-기하학적 목표를 가진 JEPA(Joint-Embedding Predictive Architecture) 세계 모델 스트레스 테스트를 포함한 12가지 보상 채널; 그 뒤에 숨겨진 보상 해킹 기법들; 학습 대 홀드아웃 결과; 체크포인트 및 북 선택; 한계점들.
- 알파 (Alpha): 시장이 어느 방향으로 가는지와는 무관하게, 서로 다른 주식들을 조합하여 얻는 수익률.
- 베타 (Beta): 시장의 방향성에 노출됨으로써 발생하는 수익률. β = 1은 시장과 일대일로 움직이며; β = 0은 시장과 함께 움직이지 않습니다.
- 롱-숏 북 (Long-short book): 최고 순위 주식들에 동일한 금액을 투자(long)하고 최저 순위 주식들에는 공매도(short)하는 방식.
- CPCV (Combinatorial purged cross-validation): 조합적 제거 교차 검증: 하나의 공식이 역사상의 15가지 다른 테스트 슬라이스에서 점수화되며; 운에 의한 결과는 페널티를 받습니다.
- 회전율 (Turnover): 일일 거래되는 북의 비중.
- JEPA (Joint-Embedding Predictive Architecture): 과거로부터 미래 시장 상태의 표현(representation)을 예측하는 모델로, 여기서는 스트레스 시나리오를 생성하는 데 사용됩니다.
0. 한눈에 보는 시스템
본 게시물에서 보고된 실행 구성.
| 항목 | 세부 내용 |
|---|---|
| 정책 (Policy) | Qwen3.8-27B, NF4 가중치 + rank-32 LoRA, 명시적 추론 없음 |
| ... |
1. 공식 언어
출처. 2016년 Zura Kakushadze는 WorldQuant의 허가를 받아
만약 주가가 일일 범위 대비 시가보다 훨씬 높게 마감했다면, 다음 날 매수 포지션(go long)을 취하라: 이는 논문에서 'delay-1 모멘텀 알파'라고 부른다. 우리의 DSL도 동일한 어휘를 사용하며, 고정된 계약이 있다:
DSL 계약. 모든 연산자는 오직 과거 시간만을 바라본다.
| 그룹 | 요소 | 의미 |
|---|---|---|
| 필드(Fields) | open high low close volume | 일일 가격 및 주식 거래량 |
| ... |
2. 공식에서 책으로 (From formula to book)
market data up to close(t)
→ evaluate formula one value per stock
→ rank across stocks values in [0, 1]
...

가상의 값을 사용한 6개 주식에 대해 동일한 세 단계만 거친다. 중요한 것은 공식 값의 순서이다.
비용 모델(Cost model). 보유 비용은 학습 비용보다 의도적으로 더 가혹하다.
| 단계 | 비용 |
|---|---|
| 학습(Training) | 거래량 단위당 3.5 bps: 수수료 2 + 슬리피지(slippage) + 반 스프레드(half-spread) 0.5, 그리고 작은 고정 영향력 추가 |
| 보유(Holdout) | $1M 규모의 책에 대한 주식별 제곱근 시장 충격(square-root market impact), 용량 페널티(capacity penalty), 공매도(shorts)를 빌리는 데 연간 50 bps |
3. 알파 vs. 베타: 모델을 시장 방향성에서 분리하기 (Alpha vs. beta: keeping the model off the market’s direction)
모든 일일 수익률 시리즈는 시장을 따르는 부분과 그렇지 않은 부분으로 나눌 수 있다:
r_book(t) = α + β · r_market(t) + ε(t)
**베타(Beta)**는 시장 노출도이다: $eta=1$인 책은 시장이 1% 상승하면 1%를 얻는다. 베타는 저렴하며, 인덱스 펀드가 몇 bps에 판매한다. **알파(Alpha)**는 시장 움직임을 제외하고 남는 부분이다: 주식들을 서로 비교하여 올바르게 순위 매긴 데서 나오는 수익률이다. 시장을 보유함으로써

롱 포지션과 숏 포지션을 동일한 금액으로 설정하면, 시장 전체의 움직임은 상쇄되고 두 방향 사이의 스프레드(spread)만 수익을 얻습니다.
모델과 시장 방향 사이에 존재하는 다섯 가지 계층({layer})입니다.
| 계층 | 메커니즘 | 차단하는 것 |
|---|---|---|
| 1. 구성(Construction) | 순위는 중심화되고 스케일링됩니다: 롱 포지션 금액은 항상 숏 포지션 금액과 같습니다. 홀드아웃에서 측정된 순 노출도: 0.00. | 직접적인 시장 노출도 |
| ... | ||
| 홀드아웃 연도 기준으로 측정했습니다. 동일한 46개 종목으로 구성된 시장은 +27.3% 상승했습니다. 이 책(book)은 β = 0.09, 상관관계 0.19로 +16.2%의 수익을 기록했으며, 따라서 시장이 설명하는 부분은 그 수익의 약 2~3포인트에 불과합니다. 시장이 1.5% 이상 하락한 7일(평균 -1.9%) 동안 이 책은 평균 0.3% 손실을 입었습니다. 강하게 상승하는 해에는 롱 온리 인덱스(long-only index)가 더 많은 돈을 벌었지만, 이 책은 시장과 무관하게 적게 벌었고, 더 높은 샤프 비율(Sharpe ratio) (2.58 대 1.95)과 절반의 최대 낙폭(-4.3% 대 -8.6%)을 기록했습니다. |

왼쪽: 추정되지 않은 연도 동안 이 책과 시장의 $1 성장률. 오른쪽: 각 점은 하루를 나타내며, 시장 대비 이 책의 기울기는 0.09로 거의 평평합니다.
4. 과제(The task)
과제 계약({task contract})。_
| 항목 | 상세 내용 |
|---|---|
| 입력(Input) | 설계 개요: 메커니즘, 기간(horizon), 입력 규칙, 구조적 힌트, 금지 패턴, 위험 선호도 |
| ... | |
| 훈련 세트의 실제 개요: |
시장(Market): 주중 세션에서 거래되는 미국 상장 주식. 주요 메커니즘이 혼합 신호 극단값(mixed-signal extremes, 가격-거래량 복합체의 이동 최대 또는 최소값)인 알파를 설계합니다. 목표 기간(Target horizon): 대략 168일 창(window). 입력(Inputs): 정확히 하나의 ts_corr을 사용해야 합니다. 구조(Structure): 시계열 관계의 부호값을 취합니다. 제약 조건(Constraint): 장기적인 가격 합산에 의존하지 마십시오. 이는 시장 베타(market beta)를 대리하기 때문입니다. 위험 선호도(Risk preference): 변동성 체제 변화에도 강건하도록 만드십시오.
모델이 항상 또는 절대 해결하지 못하는 간략한 정보(Briefs the model always or never solves give no learning signal). 이를 제외한 것이 Part 3의 holdout에서 +0.47만큼 가치가 있었습니다.
5. 열두 개의 보상 채널 (Twelve reward channels)
GDPO는 12개 답변 그룹 내의 각 채널을 표준화하고, 우선순위(priority)를 곱한 후 합산합니다. 따라서 어떤 채널도 수치적 범위로 인해 지배할 수 없습니다. 두 가지 엄격한 규칙이 따릅니다: 유효하지 않은 답변은 절대 양의 이점을 받지 못하며, 각 그룹은 영(zero-sum)을 유지해야 합니다.

채널은 답변하는 질문별로 그룹화되었으며, 최적 실행에서 GDPO 우선순위가 표시됨.
검증기 행렬(The verifier matrix). 공식들은 GDPO 표준화 전의 원시 채널 값입니다.
| ID | Channel | Priority | Computes | Blocks |
|---|---|---|---|---|
| R1 | cpcv | 3.0 | mean − 0.5·std of net Sharpe over 15 CPCV splits | luck; fit to one period |
| ... |
R1 · CPCV 핵심 점수 (CPCV core score)
훈련 창(train window)은 6개의 블록으로 나뉩니다. 모든 블록 쌍이 하나의 테스트 슬라이스(test slice, 15개 슬라이스)를 구성하며, 양 끝에서 10일이 제거되고 5일이 금지됩니다(embargoed). 각 슬라이스에 대해 연율화된 순 샤프 비율(annualised net Sharpe)이 계산됩니다:
CPCV = mean(SR_1 … SR_15) − 0.5 · std(SR_1 … SR_15)
예시: 모든 슬라이스에서 샤프 비율이 0.8이면 점수는 0.8입니다. 세 개의 슬라이스에서 샤프 비율이 3.0이고 나머지 열두 개에서 -0.2인 경우 평균은 0.44이지만, 점수는 -0.20입니다. 누락된 태그(Missing tag): -1.0. 해석 불가능한 공식 또는 252일 초과 조회 기간: -0.8.

6개 블록에서 추출한 15개의 테스트 슬라이스. 공식에 맞출 것이 없으므로 각 슬라이스는 독립적인 시험이며, 회색 블록은 R2가 사용하는 인-샘플(in-sample) 부분입니다.
R5, R6 · 거래량 밴드 (Turnover band)

하루에 책의 6%에서 50% 사이에서 자유롭고, 양쪽 모두에 페널티를 받으며, 2% 미만은 유효하지 않습니다.
예시: 훈련되지 않은 모델의 실제 답변:
scale(ts_rank(ts_delta(volume, 23), 47) - ts_rank(ts_delta(volume, 23), 47))
이 표현식은 값을 자기 자신에서 빼기 때문에 매일 모든 가중치가 0입니다. 즉, 거래가 없고, 비용도 없고, 손실도 없습니다. 높은 비용 하에서는 이 공식보다 더 나은 결과를 가져옵니다. 이 공식의 거래량(turnover)은 0으로, 2% 기준치 미만이므로 유효하지 않습니다.
R3 · JEPA 스트레스 테스트
JEPA 월드 모델은 트레인 기간(2012년 ~ 2025년 8월)의 데이터에 대해서만 훈련된 후 고정됩니다. 이 모델은 46개 종목 패널의 창을 읽어 들일 때, 8일 간격으로 종목-일 셀의 25%를 마스킹하고, 각 종목당 하나의 잠재 변수(latent)를 인코딩한 다음, 다음 창의 잠재 변수를 예측합니다. 목표는 자체 인코더의 지수 이동 평균 복사본이므로, 모델은 원시 가격보다는 시장 상태를 예측하도록 학습합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기