Qwen 3.8 Max를 세 개의 온체인 트레이딩 에이전트의 지휘자로 사용해 본 결과
요약
본 기사는 Alibaba의 Qwen 3.8 Max 모델을 활용하여 Monad 테스트넷 기반의 온체인 트레이딩 에이전트 시스템을 구축하는 과정을 다룹니다. 세 개의 자율적인 AI 에이전트가 실시간으로 거래하며, 이 과정에서 추론 모델 사용 시 토큰 소모 문제와 이를 해결하기 위한 파라미터 조정 방법을 제시합니다.
핵심 포인트
- Qwen 3.8 Max는 OpenAI 호환 API를 사용하여 통합이 용이함.
- 온체인 트레이딩 에이전트는 자율적으로 시장 상태를 읽고 기계가 해석 가능한 JSON 결정을 출력해야 함.
- 추론 모델의 'thinking trace'가 토큰 예산을 소모하여, 충분한 `max_tokens` 할당이 필수적임.
알리바바의 플래그십 추론 모델이 Monad 테스트넷에서 실시간으로 진행되는 AI 거래 아레나, Contex Arena의 두뇌가 되었습니다.
아레나
Contex Arena는 설명하기는 간단하지만 실행하기는 어려운 시스템입니다. 세 개의 AI 트레이딩 에이전트 — Degen Dan (공격적인 모멘텀), The Professor (규율 있는 평균 회귀), Whale (인내심 강한 거물) —가 Monad 테스트넷에서 합성 자산을 대상으로 실시간으로 온체인 거래를 합니다. 모든 거래는 실제 트랜잭션입니다. 관람객들은 어떤 에이전트가 라운드를 가장 높은 포트폴리오 가치로 마칠지 예측하여 MON을 베팅합니다. 승자들은 파리뮤튜엘(parimutuel) 방식으로 풀을 분배받습니다.
에이전트들은 완전히 자율적입니다. 매 틱마다 에이전트는 온체인 시장 상태(가격, 자체 포지션, 경쟁자의 포트폴리오, 남은 시간)를 읽고, 생각하고, 단일한 기계 파싱 가능한 결정(machine-parseable decision)을 출력합니다:
{"action": "BUY", "amount": 12.5, "reason": "Price 4% below average, momentum turning up."}
이 결정은 몇 초 후 agentBuy / agentSell 트랜잭션으로 변환됩니다.
게임 전체가 두뇌 역할을 합니다. 지능이 낮은 두뇌는 무작위 거래를 하고; 불안정한 두뇌는 JSON 계약을 깨뜨려 라운드가 멈추게 하며; 느린 두뇌는 라운드의 리듬을 놓칩니다. 저희는 Nebius의 Nemotron Lightning, 그다음 Atria, 그리고 NVIDIA NIM 순으로 빠른 모델들의 페일오버 체인(failover chain) 위에서 운영해 왔습니다. 그것은 작동했습니다. 하지만 우리는 실제 추론 모델이 같은 임무를 수행할 때 어떤 결과를 낼지 보고 싶었습니다.
Qwen 3.8 Max를 선택한 이유
Metropolis 해커톤의 Alibaba Cloud 바운티는 빌더들에게 Qwen 3.8 Max를
Qwen 3.8 Max는 Alibaba의 플래그십 추론 모델이며, OpenAI와 호환되는 채팅 완료(chat completions) 방언을 사용합니다. 덕분에 통합 과정이 거의 지루할 정도였습니다—가장 좋은 의미로 말이죠. 저희 에이전트 러너는 이미 제공업체 장애 조치 체인(provider failover chain) 뒤에서 모든 제공업체와 원시 POST /chat/completions을 통해 통신하고 있었기 때문에, Qwen을 추가하는 데 걸린 코드는 약 15줄에 불과했습니다. 즉, 체인의 맨 앞에 새로운 항목을 추가하여 모델로 qwen3.8-max를 지정하고 QwenCloud 국제 엔드포인트(maas.qwencloudapi.com)를 가리키는 식입니다.
단 하나의 걸림돌: 추론이 토큰을 소모한다
딱 한 가지의 놀라운 점이 있었는데, 이는 프로덕션 환경에서 추론 모델을 사용해야만 알 수 있는 종류였습니다. Qwen 3.8 Max는 'thinking trace'를 통해 추론을 수행하며, 일부 엔드포인트에서는 이 thinking 과정을 비활성화할 수 없습니다—이 트레이스가 max_tokens 예산 내의 출력 토큰을 소모하기 때문입니다. 저희의 기존 예산은 300 토큰이었는데, 이는 순수한 JSON을 반환하는 빠르고 추론 기능이 없는 모델에 맞춰진 것이었습니다. 이 300 토큰을 추론 모델에게 주면, JSON이 완성되기 전에 thinking trace가 예산을 소모해버립니다. 저희는 Nemotron Lightning으로도 같은 실패 모드를 다루었기 때문에(그리고 수정했기 때문에), 해결책의 형태를 알고 있었습니다.
수정 방법: Qwen에게 4,000 토큰 예산을 주고 파서(parser)가 제 역할을 하도록 내버려 두는 것입니다. 저희 파서는 모델이 깔끔할 것이라고 믿지 않습니다—<think> 트레이스를 제거하고 응답에서 모든 균형 잡힌 {...} 후보를 추출한 다음, 구문 분석 및 검증에 성공하는 첫 번째 것을 사용합니다. 만약 모델이 JSON 대신 산문(prose)으로 답변하면, 저희는 이를 자신의 잘못된 답변을 컨텍스트로 사용하여 한 번 유도한 후 다음 제공업체로 장애 조치합니다. 온체인 에이전트에게 인간의 개입 과정(human in the loop)이 없기 때문에 깊은 방어(Defense in depth)가 필요했던 것입니다.
실시간 결과
저희는 첫 번째 에이전트를 Qwen에 연결하고 로그를 관찰한 다음, 세 명의 전사 모두에게 주력으로 승격시켰습니다. 모든 세 에이전트가 Qwen 위에서 30분 동안 라이브 세션을 진행했고—4번의 완전한 라운드가 온체인에서 결정된 후—다음은 QwenCloud 종량제 콘솔에서 가져온 수치들입니다:
- 66 요청, 66 성공 — 100% 성공률, JSON 형식 재시도 없음. 응답 중 하나도 재시도 알림이 필요하지 않았습니다. 모든 결정은 첫 시도에 깨끗하게 파싱되었습니다.
- 66개 결정 중 64개가 Qwen에 의해 직접 답변됨. 두 번의 요청에서 클라이언트 타임아웃(45초)을 초과하여 체인이 Nebius로 자동 장애 조치되었고 — 아레나는 절대 멈추지 않았으며, 어떤 라운드도 놓치지 않았습니다. 이것이 바로 장애 조치가 설계된 대로 작동하는 것입니다.
- 평균 지연 시간 14.3초 — 결정당 45초 타임아웃 및 라운드 간격 내에서 측정되었습니다. (두 번의 타임아웃 요청이 평균을 높입니다. 일반적인 결정은 더 빠릅니다.) 추론 모델은 비추론 모델보다 느리지만, 아키텍처가 이를 흡수합니다.
- 총 55.7K 토큰 — 전체 결정 사이클당 약 844 토큰. 추론이 반드시 비용이 많이 들 필요는 없습니다.
- 측정 가능한 캐릭터 충실도 기반의 결정. 동일한 프롬프트, 세 개의 두뇌, 세 가지 행동을 세션 동안 보였습니다: Degen Dan은 13번 매수 / 5번 매도 / 3번 보유(
3. 실제 에이전트의 이야기. 이 바운티는 Qwen이 단순히 프롬프트에 답하는 것이 아니라 실제로 작업을 수행하기를 요청했습니다. 저희 에이전트들은 계획을 세우고 (페르소나 + 시장 분석), 도구를 사용하며 (RPC를 통한 온체인 읽기, 트랜잭션 제출), 다단계 루프를 실행합니다 (결정 → 라운드가 여전히 활성화되었는지 재검증 → 거래 전송 → 반복). Qwen 3.8 Max는 이 루프의 중심에 위치하여 인간의 개입 없이 결정을 내립니다.
직접 확인해 보세요
Contex Arena가 Monad 테스트넷에서 contexarena.xyz로 공개되었습니다. 지갑을 연결하고, 수도꼭지(faucet)에서 테스트넷 MON을 받아 파이터에게 베팅한 다음, 세 개의 Qwen 기반 두뇌가 서로를 능가하는 거래를 시도하는 것을 지켜보세요. 모든 거래, 베팅, 지급액은 온체인이며 검증 가능합니다.
YouTube에서 85초짜리 데모 영상을 확인하세요.
Monad Metropolis 해커톤을 위해 제작되었습니다 — 신뢰(Trust), 아이덴티티 및 AI 인프라 트랙.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기