MintEval: LLM은 요청된 트레이딩 전략을 구현하는가? 자연어-전략 코드를 위한 행동적 동등성 벤치마크
요약
본 기사는 LLM이 트레이딩 전략을 코드로 구현하는 과정에서 발생하는 '조용한 실패' 문제를 다룹니다. 기존 벤치마크는 기능적 정확성만 측정할 뿐, 실제 행동 일치 여부를 검증하지 못했습니다. 연구진은 생성된 코드와 참조 전략의 행동(actions)을 비교하는 새로운 벤치마크인 MintEval을 제안합니다.
핵심 포인트
- MintEval은 LLM이 트레이딩 로직을 코드로 구현할 때의 '행동적 동등성'을 측정한다.
- 기존 벤치마크는 기능적 정확성에만 초점을 맞춰 실제 전략 실행 오류를 놓친다.
- 프런티어 모델(Claude Opus 5.5)도 복잡한 트레이딩 로직 구현에서 여전히 상당한 실패율을 보인다.
거대 언어 모델(LLMs)은 트레이딩 신호를 생성하는 단계에서 이를 실행하는 코드를 작성하는 단계로 이동하고 있습니다. 두 번째 역할의 실패 모드는 조용합니다. 즉, 생성된 코드가 실행되고 백테스트가 플롯되지만, 트레이더가 설명한 위험 로직이 실제로 실행되는 로직과 다를 수 있다는 것입니다. 기존 코드 벤치마크는 단위 테스트(unit tests)에서 기능적 정확성을 테스트하고 금융 벤치마크는 예측을 테스트할 뿐입니다. 이들 중 어느 것도 구현체가 요청된 전략처럼 행동하는지 측정하지 못합니다. 우리는 MintEval이라는 벤치마크를 소개합니다. 여기서는 참조 전략들이 조합 가능한 빌딩 블록(composable building blocks) 라이브러리에서 프로그램적으로 생성되고, 구어체 트레이더 지침으로 역번역된 다음, 테스트 대상 모델에 의해 재구현됩니다. 생성된 프로그램과 참조 프로그램은 동일한 시장 데이터와 마찰을 기반으로 바(bar) 단위로 실행되며, 코드 유사성이나 수익률이 아닌 그 행동(actions)을 기준으로 비교됩니다. 알파는 차분 처리되어 제거됩니다. MintEval v0은 BTCUSDT 15분 데이터에 대한 800개의 태스크를 포함하며, 이는 설명 길이와 분리된 실행 측정 상태-범위 복잡도 $ au$로 계층화되었습니다. 저비용 모델들은 평균 ActionMatch가 최대 0.544에 도달하고 정확하게 재현하는 태스크는 최대 0.087개입니다. 그러나 계층화된 200개 태스크의 하위 집합에서 프런티어 모델(Claude Opus 5.5)은 0.889에 도달하고 0.575개를 정확하게 재현하지만, 여전히 0.275개의 태스크에서는 조용히 실패합니다. 빌딩 블록 메뉴가 주어졌을 때, 모델들은 전략을 거의 완벽하게 식별하지만, 사양이 올바르게 읽힌 구현 중 79.2%는 활성 바의 10% 이상에서 벗어납니다. 최근 전략 생성 벤치마크의 LLM 심사관은 이 모든 조용한 실패를 수용합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기