Launch HN: EdotEnv (YC S26) – LLM에게 연구를 가르치는 양자 트레이딩 RL 환경
요약
EdotEnv는 모델에 '재귀적 자기 개선(recursive self-improvement)' 능력을 가르치기 위해 설계된 대규모 RL 환경입니다. 이 환경은 난이도가 높아지는 금융 시장 데이터를 활용하여 에이전트가 지속적으로 학습하고 발전할 수 있도록 합니다. 이는 에이전트가 가설 설정, 실험 설계, 결과 검증을 반복하는 다단계 과정을 거치게 합니다.
핵심 포인트
- EdotEnv는 재귀적 자기 개선 능력을 목표로 하는 RL 환경입니다.
- 난이도가 높아지는 금융 시장 데이터를 활용하여 학습합니다.
- 에이전트가 가설-실험-검증의 다단계 연구 과정을 겪도록 설계되었습니다.
EdotEnv
Quant Neolab이 RSI를 향해 나아가고 있습니다.
EdotEnv의 임무는 모델에 재귀적 자기 개선(recursive self-improvement)을 가르치는 것입니다. 이를 위해, 저희는 난이도가 높아지는 금융 시장 데이터로부터 대규모 RL 환경을 구축하여 에이전트가 지속적으로 언덕 오르기(hillclimb)를 할 수 있도록 합니다.
끊임없이 움직이는 최전선.
재귀적 자기 개선은 다음과 같은 루프입니다: 에이전트가 연구하고, 결과로부터 학습하며, 더 나은 도구와 판단력으로 다음 문제에 돌아가는 것입니다. 이 루프는 매 라운드가 어려워질 때만 지속됩니다.
시장은 이러한 압력을 자연적으로 만듭니다. 모든 유용한 발견은 경쟁을 끌어들이고, 모든 성공적인 전략은 다음 기회를 찾기 더 어렵게 만듭니다. 시장은 계속 개선해야 하는 에이전트들을 위한 자연스러운 시험장입니다.
더 어려운 문제를 위한 RL 환경.
저희는 에이전트가 가설을 세우고, 실험을 설계하며, 결과를 검증하고, 반복하는 다단계(multi-step) RL 환경에서 이러한 역동성을 포착합니다. 저희는 이를 사용하여 점점 어려워지는 연구 과제에 대해 에이전트를 평가하고 사후 훈련(post-train)하는 데 사용합니다.
저희는 연구용 하네스(research harnesses), 평가 벤치마크, 그리고 사후 훈련 환경을 구축하는 최첨단 AI 연구소 및 학술 그룹과 협력하고 있습니다.
진보는 모두의 것이 되어야 합니다.
저희는 재귀적 자기 개선이 사회가 과학적, 기술적 돌파구를 더 빠르게 달성하도록 도울 수 있으며—그 발전의 혜택을 사회경제적 지위에 관계없이 이용 가능하게 만들 수 있다고 믿습니다.
저희의 장기적인 목표는 더 빠른 진보에서 얻은 이익을 모두에게 공평하게 재분배하는 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN Show HN (AI)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기