OOM-RL II: 현실은 디버거가 아닌 오라클이다 - 지속적으로 진화하는 에이전트 기반 시스템에서의 출처 제약 진단
요약
본 논문은 프로덕션 ML 시스템에서 발생하는 '결과--진단 격차' 문제를 다룹니다. 외부 피드백(오라클)만으로는 결과가 발생했음을 알 수 있지만, 그 결과를 만들어낸 정확한 진화 과정이나 원인을 식별하기 어렵다는 점을 지적합니다. 이를 해결하기 위해 아카이브 상대 주장 식별 가능성과 증거 계층 구조를 정리하는 새로운 프로토콜을 제안합니다.
핵심 포인트
- 결과(Outcome)와 그 원인(Diagnosis) 사이의 격차 문제를 정의함.
- 외부 피드백은 결과에 대한 주장을 제약할 뿐, 출처(Provenance)가 진단을 결정함.
- 아카이브 상대 주장 식별 가능성 및 증거 계층 구조를 정리하는 프로토콜을 제시함.
현실은 어떤 결과가 발생했음을 확립할 수는 있지만, 어떤 진화 과정이 그것을 만들어냈는지 또는 그 이유를 식별하지 못할 수 있습니다. 이러한 구분은 코드, 설정 및 아티팩트가 변경되고 외부 피드백이 축적되는 프로덕션 ML 시스템에서 중요합니다. 우리는 오라클(oracle)을 완전한 정확성 명세가 아닌 실현된 결과의 외부 출처로 의미하며, 인간 주도형 에이전트 기반 정량 트레이딩 시스템을 사용하여 이를 검토합니다. 1년 동안 계좌는 수익을 얻고 광범위 시장 지수를 능가했지만, 주요 회고적 명세 하에서 연간 알파는 통계적으로 0과 구별되지 않았습니다. 회고적으로 선택된 하위 기간에는 불리한 상대 성과와 선언된 근사 참조 하에서의 조건부 후보 레벨 약점이 포함됩니다. 엔지니어링 기록은 에피소드 동안의 변경 사항을 문서화하며, 완전한 추천-런타임 바인딩은 사용할 수 없습니다. 아카이브는 공통의 고정 인스턴스나 고유한 원인을 확립하지 못합니다. 이 사례는 결과--진단 격차(outcome--diagnosis gap)를 동기 부여합니다: 결과 증거, 평가된 객체 식별자, 그리고 인과적 설명은 서로 다른 주장을 뒷받침합니다. 우리는 고정 인스턴스, 사전 지정된 적응 절차, 그리고 임시 개발을 구별하고; 아카이브 상대 주장 식별 가능성과 증거 계층 구조를 정리하며; 전향적인 프로덕션 바인딩 프로토콜을 제안합니다. 설명적인 호환 기록 예시는 사실적 바인딩이 반사실적 효과를 제공하지 않으면서 추천의 참조 대상을 어떻게 해결할 수 있는지 보여줍니다. 이 프로토콜은 사전에 검증된 것이 아니라 제안되었습니다. 외부 피드백은 결과 주장을 제약하는 반면, 출처(provenance)와 추가 식별 구조가 진단의 해결을 결정합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기