da-code 사용 가이드
요약
본 가이드는 da-code라는 에이전트 기반 코드 생성 벤치마크 사용법을 안내합니다. Docker 환경 설정부터 필요한 라이브러리 설치, 그리고 `run.py`와 `evaluate.py` 스크립트를 이용한 실행 및 평가 과정까지 상세히 설명하고 있습니다.
핵심 포인트
- Docker를 사용하여 에이전트 실험의 샌드박스 환경을 구축해야 합니다.
- 필요한 API 키(Azure, OpenAI) 설정과 라이브러리 설치가 선행되어야 합니다.
- `run.py`는 모델 및 다양한 파라미터를 조정하며 코드 생성 실험을 수행합니다.
- `evaluate.py`를 통해 생성된 코드를 평가하고 결과를 분석할 수 있습니다.
당신의 에이전트와 실험은 Docker를 사용하여 샌드박스 환경에서 실행되어야 하므로, 먼저 Docker 설치는 Docker setup guide의 지침을 따라 진행해 주세요.
pip install -r requirements.txt
export AZURE_API_KEY=your_azure_api_key
export AZURE_ENDPOINT=your_azure_endpoint
export OPENAI_API_KEY=your_openai_api_key
...
python run.py
인수(Arguments):
--max_steps: 최대 스텝 수 (기본값 20)
--max_memory_length: 유지할 메모리의 최대 길이 (기본값 15)
--suffix: 파일 이름의 접미사 (기본값 빈 문자열)
--model: 벤치마크에 사용할 모델 (기본값 "gpt-4")
--temperature: 샘플링 온도 (기본값 0.0)
--top_p: Top p 샘플링 파라미터 (기본값 0.9)
--max_tokens: 생성당 최대 토큰 수 (기본값 1500)
--stop_token: 생성 중 정지를 유발하는 토큰 (기본값 None)
--task_config: 메타 설정 파일의 경로 (기본값 "da_code/configs/examples.jsonl")
--source_dir: 소스 파일 디렉토리 (기본값 "da_code/source")
--example_index: 실행할 예시의 인덱스 범위 (기본값 "all")
--example_name: 실행할 예시 이름 (기본값 빈 문자열)
--overwriting: 기존 파일 덮어쓰기 활성화 여부 (기본값 False)
--retry_failed: 실패한 평가 재시도 여부 (기본값 False)
--output_dir: 출력 파일 디렉토리 (기본값 "output")
python evaluate.py \
--output_dir output/gpt4turbo \
--gold_dir da_code/gold \
...
인수(Arguments):
--output_dir: 출력 파일 디렉토리
--gold_dir: 골드 파일 디렉토리
--eval_json: 평가 설정 파일의 경로
--result_dir: 평가 결과를 저장할 디렉토리
--timeout_seconds: 각 평가에 대한 타임아웃 시간 (초)
소스 폴더에는 데이터셋 예시 100개가 제공됩니다. 전체 데이터셋을 얻으려면 아래 지침을 따르세요:
여기에서 소스 데이터를 다운로드할 수 있습니다. 또한 gdown을 사용할 수도 있습니다.
라이브러리를 다운로드하여 골드 데이터(gold data)를 얻으려면: 먼저, pip install gdown을 실행하세요.
그런 다음, 명령어를 실행합니다: gdown "https://drive.google.com/uc?id=1ZGi0iNv797OneK_b2l2thJCulP6NUf7v" -O source.zip
데이터셋을 da_code/source에 압축 해제하세요.
unzip source.zip -d da_code/source
여기에서 **골드 데이터(gold data)**를 다운로드하세요. gdown 라이브러리를 사용할 수도 있습니다: 먼저, pip install gdown을 실행하세요.
그런 다음, 명령어를 실행합니다: gdown "https://drive.google.com/uc?"
골드 데이터를 da_code/gold에 압축 해제하세요.
unzip gold.zip -d da_code/gold
@misc{huang2024dacodeagentdatascience,
title={DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models},
author={Yiming Huang and Jianwen Luo and Yan Yu and Yitong Zhang and Fangyu Lei and Yifan Wei and Shizhu He and Lifu Huang and Xiao Liu and Jun Zhao and Kang Liu},
...}
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Coding Assistants의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기