로컬 코딩 모델이 이러한 경계 사례 버그를 수정할 수 있나요? 실패 맵: 20,168개의 오픈 Python 작업
요약
본 글은 20,168개의 오픈 Python 디버깅 작업을 모아 놓은 아카이브 'Failure Map'을 소개합니다. 이 데이터셋은 표준 라이브러리 구현 및 경계 검사 등 복잡한 버그 사례를 포함하고 있습니다. 작성자는 로컬 코딩 모델의 성능 측정에 대한 방법론적 주의점을 강조하며, 정확한 비교를 위해 상세한 실험 환경 보고가 필수적임을 주장합니다.
핵심 포인트
- Failure Map은 20,168개의 오픈 Python 디버깅 작업을 제공하는 아카이브입니다.
- 데이터셋에는 표준 라이브러리 구현 및 경계 검사 등 복잡한 버그 사례가 포함되어 있습니다.
- 모델 성능 비교 시, 실험 환경(모델 버전, 프롬프트, 설정 등)을 투명하게 공개해야 합니다.
- 단순히 모델 점수만으로는 신뢰할 수 없으며, 격리된 실행 결과와 채점 장치가 중요합니다.
저는 압축된 Python 디버깅 작업을 모아 놓은 아카이브인 Failure Map의 제작자입니다. 공개 버전에는 표준 라이브러리 구현, 명시적 계약(explicit contracts), 실패한 수정 시도, 실행 가능한 경계 검사(boundary checks)를 포함하여 254개 카테고리에 걸쳐 20,168개의 작업이 있습니다.
시험해 볼 세 가지 작은 사례:
- 중복 전송(Duplicate delivery): 동일한 양을 제거하면 합법적인 이벤트가 손실됩니다. https://failuremap.org/cases/FA-001
- 캐시 만료(Cache expiry): 전체 틱(tick)을 빼면 여전히 유효한 항목을 거부합니다. https://failuremap.org/cases/FA-006
- 페이지네이션(Pagination): >를 >=로 변경하면 커서 레코드가 반복됩니다. https://failuremap.org/cases/FA-011
프롬프트 템플릿: “명시된 계약을 만족하도록 solve 함수를 수정하세요. Python 소스만 반환하세요. 시그니처는 유지하세요. 계약(Contract): {prompt}. 깨진 구현(Broken implementation): {broken_source}.”
측정된 프로그램 기준선은 3개 중 2개가 통과했습니다 (깨짐 / 시도된 수정): FA-001 2/3 / 1/3; FA-006 2/3 / 2/3; FA-011 2/3 / 1/3. 이것은 모델 점수가 아니라 포함된 프로그램의 실행 결과입니다. 아직 주장할 만한 측정된 로컬 모델 결과는 없습니다.
실행 결과를 비교하려면 정확한 모델과 리비전, 양자화(quantization), 프롬프트, 샘플링 설정, 시드, 작업당 시도 횟수, 통과 횟수를 보고해야 합니다. 후보 코드는 격리된 환경에서 실행하고 채점 장치(grading fixtures)는 외부의 통제를 받지 않도록 유지하세요. 기록된 검사 성공은 숨겨진 테스트 성능이 아닙니다.
다운로드: https://failuremap.org/api/exports/tasks.jsonl.gz
방법론(Methodology): https://failuremap.org/methodology
제출자 /u/failuremap-f
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기