SciCodePile: 도전적인 과학 코드 생성(Scientific Code Generation)을 위한 128GB 코퍼스 및 실행 가능한
요약
과학 코드 생성 능력을 평가하기 위해 구축된 128GB 규모의 대규모 코퍼스인 SciCodePile을 소개합니다. 실행 가능한 벤치마크를 통해 기존 LLM들의 과학 코드 생성 한계를 입증하고, 지속적 사전 학습 및 지시어 튜닝을 통한 성능 향상 효과를 보여줍니다.
핵심 포인트
- 128GB 규모의 대규모 과학 코드 코퍼스 SciCodePile 구축
- 실행 가능한 200개 태스크와 자동 테스트 하네스를 포함한 벤치마크 제공
- 기존 LLM들의 과학 코드 생성 성능이 매우 낮음을 확인
- 지속적 사전 학습 및 지시어 튜닝을 통한 성능의 비약적 향상 입증
대규모 언어 모델(LLMs)은 범용 코드 생성(general-purpose code generation)에는 뛰어나지만, 과학 코드를 얼마나 잘 다루는지는 여전히 미해결 과제로 남아 있습니다. 기존의 데이터셋과 벤치마크는 규모, 도메인 범위 또는 실행 가능한 검증(executable verification) 측면에서 제한적이어서, 현재의 LLMs와 신뢰할 수 있는 과학 코드 생성기 사이의 진정한 격차를 충분히 평가하지 못하고 있습니다. 이러한 한계를 해결하기 위해, 우리는 37,737개의 공개 저장소(repositories)로부터 구축되어 여러 계산 과학 분야를 아우르는 총 128GB의 코드로 구성된, 현재까지 가장 큰 규모의 과학 코드 코퍼스(corpus)인 SciCodePile을 선보입니다. 이 코퍼스로부터 우리는 더 나아가 200개의 태스크로 구성된 실행 가능한 벤치마크를 큐레이션하였으며, 각 태스크에는 샌드박스 실행 환경(sandboxed execution environment)과 기능 검증을 위한 자동 테스트 하네스(automated test harness)가 갖춰져 있습니다. 우리는 오픈 소스 및 폐쇄형(closed-source) 계열의 15개 LLMs를 세 가지 태스크, 즉 접두사-접미사 완성(prefix-to-suffix completion), 중간 채우기(fill-in-the-middle infilling), 그리고 실행 가능한 코드 생성(executable code generation)에 대해 평가했습니다. 결과에 따르면 과학 코드 생성은 여전히 매우 도전적인 과제임을 보여줍니다. 두 가지 완성 태스크에서 가장 높은 CodeBLEU는 38.13 및 38.37에 그쳤으며, 가장 강력한 모델조차 실행 가능한 벤치마크에서 단 12.30%의 Pass@1을 달성하여, 현재 모델들이 신뢰할 수 있는 과학 코드 생성으로부터 얼마나 멀리 떨어져 있는지를 강조합니다. SciCodePile의 학습 유용성을 입증하기 위해, 우리는 우리의 코퍼스로 지속적 사전 학습(continued pretraining)을 수행했을 때 과학 코드 완성 작업의 CodeBLEU가 $ imes$2.84 향상되었으며, 우리 데이터를 통한 지시어 튜닝(instruction tuning)이 실행 가능한 벤치마크의 Pass@1을 $ imes$4.79 향상시킨다는 것을 추가로 보여줍니다. 모든 코드와 데이터는 https://huggingface.co/SciCodePile 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기