JavaScript 및 TypeScript의 취약점 및 수정된 소스 코드를 위한 함수 레벨 데이터셋
요약
본 논문은 JavaScript 및 TypeScript의 취약점 탐지 모델 학습을 위해 JsVul이라는 고품질 데이터셋을 제시합니다. 이 데이터셋은 7개 출처에서 수집되었으며, 보안 패치 주변의 사전/사후 수정본과 관련 변경 사항만을 분리하여 언어별 전용 파이프라인으로 구축되었습니다.
핵심 포인트
- JsVul은 JS/TS 취약점 탐지를 위한 고품질 데이터셋입니다.
- 보안 패치 주변의 사전(pre-fix) 및 사후(post-fix) 버전을 수집했습니다.
- 언어별 전용 파이프라인을 사용하여 노이즈를 최소화했습니다.
- 시간 순서가 지정된 JSONL 형식으로 제공되어 모델 학습에 용이합니다.
JavaScript와 TypeScript는 현대 웹 개발에서 널리 사용되어 보안이 매우 중요하지만, 자동화된 취약점 탐지는 고품질 학습 데이터의 가용성에 의해 제한되는 경우가 많습니다. 본 논문에서는 7개의 주요 출처에서 큐레이션한 데이터셋인 JsVul을 제시합니다. 노이즈(예: 난독화 코드 및 미적인 수정)를 포함할 수 있는 일반적인 다국어 데이터셋과 달리, JsVul은 언어별 전용 파이프라인을 활용합니다. 저희는 보안 패치 주변의 파일에 대해 사전 수정본(pre-fix)과 사후 수정본(post-fix) 버전을 수집하고, 관련 없는 아티팩트를 필터링하며 자동 구문 정규화를 적용하여 보안 관련 변경 사항만을 분리했습니다. 또한 다단계 중복 제거와 휴리스틱 기반 라벨링을 통해 데이터 무결성을 확보했습니다. 시간 순서가 지정된 JSONL 형식으로 제공되는 JsVul은 JavaScript 및 TypeScript 생태계에서 강력한 모델 학습을 지원하며, 취약점 데이터셋 구축 시 언어 인식 전처리(language-aware preprocessing)의 중요성을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기