VeriBugBench: 검증된 Verilog RTL 디버깅 벤치마크 구축 프레임워크
요약
본 논문은 Verilog RTL 디버깅을 위한 벤치마크 구축 프레임워크인 VeriBugBench를 제시합니다. 이 프레임워크는 LLM 기반 테스트벤치 향상과 결함 구축을 통해, 반복적인 복구 패턴을 역 연산자로 매핑하고 설계별 자극 단계를 생성합니다. 이를 통해 RTL 디버깅 방법론의 평가 기준을 높이고 결함 가시성을 개선하는 데 기여합니다.
핵심 포인트
- VeriBugBench는 Verilog RTL 디버깅 벤치마크 프레임워크입니다.
- LLM 기반 테스트벤치를 활용하여 설계별 자극 단계를 생성합니다.
- 45개 프로젝트에 적용되어 결함 가시성을 평균 36%에서 39%로 증가시켰습니다.
RTL 소스 레벨 디버깅 연구는 결함이 포함된 설계와 정확한 변경 위치, 실행 가능한 테스트 자극(test stimuli), 재현 가능한 설정(reproducible configurations)을 제공하는 벤치마크 아티팩트를 필요로 합니다. 현재 사용 가능한 Verilog 리소스들은 보통 이러한 요소들의 일부만을 제공합니다. 본 논문에서는 경험적으로 근거를 둔 결함 구축, LLM 기반 테스트벤치 향상, 실행 기반 보존(execution-based retention)을 통해 Verilog RTL 디버깅 벤치마크를 구축하는 프레임워크인 VeriBugBench를 제시합니다. 이 변이 라이브러리(mutation library)는 RTL 버그 수정 이력에서 관찰된 반복적이고 다중 세분성(multi-granularity)의 복구 패턴을 19개의 실행 가능한 역 연산자(inverse operators)로 매핑합니다. 각 프로젝트에 대해, LLM은 깨끗한 DUT(Design Under Test)와 원래 테스트벤치로부터 설계별 자극 단계(design-specific stimulus phase)를 생성하며, 이 단계는 후보 실행을 위해 원래 테스트벤치와 결합됩니다. 이 프레임워크를 45개 오픈 소스 프로젝트에 적용하여 VeriBugBench-v1.0을 얻었으며, 여기에는 설계 출력에서 효과가 관찰 가능한 2,608개의 실행 가능한 단일 결함 인스턴스가 포함됩니다. 45개 프로젝트 전반에 걸쳐, 조립된 테스트벤치들은 평균 프로젝트 수준의 결함 가시성(fault observability)을 36.01%에서 39.54%로 증가시키고, 라인 커버리지와 실행 추적 다양성을 평균적으로 개선합니다. VeriBugBench는 RTL 디버깅 방법을 평가하기 위한 버전 관리된 RTL 변형, 소스 레벨의 참값(ground truth), 테스트벤치 및 실행 아티팩트를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기