VHDL-REPOBENCH: VHDL 설계 생성을 위한 리포지토리 수준 평가 벤치마크
요약
본 기사는 FPGA 및 안전 필수 시스템에서 사용되는 VHDL 설계를 위한 대규모 벤치마크인 VHDL-REPOBENCH를 소개합니다. 이 벤치마크는 약 100개의 오픈 소스 리포지토리를 포함하며, LLM의 구문적 정확성부터 다중 파일 추론 능력까지 포괄적으로 평가할 수 있습니다. 테스트 결과, 현재 LLMs는 라인 수준은 가능하나, 복잡한 계층적 설계 이해와 크로스 파일 종속성 해결에는 어려움이 있음을 보여주었습니다.
핵심 포인트
- VHDL-REPOBENCH: VHDL 설계를 위한 최초의 대규모 리포지토리 벤치마크입니다.
- LLM 평가 항목: 구문, 의미적 정확성, 계층적 추론 등 포괄적인 검증이 가능합니다.
- 현재 LLMs의 한계: 다중 파일 추론 및 복잡한 설계 명세 이해에 어려움이 있습니다.
대규모 언어 모델(LLMs)은 하드웨어 설계 자동화에 점점 더 많이 적용되고 있으며, 하드웨어 기술 언어를 생성하고 이해하는 데 강력한 잠재력을 보여주고 있습니다. 하지만 기존의 대부분의 벤치마크는 Verilog에 초점을 맞추고 있어, FPGA 및 안전 필수 시스템에서 광범위하게 사용되는 VHDL에 대한 평가는 제한적입니다. 이러한 격차를 해소하기 위해, 우리는 현실적인 VHDL 설계 생성 및 분석 작업을 위한 대규모 크로스 파일, 리포지토리 수준 벤치마크인 VHDL-REPOBENCH를 소개합니다. VHDL-REPOBENCH는 약 100개의 오픈 소스 VHDL 리포지토리를 큐레이션하여 약 2.5k 개의 VHDL 파일과 약 500개의 테스트벤치를 포함하며, 구조화된 문제 진술(problem statements), 모듈 스텁(module stubs), 그리고 자체 검증 테스트벤치(self-verifying testbenches)를 제공합니다. 이 벤치마크는 구문(syntax), 의미적 정확성(semantic correctness), 계층적 추론(hierarchical reasoning), 크로스 파일 종속성 해결(cross-file dependency resolution), 그리고 기능적 검증(functional verification)에 걸쳐 포괄적인 평가를 가능하게 합니다. 우리는 GPT-4o, Llama-3-70B, Qwen2.5-72B, CodeLlama-70B를 포함한 여러 최신 모델과 Reflexion 및 CoDes와 같은 다단계 추론 접근 방식을 평가했습니다. 그 결과, 현재 LLMs가 중간 수준의 라인 및 블록 수준 정확도를 달성하는 반면, 다중 파일 추론, 계층적 설계 이해, 그리고 명세(specification)에서 모듈 생성에 있어 상당한 어려움이 남아있음을 보여주었습니다. VHDL-REPOBENCH는 최초의 대규모 VHDL 중심 벤치마크이며, 실질적인 VHDL 개발을 위한 LLM 역량을 평가하고 비교하며 발전시키는 하드웨어 설계 커뮤니티에 귀중한 자원을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기