VEHBench: LLM 지원 진동 에너지 수확기 설계를 위한 단계별 진단 벤치마크
요약
LLM을 활용한 진동 에너지 수확기(VEH) 설계 과정을 평가하기 위한 새로운 벤치마크인 VEHBench를 소개합니다. 이 벤치마크는 설계 단계별 LLM의 성능을 분석하여 엔지니어링 워크플로우에 최적화된 모델 평가 및 라우팅의 기반을 제공합니다.
핵심 포인트
- LLM 지원 VEH 설계를 위한 763개의 문헌 기반 태스크 포함
- 사양 분류, 검증자 가이드 검색 등 4가지 설계 역할 평가
- LLM의 능력이 설계 단계에 따라 다르게 나타남을 입증
- 검증기 기반 엔지니어링 LLM의 개선 및 라우팅을 위한 기반 마련
배터리 없는 사물인터넷 (IoT)은 결합된 물리적 제약 조건 하에서 진동 에너지 수확기 (VEH)의 반복적인 설계를 요구하며, 이 과정에서 LLM은 엔지니어링 워크플로우를 위한 인터페이스 계층으로 부상하고 있습니다. 그러나 기존의 엔지니어링 벤치마크는 주로 최종 결과물의 유효성을 평가하며, 결합된 물리적 설계의 서로 다른 단계에서 LLM이 어떻게 행동하는지에 대한 통찰은 제한적입니다. 우리는 분석적인 물리적 오라클 (physical oracle)에 의해 점수가 매겨지는 763개의 문헌 기반 태스크를 특징으로 하는, LLM 지원 VEH 설계를 위한 엔지니어링 네이티브 진단 벤치마크인 VEHBench를 소개합니다. VEHBench는 사양 분류 (specification triage), 검증자 가이드 검색 (verifier-guided search), 손상된 상태 복구 (corrupted-state recovery), 정책 조건부 선택 (policy-conditioned selection)의 네 가지 설계 역할을 평가합니다. 실험 결과, LLM의 능력은 단계 의존적 (stage-dependent)임을 보여줍니다. 즉, 단일 모델이 전체 워크플로우를 일관되게 지배하지 못하며, 응답 제어 프로필 (response-control profiles)은 설계 역할에 따라 뚜렷한 행동 패턴을 드러냅니다. 따라서 VEHBench는 검증기 기반 (verifier-grounded) 엔지니어링 LLM을 평가, 선택, 라우팅 및 개선하기 위한 단계 인식 (stage-aware) 기반을 제공합니다. 벤치마크 아티팩트는 https://huggingface.co/datasets/AnonymousVehbench/vehbench 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기