
ASCIITermDraw-Bench | 비전, 문제 정의 및 워크플로우 설명
요약
ASCIITermDraw-Bench는 LLM과 VLM의 ASCII 다이어그램 생성 및 편집 능력을 평가하는 새로운 벤치마크입니다. 아키텍처, 네트워크 토폴로지 등 4개 영역 80개 태스크를 통해 인간과 AI 간의 시각적 소통 능력을 구조적·의미적 점수로 정밀하게 측정합니다.
핵심 포인트
- ASCII 및 Mermaid를 활용한 AI-인간 간 표준 통신 채널 평가
- 기본 레이아웃부터 소프트웨어 아키텍처까지 4개 영역 포함
- 구조적 점수와 LLM 판사의 의미적 점수를 결합한 엄격한 평가 방식
- Gemma-4-31B-IT가 현재 리더보드 1위 기록
나의 비전, 문제 정의, 그리고 AI 어시스턴트와 인간 사이에서 초기 아키텍처에 대한 생각을 신뢰성 있게 전달하기 위한 표준 통신 채널의 평가 필요성을 설명하는 영상입니다! 현재 이를 수행할 수 있는 두 가지 신뢰할 수 있는 방법은 ASCII와 Mermaid입니다. 이 벤치마크는 SOTA LLM(대규모 언어 모델) 및 VLM(시각 언어 모델)의 ASCII 생성 및 편집 능력에 초점을 맞추며, 이를 통해 인간과 AI가 다양한 아키텍처, 클러스터, 토폴로지에 대한 각자의 초기 아이디어를 서로 쉽게 소통할 수 있습니다. 이 벤치마크는 다음 네 가지 영역에 걸친 80개의 태스크를 포함합니다: 기본 박스 및 레이아웃 (Basic Box and layouts), 네트워크 토폴로지 (Network topologies), 소프트웨어 아키텍처 다이어그램 (Software architecture diagrams), 이미지 조건부 다이어그램 편집 (Image-conditioned diagram editing) - 모델이 변경을 요청받지 않은 모든 것을 유지하면서 제공된 다이어그램을 수정해야 하는 작업. 태스크는 여러 난이도 수준에 걸쳐 있으며 일관된 형식을 따르므로, 카테고리와 모델 간의 결과 비교가 가능합니다. 평가(Evaluation): 각 응답은 두 가지 점수를 받습니다: 필수 레이블, 엣지(edges), 엔티티(entities) 및 관계를 검증하는 구조적 점수(structural score), 그리고 판사(judge)의 변동성을 줄이기 위해 태스크당 5회씩 평가되는 LLM 판사가 생성하는 의미적 점수(semantic score). 결과는 80개 전체 태스크에 대해 집계되며, 최종 점수에 대해 95% 신뢰 구간(confidence interval)이 계산됩니다. 이는 다이어그램이 단순히 올바르게 보이는지에 의존하는 것보다 더 엄격한 측정 방식을 제공합니다. 현재 리더보드는 다음과 같습니다: - Gemma-4-31B-IT — 73.8% (±4.1) - Qwen3.7-Plus — 70.2% (±4.6) - Kimi-K2.6 — 61.8% (±6.0) - MiniMax-M3 — 59.5% (±6.3) - Qwen3.5-9B — 47.0% (±6.4) - Ternary-Bonsai-27B — 45.9% (±7.1) 피드백이나 의견이 있다면 알려주세요!
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기