Launch HN: Confident AI (YC W25) – LLM 앱을 위한 오픈 소스 평가 프레임워크
요약
Confident AI는 오픈소스 LLM 테스트 프레임워크인 DeepEval을 클라우드화한 플랫폼입니다. 기존 DeepEval이 단순히 평가만 수행하는 데 그쳤다면, Confident AI는 '데이터셋 편집기', '회귀 감지기(Regression Catcher)', '반복 인사이트' 기능을 추가하여 개발자 경험을 극대화했습니다. 특히 LLM-as-a-judge 방식의 한계를 극복하기 위해 DAG (Directed Acyclic Graph) 메트릭을 도입, 결정론적(deterministic) 평가 결과를 제공하며 RAG 파이프라인 및
핵심 포인트
- DeepEval 기반의 Confident AI는 기업 환경에서 일일 60만 건 이상의 LLM 평가를 처리할 수 있는 클라우드 플랫폼을 제공합니다.
- 플랫폼은 도메인 전문가가 데이터셋을 관리하고 테스트 결과를 분석하는 '데이터셋 편집기'와 '회귀 감지기(Regression Catcher)' 기능을 핵심적으로 지원합니다.
- 평가 신뢰성 향상을 위해 LLM-as-a-judge 방식의 한계를 극복한 DAG (Directed Acyclic Graph) 메트릭을 도입하여 결정론적 벤치마크를 제공합니다.
- 사용자는 이 플랫폼을 통해 다양한 LLM 모델 및 프롬프트 조합을 쉽게 비교하고 최적의 구현체를 선택할 수 있습니다.
안녕하세요 HN입니다. 저희는 Jeffrey와 Kritin이며, Confident AI(https://confident-ai.com)를 개발하고 있습니다. 이는 엔지니어가 LLM 애플리케이션을 평가하고 단위 테스트할 수 있도록 돕는 오픈 소스 패키지인 DeepEval(https://github.com/confident-ai/deepeval)의 클라우드 플랫폼입니다. Pytest를 LLM에 적용한다고 생각하시면 됩니다.
저희는 지난 한 해 동안 최고의 LLM 평가 개발자 경험을 제공하는 것을 목표로 DeepEval을 구축했으며, 이를 BCG, AstraZeneca, AXA, Capgemini와 같은 기업들의 CI/CD 파이프라인에서 매일 60만 건 이상의 평가를 실행할 수 있도록 성장시켰습니다. 하지만 DeepEval은 단순히 평가를 실행하고 그 이후의 데이터를 가지고 아무것도 하지 않는다는 사실 자체가 최고의 경험은 아닙니다. 실패한 테스트 케이스를 검사하거나, 회귀(regressions)를 식별하거나, 심지어 최적의 모델/프롬프트 조합을 선택하려면 DeepEval만으로는 부족합니다. 그래서 저희는 이를 중심으로 플랫폼을 구축했습니다.
작동 방식에 대한 간단한 데모 비디오는 여기입니다:
Confident AI는 RAG 파이프라인, 에이전트(agents), 챗봇(chatbots)에 매우 유용합니다. 일반적인 사용 사례로는 기업들이 기반 LLM을 전환하거나, 더 새롭고 (그리고 어쩌면 더 저렴한) 모델을 위해 프롬프트를 재작성하고, DeepEval 테스트가 실행되는 코드베이스와 테스트 세트를 동기화하는 것이 포함됩니다.
저희 플랫폼은 '데이터셋 에디터(dataset editor)', '회귀 포착기(regression catcher)', 그리고 '반복 인사이트(iteration insights)' 기능을 제공합니다. Confident AI의 데이터셋 에디터는 도메인 전문가가 평가를 위해 가져온(pulled) 이 데이터셋을 코드베이스와 동기화하면서 편집할 수 있도록 합니다. 이후 DeepEval이 이러한 데이터셋에 대해 평가를 완료하면, 공유 가능한 LLM 테스트/벤치마크 보고서를 생성합니다. 회귀 포착기는 새로운 구현에서 발생하는 모든 회귀를 식별하며, 저희는 이 평가 결과를 사용하여 메트릭 점수(metric scores)를 기반으로 최적의 반복을 결정합니다.
저희의 목표는 LLM 애플리케이션 벤치마킹을 매우 신뢰할 수 있게 만들어, 최고의 구현을 선택하는 것이 대시보드에서 메트릭 값을 읽는 것처럼 간단하게 만드는 것입니다. 이를 달성하기 위해서는 큐레이션된 데이터셋의 품질과 메트릭의 정확성 및 신뢰성이 가능한 한 최고 수준이어야 합니다.
이것이 현재 저희가 직면한 한계로 이어집니다. 현재 DeepEval의 주요 평가 방법은 LLM-as-a-judge입니다. 저희는 신뢰성을 개선하기 위해 GEval이나 질문-답변 생성(question-answer generation)과 같은 기술을 사용하지만, 이러한 방법들은 여전히 일관성이 부족할 수 있습니다. 도메인 전문가가 큐레이션한 고품질 데이터셋이 있음에도 불구하고, 우리의 평가 메트릭은 목표 달성에 가장 큰 장애물로 남아있습니다.
이를 해결하기 위해 최근 DeepEval에 DAG(Directed Acyclic Graph) 메트릭을 출시했습니다. 이는 의사결정 트리입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기