야외 어드벤처 생성을 위한 무료 AI 모델 벤치마킹
요약
야외 어드벤처 앱 'Ruta Viva AI'의 신뢰성 확보를 위해 무료 AI 모델들의 구조화된 콘텐츠 생성 능력을 벤치마킹했습니다. 이 테스트는 단순히 응답 성공 여부를 넘어, 유효한 JSON 형식과 필수 필드 준수 등 엄격한 기준을 적용했습니다. 파일럿 결과, 속도보다 구조적 신뢰성이 중요하며, Liquid LFM이 가장 안정적인 성능을 보였습니다.
핵심 포인트
- 구조화된 출력의 신뢰성(JSON 유효성)이 핵심 지표입니다.
- 속도가 빠르더라도 파싱할 수 없는 응답은 가치가 낮습니다.
- 벤치마크는 더 많은 시나리오와 반복 테스트가 필요합니다.
_이 글은 Kaggle Benchmarking Challenge에 제출하는 내용입니다.
무엇을 벤치마킹했는가
야외 탐험 앱인 Ruta Viva AI를 위해, 저는 무료 AI 모델들이 얼마나 신뢰성 있게 구조화된 야외 어드벤처를 생성할 수 있는지 평가하고 싶었습니다.
이 벤치마크는 단순히 모델이 성공적으로 응답하는지 여부 이상의 것을 측정합니다. 각 어드벤처는 유효한 JSON을 포함해야 하며, 모든 필수 필드를 갖추고, 정확히 세 개의 미션을 포함하며, 일관된 XP 합계를 보여야 합니다.
저는 10개의 환경에 걸쳐 30가지 시나리오를 설계했으며, 각 환경마다 세 가지 프롬프트 변형을 사용했습니다. 이번 초기 파일럿에서는 모델당 3가지 시나리오를 테스트하여 총 9개의 요청을 수행했습니다.
테스트한 모델들
저는 OpenRouter를 통해 세 가지 무료 모델을 평가했습니다:
- Liquid LFM 2.5 2.6B:
liquid/lfm-2.5-2.6b:free - NVIDIA Nemotron 3.5 Lightning:
nvidia/nemotron-3.5-lightning:free - Apodex 1.1 Mini:
apodex/apodex-1.1-mini:free
저는 공통된 프롬프트 세트를 사용하여 구조화된 출력의 신뢰성과 응답 속도를 비교하기 위해 이 모델들을 선택했습니다.
발견한 점들
파일럿 테스트 결과, 구조화된 출력의 신뢰성에서 상당한 차이가 나타났습니다.
| Model | Valid JSON | Median latency |
|---|---|---|
| Liquid LFM 2.5 2.6B | 3/3 (100%) | 13.57 s |
| ... | ||
| Liquid가 이 파일럿에서 가장 신뢰할 수 있는 모델이었습니다. 세 응답 모두 유효한 JSON, 필수 필드, 정확히 세 개의 미션, 그리고 일관된 XP 합계를 포함하고 있었습니다. |
Nemotron은 하나의 유효한 응답을 생성했지만, 두 개는 출력 제한으로 인해 잘렸습니다. Apodex는 중앙값 지연 시간(median latency) 면에서 가장 빨랐지만, 그 어떤 응답도 유효한 JSON을 생성하지 못했으며, 하나는 사용 가능한 답변 내용이 없었습니다.
제가 얻은 주요 결론은 속도만으로는 유용성을 결정할 수 없다는 것입니다. 애플리케이션이 구조화된 데이터에 의존하는 경우, 파싱할 수 없는 빠른 응답은 정확하게 형식화되었지만 느린 응답보다 가치가 낮을 수 있습니다.
이 벤치마크는 한계가 있습니다: 모델당 세 번의 요청만으로는 일반적인 성능을 확립하기에 충분하지 않습니다. 안전성 검사는 기본적인 키워드 휴리스틱(keyword heuristic)일 뿐, 안전성을 입증하는 것은 아니며, 어드벤처 품질은 여전히 인간의 평가를 필요로 합니다.
다음으로 저는 더 많은 시나리오를 테스트하고, 일관성을 측정하기 위해 요청을 반복하며, 관련성, 접근성, 다양성, 실용성, 안전성에 대해 수동적으로 평가할 것입니다.
나의 벤치마크
Public Kaggle 노트북: https://www.kaggle.com/code/ezequielsalazar1/outdoor-adventure-ai-benchmark
GitHub 저장소: https://github.com/Ezequie1Sc/outdoor-adventure-ai-benchmark
이 노트북에는 벤치마크 방법론과 검증 논리가 문서화되어 있습니다. 위의 결과는 제가 로컬에서 실행한 파일럿(pilot)에서 나온 것입니다.
#kagglechallenge
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기