
VisionPsy-Nano: 해당 체급에서 최고 수준의 비전 AI, 스마트폰에서 실행 가능할 만큼 작습니다
요약
Tether AI Research가 온디바이스 실행에 최적화된 460M 규모의 비전-언어 모델 제품군 VisionPsy-Nano를 출시했습니다. 이 모델은 동급 체급뿐만 아니라 더 큰 규모의 모델들까지 압도하는 뛰어난 벤치마크 성능을 보여줍니다.
핵심 포인트
- 460M 파라미터 규모의 초소형 비전-언어 모델 출시
- 정확도 중심의 460M 모델과 속도 중심의 Flash 모델 제공
- 동급 모델 및 1B 미만 모델 대비 압도적인 벤치마크 성능 기록
- 문서 이해, 시각적 인지, 추론 및 지식 등 전 영역에서 우수
Tether AI Research*는 주머니 속의 기기(on-the-device)에서 실행되도록 구축된 약 460M-파라미터(parameter) 규모의 비전-언어 모델(vision-language models) 제품군인 VisionPsy-Nano를 출시합니다.
두 가지 변형이 있습니다: 정확도가 우선일 때는 VisionPsy-Nano-460M, 첫 번째 토큰 생성 시간(time-to-first-token)과 메모리가 가장 중요할 때는 VisionPsy-Nano-460M-Flash입니다.
지금 HuggingFace에서 VisionPsy-Nano를 다운로드하세요: https://huggingface.co/collections/qvac/visionpsy
해당 체급에서 최고
테스트된 다른 모든 ~0.5B 비전 모델(LFM2.5-VL-450M, SmolVLM2-500M, 그리고 자체 모델인 nanoVLM-460M-8k base)과 비교했을 때, VisionPsy-Nano-460M은 17개 벤치마크 중 16개에서 앞서며, 해당 체급에서 가장 높은 전체 정규화 점수(normalized score)를 기록했습니다:
| 모델 | 전체 정규화 점수 |
|---|---|
| VisionPsy-Nano-460M | 62.3 |
| ... |
또한 평균뿐만 아니라 네 가지 모든 능력 범주에서도 앞서고 있습니다: 문서 이해 및 OCR (73.9), 시각적 인지 (61.5), 추론 및 지식 (52.2), 그리고 지시 이행 및 신뢰성 (65.1). 가장 큰 격차를 보인 부분은 보통 소형 모델들이 무너지는 두 영역인 추론 및 지식(다음으로 우수한 ~0.5B 모델보다 +7.4%)과 시각적 인지(+4.6%)입니다.
체급을 뛰어넘는 성능
더 흥미로운 결과는 동일 체급과의 비교를 멈췄을 때 나타납니다. 세 가지 전체 벤치마크에서 460M 모델은 Apple의 FastVLM-0.5B (759M), Qwen3.5-0.8B (873M), 그리고 InternVL3.5-1B (1061M)를 포함하여 테스트된 모든 0.75B에서 1B 사이의 모델들을 완전히 압도했습니다. 이 모델들은 VisionPsy-Nano보다 1.6배에서 2.3배 더 큽니다.
| 벤치마크 (Benchmark) | VisionPsy-Nano-460M | FastVLM-0.5B | Qwen3.5-0.8B | InternVL3.5-1B |
|---|---|---|---|---|
| ScienceQA | 86.5 | 84.7 | 71.6 | 79.7 |
| ... | ||||
| MM-IFEval은 보기보다 더 중요합니다. 이는 모델이 실제로 당신이 요청한 대로 수행하는지를 측정합니다. 해당 축에서 테스트된 모든 더 큰 모델들을 앞선다는 것은, 제품을 구축할 수 있는 모델과 일일이 관리(babysit)해야 하는 모델 사이의 차이를 의미합니다. |
Flash: 실제 스마트폰에서의 첫 번째 토큰 (the first token)
온디바이스 비전 (on-device vision)이 사용 가능한 수준인지 결정하는 비용은 모델의 크기가 아니라, 카메라를 비춘 후 얼마나 오래 기다려야 하는가입니다. 그 대기 시간은 모델이 읽어야 하는 시각적 토큰 (visual tokens)의 수에 의해 결정됩니다. Flash는 전체 모델이 1088개를 사용하는 반면 64개의 시각적 토큰을 사용하며, 품질을 유지합니다: 전체 모델의 약 1% 이내의 차이를 보입니다 (정규화된 수치 기준 61.4 대 62.3).
512x512 해상도의 양자화된 GGUF 빌드를 실제 스마트폰에서 측정한 결과는 다음과 같습니다:
| 기기 (Device) | Flash, 첫 번째 토큰까지의 시간 (time to first token) |
|---|---|
| iPhone 15 | 0.3초 |
| ... | |
| 이는 동일한 런타임에서 nanoVLM-460M 및 SmolVLM2-500M보다 첫 번째 토큰 생성 속도가 11.9배에서 25.1배 더 빠르며, 4개 기기 모두에서 LFM2.5-VL-450M보다 1.3배에서 2.4배 더 빠르고, Qwen3.5-0.8B보다 2.3배에서 3.5배 더 빠릅니다. 피크 메모리 (Peak memory)는 전체 토큰 베이스라인 대비 Android에서는 24%~39%, iPhone 15에서는 41%~65% 감소합니다. |
억지로 줄인 것이 아니라, 로컬 실행을 위해 설계되었습니다
VisionPsy-Nano는 스마트폰에서 실행될 수 있을 때까지 크기를 줄인 클라우드 모델이 아닙니다. 디바이스에서 실행되는 것이 처음부터 설계 제약 조건(design constraint)이었으며, 이는 모든 선택을 결정지었습니다. 즉, 파라미터 예산(parameter budget), Flash가 가져오는 비주얼 토큰(visual-token) 예산, 쿼리당 단일 이미지를 최적화하기로 한 결정, 그리고 전체 정밀도(full-precision) 가중치와 함께 배포되는 양자화된 빌드(quantized builds) 등이 모두 이에 해당합니다. 스마트폰은 하나의 앱에 적은 양의 RAM만을 할당하며 전용 VRAM이 없으므로, 그곳에서 구동될 모델은 작고, 양자화(quantizable)가 가능하며, 첫 번째 토큰 생성 속도(fast to the first token)가 빨라야 합니다. 그것이 바로 이 모델이 구축된 목적입니다.
이를 통해 얻는 이점은 로컬 AI(local AI)의 존재 이유와 맞닿아 있습니다. 이미지는 촬영된 그 자리에서 이해되므로, 읽기 위해 디바이스를 떠날 필요가 없습니다. 모델은 신호가 없는 상태에서도 계속 작동합니다. 또한 카메라가 향하고 있는 것에 대해 질문하기, 문서·차트·도표 읽기, 장면에서 텍스트 추출하기, 가벼운 시각적 지시 따르기 등 설계된 목적에 부합하는 상황들에 적합합니다.
어떻게 도달했는가: 규모가 아닌 실패를 통한 학습
이 결과는 데이터 규모를 키워서(scaling data) 얻은 것이 아닙니다. 모델이 정확히 어디에서 틀리는지를 찾아내고 이를 수정함으로써 얻은 결과입니다.
Tether AI Research는 에이전트 기반의 실패 발견 하네스(agentic failure-discovery harness)를 구축했습니다. 더 큰 티처 모델(teacher model)이 실제 이미지에 대해 현실적인 질문으로 작은 모델을 심문하고, 이미지를 참조하여 모든 답변을 채점한 뒤, 발견된 내용을 약점 카탈로그(weakness catalogue)로 클러스터링하여 다음 라운드를 유도하는 방식입니다. 300회 이상의 라운드와 약 18,000회의 탐색(probes)을 통해, 모델은 구체적인 실패 모드(failure modes)를 파악했습니다. 가격과 번호판 오독, 차트 값은 정확히 읽지만 열의 합계를 구하지 못하는 경우, 좌우 혼동, 그리고 퇴행적 반복 루프(degenerate repetition loops) 등이 이에 해당합니다.
해당 클러스터들은 학습 신호(training signal)가 되었습니다. 이후 5단계의 사후 학습(post-training) 파이프라인을 통해 우수한 베이스 모델을 동급 최고 수준의 모델로 변모시킵니다. 이 과정은 광범위한 지도 미세 조정(supervised fine-tuning), 역량 타겟 미세 조정(capability-targeted fine-tuning), 교사 모델이 검증한 합성 데이터(synthetic data)를 활용한 약점 타겟 미세 조정(weakness-targeted fine-tuning), 그리고 추가적인 추론 비용 없이 강점들이 축적될 수 있도록 TIES를 사용하여 결과물인 역량 전문가 모델들을 단일 체크포인트로 병합하는 과정, 마지막으로 반복 루프(repetition loops)를 제거하는 선호도 정렬(preference-alignment) 단계로 구성됩니다.
이용 방법
Apache 2.0 라이선스 하에 공개된 오픈 웨이트(Open weights) 모델인 이 모델들은 연구자 지원 및 교육적 목적을 위해 설계되었습니다. 현재 세 가지 방식으로 실행할 수 있습니다: Transformers를 통한 풀 프리시전(full precision), llama.cpp를 통한 온디바이스 추론용 양자화된 GGUF 빌드, 그리고 고처리량 서버 추론을 위한 vLLM입니다. QVAC SDK 지원도 예정되어 있습니다.
보고서의 모든 모델은 공개된 평가 설정(eval configs) 및 판사(judge) 설정이 포함된 하나의 VLMEvalKit 하네스(harness) 하에서 점수가 매겨졌으므로, 벤치마크 수치는 재현 가능합니다.
- Tether AI Research에 대한 언급은 Tether Data, S.A. de C.V.를 의미합니다.
참고 문헌:
Hugging Face VisionPsy-Nano 컬렉션: https://huggingface.co/collections/qvac/visionpsy
Hugging Face 블로그 기사: https://huggingface.co/blog/qvac/visionpsy
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기

