Qevi-2B: 이미지 분류를 위해 Jev 스타일로 파인튜닝된 모델
요약
본 기사는 Qwen3-VL-2B를 기반으로 Jev 스타일 추론을 구현한 Qevi-2B 모델에 대한 내용을 담고 있습니다. 이 모델은 28,000개의 이미지로 파인튜닝되었으며, 특히 하나의 이미지에 대해 여러 질문이 요청되는 이미지 분류 작업에서 뛰어난 성능을 보입니다.
핵심 포인트
- Qwen3-VL-2B 기반의 Qevi-2B 모델 공개
- Jev 스타일 추론 구현을 목표로 함
- 이미지 분류 및 다중 질문 처리 특화
- NSFW 데이터 포함으로 이미지 식별 능력 강화
안녕하세요 여러분!
지난 며칠 동안 저는 Qwen3-VL-2B와 약간 수정된 패키지를 기반으로 전체 파인튜닝 작업을 진행했습니다. 이 작업은 여러분이 아마도 잘 알고 계시고 (그리고 좀 지겨워하셨을) Jev/Typesafe.ai 모델처럼 작동하는 Jev 스타일 추론을 구현하기 위함입니다.
파인튜닝은 약 28,000개의 이미지를 사용하여 dual RTX3090 환경에서 진행되었습니다. 이 이미지들 중 일부는 NSFW 데이터였는데, 그 이유 중 하나는 사용자가 업로드한 이미지에서 NSFW 이미지를 쉽게 식별하기 위함입니다. 이 모델은 여러 질문이 한 번에 하나의 이미지에 대해 요청되는 종류의 작업에서 특히 뛰어납니다. 첫 번째 질문 이후 추가적인 각 질문은 약 3ms의 추가 시간이 소요됩니다.
제가 이 분야의 전문가라는 것을 암시하려는 것은 절대 아니지만, 단순히 아이디어와 작동하는 개념 증명(proof of concept)을 여러분과 공유하고 싶었습니다 :)
HuggingFace 리포지토리는 여기를 확인하세요: https://huggingface.co/MeerDevelopment/Qevi-2B
피드백을 듣고 싶습니다!
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기