ImaJev-4b: 텍스트와 사진을 이용해 비즈니스 결정을 내리도록 4B 모델을 파인튜닝하는 데 15일을 사용했고, JevBench에서 91개
요약
본 글은 비즈니스 의사결정 워크플로우 개선에 초점을 맞춘 ImaJev-4b 모델 개발 과정을 다룹니다. 텍스트와 이미지를 모두 처리할 수 있도록 Jev를 파인튜닝했으며, 복잡한 결정 노드를 코드가 아닌 AI가 대체하는 데 성공했습니다. 최종적으로 JevBench에서 높은 점수를 기록하며 기존 모델을 능가했고, 정확성 외에도 보정 및 속도 측면에서 강점을 입증했습니다.
핵심 포인트
- 텍스트와 이미지를 결합한 ImaJev-4b를 개발하여 비즈니스 의사결정에 활용 가능하게 함.
- 초기 파인튜닝 실패 후, 오픈 가중치 모델을 이용해 어려운 질문 생성 및 검증 과정을 거쳐 성능 회복.
- JevBench에서 91개 중 1위를 차지하며 기존 최고 점수(63.29점)를 상회하는 성과를 달성함.
먼저 배경 지식을 말씀드리겠습니다.
저는 프로세스 개선/비즈니스 컨설턴트이며, 포춘 500대 기업들과 환불, 반품, 고객 지원 등 프로세스를 개선하는 작업을 해왔습니다.
이 전체 과정에는 매우 복잡한 의사결정이 포함되어 있었고, 일반적으로 프로세스 맵의 모든 결정/조건 노드는 코드로 처리하기가 매우 어렵기 때문에 인간에게 대체되었습니다.
ImaJev 아이디어
그래서 Jev가 나왔을 때 저는 매우 흥미를 느꼈고, 복잡한 의사결정 워크플로우에서 의사결정을 개선하는 사용 사례를 명확하게 볼 수 있었습니다.
하지만 Jev는 이미지 지원 기능이 없었고, 저는 텍스트와 이미지를 모두 단일 모델로 재현할 수 있을 것이라고 생각했고, 그때 ImaJev 작업을 시작했습니다.
학습 과정
처음에는 잘 되지 않았습니다. 약 50만 개의 짧은 결정에 대한 첫 번째 대규모 파인튜닝을 진행한 결과, 9B 모델의 추론 능력이 오히려 떨어졌습니다: JevBench hard에서 64.9점에서 42.3점으로 하락했습니다. 이 모델은 기본적으로 패턴 매칭을 학습한 것이었습니다. 저는 다음 몇 주 동안 오픈 가중치(open-weight) 모델들을 사용하여 어려운 질문들을 생성하고, 두 개의 AI 모델이 답변에 동의하는 경우만 남기는 작업을 했습니다. 그 결과 추론 능력이 다시 회복되었습니다.
결과
그 후, JevBench에서 91개 중 1위(v1.4.2.2, 9월 27일 점수)를 기록하며 63.29점이었던 Jev 1.13.0의 67.37점을 상회했습니다.
같은 주 DecisionBench에서는 56개 중 3위를 차지하며 GPT-5.6 Luna와 DeepSeek V4.1을 능가했습니다.
솔직히 저는 어느 쪽도 예상하지 못했습니다.
공정하게 말하자면, 1위라는 것은 정확성(accuracy), 보정(calibration), 속도(speed), 비용(cost)을 동등하게 가중치를 부여한 점수입니다. 순수한 정확성만 놓고 보면 3위입니다. 이 모델의 주요 강점은 90%라고 말할 때 보통 맞고, 추측하는 대신
전체 프로젝트 비용은 임대 GPU에 약 $1200이 들었고 시간이 많이 소요되었습니다 :P
Weights (Apache-2.0): https://huggingface.co/mohit67890/imajev-4b
Code: https://github.com/mohit67890/imajev
Demo: https://huggingface.co/spaces/mohit67890/imajev
JevBench 보드: https://benchmarkheaven.com/jev-models/v1.4.2.2
DecisionBench 보드: https://huggingface.co/spaces/Hanno-Labs/decision-bench-leaderboard
이에 대한 여러분의 생각을 듣고 싶습니다. 혹시 시도해 보고 싶은 분이 계신가요?
제출자 /u/Educational-Care7867
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기