나만의 의사결정 모델 만들기
요약
본 글은 Jev와 같은 제로샷 분류기(Zero-shot Classifier)의 활용과 한계에 대한 개인적인 경험 및 분석을 담고 있습니다. 퀴즈 생성기 개발 경험을 바탕으로 LLM 기반 의사결정 모델 구축 과정을 공유하며, 전통적 분류기와 비교했을 때의 장점과 비용 효율성을 논합니다.
핵심 포인트
- LLM 기반 제로샷 분류기는 사용하기 편리하고 저렴하다는 강점이 있습니다.
- Jev와 같은 도구는 API 구조가 직관적이어서 활용도가 높습니다.
- 모델의 확신도(Confidence) 평가 시 p-해킹에 주의해야 합니다.
- 전통적 분류기 대비 LLM 기반 접근 방식이 비용 효율성을 제공합니다.
Jev를 보고 제대로 이해하지도 못한 채 “나도 만들 수 있겠는데?” 싶어서, Alex Trebek의 Jeopardy 퀴즈 생성기 trebek을 구상함. Bun으로 실행하는 TypeScript 앱으로, 입력이 주제·질문·답 중 무엇인지 판별한 뒤 나머지를 생성함.
작은 Qwen 임베딩 모델로 며칠간 영어 데이터를 처리해 SQLite-vec 데이터베이스에 벡터를 넣다가 중단하고, LLM에 Jev의 정확한 명세를 제공하기 시작함. 지금은 퀴즈 생성기이면서 Jev 복제 분류기로도 작동하고, System 0인가 하는 것을 위한 맞춤형 v1 엔드포인트도 갖춤. 이해 수준은 이 정도지만 재미있는 실험이었고 쓸 만한 결과도 나옴.
특정 벤치마크에서 모델의 확신도가 잘 보정된 것처럼 보이도록 사후에 temperature만 바꾸는 것이 허용되는 걸까? p-해킹 같다는 느낌이 듦.
효과가 있다면 쓸 만함! 테스트 세트가 충분히 크고 다양하다면 아무것도 안 하는 것보다는 나음. 수십 종류의 작업을 넣고 확신도가 얼마나 달라지는지 살펴보면 견고함을 평가할 수 있음.
토큰 생성 과정을 직접 조작해볼 수 있어서 좋았음. 모델을 어떻게 바라봐야 하는지 단계별로 풀어줘서 Jev와 의사결정 모델을 쉽게 이해할 수 있었고, 모델의 확신도 보정 개념도 도움이 됨.
머신러닝 엔지니어로서 수년간 분류기에 관심을 끌어보려다 실패했는데, Jev 열풍을 보니 속으로 비명이 나옴. 제로샷 분류기가 전통적인 분류기보다 편리하다는 건 이해하고 멋지기도 함. 하지만 일반 LLM도 이미 꽤 오래전부터 충분히 저렴하고 쓸 만한 제로샷 분류기였으니, 다시 속으로 비명을 지르게 됨.
Jev가 인기를 얻은 이유 중 하나는 API가 if(...)나 switch문처럼 생겼기 때문이라고 봄. 다들 채팅형 API에 익숙하다 보니, 이모지 여러 개를 보내고 현재 맥락에 가장 적합한 하나를 고르게 하는 활용조차 생각하지 못한 것 같음. 채팅 모델은 같은 동작에도 더 비싸고, 거부 응답처럼 엉뚱한 출력을 낼 수도 있음.
아이러니하게도 2020년 GPT-3 논문에서도 일부 객관식 문제는 빈칸을 생성해 채우는 대신, 특정 후속 문자열의 토큰 확률을 비교해 풀었던 것으로 기억함.
저렴함의 정도가 다름. 특히 Jev는 워낙 싸고 빨라서 예전에는 비용을 정당화하기 어려웠던 곳에도 적용할 수 있고, 간단한 테스트 외에는 별다른 작업도 필요하지 않음.
긍정적으로 보면, 이번 제로샷 분류기 열풍이 데이터 선정과 학습에 더 공을 들인 전문 분류기의 기반이 될 수도 있음.
그 분노를 같이 느껴보고 싶음. 어떤 부분 때문에 비명이 나오는지 더 자세히 풀어줄 수 있을까?
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기