Jev 진짜 200배 빠르고 400배 저렴한지 테스트 해봤습니다.
요약
최신 AI 모델 Jev가 기존 LLM 대비 최대 200배 빠른 속도와 낮은 비용으로 다양한 작업을 처리할 수 있음을 테스트한 내용입니다. Jev는 자유로운 문장 생성을 대신하여, 주어진 선택지 기반의 병렬적 판단(예: 질문 여부 판단, 우선순위 점수 부여)에 특화되어 효율성과 경제성을 극대화합니다.
핵심 포인트
- Jev는 기존 LLM과 달리 병렬적인 판단 처리에 최적화됨.
- 토큰 생성 부담을 줄여 속도와 비용 측면에서 혁신적임.
- 놀이스코어(NovelScore) 등 다양한 타입으로 정교한 분류가 가능함.
- 댓글/광고 문구 분류, 긴급도 판단 등 실무 적용 사례 제시.
Video: Jev 진짜 200배 빠르고 400배 저렴한지 테스트 해봤습니다.
Channel: 코드팩토리
Duration: 13m 40s
Source: subtitle (auto, ko)
Transcript:
기존 AI보다 최대 200배나 빠르고 환각은 0%라고 주장하는 AI가 새로 출시됐어요. 출시 24시간 반에 버셀의 역대 모델 도입 기록을 한 번에 갈아치운 AI 제브의 이야기입니다. 자, 그런데 황당하게도이 AI는 대화를 할 줄은 몰라요. 코딩도 못 해요. 자, 대신에 주어진 선택지에서 선택하고 점수를 먹기고 맞을 확률을 알려주고 있어요. 엄청나게 빠른 속도로요. 아무리 빠르다고 해도이 땅을 어디에다 쓰냐고 생각을 할 수가 있겠죠. 자, 근데 제가 써 보니까 생각 이상으로 할 수 있는 일이 많아요. 여러분의 돈과 시간을 많이 아껴 줄 수 있을 겁니다. 자, 오늘 그래서 제가 직접 테스트를 해 봤는데 유튜브 댓글 분류부터 고객 무늬 분류랑 긴급도 판단. 자, 그리고 유튜브 광고문이 매일 100개를 분류하는 작업까지 한번 다 맡겨 봤고요. 실제로 타입세에서 사용을 한 5.6 테라에게도 똑같은 작업을 시켜보고서 비용이랑 시간을 측정을 해 봤어요. 전부 다 비교를 한번 해 볼게요. 오늘 영상 하나만 보시면은 여러분의 서비스에 제를 녹여서 시간과 돈을 많이 아낄 수 있도록 제가 도와드릴게요.
쏘asy. 자, 그럼 첫 번째로 일단은 우리가 어, 제가 뭐가 다른지부터 다른 LM과 뭐가 다른지 우리가 한번 간단하게 짚고가 보겠습니다. 자, 예를 들어서 우리 영상에 댓글이 1천000개가 달렸다고 한번 가정을 해 볼게요. 자, 여기에서 제가 답변해야 되는 질문만 골라내고 싶다고 한번 가정을 해 보겠습니다. 자, 우리가 제가 아니더라도 일반적인 LRM에게도 댓글을 우리가 소스로 넣어 주면은 그 댓글이 나한테 질문을 하고 있는 글인지 물어볼 수가 있을 거예요. 자, 그러면은 그 모델은 토큰 단위로 답변을 생성을 할 겁니다. 자, 이게 우리가 흔히 알고 있는 LRM이 작동하는 방식이죠. 자, 그런데 제브는 자유롭게 그냥 그를 막 작성을 하는 대신에 우리가 정한 항목을 판단을 하도록 만든 모델이요. 자, 댓글에다 우리가 답장을 직접 쓰게 할 수는 없는데이 댓글에 나에게 하는 질문이 있는지 판단하거나 답변 우선 순위에 대한 점수를 우리가 매일 수가 있어요. 자, 이거를 지금 타이세프에서는 시스템 모델이라고 부르고 있고요.이 이 약간의 설명을 붙이자면은 문장을 순서대로 생성하는 부담을 우리가 줄이고 여러 판단을 동시에 병렬로 처리하도록 만들어서 속도랑 비용을 우리가 효율적으로 개선을 한다라는 목적인 거예요.
자, 우리가 종합적인 판단을 LRM에게 한 번에 받기보다 여러 개의 병렬적 판단을 단순한 아웃풋을 받을 수가 있으면은 엄청 저렴하고 빠르게 작업을 할 수 있다라는 이야기인 거죠. 자, 그래서 이걸 효율적으로 하기 위해서 잭에서는 세 가지 타입들이 있는데 놀이스코어라는이 세 가지 우리가 질문을 할 수 있는 방식이 있어요. 자, 이것부터 조금 여러분이 한번 배워야 됩니다. 자, 예를 들어서 우리가 이런 댓글이 달렸다라고 한번 가정을 해 볼게요. 자, 영상대로 설치를 했는데 실행이 안 돼요. 어디서부터 확인을 해야 되나요? 맥에서 설치하는 방법도 영상으로 다뤄 주세요라는 댓글이 있었다고 한번 가정을 해 볼게요. 자, 먼저 놀 타입부터 우리가 한번 봐 보겠습니다. 자, 어떤 내용이 참인지 그러니까 트루인지 0에서 1 사이의 값으로 판단을 할 수 있는 타입이에요. 자,이 댓글에는 예를 들어서 우리가 코드 팩토리의 답변이 필요한가라고 우리가 물어볼 수가 있겠죠. 값이 1에 가까울수록 답변이 필요하다라고 판단을 한 거고요.
그러니까 트루인 거고. 자, 그리고 그 값이 일정 수준을 넘은 친구들만 우리가 모으게 되면은 그런 댓글들만 모으게 되면 우리가 답변을 해야 되는 후보 댓글들을 분류를 할 수가 있겠죠. 자, 두 번째 타입인 초이스 타입은 선택지 중에서 우리가 고르는 방식이라고 보시면 돼요. 자,이 댓글에 주된 의도가 무엇인가라고 우리가 물어보고 뭐 질문, 영상 요청, 의견, 비판, 홍보 이렇게 여섯 가지를 선택지로 주는 거예요. 자, 그러면 제프가이 옵션들을 보고서 항목을 고르고 그 선택지가 맞을 확률이 또 전달이 되는 거죠. 자, 그런데이 댓글은 보면은 질문이랑 영상 요청 두 가지가 다 있죠. 자, 그래서 우리가 주된 내용을 하나만 고른다면은 다른 내용은 또 우리가 놓칠 수가 있단 말이에요. 자, 이럴 때는 우리가 병렬로 여러 가지를 물어보면 된다라는 거예요. 자, 예를 들어서 구체적인 다음 영상에 대한 요청이 있는가라는 거를 우리가 놀 타입으로 따로 추가로 병렬로 물어보면은 그러면 우리가 동시에 두 가지에 대한 판단을 다 할 수가 있다라는 거죠.
자, 그리고 마지막으로 이제 스코어 타입이 있는데 스코어 타입은 우리가 정한 기준으로 점수를 먹기는 방식이에요. 여러분이 그냥 상상했을 때 떠오르는 그런 방식인데 자, 여기서는 답변 우선 순위를 우리가 어, 0부터 3까지 정했다고 한번 가정을 해 볼게요. 자, 0은 답변이 필요 없는 댓글이고 자, 1은 일반적인 그냥 의견이나 뭐 요청이 있을 때 자, 2점은 굉장히 구체적인 질문이 있을 때, 그리고 3점은 실행이 막혀서 도움이 필요한 질문이 들어왔을 때 자, 이런 식으로 우리가 어, 점수별로 기준을 함께 주면 됩니다. 자, 그럼 이걸 우리가 어떻게 쓸 수가 있냐면은 답변이 필요한 댓글을 우리가 노 타입으로 그루핑을 먼저 하고 초이스 타입으로 우리 답변에이 댓글의 유형을 분류를 할 수가 있고요. 자, 그리고 스코어로 우리가 점수가 높은 순서로 우선 순위대로 확인을 하는 거를 전부 다 병렬로 실행해서 우리가 작업을 할 수가 있다라는 거죠. 자, 또이에 유리한 점은이 질문들을 우리가 한 번의 요청에 함께 넣을 수도 있어요.
그래서 같은 댓글을 보고서 각 질문들을 동시에 판단을 하게 될 거고요. 자, 그런데이 각각이 다 독립적이기 때문에 초이스 타입의 답을 보고서 스코어 타입을 먹기는 그런 형태는 되진 않을 거예요. 만약에 그렇게 하고 싶다라고 하면은 설계를 파이프라인을 다시 만들어 가야겠죠. 자, 그래서 우리가 일반적으로 LRM이랑 대화하듯이 작업을 했던 프로세스에서 조금 달라지게 돼요. 파이프라인에 제를 넣게 되면은요. 자, 그래서 제에서 우리가 쓸 수 있는 타입은 이렇게 세 가지가 있고요. 물론 우리가 일반적인 LM을 사용을 할 때처럼 여러분이 당연히 고려를 해야 될 것은 제가 이렇게 판단을 한다. 그래서 확률이 함께 들어가는만큼 100% 올바른 판단했다라는 건 우리가 보장을 할 수는 없어요. 그건 LRM이랑 똑같습니다. 그래서 우리가 일반적으로 LRM을 사용을 할 때 주의해야 될 부분들은 전부 다 어 여러분이 재부를 사용을 할 때도 똑같이 주의를 해야 된다라고 생각하시면 될 거 같아요. 자, 그래서 이렇게 기본기를 조금 배웠으니까 얼마나 우리가 빠르게 처리를 할 수 있는지 그리고 작업은 실제로 어떻게 시키면 되는지도 한번 봐 보도록 할게요.
자, 고객 문의를 가정하고서 제가 일단 테스트를 하나 돌려 봤거든요. 사용법을 묻는 분이랑 지금 계정에서 파일이 삭제되고 있다라는 문의가 함께 들어온다면 당연히 우리가 뭐 계정이 막 삭제되고 있다라는 급한 것부터 우리가 확인을 하고 처리해 줘야겠죠. 자, 그래서 제가 테스트용으로 어, 한국어 문의 100건 정도는 이제 준비를 했고요. 자, 굳이 한국어를 골랐던 이유는 영어가 당연히 더 퍼포먼스가 좋다는 이견 되게 많더라고요. 나중에 이제 영어도 한번 비교하는 것도 한번 찍어 볼 건데 일단 저는 성능이 조금 덜 나온다는 한국어 기반으로 먼저 한번 해 봤습니다. 자, 그래서 문의 종류는 우리가 초이스 타입으로 분리할 수 있도록 했고 긴급 또는 스코어 타입으로 지정하도록 했고 급하게 확인해야 되는지는 노일 타입으로 우리가 트루스를 판단하도록 했어요. 자, 그리고 제가 비교할 때 썼던 경로는 이제 세 가지를 썼는데 자, 재브를 제브에서 공식으로 지원해 주는 CLI, 그러니까 공식 게이트웨이로 직접 호출하는 방식.
그리고 두 번째로 이제 세를 거쳐서 제를 건너서 한번 노출하는 방식. V세 AI 게이트웨이죠. 그리고 마찬가지로 V셀에서 GPT 5.6 테라로 똑같은 작업을 시켰을 때 이렇게 세 가지 케이스를 제가 전부 다 작업을 시켜 봤어요. 전부 다 똑같은 인스트럭션을 줬고요. 그리고 병렬로 처리하는 개수도 매번 통일을 했습니다. 자, 그리고 테라한테 요청을 할 때는 제브에서 응답하는 형태 그대로 응답을 할 수 있도록 저희가 설계를 해 놨어요. 자, 이걸 실행을 하니까요. 제이프를 공식 게이트웨에서 호출한 거는 거의 시작하자마자 바로 100건이 다 끝났고요. 버셀의 AR 게이트웨를 거쳐서 사용한 제도 작업이 금방 끝났어요.이어서 이어서 끝났고 한번 거쳐서 오는만큼 확실히 AR게이트가 조금 더 느리게 끝나긴 했습니다. 자, 그런데 테라는 아직도 처리 중이죠. 자, 여기까지는 우리가 당연히 예상한 결과기는 해요. 자, 그래서 전체 처리하는 시간은 제를 직접 호출했을 때 2.1초밖에 안 걸렸고 격려했을 때는 3.7초 정도가 걸렸고 테라만 우리가 썼을 때는 17.4초가 4초가 걸렸어요.
자, 그래서 이제를 우리가 직접 호출한 기준으로는 거의 여덟 배 정도 테라보다 빨랐다라고 판단할 수가 있고요. 자, 그리고 비용 사용량도 차이가 굉장히 좀 크거든요. 공식적인 단가를 우리가 사용해서 계산을 해 보면은 제를 사용했을 때는 0.0037달러 정도가 사용이 됐고 테라 같은 경우에는 0.28달러가 사용이 됐어요. 자, 그렇다면 가격적인 부분을 봤을 때 거의 76배 정도 차이난다고 볼 수가 있겠죠. 그런데 아무리 빠르다고 해도 분류 결과 자체가 정확하지 않으면은 당연히 우리가 쓰기 조금 힘들 겁니다. 자, 그런데 결과적으로 봤을 때이 100개의 무늬 중에서 딱 11개의 무늬만 제랑 테라가 다른 분류를 해냈고 나머지 89개에서는 완전히 똑같은 결정을 내렸어요. 자, 그런데 또 재미있는 거는 분류를 다르게 했더라도 긴급 여부에 대한 판단은 제랑 테라에서 100건에 대해서 모두 똑같이 판단했습니다. 자, 그러니까 제가 여덟 배 이상 빨랐음에도 불구하고 굉장히 판단을 잘했다라고 볼 수가 있겠죠. 뭐 정확하다는 조금 애매할 수가 있는데 일단 기본적으로 테라랑 똑같은 생각을 했다라고 볼 수는 있을 것 같습니다.
자, 그런데 혹시나 다른 테스트라면 조금 다른 결과가 나올까 싶어서 제가 다른 작업들도 좀 시도를 해 봤거든요. 뭐 유튜브 댓글에서 답변할 질문을 골라보고 댓글 피드에서는 영상 소재가 될 만한 글을 막 분류를 하고 뭐 유튜브 광고 분위 메일을 분리한 다음에 브랜드 정보를 조회하고 제 조건에 맞는 제한은 이제 판단까지 시키고 뭐 이런 것까지 제가 한번 작업을 해 봤는데 사실상 다 거의 비슷한 결과가 나왔어요. 댓글 피드를 처리하는 거는 제 같은 경우는 직접 호출하는게 자, 댓글 피드를 정리하는 데는 100회 정도 처리를 할 때 직접 호출하는게 5.6초 정도 걸렸고요. 테라가 35.2초 정도 걸렸고 유튜브 광고 무의 매일 분류는 제가 6.3초 정도, 테라가 45.2초 2초 정도 걸렸습니다. 자, 그래서 새 실험을 했을 때 모두 다 제가 훨씬 더 빨랐고 단가도 당연히 훨씬 더 낮았어요. 그리고 유형은 분류해 낼 때도 거의 비슷한 결과를 냈고요. 유튜브 광고 이메일은 100건 중에 99건을 전부 다 같은 카테고리로 분류를 했습니다.
뭐 아까도 말했다시피 같은 분류를 해냈다. 그래서 정답을 맞췄다라고 말할 수는 없긴 하겠지만 최소한 둘이서 같은 기준으로 판단을 했다라고 볼 수는 있을 것 같아요. 자, 그래서 반복된 테스트 속에서도 일단 기본적으로 제가 빠르고 저렴했고 테라랑 거의 똑같은 거의 비슷한 결정들을 내렸다라고 판단해 볼 수가 있었어요. 자, 그런데 우리가 실제로 작업을 하게 되면은 뭐 분류를 할 때만 우리가 AI를 사용을 하는게 아니잖아요. 그죠? 예를 들어서 우리가 응답을 할 댓글들을 골랐다라고 하면은 답변을 작성도 해야겠죠. 자, 근데 브는 애초에 글을 생성해 주진 않으니까 제브에게 분류만 시키고 글은 전통적인 LM한테이어서 답변을 만들게 하면은 효율이 얼마나 올라갈지도 우리가 한번 테스트를 해 봤어요. 자, 이때 만약에 우리가 모든 유튜브 댓글에 전부 답변을 다할 계획이라면은 답변할 대상을 고르는 단계 당연히 필요가 없겠죠. 자, 이럴 때는 테라한테 그냥 모든 댓글을 각각 입력을 해 주고 바로 작성을 맡기는게 제일 저렴하고 제일 빠를 겁니다.
자, 그런데 우리가 댓글을 뭐 수백개씩 달린다라고 가정을 하면은 단순히 뭐 감상하는 댓글이나 짧은 반응까지 전부 다 답변할 필요는 없고 도움이 실제로 필요한 부분 또는 뭐 진짜 급하게 제가 답변을 해야 되는 부분 이런 것들을 우리가 먼저 분류를 해는게 가장 현실적이란 말이에요. 자, 그래야지 우리가 답변을 생성하는데 드는 토큰도 효율적으로 우리가 관리할 수가 있고요. 자, 그리고이 사례가 아니더라도 여러분이 어떤 상황에서든 일상에서 예약을 사용하게 되면은이 앞 분류 작업이 사실 제일 중요합니다. 이걸 하지 않으면 우리가 시간과 돈을 너무 많이 쓰게 되니까요. 자, 그래서 일단은 답변이 필요한 댓글들을 우리가 분류해서 고르고 분류한 댓글에만 답변을 작성하도록 한번 시켜 볼 거예요. 자, 그래서 여기선 두 가지 방법을 한번 비교를 해 봤는데 첫 번째 방법은 테라가 댓글을 고르는 것부터 답변까지 전부 다 작성을 해 주는 거고 두 번째 방법은 제가 답변할 댓글을 판별해서 분류만 먼저 하고 그다음에 실제 답변 작성은 테라가 진행을 하는 거예요.
자, 그래서 두 가지 방법 모두 댓글 100개에서 우선 순위가 높은 다섯 개의 댓글을 고르고 그 부분에 대해서만 답변을 생성을 하도록 와이어링을 해 놨어요. 자, 그러니까 인스트럭션 완전 똑같고 모델 조합만 다른 거죠. 자, 이걸 실행을 해 봤더니 제프가 분류를 해 주는 쪽은 무려 3,9초 만에 댓글을 전부 다 읽었고 답변 작성으로 넘어갔어요. 자, 그런데 그동안 테라 단독 사용하는 방식은 여전히 계속 분류를 하고 있고요. 자, 그리고 제는 답변을 실제 작성하는 것까지도 11초 만에 다 끝났습니다. 자, 그리고 테라 단독으로 작업하는 경우에는 분류하는데만 34초가 걸렸고 작성을 끝내는 데까지는 42초가 걸렸어요. 그래서 앞단에 분류하는 단계만 바꿨는데 제를 넣어 줬는데 우리 전체 작업을 거의 3.8배 8배 거의 네배 가까이 빠르게 만들 수가 있었다라는 거죠. 자, 비용을 확인해 보면은 테라만 썼을 때 우리가 0.36달러 정도를 사용을 했고요. 제브랑 테라를 함께 사용한 쪽이 0.026달러밖에 사용을 안 했습니다.
그러니까 14배 정도 차이가 나는 거죠. 자, 그리고 결과를 봐 보면은요. 답변한 댓글은 두 쪽 모두 다섯 개씩 이제 잘 골랐는데 두 개가 일단 겹쳤고요. 서로 다른 거를 고른 예를 보면은 제가 고르고 테라가 고르지 않은 댓글 중에서는 윈도우에서 에이전트의 한글 이름이 깨졌다라는 댓글이 들어가 있었고 테라만 독립적으로 고른 거는 윈도우 버전이랑 설치 방식 화면 캡처를 알려 달라는 댓글에 대한 답변 초환을 작성을 했습니다. 자, 그래서 둘 다 뭐 굉장히 합당한 선택지라고 볼 수가 있겠죠. 사실이 방식을 보면은 이미 API을 통해서 AI을 많이 사용하신 분들은 느끼셨겠지만 제가 없던 시절에도 우리가 굉장히 많이 쓰던 방식이기는 해요. 저렴한 모델로 우리가 앞에서 라우팅을 먼저 해 주고 비싼 모델로 우리가 아티팩트를 생성하는 방식인데 어 그럼에도 불구하고 이런 테스트가 조금 유의미한 이유는 제는 사실상 태초부터 라우팅이 굉장히 최적화돼 있는 모델이라고 볼 수 있기 때문이죠. 자, 그럼 직접 써 보니까 제브를 어디에 쓰면 좋을지는 아마 여러분이 확실히 느꼈을 것 같아요.
엄청 많은 입력 소스를 받아들이고 정해진 기준으로 판단을 하고 다음 장으로 넘기는 데는 재브가 진짜 정말 최적화돼 있는 모델인 거 같습니다. 특히나 우리가 테스트를 해 봤던 고객이라든가 댓글 분류가 뭐 그런 일이죠. 자, 우리가 테스트를 해 봤을 때 공식 사이트에서 주장하는 것처럼 뭐 40배에서 200배까지는 저희가 느끼지는 못했지만 최소 여섯 배에서 여덟배 이상 빨랐고요. 어, 굉장히 많이 저렴했기 때문에 이런 분류하는 작업을 우리가 앞단해서 라우팅을 해야 된다라고 하면은 사용하지 않을 일가 없는 거죠. 자, 그래서 현재 지금 여러분이 AI을 사용하고 있는 영역에서 실제을 해야 되는 부분이랑 판단만 하면 되는 부분을 한번 나눠 보시면은 제를 사용할 만한 파이프라인지 여러분이 쉽게 판단할 수가 있을 것 같아요. 자, 그래서 만약에 어, 판단만 하면 되는 라우팅만 하면 되는 영역이 존재한다라고 하면 제를 앞단에 붙이고 그 뒤에는 여러분이 원래 하던 대로 생성 부분만 여러분이 원래 쓰시던 모델에다 맡기면은 비용이랑 시간을 진짜 확실히 줄일 수가 있을 걸로 보입니다.
자, 여러분이라면 어떤 작업의 제을 한번 써 보고 싶으신가요? 댓글로 남겨 주시고 오늘 영상이 좋았다면은 구독과 좋아요 알림 설정에 하이보이까지 눌러 주시면 감사하겠습니다. 쏘지.
AI 자동 생성 콘텐츠
본 콘텐츠는 코드팩토리의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기