200배 빠른데 400배 싸다, AI 업계 지각 변동, LLM 아닌 새로운 AI 등장 Jev… 단어 생성이 아니라 확률이 바꾸는 AI 생산성
요약
본 기사는 LLM(대규모 언어 모델)의 한계를 넘어, 프로그램이 즉시 활용할 수 있는 판단을 내리는 새로운 AI 모델 'Jev'를 소개합니다. Jev는 글쓰기 평가, SNS 필터링 등 다양한 소프트웨어 기능에 통합되어 실시간으로 작동하며, 기존 방식 대비 속도와 비용 효율성을 획기적으로 개선하여 사용자 경험을 혁신하는 데 초점을 맞추고 있습니다.
핵심 포인트
- Jev 모델은 장문 답변 대신 프로그램이 바로 쓸 수 있는 판단(Decision)을 제공합니다.
- 실시간성이 중요해지는 소프트웨어 기능에 AI를 통합할 때 지연 시간을 획기적으로 줄입니다.
- 기존 LLM 방식의 느린 응답 속도와 높은 호출 비용 문제를 해결하는 데 중점을 둡니다.
Video: 200배 빠른데 400배 싸다, AI 업계 지각 변동, LLM 아닌 새로운 AI 등장 Jev… 단어 생성이 아니라 확률이 바꾸는 AI 생산성
Channel: 안될공학 - IT 테크 신기술
Duration: 11m 28s
Source: subtitle (auto, ko)
Transcript:
네, 여러분 안녕하세요. 패치입니다. 여러분, 여러분, 지금이 화면 좀 한번 보세요. AI가 장애물을 피하면서 달리기 게임을 하고 있거든요. 아, 여기까지는 보셨을 수 있죠. 그런데 이거 화면을 이렇게 넓혀 보면 게임이 하나가 아닙니다. 개발자가 공개한이 데모에서 지금 무려 50개 게임이 동시에 돌아가고 있어요. 자, 이번에는 글을 써 보는데요. 글을 다 쓴 다음에 평가해 달라고 하는게 아니에요. 이거는 쓰고 있는 도중에 지금이 문장이 얼마나 감정적인지 아니면 논쟁을 부를지 또는 어떤 어조인지 평가가 바뀝니다.이 화면에는 지금 16개 질문 약 0.56초라고 56초라고 찍혀 있어요. 그리고 이번에는 SNS입니다. 내가 보고 싶지 않은 글의 조건을 말로 이렇게 정해 놓잖아요. 그러면 스크롤 하는 동안에 해당 게시물이 이렇게 접힙니다. 게임을 움직이고 글을 평가하고 내 피드를 걸러내고 서로 다른이 데모 안에 같은 AI 모델이 들어간 건데요. 이름은 요즘 핫한 제입니다. 그런데이 모델이 우리한테 길게 답변을 써 주는 모델이 아니에요.
얘는 사람이랑 대화를 하는 대신에 프로그램이 바로바로 쓸 수 있는 판단을 내놓습니다. 오늘 볼 변화는 이건데요. AI가 한 번에 얼마나 대단한 답을 하느냐 이거를 넘어 가지고 우리 주변의 소프트웨어가 얼마나 자주 AI의 판단을 쓸 수 있게 되느냐 요거를 같이 한번 봐 보도록 하겠습니다. AI한테 내가 보고서 하나를 부탁을 했는데 몇 초 정도 기다려야 된다. 아 그건 뭐 괜찮죠. 그런데 게임에서 장애물이 나타날 때마다 몇 초를 기다린다. 그럼 그 사이에 벌써 부딪히거나 죽어 버리겠죠. 글을 한 문장 한 문장 고칠 때마다 기다리고 피드에 글 하나를 읽을 때마다 기다리고 웹페이지에서 버튼 하나를 누를 때마다 기다린다면요. 똑똑한 AI를 고쳐도 쓰는 사람 입장에서는 이게 굉장히 답답한 프로그램이 될 수 있겠죠.이 이 차이를 아주 구체적으로 보여준 개발자가 있는데요. 플레이어가 하고 싶은 행동을 자유롭게 입력을 하는 텍스트 MLO RPG를 만들고 있습니다. AI가 그 문장을 캐릭터 상황에 맞춰 가지고 해석을 하고요.
게임 서버가 실행을 할 수 있는 행동으로 바꾸는 방식인데요.이 개발자가 공개한 수치를 보면 기존 구성에서는 행동 해석의 중앙값이 6.52초가 걸렸는데요. 제부에서는 0.317초였다고 합니다. 사용자가 한번 움직일 때마다 6초 넘게 기다려야 되는 게임이라 0.3초만에 3초 만에 행동을 해석을 하는 게임. 그러면은 와 이거는 사용감이 달라질 수밖에 없겠죠. 제가 지금이 사례에서 중요하게 보는 건 이게 20배쯤 빨라졌다 이런 숫자보다는 얼마나 자유로운 행동을 받아 줄 수 있느냐가이 속도랑 비용에 묶여 있었다라는 점인데요. 어 물론 기존 게임 AI나 블류 모델 같은 걸로 빠른 판단을 못 했다는 뜻은 아니거든요. 근데 여기에서 관심을 끄는 건 사람 말로 정한 여러 종류의 판단을 하나의 모델한테 맡기면서도 자주 호출을 할 수 있겠다라는 가능성이에요. 개발자들이 만들고 싶었던 기능 중에는 뭐 아이디어가 없어서가 아니라 매번 AI한테 하나하나 물어보기는 조금 부담스러워서 못 붙였던 기능도 있을 거거든요. 제브는 타이프세이프 AI가 2026년 9월 15일에 공개한 모델인데요.
공동 창업자의자 CEO인 디오그 알메이는 오픈 AI에서 인스트럭트 GPT 연구에 참여를 했던 사람이에요. 사람들이 지시한 일을 언어 모델이 더 잘 따르도록 만드는 연구였고요. 그게 체제트로 이어진 아주 중요한 흐름이었죠. 메타의 AI 연구 조직 출신인 사샤형. 그리고 AI 시스템을 만들어 온 에릭 게프니도 공동 창업자인데요.이 팀이 잡은 방향이 아주 흥미롭습니다. 사람이 읽기 좋은 답을 해 주는 AI에서 소프트웨어가 바로 받아서 움직일 수 있는 그런 AI로 중심을 좀 옮겨 보자는 거예요. 회사는 이런 모델을 시스템 모델이라고 부릅니다. 뭐 빠르고 직관적인 판단을 가르키는 이름인데요. 그렇다면 실제 기술은 뭐가 다를까요? 공개된 내용을 기준으로 이걸 좀 세 부분으로 나눠 보겠습니다. 첫 번째는 일단 출력하는 거 자체가 달라요. SNS 필터를 만든다고 해 볼게요. 프로그램이 필요한 건네 뭐이 글에는 정치적 내용이 포함될 거 어쩌고 저쩌고 하는 이런 긴 해설문이 아니고요. 이거를 그대로 보여 줄까 접을까 판단을 보류할까 이렇게 빠르게 선택을 하는게 필요하죠.
재브는 답변을 더 빨리 쓰는 모델이 아니고요. 얘는 아예 답변 문장을 생성화를 하질 않아요. 대신에 개발자가 질문이랑 가능한 답의 형태를 미리 정해 둡니다. 자, 제가 직접 댓글을 넣어 볼게요. 와, 설명 참 쉽네요. 문가인 저도 한 번에 이해했어요. 이렇게 써 볼게요. 스테이트에는 판단할 자료를 넣고 question에는 무엇을 판단을 할지 정합니다. 저는 과연이 사람이 설명을 이해했다고 말하고 있는가? 이거를 한번 물어볼게요. 자, 여기 보시면이 말이 지금 참이라고 보는 확률이 바로 나옵니다.이 댓글을 분석해 보면 어쩌고 저쩌고 이렇게 하면서 설명을 길게 쓰는 과정이 없이 그냥 우리가 물어본 판단의 값을 바로 반환하는 거예요. 자, 그러면 이번에는 댓글을 바꿔 볼게요. 여러분이 자주 달아 주시는 아, 완벽히 이해했어. 가로 열고 이해 못 했음. 자, 그러면 이번에는 이걸 어떻게 판단했는지 한번 볼까요? 훨씬 더 낮은 수치가 나온 걸 확인할 수가 있죠. 중요한 건 프로그램도이 설명을 읽고 기다릴 필요가 없다는 거예요.
반환된 값을 받아 가지고 아, 이거를 이해하기 어려웠다는 반응으로 분류를 할까? 그런 다음 처리를 할 수 있죠. 이런 짧은 판단을 자주 써야 하는 곳에서는 결과를 얼마나 빨리 받느냐가 사용감 자체를 바꿀 수가 있습니다. 방금처럼 어떤 조건이 참일 확률을 받는게 너인데요.이 밖에도 정해진 선택지 중에 고르는 초이스 그리고 순서가 있는 척도로 평가하는 스코어가 있어요. 물론 기존 언어 모델도 정해진 제일슨 형식으로 답하게 할 수도 있고요. 선택지 중에 하나를 고르게 만들 수도 있습니다. 그런데 제브가 내세우는 차이는 그냥 형식을 맞춰 준다 해서 끝나지가 않아요. 이런 판단이랑 확률 출력을 중심으로 모델을 학습시키고 실행 방식도 그 목적에 맞췄다는게 회사의 설명입니다. 어, 제 관점에서는 프로그램 안에다가 이렇게 말로 기준을 정하는 그런 뭐 일종의 판단 함수 이런 거를 넣는 모습에 좀 가까운 거 같아요.이 단어가 있으면 차단 뭐 이런 규칙에서 한 발 더 들어가서이 글은 과연 내가 정한 종류의 논쟁인가?
이거를 묻는 거죠. 자, 그리고 두 번째는 답을 꺼내는 방식인데요. 일반적인 자기 회계형 언어 모델은 앞에서 만든 토큰을 이어 가지고 다음 토큰을 생성하게 되거든요. 답이 긴 글이든 짧은 제이슨이든 기본적으로는 순서대로 출력을 하는 거예요. 제브는 질문마다 정해진 형태의 판단을 바로바로 산출하도록 설계가 됐다는게 회사의 설명입니다. 같은 입력을 보고서 서로의 답을 기다릴 필요가 없는 질문들은 함께 동시에 평가를 할 수가 있는 거죠. 자, 방금 제가 해본게 댓글 하나에다가 질문 하나를 던지는 거였죠. 그런데 만약에 같은 글에서 제가 확인하고 싶은게 여러 개라면요. 오프닝에 글 쓰기 데모를 다시 한번 봐 볼게요. 이게 감정적인지 논쟁적인지 뭐 얼마나 격식을 갖췄는지 같은 글에 대한 이런 질문들을 한 요청에 다 넣을 수가 있는 거예요. 어 물론 기존 언어 모델들도 여러 질문을 한 번에 받을 수는 있거든요. 근데 제가 내세우는 거는 질문을 묶는 데서 나아가 가지고이 답을 산출하는 과정도 병렬로 처리를 한다는 그런 차이입니다.
이게 유용한 이유는요. 프로그램이 어떤 행동 하나를 결정할 때 확인할 조건이 생각보다 많기 때문이에요. 음. 예를 들어서 고객의를 처리를 한다면 이게 환불 요청인지 아니면 고객이 단순히 그냥 좀 화가 나 있는지 아니면 뭐 추가 확인이 더 필요한지 이런 질문들을 함께 평가를 하고요. 실제 처리는 코드가 정할 수가 있겠죠. 근데 다만 어떤 버튼을 누른지 새로 뜬 화면은 눌러보기 전에는 알 수가 없잖아요. 이렇게 새 정보가 필요한 다음 단계까지 한 번에 끝나는 거는 아니에요. 같은 상황에서 함께 물어볼 수 있는 그런 판단들을 묶는 거.이 이 지점에서 재부는 왕복이랑 순차 대기를 줄이는 겁니다. 자, 그리고 세 번째는 판단이랑 함께 불확실성을 다룬다는 점인데요. 회사는 RLCD라는 학습 방법으로 예측한 확률이 실제랑 잘 맞도록 학습을 시킨다고 설명을 해요. 80%라고 예측한 사례들을 모았을 때 실제로도 그 정도 비율로 맞아 떨어지는가? 이런 문제인 거죠. 예를 들어서 어느 팀에 문의를 보낼지 판단을 하는데 한쪽 확률이 91%일 때랑 52%일 때 뭐 이거를 똑같이 처리할 필요는 없겠죠.
애매하면 정보를 더 모으거나 다른 모델 사람한테 확인을 하도록 만들 수가 있습니다. 의미를 판단하는 건 모델이고요. 어느 수준에서 자동 처리를 할지 정하는 거는 코드예요. 그렇지만 그 확률이 이제 실제 업무에서도 믿을 만할지는 검증을 해 봐야겠죠. 자, 그러면 이렇게 생각을 할 거 같은데요. 어, 트랜스포머를 벗어난 새로운 AI가 나온 걸까요? 근데 현재 공개된 내용만으로는 그렇게 말하긴 좀 어렵습니다. 트랜스포머는 신경만 구조이고요. 자기 회기는 앞선 출력에 이어가지고 그다음 출력을 만드는 방식인데요. 물론 트랜스포머로 분류 모델을 만들 수도 있어요. 타입세이프는 지금 새 아키텍처랑 샘플러를 만들었다고 설명을 하지만 세부 설계는 추가 공개가 좀 더 필요한데요. 어 저희가 지금 확인을 할 수 있는 건 문장을 이어 쓰는 것보다 판단이랑 확률을 빠르게 내놓는데 집중을 했다라는 이런 차이인 거죠. 그러면 이제 피드에는 아까 글 쓰기 데모를 한번 확장을 해 보면 내가 고객한테 답장을 쓰는 도중에이 약속 정말 지킬 수 있나요라고 이렇게 한번 짚어 주는 그런 편집기를 생각해 볼 수 있겠죠.
그리고 뭐 피드에는 홍보 글은 줄이고 실제 사용 경험은 남겨 줘라고 이런 식으로 내 기준을 좀 정해 놓을 수도 있을 것 같고요. 이게 이런 방향으로 발전을 하게 되면 AI를 쓰려고 작업을 딱 멈추고 또 따로 질문할 필요가 줄어드는 거예요. 그냥 내가 작업하는 순간에 판단이 바로 붙는 거죠. 그리고 큰 AI랑 빠른 AI가 일을 나누는 모습도 나오는데요. 브라우저에서는 이렇게 쓰입니다. 출발지랑 목적지를 입력을 하고요. 항공편 검색 결과를 띄우는데이 공개된이 실행은 약 한 7초가 걸렸어요. 검색 결과까지 나온 장면이거든요. 여기서 재밌는 건 브라우저 조작을 일종의 객관식 문제로 바꿨다는 거예요. 프로그램이 페이지에 버튼이랑 입력창을 읽어 가지고 번호를 붙이고요. 그러면 제브는 이제 어떤 동작을 할까? 몇 번을 누를까? 이거를 고르는 거예요. 입력할 문장이 필요할 때만 별도의 작은 생성 모델을 부르고요. 브라우저 유저 팀은이 구성을 오픈 소스로 공개를 했는데요. 이게 우리가 모든 클릭에 긴 출론이 필요한 건 아니거든요.
그러면 이제 빠르게 고르기만 하면 되는 일이랑 새로 만들어야 하는 일 이거를 나눠서 바뀌는 거죠. 모델한테이를 어떤 형태로 맡기느냐 이것도 속도를 자하는 겁니다. 컴퓨터 조작 도구인 쿠아도 실행 가능한 행동 후보를 만들고요. 제브가 고른 답을 검증을 해서 실행하는 구성을 공개를 했습니다. 자, 그렇게 되면 이제 다음 과제도 보이죠? 판단이 빨라져도 화면을 읽고 실제로 실행하고 잘못된 결과를 알아채는 그런 과정이 남는데요. 그래서 앞으로는 빠른 모델을 어디에다 붙일지 그리고 실패를 하면 어떻게 복구를 할지 설계하는 그런 기술들도 중요해질 수 있겠죠. 물론 빨리 고른 답이 항상 옳은 건 아니에요. 회사가 말하는 형식 보장은 어 정해진 선택지 안에서 답을 한다는 뜻이지 그렇다고 이게 항상 정답을 고른다는 뜻은 아니거든요. 잘 맞는 건 가능한 답이 정해져 있고 또 문맥을 읽으면 빠르게 판단할 수 있는 일이죠. 새롭게 글을 쓰는 일은 생성 모델한테 맡기고 정확한 계산은 코드한테 맡기고요. 앞선 결과를 알아야지 다음 판단을 할 수 있는 일은 순서대로 처리를 해야 됩니다.
지금 나와 있는 가격은 현재 입력만 토큰당 0.042 사이 달러인데요. 어, 다만 이게 화면 인식이라든가 다른 모델 비용까지 포함을 해 가지고 필요한 정확도를 유지를 하면서 전체 작업이 얼마나 빨라지고 저렴해지는지 이것까지 좀 봐야 될 거 같아요. 저는 일단 이번 데모에서 아무도 AI의 답변을 읽고 있지는 않은데 프로그램은 계속 움직이는 장면 이게 가장 흥미로웠던 거 같습니다. 글을 보여 줄지 아니면 버튼을 누를지 아니면 조금 더 기다려 볼지 이런 어떻게 보면 하찮게 보이는 판단들을 빠르고 저렴하게 쓸 수 있다면 AI는 우리가 쓰는 앱들에 훨씬 많은 순간순간들에 들어갈 수 있겠죠. 여러분 AI를 더 자주 사용할 수 있게 된다면 여러분은 어떤 프로그램을 만들고 싶으신가요? 저도 한번 고민해 봐야겠네요.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube 안될공학 (IT/테크)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기