Jev가 AI 틈새 기술? 구글이 바로 반응합니다… 빠른 응답에 돈을 내는 이유 | 세레브라스, Groq도 절대 안되는 기술이라 했죠
요약
본 기사는 주어진 선택지의 가능성을 숫자로 바로 돌려주는 제브(Jev) 모델을 소개하며, 이 기술의 활용성과 한계에 대해 논합니다. 특히 빠른 응답 속도가 중요한 자동 매매 프로그램 등에서 그 가치를 보여주지만, 기존 LLM과의 차이점과 추론 능력의 약점도 지적됩니다.
핵심 포인트
- 제브는 선택지별 가능성을 숫자로 바로 출력하여 빠른 판단에 유리함.
- 빠른 응답 속도는 금융 자동 매매 프로그램 등에서 핵심 기능으로 작용함.
- 기존 LLM은 토큰을 순차적으로 생성하는 반면, 제브는 확률 예측 방식을 사용함.
- 제브는 정확한 계산이나 다단계 추론에는 여전히 약점을 가질 수 있음.
Video: Jev가 AI 틈새 기술? 구글이 바로 반응합니다… 빠른 응답에 돈을 내는 이유 | 세레브라스, Groq도 절대 안되는 기술이라 했죠
Channel: 안될공학 - IT 테크 신기술
Duration: 10m 33s
Source: subtitle (auto, ko)
Transcript:
네, 여러분 안녕하세요. 패치입니다. 여러분, 요즘 제가 진짜 핫하죠? 지난번 올려드린 안들공학 영상에도 많은 분들이 관심을 보여 주셨는데요. 질문에 긴 문장으로 답하는 대신에 주어진 선택지가 맞을 가능성을 숫자로 바로 돌려주는 모델인 제. 이거를 프로그램에 붙여보는 개발자들이 나오면서 어디까지 쓸 수 있는지를 놓고 논쟁도 벌어지고 있습니다. 댓글을 보니 여러분도 이거를 주식이나 코인에 응용할 수 있지 않을까라고 많은 분들이 궁금해하셨던 거 같은데요. 네. 실제로 그런 프로그램도 나왔습니다. 약 0.3초마다 3초마다 사고 팔지를 판단하도록 만든 자동 매매 프로그램인데요. 개발자 제러드 워치의 제브 트레이더입니다. 모나드라는 블록체인에서 암호화폐를 거래를 하는 실험용 프로그램이에요. 공개 코드에 재부를 연결하는 기능이랑 모의 거래 모드가 들어 있습니다. 여기에서 눈에 들어온 건 답이 늦었을 때의 처리인데요. 그 차례에는 그냥 주문을 건너 띄워 버립니다. AI가 답을내는 사이에 가격이 움직여 버리면 조금 전 상황을 보고 내린 판단은 이미 늦을 수 있거든요.
이런 프로그램에는 답을 언제 받느냐가 이미 기능의 일부입니다. 그런데 재부를 놓고는 야, 저 정도는 작은 언어 모델도 한다. 추론을 잘 못 하는데 빠르기만 하면 무슨 소용이냐 이런 비판도 나오고 있죠. 소프트웨어 엔지니어 괴덱는 분석 글에서 빠른 구조와 출력은 이미 가능하다고 생각한다는 점을 제부에 대한 가장 큰 문제로 꼽았습니다. 컴퓨터가 바로 쓸 짧은 답은 기존 모델로도 빨리 받을 수 있다는 뜻인데요. 어 비교할 때 기존 LLM에는 긴 형식으로 답하게 한 것도 지적을 했어요. 본인이 작은 QN 모델을 테스트했을 때도 답의 앞부분을 미리 채워 주니까 같은 모델의 응답이 두 세 배 정도 빨라졌다고 적었죠. 연구자 난다 키르 M은 자신이 2025년에 공개한 연구를 들면서 문장을 계속 생성하지 않고 확률을 예측하는 접근은 이전에도 있었다고 주장을 했습니다. 영업 대화가 구매로 이어질 가능성을 예측을 하는 연구였는데요. 음. 현재 제부가 정확한 계산이라든가 여러 단계를 거치는 그런 출론에 약하다는 점은 개발사도 이미 공개를 했어요.
지금 제품의 능력이랑 비교 방식에 대한 비판은 충분히 따져 볼 만 합니다. 자, 그럼 작은 언어 모델이랑 재부는 과연 어디서 차이가 날까요? 우선 작은 모델을 평소 채팅하듯이 쓰는 경우부터 한번 볼게요. 자,이 고객이 환부를 원합니까라고 물어보면 작은 모델은 네, 환부를 요청하고 있습니다라고 이렇게 답을 하겠죠. 근데 제는 환불 요청의 가능성을 그냥 숫자로 돌려 주는 거고요.이 차이를 눈으로 보면 더 쉽게 이해되겠죠? 제가 구글 플로우로 두 출력 방식을 설명을 하는 영상을 한번 만들어 봤어요. 그런데 이게 실제 모델의 속도를 비교하는 실험이 아니라요. 작동 방식의 차이를 보여주는 그런 그림이라고 생각을 하시면 됩니다. 프롬프트에는 이렇게 넣었어요. 기존 lm이 토큰을 하나씩 하나씩 생성을 해서 답하는 방식이랑 제브가 선택제 확률을 바로 내놓는 방식의 차이를 보여주는 그런 영상을 만들어 줘. 자, 영상이 이렇게 나왔는데요. 왼쪽은 앞에 조각 다음에 또 하나가 붙고 또 하나가 붙고 이렇게 토토토 붙죠. 언어 모델이 문장을 잘게 나눈 조각, 그러니까 토큰을 차례차례대로 만드는 모습을 표현을 한 거고요.
하나를 만든 뒤에 그 결과를 보고 다음 것을 만들고 있습니다. 어, 소프트웨어의 기능만 보면 아, 작은 모델도 똑같이 판단을 하네라고 할 수 있죠. 그런데 하드웨어가 처리를 하는 과정을 보면 이렇게 문장으로 답하는 동안에는 토큰을 하나씩 만드는 계산이 이어집니다. 모델을 작게 만들면 각 단계는 가벼워질 수 있는데 그래도 어쨌든 다음 토큰이 앞에 결과를 기다리는 순서는 남는 거죠. 우리가 GPU를 더 붙인다고 해서이 순서가 저절로 사라지진 않습니다. 그리고 오른쪽은 질문에 대한 판단값이 바로 이렇게 빠 형태로 표시가 되는데요. 개발사 설명에 따르면 제브는 처음부터 이런 판단이랑 확률을 내놓도록 학습을 했습니다. 그러니까 환불 요청일 가능성을 숫자로 받아서 프로그램이 그냥 바로 그걸 사용해서 쓰는 식이죠. lm도 확률을 계산을 합니다. 보통은 다음에 쓸 토큰의 확률을 계산을 하고 제브는 정해 준 선택지의 확률을 돌려 주는데 집중을 하는 거죠. 같은 문의에서 환불 요청인지 결제 오류인지 뭐 급한 상황인지 이거를 다 한꺼번에 묻는 경우도 있겠죠.
제브는 이런 질문을 병렬로 평가하도록 설계가 됐다고 설명을 하는데요. 그러니까 답을 하나씩 하나씩 글로 완성을 하는 그런 부담을 줄이는 거죠. 물론 기존 모델도 답을 길게 쓰지 않도록 바꿀 수는 있습니다. 선택제 하나만 출력을 하게 하거나 아니면 계산한 선택제 점수를 바로 꺼내서 쓰는 방법이 있죠. 작은 분류 모델도 확률을 바로 내놓을 수 있고요. 그래서 속도를 비교를 하려면 이렇게 최적화한 모델도 함께 넣어야 합니다. 괴득해도 판단 출력에 맞춰서 학습을 하고 최적하는 데는 장점이 있을 수 있다고 봤어요. 작은 모델도 된다라는 이런 말 다음에는 같은 정확도로 답을 할 때 어느 쪽이 덜 기다리고 덜 쓰는지를 물어야겠죠. 발전할 여지도 바로 여기에 있습니다. 같은 시간 안에 문맥을 더 잘 읽고요. 내놓는 확률도 더 믿을 만하게 만드는 거죠. 가령 90%라고 판단한 사례를 모았을 때 실제 결과도 그 정도로 맞게 된다면 개발자는 어디까지를 자동 처리할지 정하기가 쉬워지겠죠. 개발사인 타입세이프도 이런 확률을 학습 목표로 삼았다고 설명을 합니다.
근데 작은 모델도 자주 쓰면 비용이 들겠죠. 입력을 읽고 계산을 하는 데는 장비와 시간이 드니까요. 한번 물어볼 때는 그 차이가 작아 보여도 수많은 사용자의 동작마다 AI를 부르면 그 비용이 쌓이게 돼요. 그래서 같은 판단을 더 싸고 빨리 끝낼 수 있다면 비용이나 기다림 때문에 뭐 굳이 넣지 않고 요건 아쉽지만 좀 패스하자 이렇게 빼놨던 기능도 서비스에 넣을 수 있겠죠. 재부처럼 기존에는 느리거나 비싸서 엄두를 못 냈던 그런 일들을 가능하게 하려는 기술이 나오게 되면 보통 평가가 갈리게 됩니다. 한쪽에서는 이거 되게 혁명적이라고 하고요. 다른 쪽에서는 이거는 사용처가 너무 좁은 틈새 기술이라고 봅니다. 그런데 지금 있는 서비스만 놓고 보면 안 되죠. 어, 왜냐하면 그 기술 덕분에 새로 생길 사용처는 지금 계산에서 빠져 있잖아요. 안델 공학에서 예전에 세레브라스랑 그록을 처음 다룰 때도 비슷했던 거 같아요. 국내 유튜브에서 많이 다루기 이전부터 에러 님께서 벌써이 반도체들의 기술 원리를 자세히 소개를 하셨는데요.
당시에도 이게 빠르고 좋긴 하지만 쓸 것이 좀 제한적이고 그런 구조로는 사업이 되게 어렵다라는 이런 반응들이 많았습니다. 그런데 2026년 5월 세레브레스는 나스닥에 상장을 했죠. 그록의 기술은 엔비디아가 공개한 베라루빈 플랫폼에 그록 3 FPX라는 추론 가속 장비로 들어갔습니다. GPU랑 그록의 연산 장치가 함께 모델의 답을 계산을 하는 그런 구성이에요. GPU를 쓰는 시스템에도 그록에 빠른 응답을 더할 자리가 생긴 겁니다. 얘네들의 강점은 하드웨어 구조에서 나왔어요. 연산 장치가 빨라도 계산할 데이터를 못 가져오면 기다려야 하잖아요. 그래서 계산하는 곳 가까이에 빠른 메모리를 많이 배치를 한 거고요. 세드브라스는 커다란 실리콘판 하나의 연산 장치랑 메모리를 촘촘하게 연결을 했습니다. 그록은 치안에 넣는 빠른 메모리 S램을 적극적으로 썼고요.이 메모리는 같은 용량을 담아도 디램보다 측면적을 많이 차지하죠. 비용이 들고 큰 모델을 담으려면 여러 칩을 연결을 해야 하고요. 그래서 당시 비용을 지적한 데는 이유가 있었습니다.데 사업성을 따지려면 그 속도에 돈을 낼 고객도 봐야 하죠.
대화 도중에 즉시 반응해야 하는 AI. 그리고 뭐 도구를 여러 번 써야지 일을 끝내는 AI에서는 매번 기다리는 시간이 쌓일 수밖에 없거든요. 이런 응용이 넣수록 빠른 응답의 가버치도 커지게 됩니다. 세레브라스랑 그록은 토큰 하나하나를 더 빨리 계산하도록 하드웨어를 바꿨어요. 그리고 [목을 가다듬음] 제는 짧은 판단을 할 때 토큰을 줄줄이 만드는 그런 부담을 줄이려는 쪽이죠. 각각 다른 방법으로 프로그램이 기다려야 하는 시간을 줄이는 겁니다. 자, 그럼 이렇게 빠른 판단들은 다른 모델로도 번질 수 있지 않을까요? 이미 다른 모델로 비슷한 판단을 구현을 하는 시도가 나오고 있습니다. 개발자 마스트라츠가 구글의 공개 모델인 디퓨전 잼마를 재부처럼 쓰도록 바꿨고요. 그리고 구글 공식 계정이 이거를 소개를 했어요. 디퓨전 잼마는 글의 여러 자리를 함께 채워가는 그런 확산 모델인데요.이 성질을 이용을 해 가지고 답을 넣을 칸들을 함께 평가를 하고요. 선택지의 확률을 잃도록 한 거죠. 원래 가지고 있던 그 이미지 인식 기능도 활용을 해 가지고 사진을 보고 판단할 수 있습니다.
이런 판단은 큰 AI랑 함께 쓸 수도 있는데요. 랭체인은 재부로 요청을 살펴서 어떤 모델에 보낼지 고르는 그런 기능을 공개를 했습니다. 간단한 일은 가벼운 모델로 그리고 어려운 일은 큰 모델로 보내는 거죠. 앞으로 오픈 AI라든가 구글 앤트로픽 같은 회사가 재브를 만든 타입세이프를 인수를 하거나 뭐 판단에 택화된 모델을 직접 개발하는 시나리오도 생각을 해 볼 수 있을 것 같아요. 이런 경쟁이 붙게 되면 지금의 속도랑 정확도에서 훨씬 더 발전할 여지가 있습니다. 개발자도 사진을 넣을지 자기 컴퓨터에서 실행을 할지까지 이런 것들도 다 필요에 맞춰서 고를 수 있게 되고요. 그 판단을 어디에 연결시키느냐에 따라서 앱의 모습도 달라지게 됩니다. 개발자들이 공개한 FAQ 실험에서는 lm이 답변을 만들고요. 제브가 그때 필요한 화면 구성 요소를 고릅니다. 사용자가 뭘 물어봤느냐에 따라 가지고 답과 함께 보여줄 화면도 달라지는 거죠. 준비된 3D 소품을 골라서 공간을 구성을 하는 실험도 나왔는데요. 어떤 소품을 어디에 놓고 조명은 또 어떻게 비출지 이런 걸 정하는 방식입니다.
제브가 고르는 건 정해진 선택지이긴 하지만 그 조합으로 만들 수 있는 공간이 이제 다양해지는 거죠. 자, 그럼 여기에다가 이제 실제 제품 목록을 연결하면 어떻게 될까요? 쇼핑몰은 고객이 찾는 제품에 맞춰서 화면을 구성을 하고요. 가구 회사는 고객의 요구에 맞춰서 방을 꾸며 주는 그런 서비스로 발전시킬 수 있겠죠. 같은 판단 기능을 가져다 써도 개발자가 어떤 데이터랑 어떤 기능을 연결하느냐에 따라서 완전히 다른 사업이 나올 수도 있는 거예요. 이런 점에서는 저는 좀 아이폰이랑 앱스토어가 떠오르는데요. 2008년 앱스토어는 500개 앱으로 출발을 했거든요. 근데 애플이 외부 개발자에게 아이폰의 기능을 활용을 하고 앱을 배포할 길을 열어 주니까 개발자들은 카메라 기능이랑 위치 정보를 저마다 다른 서비스에 연결을 했고요. 그러니까 사진을 공유하는 방식부터 차를 부르는 방식까지 다 달라졌죠. 빠른 판단도 누구나 쉽게 가져다 쓸 수 있게 된다면 작은 회사가 자체 AI 모델을 만들지 않고도 이런 서비스를 충분히 시도할 수 있습니다.
모델 회사가 모든 사용자를 생각해 낼 필요도 없고요. 왜냐면 각 분야의 문제를 아는 개발자들이 자기 고객에게 필요한 기능들을 만들 테니까요. 안델 공학에서 다뤘던 딥크라든가 터보컨트 때에도 재본스의 역설이 거론이 됐죠. 한 번에 드는 비용이 내려가면서 사용처가 늘고 전체 컴퓨팅 수요는 오히려 커질 수가 있다는 이야기입니다. 저는 제부의 다음 성과를 이걸로 만든 앱에서 보고 싶어요. 응답 시간이랑 비용 때문에 그동안 사업이 되기 어려웠던 기능들이 사람들이 매일 쓰는 서비스로 과연 자리 잡을 수 있는지 그런 거 말이죠. 그런 서비스가 늘어난다면 지금의 몇 가지 판단 기능만 보고 우리가 예상한 거보다 시장은 훨씬 커질 수 있을 것 같습니다. 그럼 오늘은 여기까지 패치였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube 안될공학 (IT/테크)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기