ex-OpenAI 연구원이 LLM에서 언어를 삭제하다
요약
ex-OpenAI 연구원 Diogo Almeida의 TypeSafe AI가 개발한 Jev는 기존 LLM의 '언어'를 제거하여, 빠르고 저렴하며 환각이 없는 새로운 유형의 분류기입니다. 이 모델은 TypeScript처럼 강력하게 타입 지정된 질문을 받아 choice, score, null 중 하나로만 응답하는 것이 특징입니다. 이는 느리고 복잡한 추론(시스템 2) 대신 빠르고 직관적인 결정(시스템 1)에 최적화되어 앱 개발자에게 큰 이점을 제공합니다.
핵심 포인트
- Jev는 LLM에서 언어를 제거하여 분류기 성능을 극대화했습니다.
- TypeScript처럼 강력하게 타입 지정된 스키마 매칭이 가능합니다.
- 응답은 choice, score, null 중 하나로만 제한되어 환각(hallucination)이 없습니다.
- 기존 대형 모델 대비 440배 저렴하고 빠르며 실시간 애플리케이션에 적합합니다.
지난주, AI에 관한 모든 것이 영원히 바뀌었습니다. 저는 AI에 관한 모든 것이 거의 매주 바뀐다고 깨닫지만, 이번에는 평소보다 더 크게 AI가 영원히 변했습니다. 왜냐하면 결국 ChatGPT가 된 명령어 수행(instruction-following) 작업의 배후에 있는 OpenAI 연구원 중 한 명이 2년간 은밀한 개발 끝에 다음 거대 프론티어 모델을 출시했기 때문입니다. 말할 수 없고, 코드를 작성할 수 없으며, 대학 에세이를 쓸 수 없고, 당신이 절대적으로 옳다고 결코 말해주지 않는 모델입니다.
그 이름은 Jev입니다. >> 제 이름은 Jev이고요. >> 그리고 이것은 엄청난 일인데, 거대 언어 모델(LLM)에는 치명적인 결함이 하나 있습니다. 바로 닥치지 않는다는 것입니다. Fable이나 Astra 같은 것에 '참 또는 거짓을 반환하라'와 같은 간단한 지침을 주면, 4,000 토큰 동안 생각한 후 세 번째 옵션을 발견하고 신용카드로 11센트를 청구할 것입니다. Jev는 이 문제를 급진적인 해결책으로 고쳤습니다. 거대 언어 모델에서 언어를 삭제했고, 그 결과는 200배 빠르고, 400배 저렴하며, 무료 출력 토큰과 제로 환각(zero hallucinations)을 가진 새로운 유형의 분류기입니다.
너무 좋아서 사실이 아닌 것처럼 들리죠. 그래서 오늘 영상에서는 Jev의 코드, 그 신뢰해라-형제(trust-me-bro) 벤치마크, 그리고 이 모델을 1년 전에 오픈 소스로 만들었다고 말하는 사람에 대해 알아볼 것입니다. 지금은 2026년 9월 21일이고, 여러분은 The Code Report를 보고 있습니다. 거대 AI 양강 구도가 문자 그대로 흔들리고 있는데, Jev는 빠르고 직관적인 결정이 필요한 거의 모든 AI 문제를 해결하는 더 저렴하고 빠른 방법이기 때문입니다. >> 이것은 화물(freight)입니다. >> 하지만 가장 먼저 알아야 할 것은 Jev가 ex-OpenAI 연구원인 Diogo Almeida와 그의 회사 TypeSafe AI에 의해 만들어졌으며, 이 회사는 방금 4천만 달러를 유치했다는 것입니다.
하지만 이 회사의 이름 자체가 Jev가 무엇인지 알려주는 첫 번째 단서입니다. 일반적인 대규모 언어 모델(LLM)처럼, 질문과 구조화되지 않은 텍스트 덩어리 같은 컨텍스트를 전송합니다. 하지만 다른 점은 TypeScript와 같은 타입 안전 프로그래밍 언어처럼 작동한다는 것입니다. 모델에 보내는 질문은 특정 형태를 반환해야 하는 강력하게 타입 지정된(strongly typed) 질문이며, 실제로 세 가지 형태 중 하나인 선택지(choice), 점수(score), 그리고 null(기본적으로 예/아니오)을 반환합니다. 이 모델의 스키마 매칭(schema matching)은 보장되며, 타입 오류가 발생할 수학적 가능성은 없습니다.
사람들은 Jev를 시스템 1 모델이라고 부르는데, 이는 Daniel Kahneman의 저서 『생각에 관한 생각 (Thinking Fast and Slow)』에서 유래한 이름입니다. 시스템 1 모델은 빠르고 직관적인 본능(gut instinct)에서 나오며, 반면 시스템 2 모델은 느리고 신중하여, 변수 하나를 명명하는 데 40,000 토큰을 소모하는 GPT-6이나 Claude Fable 같은 오래된 골동품 추론 모델과 같습니다. 하지만 이 차이는 저처럼 빠르고 저렴한 AI를 애플리케이션에 통합하려는 앱 개발자에게는 엄청난 차이입니다. 예를 들어, 저희 Horse Tinder에서는 최근 서비스 약관상 엄격히 금지된 말들이 앱을 사용하려고 하는 문제가 있었습니다.
Jev 덕분에, 우리는 말이 아닌 계정은 즉시 차단(insta-ban)하는 AI 중재 단계를 구현할 수 있었는데, 이는 '이것이 말인가요?'라는 질문에 null 응답을 반환함으로써 달성되었습니다. 이 모델은 TMBB가 주장하는 것처럼 매우 빠할 뿐만 아니라, 더 중요한 것은 엄청나게 저렴합니다. 대형 브랜드 모델보다 440배나 저렴합니다. 실제로 너무 빠르고 저렴해서 실시간 애플리케이션에도 사용할 수 있습니다. 예를 들어, 개발자들은 이미 비디오 게임에서 NPC(Non-Player Character) 행동을 구현하는 데 이를 사용하고 있습니다.
심지어 이 개발자는 이를 이용해 세계 최초의 실시간 AI 계산기를 만들기도 했습니다. 하지만 출력이 타입 세이프(type safe)하다고 해서 항상 정확하다는 의미는 아닙니다. 게다가 결정론적(deterministic)이지도 않습니다. 예를 들어, 완전히 동일한 질문과 맥락을 보내더라도 일반적인 대규모 언어 모델(LLM)처럼 다른 결과를 얻을 수 있습니다. 하지만 응답의 품질을 파악하기 위해 '보정된 신뢰도 숫자(calibrated confidence number)'라는 것을 반환합니다. 챗 모델들은 인간 독자들을 만족시키도록 훈련되었고, 인간은 자신감(confidence)을 좋아하기 때문에, 우리는 Kanye처럼 잘못되면서도 높은 신뢰도를 가진 모델을 얻게 되었습니다.
Jev는 RLCD(Reinforcement Learning for Calibrated Decisions), 즉 보정된 결정을 위한 강화학습(RL)이라는 기술을 통해 신뢰도를 확보했습니다. 이는 모든 응답이 신뢰도 값을 제공한다는 의미입니다. 예를 들어 60%라는 값은 매번 60%의 확률로 맞다는 뜻입니다. 하지만 큰 질문은 Jev가 실제로 어떻게 작동하는지입니다. 아무도 확실히 알지 못하는데, CEO는 아키텍처를 비밀에 부치고 있으며 어쩌면 나중에 논문을 발표할 수도 있다고 합니다. 하지만 Jev에는 회의론자들도 있습니다. 어떤 사람들은 이것이 과거의 제로샷 분류기(zero-shot classifier)와 다르지 않다고 말하지만, 이 회사는 10년 전에 제로샷 분류기를 구축했던 Jin Yang과 같은 원래 개척자들에게 아무런 공로도 돌리지 않습니다.
게다가 이 개발자는 자신이 1년 전 발표한 논문이 Jev와 정확히 동일한 것이라고 주장합니다. 그리고 또 다른 개발자가 이미 OpenJeb을 만들었는데, 이는 고정된 Qwen-4B 모델의 옵션 확률을 단일 순전파(single forward pass)로 읽어 전체 인터페이스를 재현합니다. 새로운 훈련이 필요하지 않으며 3090에서도 실행할 수 있습니다. 심지어 지금 브라우저에서 실행할 수 있는 웹 GPU 데모까지 있습니다. 개발자에게는 정말 멋진 시기이며, 이것이 오늘 영상의 스폰서인 Mux를 확인해야 하는 이유입니다. 그들의 고도로 사용자 정의 가능한 API는 FFmpeg에 의해 놀라게 당황하는 일 없이 애플리케이션에 비디오 기능을 추가할 수 있는 가장 쉬운 방법임이 분명합니다.
저희는 이 기능을 수년 동안 코스 전반의 호스팅과 스트리밍을 처리하는 데 사용해 왔지만, 단순히 인프라를 넘어 훨씬 더 많은 것을 할 수 있습니다. Mux에 비디오를 업로드하면, 영상 안에 실제로 무엇이 들어있는지에 대한 구조화된 데이터와 함께 자동으로 스크립트(transcripts), 스토리보드(storyboards), 썸네일(thumbnails), 클립들이 제공됩니다. 이것이 바로 Mux robots의 동력이 되는데, 이는 사용자가 모델을 호스팅하거나 파이프라인을 유지할 필요 없이 오디오를 다른 언어로 번역하고, 콘텐츠를 중재하며, 그 외에도 많은 것을 할 수 있는 AI 기반 호스팅 워크플로우입니다. 작업 지시어(directives)를 사용하여 모든 것을 자동화할 수 있습니다. 여기서 한 번 워크플로우를 정의하면 새로운 업로드마다 실행됩니다.
게다가 실제로 실행되는 작업에 대해서만 비용을 지불합니다. Perplexity, Patreon 등 많은 명망 있는 회사들이 Mux를 신뢰하고 있으며, 무료 플랜에는 신용카드 요구 없이 매월 10개의 비디오와 100,000분의 전송 분량이 포함됩니다. 아래 링크에서 추가 $50 크레딧을 받을 수 있습니다. 이것이 The Code Report였습니다. 시청해 주셔서 감사드리며 다음 영상에서 뵙겠습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube Fireship (개발 트렌드)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기