Jev 덕분에 구조화된 출력이 다시 흥미로워졌다
요약
본 기사는 AI가 긴 답변 대신 프로그램의 의사결정 지점에서 빠르고 저렴한 판단을 제공하는 새로운 응용 방식을 제시합니다. Jev와 같은 모델은 자연어 입력과 선택지를 받아 여러 질문에 대한 답을 병렬 처리하며, 실시간 게임 플레이 등 비챗봇 응용 분야에서 강점을 보입니다. 이는 빠른 구조화된 출력이 AI 제품 개발의 새로운 기반이 될 수 있음을 시사합니다.
핵심 포인트
- AI를 의사결정 지점에 배치하여 빠르고 저렴한 판단을 제공하는 것이 핵심입니다.
- Jev는 병렬 처리를 통해 실시간 게임 플레이 등 비챗봇 응용에 최적화되어 있습니다.
- 빠른 구조화된 출력은 기존 챗봇 형태를 넘어 새로운 연산 단위가 될 잠재력이 높습니다.
- AI가 긴 답변 대신
프로그램의 의사결정 지점마다 빠르고 저렴한 판단을 제공하면, 정교한 챗봇을 넘어 새로운 종류의 응용을 만들 수 있음 - Jev는 자연어 입력과 선택지를 받아
여러 질문의 답을 한 번에 병렬 처리하며, 텍스트로 전달한 게임 상태를 바탕으로 Doom을 실시간 플레이할 만큼 빠르게 동작함 - 기존 LLM도 응답 앞부분을 미리 채우고
선택지를 단일 토큰으로 출력하게 하면 비슷한 특성을 구현할 수 있으며, Qwen 소형 모델 실험에서는 일반 구조화된 출력보다 2~3배 빨랐음 - Jev의 차별성이 모델 자체와 실행 방식 중 어디에서 나오는지는 불분명하지만,
구조화된 출력에 집중한 학습과 최적화는 의미 있는 강점이 될 수 있음 - 선택지를 제한해도 오답은 가능하고 긴 추론에는 불리하지만,
빠른 판단에 특화된 모델들이 경쟁하는 방향은 AI 제품을 만드는 새로운 기반이 될 수 있음
구조화된 출력만 만드는 Jev
-
Jev는
“System One” 모델로, 일반 LLM의 구조화된 출력과 완전히 다른 방식은 아니지만 구조화된 출력만을 위한 인터페이스를 사용함 -
이름은 Daniel Kahneman의 『Thinking, Fast and Slow』에서 빠른
System One과 느리고 숙고하는 System Two로 인간 인지를 나눈 구분에서 유래함 -
해당 책의 일부 내용에는 재현성 문제가 있음
-
일반 LLM은 자연어 입력을 받아 토큰을 하나씩 생성하는
자기회귀 방식으로 자연어를 출력함 -
컴퓨터가 할 수 있는 작업을 폭넓게 처리할 수 있지만, 토큰마다 새 생성 연산이 필요해 느림
-
학습 대상인 자연어의 범위가 넓어 출력에 중국 도박 광고가 등장하는 사례처럼 이상한 동작도 발생할 수 있음
-
Jev는 “하늘은 무슨 색인가?”라는 상태와
["blue", "red", "yellow"]
같은 선택지를 입력받아 { answer: "blue" }
처럼 답함
- 빠른 추론으로 사용 방식 자체를 바꾸려는 접근에는 Thinking Machines의 “interaction models”도 있음
낮고 일관된 지연 시간이 여는 활용
- Jev의 응답 시간은 가장 빠를 때 약
70ms, 가장 느릴 때 500ms로, 일반 LLM의 수 초 단위 응답보다 빠름 - 일반 LLM은 구조화된 출력에서도
{
, 공백, answer
, :
등을 연속된 순전파로 생성함
- Jev는 자기회귀 생성 대신
한 번의 순전파로 여러 질문의 답을 병렬 생성함
Doom 실시간 플레이에서는 현재 게임 상태를 텍스트로 전달하고, 방아쇠를 계속 누를지, 현재 목표를 무엇으로 할지, 그 목표에 따라 어떤 키를 누를지 등을 선택하게 함
-
지연 시간이 충분히 낮고 판단 능력도 충분해 실시간으로 게임을 잘 플레이함
-
Doom 전용 신경망과 달리 여러 작업에 적용할 수 있는 모델이며, 기존 LLM도 Doom을 플레이할 수 있지만 느림
-
Nelson Elhage의 성능에 관한 논의처럼,
빠른 소프트웨어는 같은 작업을 더 빨리 하는 데 그치지 않고 새로운 종류의 작업을 가능하게 할 수 있음 -
프로그램의 여러 의사결정 지점에 저렴한 지능을 약 100ms씩 투입하는 방식이 새로운 응용을 열 수 있음
-
자기회귀 토큰 생성에 기반한 응용이 주로 정교한 챗봇 형태였다면, 빠른 구조화된 출력은
비챗봇 응용을 위한 새로운 연산 단위가 될 가능성이 있음
기존 LLM으로도 가능한 단일 토큰 선택
- 기존 구조화된 출력은 큰 JSON 객체를 원하는 수요 때문에 보통
문법 제약 디코딩 으로 구현됨 - 일반적인 자기회귀 생성을 유지하면서, 로짓 샘플러가 출력 형식에 맞지 않는 토큰을 제외함
- 예를 들어
[
가 나오지 않았다면 ]
를 출력하지 못하게 함
-
빠른 구조화된 출력에 대한 관심이 부족했던 점도 속도가 느린 이유로 꼽을 수 있지만, 모델에 내장된 도구 호출은 이 논의의 예외임
-
제한된 선택지 중 답을 고르는 작업은 응답에
"choice": "
를 미리 채운 뒤, 사용자 선택지로 제한한 토큰 하나만 생성하는 방식으로 처리할 수 있음
-
LLM은 입력 토큰을 병렬로 처리하므로 전체 구조화된 출력을 생성하는 것보다 훨씬 빠름
-
여러 선택 작업도 일반적인
추론 배치 처리를 통해 같은 순전파에 묶을 수 있음 -
긴 구조화된 출력은 만들 수 없지만, Jev의 속도, 일관성, 병렬성 중 상당 부분을 구현할 수 있음
-
선택지가 여러 토큰으로 구성될 때는
단일 토큰으로 매핑하거나, 내부적으로1/2/3
을 출력하도록 학습하거나, 선택지별 첫 토큰이 다르면 그 토큰만 생성하는 방법을 생각할 수 있음
-
이 다중 토큰 선택지 처리 방법들은 직접 시험한 결과가 아님
-
Jev 발표 뒤 유사한 시도가 시작됐으며, 어느 정도 작동하는 것으로 보임
Qwen2.5-1.5B-Instruct
를 이용한 직접 실험에서는 접두사를 미리 넣지 않은 구조화된 출력보다 2~3배 빨라짐
모델 자체의 차별성과 확률 보정은 얼마나 큰가
-
단일 토큰 추론으로 유사한 성능을 낼 수 있다면, Jev의
기술적 방어력이 크지 않을 수 있음 -
다른 연구소가 재현하거나 개발자가 기존 오픈소스 LLM을 빠른 Jev 유사 모델로 바꾸는 일이 비교적 쉬울 가능성이 있음
-
“
Reinforcement Learning for Calibrated Decisions”가 완전히 새로운 스케일링 축인지는 의문임 -
반면
구조화된 출력에만 특화한 미세 조정과 최적화는 의미 있는 장점일 수 있어, 단순히 기존 모델을 개조한 대부분의 구현보다 Jev가 나을 가능성도 있음 -
Jev는 출력 확률이
보정됐다(calibrated) 고 하지만, 일반적인 로짓 확률과 어떻게 다른지 판단할 정보가 충분하지 않음 -
동전 던지기 예측에서
heads: 50, tails: 50
을 내도록 하는 등, 불확실한 상황의 로그 확률을 정확하게 만드는 별도 학습이 있을 수 있으나 확인되지 않음
- 이 부분을 평가하려면 발표에 담긴 것보다 더 구체적인 정보가 필요함
지능의 한계와 환각 면역의 의미
추론 시점 연산(test-time compute) 을 활용하지 못하는 점은 큰 제약이며, 이런 모델의 능력이 비추론 LLM 수준에서 제한될 가능성이 있음
-
저지연 응용에서는 큰 문제가 아닐 수 있지만, 더 높은 지능을 만드는 새로운 스케일링 축으로 보기는 어려움
-
Transformer를 고정 횟수 반복하는 방식은 생각할 수 있으나, 추론에 가까운 처리는 지연 시간을 늘리고 예측하기 어렵게 만들어 저지연이라는 목적을 해칠 수 있음
-
개발사 측은 Jev가
환각에 면역이라고 하지만, 하늘의 색을red
로 고르는 것처럼 잘못된 선택은 여전히 가능함
- 새로운 내용을 지어내지 않고 사용자가 준 선택지에서 고르므로 기술적으로는 환각보다
오답이라고 부를 수 있음 - 같은 특성은 일반 LLM의 구조화된 출력에도 적용되므로, 이것만으로 Jev가 실제로 더 신뢰할 만해지는 것은 아님
필요한 비교와 기대되는 경쟁
- Jev의 가치 중
모델 자체와 질문당 한 토큰만 생성하는 추론 전략이 각각 차지하는 비중은 불분명함 - 발표의 데이터와 데모는 Terra 규모 모델을 단일 토큰 추론 스택에 연결해도 만들 수 있어 보임
- 개발진의 신뢰성과 모델의 품질에 대한 긍정적 평가와 별개로, 비교 대상 LLM이 불필요하게 JSON을 토큰별로 생성하지 않는 조건의 비교가 필요함
빠른 구조화된 출력 시장의 경쟁과 주요 연구소의 공식 특화 모델이 기대됨
GPT-5.6-Terra-System-One
같은 가상의 모델은 AI 제품을 구축하는 데 흥미로운 기반이 될 수 있음
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: GeekNews (한국어)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기