OpenAI, 확률·선택지·점수를 반환하는 Decisions API 공개 베타 시작
요약
OpenAI가 확률, 선택지, 점수를 반환하는 Decisions API의 베타 버전을 공개했습니다. 본문은 Jev, Mercury Decide 등 경쟁 모델과 비교 평가하며, OpenAI 모델이 특정 작업(규정 준수)에서 더 높은 신뢰도와 안정성을 보였음을 분석합니다. 또한 AI 시장 전반에 대한 비판적 시각을 제시하고 있습니다.
핵심 포인트
- OpenAI Decisions API는 확률/점수 반환 기능으로 실용성이 높음.
- 경쟁 모델(Jev 등)은 가격 경쟁력은 있으나, 신뢰도와 안정성에서 부족함이 발견됨.
- 클라우드 기반 데이터 처리의 높은 비용과 쉬운 전환 용이성에 대한 경고가 있음.
- AI 시장 참여자들은 완성도 높은 제품에 집중하고 과도한 발표를 자제해야 함.
Jev에 대한 대응을 보면 AI 사업이 범용재 시장인지에 대한 논쟁은 이제 끝내도 될 듯함. 갑자기 등장한 Jev가 가격 경쟁의 다음 라운드를 열었고, 빠르게 예·아니요와 신뢰도 점수를 내놓는 시스템 1 모델의 가치를 보여줌. 비용도 저렴하지만, 애초에 사람들이 원하는 것이 딱 그 정도인 경우도 많음.
Hugging Face에는 오픈소스 모델이 쏟아지고, 대형 업체들은 고객을 붙잡고 가격 경쟁에 나서기 위해 상당한 출력 토큰 수요를 포기하고 있음. 내가 OpenAI나 Anthropic이라면 고객이 쉽게 떠나지 못할 제품을 만드는 데 전력을 다할 것 같음. 그렇지 않으면 다들 가장 싼 곳으로 옮겨갈 것임.
모델을 바꾸는 데 키를 두 번만 누르면 됨. 이보다 전환이 쉬운 제품은 모르겠음.
오히려 범용재가 되고 가장 쉽게 교체할 수 있는 제품을 지향하는 곳으로 사람들이 몰리길 바람. 데이터 반입은 무료지만 반출은 TB당 100달러인 클라우드 같은 상황은 다시 겪고 싶지 않음.
OpenRouter를 통해 이 모델을 Jev, Mercury Decide와 비교 평가함. 아직 기초적인 평가로, UI 구성요소 선택·채팅 내 차트 생성·태그 선택·개인 지식 관리(PKM) 작업 등 600회 미만의 호출을 시험함. Jev는 압도적인 가격 경쟁력과 MacBook Neo의 실행 한계 때문에 기존 mt0 작업을 대체했고, Mercury Decide는 확산형 언어 모델(dLLM)에 관심이 있고 모델 제공업체 수를 줄이고 싶어 비교 대상으로 골랐음.
예비 결과지만 Luna는 Jev보다 느리고 Mercury Decide와 비슷한 지연 시간을 보임. 중앙값 346ms, 95백분위 860ms였으며, 입력량에 정비례해 늘어나지는 않았음. Mercury Decide는 입력 크기에 따른 변화가 더 일관적이었고, 이전에 1.3초까지 걸리던 일부 호출은 오늘 약 800ms였는데 미리보기 서비스라 그랬을 수 있음.
모호한 UI 구성요소나 특정 응답 구조를 고르는 작업에서는 신뢰도가 낮았고, Luna는 0.6 이하에서 내 요구를 충족하지 못하는 경우가 잦았음. 경쟁 모델 둘은 호출 실패가 없었지만 Luna는 4회 실패했고, 비용도 Jev보다 평균 3.1배 높았음. Mercury Decide 가격은 아직 모르는 것으로 알아 비교하지 못함.
여러 무한 캔버스와 의사결정 모델로 여러 출처의 정보를 종합하는 PKM 중심 Firefox 포크라는 특수한 용도에서는 Jev보다 느리고 비싸며 성능도 낮았고, Mercury Decide와는 대체로 비슷했음. 다소 덜 다듬어진 듯하며, 선도 AI 연구소라면 가격이나 성능에서 경쟁력 있는 제품을 내놓기 전까지 유행을 좇지 않았으면 함. 다만 이미지 입력은 아직 시험하지 않았고, 여기서 차이가 날 수도 있음. 내 용도가 모두를 대표하지는 않으니 다른 평가 결과도 궁금함.
뒤늦게 Devday 내용을 읽어보니 Notion, GDocs, Jev, Muse 등 기존 경쟁 제품을 복제한 듯한 발표가 많았음. 샌드박스 없는 Mega Astra와 무제한 초고속 코드 토큰을 내세운 것치고 결과가 그리 놀랍지도 않음. 발표 수를 줄이고 집중도와 완성도를 높였으면 함. Chromium 기반 ChatGPT Atlas가 너무 빨리 사라진 것을 보면, 기존 제품보다 나은 부분이 있더라도 여기에 크게 투자하기는 꺼려짐. 새 사전학습과 샌드박스 개선에 집중하는 편이 나을 듯함.
규정 준수 요건에서는 Jev가 실질적인 요구를 충족하지 못하지만 OpenAI 모델은 충족함. 따라서 규정 준수가 필요한 고객은 Jev가 더 빠르더라도 선택할 수 없어 OpenAI를 고르게 됨.
몇 주 뒤 더 나은 버전을 내놓으면 됨. 평가대로 성능이 떨어지더라도 먼저 시장에 자리 잡는 것은 의미가 있음. OpenAI라는 이유만으로 쓰는 고객도 있고, 몇 달 뒤에는 출시 2주 차 평가를 아무도 기억하지 않을 것임.
덜 다듬어졌더라도 여전히 매우 저렴하므로 출시할 만함. 이미 OpenAI와 기업 계약을 맺었다면 Jev와 새로 계약하는 것보다 도입이 훨씬 쉬움. 이 모델들이 어떻게 자리 잡을지는 아직 모르지만, 기업에는 기존 공급업체 계약과 이용약관이 중요함.
Luna Decide의 범용 성능이 Jev보다 낮다면 상당히 놀라울 것 같음. 내가 제시한 생소한 분야는 Jev가 하나도 이해하지 못했음. 결국 아무 데이터도 없는 것보다는 낫다는 정도로만 사용하게 됨.
이런 API는 극히 단순한 판단을 위한 것임. 현실의 문제는 여러 출력 속성과 하위 구조를 포함하는 복잡한 결과가 필요한 경우가 많아, 명시된 스키마에 따른 기존 구조화 출력이 더 적합함.
대신 의사결정 API를 독립적으로 20번 호출하면 판단 사이의 일관성을 잃게 됨. 의사결정 API를 둘러싼 열풍도 머지않아 잊힐 것 같음.
용도마다 API를 따로 두는 것을 보니 초기의 자동완성 API와 지시형 API가 떠오름. 언젠가 이 기능이 모델이나 후속 학습 과정에 통합돼 확률 보정이 더 잘 된 출력을 만들게 될까?
AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: GeekNews (한국어)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기