Aplomb 1, Typed Decisions에서 1위 기록
요약
Aplomb 1이 확률적 의사결정 평가 벤치마크인 Typed Decisions에서 최고 성능을 기록하며 주목받고 있습니다. 이 모델은 파라미터 규모 대비 뛰어난 정확도를 보여, 자신보다 훨씬 큰 27B 모델을 능가했습니다. 또한, 텍스트 외에도 JSON, 이미지, 비디오, 오디오 등 다양한 모달리티를 처리하고 최대 1M 토큰까지 지원합니다.
핵심 포인트
- Aplomb 1이 Typed Decisions에서 리더보드 1위를 차지함.
- 5.3B 파라미터 규모로 27B 모델을 능가하는 성능을 보임.
- 텍스트, JSON, 이미지 등 다중 모달리티를 처리 가능하며 최대 1M 토큰 지원.
- API 사용 시 짧은 질문에 대해 빠른 응답 속도(약 15ms)를 제공함.
Aplomb 1은 확률적 의사결정을 위한 공식 Hugging Face 벤치마크인 Typed Decisions에서 1위를 차지했습니다. 5.3B 파라미터 규모임에도 불구하고, 그 확률값들은 리더보드 상에서 KL from gold와 Brier score 측면 모두에서 진실된 정답에 가장 근접하며, 자신보다 약 5배 큰 27B 모델을 앞섰습니다. Typed Decisions는 모델에게 비정형 텍스트(unstructured text) 한 조각과 그에 대한 다섯 가지 유형화된 질문(typed questions)을 동시에 제공합니다. 모든 답변은 확률 분포(probability distribution)이며, 400가지 사례와 2,000개의 의사결정을 거쳐 정답 분포(gold distribution)와 비교 평가됩니다. KL from gold와 Brier score는 모델의 확률값이 실제 정답으로부터 얼마나 떨어져 있는지를 측정하며, 이 값이 낮을수록 성능이 좋습니다. 결과: KL from gold: 0.123로 리더보드 1위이며, 2위를 차지한 27B 모델보다 40% 더 낮은 수치입니다. Brier score: 0.065로 리더보드 1위이며, 2위를 차지한 27B 모델보다 3분의 1 낮은 수치입니다. Aplomb 1은 하나의 요청으로 텍스트, JSON, 이미지, 비디오, 오디오를 모두 처리하며 최대 1M 토큰을 읽을 수 있습니다. 당사 API에서는 짧은 질문에 대해 약 15ms의 모델 시간 만에 답변하고, 1M 토큰 문서를 약 3초 만에 읽어낼 수 있으며, 입력 토큰 1M당 $0.02이고 출력은 무료입니다. 가중치(weights)는 Hugging Face에서 공개되었습니다. 리더보드: https://huggingface.co/datasets/LocalLLaMA/typed-decisions?leaderboard_task_id=kl_from_gold 가중치: https://huggingface.co/empiriolabsai/aplomb-1 사용해보기: https://platform.empiriolabs.ai/dashboard/playground?model=aplomb-1&utm_source=linkedin&utm_medium=social&utm_campaign=aplomb-1-typed-decisions /u/empiriolabsai가 제출했습니다. [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기