엣지 환경을 위한 멀티모달 오픈 d1 의사결정 모델
요약
오픈 d1 결정 모델(d1-3B, d1-omni-600M)이 엣지 환경을 위한 고성능 멀티모달 의사결정 능력을 보여줍니다. 이 모델들은 생성형 모델과 달리 단일 순방향 통과로 답변하며, 다양한 벤치마크에서 높은 성능을 기록했습니다. 특히 d1-3B는 텍스트와 이미지를 지원하고, d1-omni-600M은 텍스트, 이미지, 오디오 세 가지 모달리티를 처리할 수 있습니다.
핵심 포인트
- d1 결정 모델은 단일 순방향 통과로 답변하여 효율적입니다.
- d1-3B는 텍스트/이미지 기반으로 높은 의사결정 능력을 보였습니다.
- d1-omni-600M은 텍스트, 이미지, 오디오의 멀티모달리티를 지원합니다.
- NVIDIA Jetson 환경에서 낮은 지연 시간(latency)을 보여줍니다.
Decision Index 0.2.1에서 10B 미만 최고 성능의 결정 모델: d1-3B가 48.57점을 기록하며, 모든 4B 및 9B 모델과 Decider 35B-A3B(47.11)보다 앞섰습니다.멀티모달 기능: d1-3B는 텍스트와 이미지를 지원하고, d1-omni-600M은 텍스트와 이미지 또는 텍스트와 오디오를 지원합니다속도: d1-3B는 NVIDIA Jetson AGX Thor에서 질문에 16ms 만에 답하며, Jetson AGX Orin에서는 26ms, Jetson Orin Nano에서는 50ms가 걸립니다.
이러한 오픈 d1 결정 모델들은 저희의 Liquid Foundation Models (LFMs)을 기반으로 구축되었습니다. 생성형 모델(generative models)과 달리, 결정 모델은 토큰을 생성하는 것이 아니라 단일 순방향 통과(single forward pass)를 통해 답변합니다.
d1-3B와 d1-omni-600M은 매우 다른 두 개의 백본(backbones)에서 훈련되었습니다:
d1-3B는 저희의 최신 VLM인 LFM2.5-VL-3B (디코더 전용, decoder-only)에서 훈련되었으며, 텍스트와 이미지를 입력으로 받습니다.d1-omni-600M은 양방향 인코더(bidirectional encoder)인 LFM2.5-Encoder-350M에서 훈련되었습니다. 이 모델은 세 가지 모달리티를 처리하기 위해 비전 및 오디오 인코더를 추가했습니다. 입력으로는 텍스트와 이미지, 또는 텍스트와 오디오 중 하나를 받을 수 있습니다. 이 모델은 현재 초기 연구 공개(early research release) 상태이며 추가 개발이 진행 중입니다.
저희는 d1-3B와 d1-omni-600M을 독해 이해력(reading comprehension), 유해성 탐지(toxicity detection), 의도 분류(intent classification), 의료 QA(medical QA), 그리고 교차 언어 이해(cross-lingual understanding)를 아우르는 7개의 공개 데이터셋에서 벤치마킹했습니다. d1-3B는 표에서 가장 높은 평균 점수인 82.9점을 달성했으며, Decider 4B보다 높습니다. d1-omni-600M은 파라미터가 4분의 1에 불과함에도 불구하고, 77.1점인 Decider 2B를 능가하는 78.4점을 기록했습니다.
| Benchmark | d1-omni-600M | d1-3B | Decider 2B | Decider 4B |
|---|---|---|---|---|
| SQuAD 2.0 | 74.0 | 83.3 | 67.7 | 76.0 |
| Civil Comments | 95.8 | 93.3 | 93.6 | 92.8 |
| MASSIVE intent | 86.1 | 86.9 | 81.1 | 88.3 |
| PubMedQA | 61.3 | 68.3 | 65.7 | 63.3 |
| BoolQ | 77.7 | 86.3 | 87.3 | 89.0 |
| XNLI | 74.7 | 85.6 | 85.0 | 88.6 |
| PAWS-X | 79.5 | 76.4 | 59.5 | 69.8 |
| Mean | 78.4 | 82.9 | 77.1 | 81.1 |
우리는 d1-3B가 기반 모델인 LFM2.5-VL-3B의 비전(vision) 기능을 표준 비전 벤치마크에서 유지함을 검증했으며, d1-omni-600M은 세 가지 모달리티를 모두 처리합니다. 의사결정 지수 (Decision Index) v0.3에는 사설 비전 분할만 포함되어 있고 오디오 의사결정 벤치마크는 현재 미해결 문제(open problem)이므로, 저희는 비전이나 오디오 벤치마크를 보고하지 않습니다.
NVIDIA와 협력하여, 우리는 NVIDIA GeForce RTX 4090, NVIDIA Jetson AGX Thor, Jetson AGX Orin 64 GB, 그리고 Jetson Orin Nano 전반에 걸쳐 d1-3B를 평가했습니다. d1-omni-600M은 초기 연구 출시 버전이므로, 이번 릴리스에서는 속도 수치를 보고하지 않습니다.
엣지 추론 (Edge inference). d1-3B는 측정된 모든 장치에서 단일 질문에 대해 50ms 미만의 응답 시간을 보입니다. 세 개의 질문은 한 개의 시간 대비 단지 1.3배의 시간이 소요되며, AGX Thor의 경우 16ms에서 20ms로 증가합니다.
| 단일 질문 | 3개 질문 | 3.4K-토큰 상태 | 384px 이미지 | 64 상태, 패킹됨 | |
|---|---|---|---|---|---|
| Apple M5 Pro | 30 ms | 41 ms | 640 ms | 62 ms | 78 / s |
| ... |
GPU 추론 (GPU inference). GPU에서는 d1-3B가 두 플랫폼 모두에서 질문에 대해 10ms 미만으로 응답하고, 384px 이미지 처리에 18ms 미만의 시간을 소요합니다.
| 단일 질문 | 3개 질문 | 3.4K-토큰 상태 | 384px 이미지 | 64 상태, 패킹됨 | |
|---|---|---|---|---|---|
| NVIDIA RTX 4090 | 8 ms | 21 ms | 102 ms | 17 ms | 475 / s |
| AMD MI325X | 9 ms | 14 ms | 44 ms | 18 ms | 1,106 / s |
d1-3B는 멀티모달 입력 등 빠르고 구조화된 의사결정이 필요할 때 d1 의사결정 모델을 활용하십시오. d1-3B는 크기 대비 최고의 의사결정 품질을 제공하며, d1-omni-600M은 공간 제약이 중요한 곳에 적합합니다.
의존성을 설치하십시오 (transformers>=5.14 필요):
pip install
두 의사결정 모델 모두 오픈 웨이트(open-weight)이며 오늘 Hugging Face에서 이용 가능합니다:
**다운로드:** Hugging Face에서 d1-3B와 d1-omni-600M을 다운로드하세요.**사용해보기:** System One Arcade Hugging Face Space의 데모를 실행해 보세요.
무엇을 만드실지 기대됩니다.
본 연구를 사용하실 경우, 다음 릴리스 블로그를 인용해 주십시오:
@article{liquidAI2026opend1,
author = {Liquid AI},
title = {Open d1: Edge decision models for text, vision, and audio},
...
AI 자동 생성 콘텐츠
본 콘텐츠는 Hugging Face Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기