Liquid AI의 d1-omni-600M 모델을 브라우저에서 WebGPU로 구동하기
요약
Liquid가 의사결정 모델 d1-omni-600M을 WebGPU 기반 추론 라이브러리 runntime에 포팅했습니다. 이 모델은 WASM 없이 순수 TypeScript로 구현되었으며, 핵심 연산이 직접 작성되어 효율적입니다. 데모에서는 댓글의 유해성, 스팸 여부 등을 실시간으로 판별하는 기능을 보여줍니다.
핵심 포인트
- d1-omni-600M 모델을 WebGPU로 구동하여 브라우저 환경에서 추론 가능하게 함.
- WASM 없이 순수 TypeScript로 구현되어 배포 및 사용이 용이함.
- 댓글의 유해성, 스팸 여부 등 다중 질문에 대한 실시간 판별 기능을 시연함.
- runntime 라이브러리는 탐지, 분할, 음성-텍스트 변환 등 다양한 기능을 제공함.
Liquid가 d1-omni-600M을 공개했는데, 이건 의사결정(decision) 모델입니다! 제가 현재 작업 중인 WebGPU 추론 라이브러리인 runntime에 포팅했습니다. WASM 없이 TypeGPU 위에 순수 TypeScript로 구현되었고, 내보내기 단계가 거의 없습니다. 이 모델은 저희의 핵심 연산(matmul, attention, norms, 몇 가지 elementwise 비트)에서 직접 작성되었으며, 가중치는 HF safetensors에서 바로 로드됩니다. 영상 속 데모는 실시간으로 중재되는 가짜 댓글 피드입니다. 각 댓글은 4가지 질문을 받습니다: 유해한가(toxic)? 스팸인가(spam)? 무언가를 묻고 있는가(asking something)? 전반적인 분위기는 어떠한가(overall tone)? '유해함'과 '스팸'으로 판별된 것은 제거됩니다. 4가지 질문에 대한 댓글당 약 180ms, 질문당 약 45ms가 소요됩니다. 이 모델을 위해 엔진 튜닝에 시간을 좀 더 투자하면 성능은 훨씬 좋아질 가능성이 높습니다. 저는 이것으로 스네이크 게임도 만들어보려고 시도했지만, 잘 되지는 않았네요 lol. d1 포트는 아직 npm 릴리스에는 포함되지 않았습니다. runntime의 나머지 기능들(탐지, 분할, 음성-텍스트 변환, 임베딩 등)이 있습니다. 문서 및 라이브 데모: https://docs.swmansion.com/runntime 포팅이나 WebGPU 관련하여 질문 있으시면 기꺼이 답변드리겠습니다. submitted by /u/FinancialAd1961 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기