
커스텀 백엔드를 통해 브라우저에서 1440 tok/s로 구동되는 LFM 2.5 230M
요약
WebGPU를 활용하여 브라우저 및 Electron/Tauri 환경에서 LFM 2.5 230M 모델을 초당 1440 토큰의 속도로 구동하는 기술을 소개합니다. Nvidia와 Apple Silicon의 하드웨어 특성에 최적화된 커널을 통해 높은 성능을 구현했습니다.
핵심 포인트
- WebGPU 기반의 브라우저 및 데스크톱 앱 실행 지원
- Nvidia 및 Apple Silicon 하드웨어 최적화 커널 적용
- LFM 2.5 230M 모델 기준 최대 1440 tok/s 성능 달성
- Sipp 라이브러리에 향후 통합 예정
모든 것은 WebGPU를 통해 브라우저 내부 또는 electron/tauri 앱에서 실행됩니다. 이는 완전히 휴대 가능하며 Nvidia 및 Apple Silicon (Metal)을 모두 지원합니다. 실제 커널(kernels)은 장치의 특정 하드웨어에 최적화되어 있습니다. Nvidia 커널은 멀티 패스 아키텍처(multi-pass architecture)로 공격적으로 융합(fused)되어 있는 반면, Apple Silicon 커널은 WebGPU의 타일 기반 지연 렌더링 (Tile Based Deferred Rendering, TBDR) 오버헤드를 최소화하기 위해 융합된 메가 커널(fused mega-kernel)로 생성됩니다. 데모: https://warp.sipp.sh RTX 3090 (webgpu) M4 (webgpu) LFM 2.5 230M 1400-1500 tok/s 400-500 tok/s Bonsai 1.7B 500-600 tok/s 100-150 tok/s 이것은 여전히 활발히 개발 중이며, 앞으로 몇 주 안에 이 기능을 Sipp 라이브러리에 통합할 예정입니다. /u/lordhiggsboson에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기