
Nifer는 정말 미쳤습니다. Qwen 3.6 35B (No thinking 모드)로 700t/s 달성. RTX5090을 위해 제작됨.
요약
Nifer는 Qwen 3.6 35B 모델을 사용하여 단일 인스턴스에서 최대 700t/s의 압도적인 추론 속도를 구현한 도구입니다. RTX 5090에 최적화되어 설계되었으며, No thinking 모드를 통해 Cerebras 수준의 성능을 제공합니다.
핵심 포인트
- Qwen 3.6 35B 모델 기준 550-720t/s의 초고속 추론 달성
- 배치 처리 없이 단일 인스턴스만으로 높은 처리량 구현
- RTX 5090 하드웨어 성능을 극대화하도록 맞춤 제작됨
- Windows 환경에서도 빌드를 통해 실행 가능
방금 윈도우(Windows)에서 실행하는 데 성공했는데, 이건 정말 미친 수준입니다. 수행하는 작업에 따라 약 550-720t/s 정도가 나옵니다. 이전에는 이런 수치를 얻으려면 배치(batching)를 하거나 에이전트(agents)를 병렬로 돌려야 했습니다. 하지만 여기서는 단일 인스턴스(single instance)만으로 이 말도 안 되는 속도를 냅니다. 여기에 No thinking 모드를 결합하면 정말 장난이 아닐 정도로 강력합니다. 거의 Cerebras 수준의 속도입니다. git 링크 (리눅스 전용이지만, open code나 deepseekv4pro 같은 것을 통해 윈도우용으로 빌드할 수 있습니다.) https://github.com/Neroued/ninfer 이것은 RTX5090을 위해 맞춤 제작되었으며, Qwen3.6 27b와 35B 두 모델만 지원합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기