RTX5090 및 Qwen3.8 27B를 위한 가장 빠른 추론 엔진 MegaCapybara 발표
요약
MegaCapybara는 RTX5090을 위한 고성능 추론 엔진으로, 기존 SOTA 엔진인 Ninfer보다 디코딩 속도가 약 2배 빠릅니다. 이 엔진은 커스텀 커널과 다중 작업/장기 컨텍스트에 최적화되었으며, 가중치(weights) 상태를 개선하여 모든 변경 사항을 측정하고 통계적으로 제공합니다. 또한, 효율적인 캐시 관리와 루프 가드 기능을 통해 안정적인 에이전트 서비스를 지원합니다.
핵심 포인트
- RTX5090에 최적화된 고성능 추론 엔진 MegaCapybara 발표
- 기존 SOTA 대비 디코딩 속도 약 2배 향상 (최대 2600t/s)
- 커스텀 커널로 단일/다중 작업 및 장/단 컨텍스트 모두 최적화
- 가중치에 메타데이터를 첨부하여 모든 변경 사항을 투명하게 측정 제공
안녕하세요, 여러분.
MegaCapybara를 발표하게 되어 매우 기쁩니다. 이 엔진은 RTX5090을 위해 목적에 맞게 구축되었으며 Qwen3.8 27B에 초점을 맞추고 있습니다 (나중에 더 많은 모델이 추가될 예정입니다).
GITHUB (엔진)
HUGGINGFACE (가중치)
왜냐고요?
- 이 엔진은 그전까지 RTX5090의 SOTA(State-of-the-Art) 엔진이었던 Ninfer를 능가합니다. 단일 작업 및 다중 작업을 동시에 처리할 때 디코딩 속도가 대략 두 배 빠릅니다 (작은 버스트에서 최대 650t/s, 상황이 잘 맞고 12 슬롯 서버의 순수 코딩 답변 시 2600t/s에 도달). 커스텀 커널을 모델마다, 단일 vs 다중 작업뿐만 아니라 짧은 컨텍스트 vs 긴 컨텍스트에도 적용하여 필요에 따라 동적으로 전환되므로, 누군가 짧은 컨텍스트에 맞춰 최적화했다고 해서 긴 컨텍스트에서 속도가 떨어지는 일이 없습니다. Dflash2와 Dspark의 confidence scheduling, 그리고 draft trees를 동시에 사용합니다.
- 저는 가중치(weights) 상태에 짜증을 느꼈습니다. 즉, 모델을 다운로드했지만 그 모델이 제대로 작동하는지 알 수 없었던 것입니다. 제 가중치는 MC 전용 메타데이터가 첨부된 자체 형식으로 제공됩니다. 이 가중치를 생성할 때 벤치마크를 실행하고 원래 BF16 가중치와 모든 MC 설정에서 비교하여 해당 데이터를 런처에 직접 표시합니다. KV를 4bit로 전환하고 싶나요? MC는 손실 KL과 top-1%를 직접 보여줄 것입니다. YARN으로 확장하고 싶나요? 변화량을 보여줄 것입니다. 모든 변경 사항은 모델을 로드하기 전에 측정되어 통계에 표시됩니다. 이는 검열된(censored) 모델과 검열되지 않은(uncensored) 모델 모두에 해당합니다. MC에서 SOTA unsloth 양자화(quants)를 사용한 Qwen27B와 직접 비교할 수도 있습니다. 본질적으로 손실이 없는 방식으로 실행하고 싶나요? 할 수 있습니다. 엄청난 1,000,000 컨텍스트를 얻고 싶나요? 할 수 있습니다. 정신없이 12개의 슬롯에 에이전트를 분산시키고 싶나요? 할 수 있습니다. 원하는 것을 결정하시면 됩니다.
- 알고리즘을 통해 제대로 된 에이전트 서비스를 제공하며 엔진이 가능한 한 바쁘게 작동하도록 유지합니다. 이는 t/s(초당 토큰)를 우선시하여, 만약 엔진이 동시에 5개의 작업과 1개의 작업을 처리할 선택지가 있다면 5개를 먼저 처리하고 나머지 1개도 점진적으로 완료하는 방식으로 서비스를 제공할 것입니다.
엔진은 또한 특정 작업이 얼마나 오래되었는지 점수를 매기고 T/S(처리 속도)가 저하되더라도 해당 작업을 재개해야 하는지 판단할 수 있어, 메인 세션에서 에이전트를 쉽게 확장하고 동시에 모니터링할 수 있습니다. 4. 적절한 캐시 관리. 작업은 작업 시작 시에만 프리필(prefill)하며 거의 다시는 하지 않기 때문에 장시간 세션에서의 프리필 공간은 거의 사용되지 않습니다. '통합 컨텍스트(unified context)'를 사용할 때 모델이 컨텍스트가 부족해지면 일부는 일시 중지되어 RAM에 저장되고, 이 스와핑(swapping) 과정은 즉각적입니다. 여유 컨텍스트 공간이 있다면 해당 작업들은 0.03초 만에 리필 없이 계속 진행됩니다. 프론트엔드에서 한 번에 30개의 에이전트를 확장하더라도 로드를 가장 효율적인 방식으로 처리하여 T/S를 가능한 높게 유지할 것입니다. 기본 설정으로 실행하고 에이전트의 컨텍스트는 신경 쓰지 않아도 됩니다. 알아서 처리해 줄 것입니다. 6. 루프 가드(Loop guard). 2단계로 구성되어 있습니다. 엔진은 대화 세션에서 에이전트가 반복되는 것을 감지하기 시작하면, 반복이 멈출 때까지 동적으로 반복 페널티(repetition penalty)를 조정합니다. 만약 이것이 일어나지 않고 엔진이 반복 페널티 한계에 도달하면 중지 신호를 발생시켜 서비스 종료를 알리고 프론트엔드에 정보를 제공하여, 프론트엔드가 무한 루프에서 복구하고 사용자에게 불편함을 주지 않도록 합니다. 6. 무엇인지 보여주는 적절한 nice UI. 모델 서빙(serving)에 대해 잘 모른다면 ? 위에 마우스를 올려놓기만 하면 모든 것을 설명하는 대화형 패널이 나타납니다. 7. 자동 다운로더(Autodownloader). 다운로드 버튼을 누르기만 하면 Huggingface 내부의 런처에서 직접 제 가중치(weights)를 다운로드할 수 있습니다. 8. 런처가 마음에 들지 않나요? bats와 터미널 서빙을 사용하세요. 또는 런처를 사용하여 원하는 설정을 구성하고, 오른쪽 하단 모서리에서 복사하여 새로운 bat 파일을 만드는 데 사용할 수도 있습니다. 핵심은 모델을 로드하고, 엄청난 컨텍스트를 가진 수많은 에이전트를 확장한 다음, MC(MegaCapybara)에게 처리하게 하는 것입니다. 사용자는 편안히 앉아 에이전트들이 SOTA 속도로 작업을 수행하는 것을 지켜보기만 하면 됩니다. 의견과 리뷰는 환영합니다. RTX5090을 가지고 있다면 시도해 보세요. 소스는 나중에 공개될 예정입니다. 먼저 몇 가지 정리할 것이 있습니다.
나중에 weights builder도 공개할 예정이라서, 어떤 3.8 27B BF16 모델이든 가져와서 가중치를 생성하고 메타데이터를 다시 첨부한 BF16 형태로 만들 수 있고, 이걸 hugginface에 직접 호스팅하거나 models 폴더에 그냥 넣을 수 있을 거예요.
MIT 라이선스라서 마음대로 사용하셔도 됩니다.
제출자: /u/BringTea_666
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기