RTX 5090 환경에서 Strata와 Infernix 엔진 비교 테스트 (262k 및 512k 컨텍스트)
요약
본 기사는 RTX 5090 환경에서 Strata와 Infernix 두 추론 엔진을 비교 테스트한 결과를 다룹니다. 동일 모델과 사양으로 진행된 A/B 테스트 결과, Infernix가 262k 컨텍스트에서 디코드 속도를 +23% 향상시키는 등 전반적인 성능 우위를 보였습니다. 또한, 긴 컨텍스트 처리 시 병목 현상은 KV 캐시보다 전문가(experts)에 있음을 확인했습니다.
핵심 포인트
- Infernix가 262k 컨텍스트에서 디코드 속도를 +23% 향상시켜 성능이 뛰어남.
- 512k 컨텍스트는 두 엔진 모두에서 거의 무료로 작동하는 수준임.
- 긴 프롬프트 재-프리필은 KV 캐시보다 전문가(experts)가 병목 현상의 원인임.
- 두 엔진의 품질은 통계적으로 동등하며, Infernix가 전반적인 성능 우위를 보임.
같은 모델, RTX 5090에서의 Strata vs Infernix - 262k 및 512k 컨텍스트 A/B 테스트
안녕하세요 여러분, 또 다른 추론 엔진 포스팅을 들고 왔습니다. 저는 Strata에 깊은 인상을 받았지만, 누군가 Infernix에 대해 엄청난 주장들을 담아 게시한 것을 봤는데, 이 엔진은 그다지 알려져 있지 않은 것 같았습니다. 그래서 하루를 보내면서 모델들을 다운로드하고 각 엔진별로 A/B 테스트를 진행했습니다.
이 소프트웨어들이 Windows에서 작동한다는 사실에 완전히 놀랐고, 설정 과정도 비교적 수월했습니다. 같은 날 인터리브드 벤치마크(interleaved benches)를 동일한 모델(Qwen3.8-Flash-Next Uncensored, orcarouter의 Apache-2.0 abliterated 체크포인트), 동일한 추론 계약(int8 KV, MTP spec-4 + lm-head-draft, 512k용 YaRN 2)으로 진행했습니다.
3개의 디코드 실행을 평균값으로 측정했습니다.
하드웨어: RTX 5090 32 GB (Gen5 x16), RAM 189.6 GB, 9950x, Windows 11, NVMe에 모델 저장, llama-swap이 둘 다 전면 배치(fronting).
엔진: Strata 0.1.41, orcarouter Q4_K_S GGUF, 보정 플래그 (pcie-frac 0.55, pool-workers 4, adapt-every 1/160/0.97, spec-min-p 0.7)
Infernix 2026.10.09.2, 공개된 NVFP4 레시피-C 아티팩트 (76.3 GB) + NVMe에 공유된 52 GB n-gram 볼륨 (mmap 처리되어 RAM으로 로드되지 않음 — 63.3 GiB의 전문가(experts)가 고정됨). 비전 기능 작동 확인 (--vision, tower는 고정 RAM으로 오프로드되며 인코딩 시에만 VRAM을 사용).
결과 (디코드 tok/s, 3회 평균 / 콜드 프리필 tok/s):
| 컨텍스트 | 262k | 512k (YaRN 2) |
|---|---|---|
| Strata Q4_K_S | 120.6 / 1,550 | 126.3 / 3,045 |
| Infernix NVFP4 | 149.0 / 3,548 | 137.0 / 3,497 |
주요 시사점:
- Infernix는 동일한 모델, 동일한 사양 계약에서 262k 컨텍스트에서 디코드 속도가 +23%, 512k 컨텍스트에서 +9% 향상되었습니다.
- 512k 컨텍스트는 두 엔진 모두에서 거의 무료(≤8%)에 가깝습니다.
- 32 GB 5090 환경에서는 어텐션 KV가 아니라 전문가(experts)가 병목 현상의 원인입니다. 프롬프트를 반복할 때 긴 프롬프트의 재-프리필은 거의 무료로 작동합니다(~39k 프롬프트의 따뜻한 재-프리필 시 약 0.09초).
- 품질: 통계적으로 동등합니다 — 교사 강제 PPL(teacher-forced PPL) 4.772 (Infernix) 대 4.844 (Strata의 양자화), ΔNLL −0.015 ± 0.010 nats; 이 아티팩트는 abliterated 가중치를 비트 단위로 정확하게 실행합니다.
Vision이 두 엔진 모두에서 작동하는 것을 확인했습니다 — Infernix는 --vision (기본값으로 꺼짐)을 필요로 하며 모델 문자열을 엄격하게 검증합니다 (--model-id를 프록시의 항목 이름과 일치시키세요 — 404 오류가 발생했습니다). 콜드 스타트(Cold start): Infernix 약 28초; Strata 약 1분. 주의사항: 디코딩은 약 39k의 유효 컨텍스트에서 측정되었습니다 (깊게 채워진 500k는 다른 KV-vs-캐시 문제입니다); ±10-15 토큰/초 실행 노이즈가 있으므로 10% 미만의 차이는 노이즈로 간주하세요; YaRN은 262k를 넘어서면 실험적입니다 (속도 측정만 했고, 512k 품질은 아닙니다). 결론: Infernix NVFP4가 일상적인 드라이버(daily driver)입니다 — 150 토큰/초, 512k, 비전 기능, 모든 것이 하나의 5090에서 가능합니다. Strata는 두 번째 엔진으로 유지됩니다. 코딩 및 기타 작업을 위해 사용했을 때, 창의적 글쓰기/역할극(role play)에서는 Silly Tavern에서 환상적이며, 저는 이것을 더 작은 창의적 파인튜닝 모델 대신 사용해 왔습니다. 에이전트 작업(agentic work)과 태스크에 대해서는 제가 요청한 모든 것을 처리하기에 충분했고, 심지어 Deepseek 4.1 및 GLM 5.3 Flash가 API를 통해 작성하도록 비용을 지불해야 했던 실수들까지 수정했습니다. 제출자: /u/zipzak [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기