Ling-3.0-flash 가중치: SGLang은 당일 지원을, vLLM은 공개 시 지원을 언급했으며 llama.cpp는 2.6 요청을
요약
Ling-3.0-flash 모델의 가중치 공개에 따른 주요 추론 엔진(SGLang, vLLM, llama.cpp)의 지원 현황을 분석합니다. SGLang은 당일 지원을 약속했으나, llama.cpp는 아키텍처 변환 문제로 인해 지원이 불투명한 상태입니다.
핵심 포인트
- SGLang은 Ant 팀과 협력하여 당일 지원(day-0)을 약속함
- vLLM은 모델 가중치가 오픈 소스로 공개된 이후 지원 예정
- llama.cpp는 Bailing MoE 변환 경로 문제로 지원이 지연되거나 계획되지 않음
- 기술적 난제보다는 구현을 위한 Pull Request(PR) 작업이 핵심 과제임
지난주 이곳의 몇몇 Ling-3.0-flash 스레드들은 명확한 답변 없이 동일한 두 가지 질문으로 끝났기에, 제가 직접 저장소(repos)들을 살펴보았습니다. 작성 시점의 상태를 링크와 함께 정리하였으니, 제 말만 믿지 마시고 직접 확인해 보시기 바랍니다.
SGLang은 공개적으로 당일 지원(day-0 support)을 약속했습니다. 23일자 그들의 게시물에 따르면 Ant 팀과 함께 작업 중이며, 해당 모델을 KDA + MLA 하이브리드 어텐션 (hybrid attention)으로 설명하고 있습니다.
https://x.com/sgl_project/status/2080372971219415458
vLLM은 속마음을 솔직하게 드러냈습니다. 그들의 지원은 "곧 제공될 예정이며, 모델 가중치(weights)가 오픈 소스로 공개될 때 사용 가능할 것"이라고 밝혔으며, 그들은 '먼저 발표하고 나중에 가중치를 공개하는' 방식을 다른 벤더들도 따라야 할 출시 패턴이라며 네 단락에 걸쳐 지지했습니다.
https://x.com/vllm_project/status/2080702006378082384
둘 중 어느 것도 구체적인 날짜를 제시하지 않았습니다. 작성 시점 기준으로 Hugging Face에 Ling-3.0-flash 모델 카드(model card)가 없으며, 이번 세대에 대한 라이선스 성명도 없고, vLLM이나 SGLang 모두에서 이를 언급하는 공개적인 PR(Pull Request)도 찾을 수 없었습니다.
두 스레드 모두에서 아무도 언급하지 않은 부분은 GGUF 측면인데, 상황은 가중치 측면보다 더 좋지 않습니다.
lama.cpp는 이 제품군이 전환한 Bailing MoE 변형을 지원하지 않습니다. Ling-2.6-flash (BailingMoeV2_5)에 대한 기능 요청(feature request)은 https://github.com/ggml-org/llama.cpp/issues/22641 입니다. 5월 3일에 생성되어 7개의 추천(upvotes)을 받았으나, 구현되지 않은 채 방치되다가 6월 18일에 '계획되지 않음(not_planned)'으로 종료되었습니다. 이전의 "Add support for Ling v2" PR인 https://github.com/ggml-org/llama.cpp/pull/16028 은 거의 3개월 동안 열려 있다가 병합(merge)되지 못한 채 종료되었습니다. 오직 2025년 3월의 원본 BailingMoE만이 반영되었는데, 이는 연구소(lab) 인원이 아닌 llama.cpp 유지 관리자(maintainer)가 작성한 것입니다.
하지만 여기서 까다로운 점은 어텐션(attention)이 걸림돌이 아니라는 것입니다. llama.cpp는 이미 Qwen3.5, Qwen3-Next, Kimi-Linear를 위해 delta-net/KDA 커널(kernels)을 포함하고 있습니다. 이 스레드 중 누군가가 이 아키텍처가 Kimi K3와 매우 유사해 보인다고 말했다면 그 말이 맞으며, 이는 우리에게 도움이 됩니다.
부족한 점은 Bailing MoE 변환 경로인데, 이는 기술적으로 어려운 문제라기보다 누군가가 반드시 PR (Pull Request)을 작성해야 하는 문제입니다.
따라서 가중치 (weights)가 공개된다면, 현실적인 순서는 SGLang, 그다음 vLLM, 그리고 자원봉사자가 나타날 때마다 GGUF 순서가 될 것입니다. K3는 어제 가중치를 공개했고, 관련 파이프라인 (plumbing)이 이미 존재했기 때문에 몇 시간 만에 HF (Hugging Face)에 부분적인 GGUF 파일들이 올라왔습니다. 하지만 이번 모델은 그렇지 않습니다. 만약 누군가 실제로 BailingMoeV2_5 변환을 시도해 보았다면, 얼마나 차이가 나나요? 22641 스레드는 아무도 그 질문에 답하기 전에 종료되었습니다.
...그리고 이 글을 다 쓰고 나서 그들의 출시 스레드를 확인했습니다. 아무도 실제로 읽지 않은 건가요? ㅎㅎ "무료 액세스는 8월 3일까지 진행됩니다. 오픈 소스 공개가 곧 예정되어 있으니 계속 지켜봐 주세요." 7월 24일에 게시되었습니다. https://x.com/AntLingAGI/status/2080554215144059027
제 생각에는 4월 22일에 발표되어 일주일간의 무료 API를 제공하고 28일에 HF에 가중치가 올라왔던 2.6-flash와 동일한 패턴인 것 같습니다. 가중치는 무료 이용 기간 이후에 공개된다는 것이 패턴이며, 우리 모두가 점을 치고 있는 동안 그 정보는 그들의 스레드에 내내 놓여 있었습니다.
submitted by /u/niacolhealth
[link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기