텍스트, 이미지, 비디오 기능을 갖춘 이 AI 모델: 알아야 할 모든 것
요약
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-GGUF는 텍스트, 이미지, 비디오 기능을 갖춘 대규모 로컬 구동(locally runnable) GGUF 모델입니다. 이 모델은 MoE 아키텍처와 Hermes 에이전트 동작 방식을 통합하여 코딩, 도구 사용, 장문 분석 등 다양한 고급 작업을 수행할 수 있도록 설계되었습니다.
핵심 포인트
- 350억 매개변수 규모의 대형 GGUF 모델입니다.
- MoE 아키텍처와 262K 토큰 네이티브 컨텍스트를 가집니다.
- Hermes 에이전트 기능을 통해 도구 사용 및 계획에 적합합니다.
- 로컬 환경에서 코딩, 장문 분석 등 고급 작업을 시도할 수 있습니다.
개요
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-GGUF는 네이티브 텍스트, 이미지, 비디오 기능을 갖춘 로컬 구동(locally runnable) 방식의 텍스트-투-텍스트 GGUF 릴리스입니다. LuffyTheFox가 무검열된 HauhauCS Qwen3.6-35B-A3B 기본 모델을 기반으로 제작했으며, Genesis 텐서 복구 프로세스를 적용하고 Hermes 파인튜닝에서 가져온 두 개의 FFN 전문가 텐서 약 2,000 블록을 전송하여 Hermes-agent 동작 방식을 추가했습니다. 이 모델은 총 350억 개의 매개변수를 가지고 있으며, 순방향 패스(forward pass)당 약 30억 개의 활성 매개변수, 262K 토큰의 네이티브 컨텍스트 창을 가지며, Gated DeltaNet 선형 어텐션과 전체 소프트맥스 어텐션을 결합한 하이브리드 MoE 아키텍처를 사용합니다.
핵심 실용적 포인트: 이 모델은 가벼운 3B 모델이 아니라 대규모 GGUF 모델입니다. 활성 매개변수 수는 전체 저장 공간이나 메모리 사용량을 설명하지 않습니다. llama.cpp, LM Studio, koboldcpp 및 기타 GGUF 호환 런타임에서 실행할 수 있습니다. 모델 카드에서는 NVFP4 또는 APEX 양자화를 권장하며, 8GB 및 12GB GPU의 경우 APEX Compact를 추천합니다. 명시된 라이선스는 Apache-2.0이지만, 상업적 배포 전에 업스트림 구성 요소의 약관을 확인해야 합니다.
최적 사용 사례
로컬 코딩 및 정밀한 지침 따르기. 모델 카드에는 코딩 및 정밀 작업을 위한 전용 사고 모드(thinking-mode) 샘플링 프로필이 제공됩니다: temperature 0.6, top_p 0.95, top_k 20, min_p 0.01, seed 42이며, presence와 repeat 페널티는 비활성화되어 있습니다. Hermes에서 파생된 에이전트 동작 방식과 대규모 컨텍스트 덕분에 코드 설명, 다중 파일 계획(multi-file planning), 구조화된 기술 작업에 적합한 후보입니다. README에는 벤치마크 결과가 제공되지 않으므로, 프로덕션 코드로 의존하기 전에 자체 코딩 작업을 통해 테스트해 보십시오.
도구 지향형 어시스턴트 워크플로우. Hermes 에이전트 전송과 권장 함수 호출 데이터셋 명령어는 이 릴리스를 도구 사용 규칙을 따라야 하는 로컬 에이전트에 관련성 있게 만듭니다. 모델 카드에는 스키마 제약 조건이 있는 응답을 위한 JSON 기반 시스템 프롬프트 패턴도 제공됩니다. 이를 신뢰할 수 있는 도구 실행의 증거가 아닌, 프롬프팅 가이드로 간주하십시오: README에는 함수 호출 정확도나 구조화된 출력 벤치마크가 보고되지 않았습니다.
장문 분석. 네이티브 컨텍스트는 262K 토큰이며, 모델 카드에 따르면 사고 능력을 유지하기 위해 최소 128K의 컨텍스트를 유지해야 한다고 합니다. 이는 런타임 메모리 및 컨텍스트 캐시 비용에 따라 긴 보고서, 코드베이스 또는 문서 컬렉션을 포함하는 실험에 적합합니다. 모델 카드에는 YaRN이 컨텍스트를 1M까지 확장할 수 있다고 나와 있지만, 그 길이에서의 품질이나 속도 측정은 제공하지 않습니다.
검열되지 않은 창의적 글쓰기 및 역할극. 기본 모델(base)은 명시적으로 검열되지 않았다고 설명되어 있으며, 유지 관리자는 기본 모델에 대해 465개 프롬프트 테스트에서 거부율이 0이라고 보고합니다. 이 결과는 독립적인 안전 또는 품질 평가가 아닌, 유지 관리자가 보고한 테스트입니다. 카드에는 비사고적 창의 프로필(temperature 0.7, top_p 0.8, top_k 20, min_p 0.01)과 선택적 창의 시스템 프롬프트가 제공됩니다.
멀티모달 로컬 실험. 아키텍처는 텍스트, 이미지 및 비디오에 대해 네이티브하게 멀티모달이라고 설명되어 있습니다. GGUF에서의 시각(vision)을 위해 README에는 메인 모델 파일과 함께 mmproj 파일을 요구합니다. 제공된 자료에는 지원되는 이미지 또는 비디오 형식, 해상도 제한 또는 멀티모달 벤치마크 결과가 명시되어 있지 않으므로, 이를 중심으로 워크플로우를 구축하기 전에 선택한 런타임에서 해당 기능을 검증해야 합니다.
한계점(Limitations)
README에는 독립적인 벤치마크 점수, 측정된 추론 속도, 지연 시간(latency), 처리량(throughput) 또는 정확한 VRAM 요구 사항이 제공되지 않습니다. 활성 파라미터(active-parameter)가 3B라는 수치가 전체 35B 모델이 3GB 메모리에 들어간다는 것을 의미하지는 않습니다. 양자화(quantization), 컨텍스트 길이, 캐시 정밀도, CPU/GPU 오프로드는 모두 자원 사용에 영향을 미칩니다.
유지 관리자는 APEX를 위한 F16 K 및 V 캐시 양자화, 최대 GPU 오프로드, 그리고 40개 레이어의 MoE(Mixture-of-Experts) 가중치를 CPU로 강제하는 것을 권장하지만, 이러한 설정에 대한 하드웨어 구성이나 성능 결과를 제공하지는 않습니다.
모델 카드에 명시된 Genesis 주장은 노이즈 감소, 신호 및 학습된 기울기(learned gradient)의 99% 보존, 개선된 안정성 등을 포함하며, 이는 유지 관리자가 만든 맞춤형 텐서 복구 방식에 대한 설명입니다. 제공된 자료에는 통제된 비교, 재현 가능한 평가 결과 또는 독립적인 검증이 포함되어 있지 않습니다. 이 모델은 재학습되거나(retrained) 전통적으로 엔드투엔드로 미세 조정되었다고(fine-tuned) 기술되지 않았습니다. 유지 관리자는 Genesis가 GGUF 텐서 데이터를 수정하며, Hermes 데이터는 약 2,000개의 블록에서 두 개의 FFN 전문가 텐서로부터 전송되었다고 말합니다.
검열되지 않은 기본 모델과 보고된 0/465 거부 결과는 안전성 트레이드오프(safety tradeoff)를 시사합니다. 이 모델이 유해한 요청을 거부하거나 배포의 안전 요구 사항을 충족할 것이라고 가정하지 마십시오. README에는 또한 컨텍스트가 128K 미만일 경우 사고 능력에 영향을 줄 수 있다는 경고와, 1M YaRN 확장 기능에 대한 보고된 품질 측정값이 없다는 내용이 있습니다. 비전(Vision) 기능을 사용하려면 별도의 mmproj 파일이 필요하며, 주 GGUF 모델만으로는 해당 용도를 충족하기에 충분하지 않습니다.
명시된 라이선스는 Apache-2.0입니다. 제공된 자료는 모든 상위 구성 요소와 재분배된 양자화가 동일한 조건을 가지는지 명확히 하지 않으므로, 상업적 사용 전에 관련 모델 및 아티팩트 라이선스를 검토하십시오. 이 릴리즈를 대체하는 특정 최신 모델은 확인되지 않았습니다.
비교 분석 방법
제공된 대안들은 동일한 유지보수자(maintainer)의 다른 Genesis Hermes 버전을 나타냅니다. 제공된 정보는 버전 간의 통제된 품질, 속도 또는 비용 비교를 제공하지 않으므로, 버전 번호만으로는 어떤 버전이 더 나은 성능을 보이는지 확정할 수 없습니다.
- Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF: 이 배포판은 여기서 문서화된 특정 조합(HauhauCS uncensored base, 약 2,000 블록 분량의 두 FFN expert tensor를 통한 Hermes 데이터 전송, 그리고 설명된 Genesis 복구)을 원할 때 선택하십시오. 만약 자체 모델 카드에 배포 환경에 필요한 기능, 양자화(quant), 또는 런타임 적합성이 문서화되어 있다면 V6를 선택하십시오. 제공된 비교 데이터는 품질이나 속도의 우위를 확립하지 않습니다.
- Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-Final-GGUF: 이 가이드에서 설명하는 정확한 배포판과 그 명시된 설정 및 양자화 권장 사항을 필요로 할 때 이 모델을 선택하십시오. 만약 아티팩트(artifact)나 카드가 귀하의 런타임 또는 배포 요구 사항에 더 잘 맞으면 Final을 선택하십시오. 여기에는 측정된 품질, 지연 시간(latency), 또는 메모리 비교가 제공되지 않습니다.
- Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V10-GGUF: 이 배포판은 현재 모델의 명시된 262K 네이티브 컨텍스트, 멀티모달 지원, 그리고 APEX/NVFP4 지침을 원할 경우 문서화된 선택지입니다. 만약 자체 카드나 파일이 작업에 더 나은 적합성을 제공한다면 V10을 고려하십시오. 제공된 자료는 V10이 더 빠르거나, 더 정확하거나, 실행 비용이 저렴하다는 것을 확립하지 않습니다.
- Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V9-GGUF: 여기서 문서화된 특정 Genesis/Hermes 구성 및 런타임 지침을 위해 이 배포판을 선택하십시오. 만약 작업 부하(workload)에서 검증했거나 버전별 아티팩트가 필요하다면 V9를 선택하십시오. 제공된 자료에는 일반적인 품질이나 속도 선호도를 뒷받침하는 벤치마크 증거가 없습니다.
- Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF: 이 배포판은 APEX 설정, 컨텍스트 길이 및 멀티모달
mmproj에 대한 명시적인 권장 사항을 가지고 있습니다.
use. V7이 자체 파일이나 카드가 배포 환경에 더 적합할 수 있지만, 제공된 정보에는 출력 품질, 추론 속도 또는 비용의 차이를 정량화한 내용은 없습니다.
기술 사양 (Technical Specifications)
이 모델은 총 350억 개의 파라미터와 순방향 패스(forward pass)당 약 30억 개의 활성 파라미터를 사용하는 Mixture-of-Experts (MoE) 아키텍처를 사용합니다. 이 모델은 토큰당 8개의 라우팅된 전문가(routed experts)와 1개의 공유 전문가(shared expert)를 포함하여 총 256개의 전문가를 가지고 있습니다. 40개 레이어는 세 개의 DeltaNet-MoE 레이어가 하나씩 Attention-MoE 레이어를 따라 반복되는 패턴을 따르며, 총 10번 반복됩니다. 어텐션 설계는 Gated DeltaNet 선형 어텐션과 전체 소프트맥스(softmax) 어텐션을 3:1 비율로 결합합니다.
컨텍스트 (Context): 기본적으로 262K 토큰을 지원하며, YaRN을 통해 1M까지 확장 가능합니다. 모델 카드는 사고 능력을 유지하기 위해 최소 128K의 컨텍스트를 권장합니다.모달리티 (Modalities): 텍스트, 이미지, 비디오가 네이티브 기능으로 나열되어 있습니다. GGUF에서의 비전 지원은 메인 GGUF 파일과 함께 mmproj 파일을 필요로 합니다.어휘 및 언어 (Vocabulary and languages): 248K 어휘를 가지며 201개 언어를 지원합니다.모델 형식 및 런타임 (Model format and runtime): GGUF; llama.cpp, LM Studio, koboldcpp 등 다른 GGUF 호환 런타임과 호환됩니다. llama.cpp의 --jinja
chat-template 처리를 위한 플래그.양자화(Quantization): 권장 옵션은 NVFP4와 APEX입니다. 8GB 또는 12GB 메모리의 GPU에는 APEX Compact가 권장됩니다. README에는 Unsloth 프로파일 지원을 하는 양자화 스크립트 링크가 있으며, 별도의 NVFP4 GGUF 릴리스를 가리킵니다.APEX 설정: K 및 V 캐시 양자화를 F16으로 설정하고, 40개 레이어에 대한 MoE(Mixture-of-Experts) 가중치를 CPU로 강제 지정하며, GPU 오프로드를 최대값으로 설정하고, 활성 전문가를 8로 설정합니다.샘플링 프로파일: Thinking-mode Hermes 에이전트 및 코딩/정밀 작업은 temperature 0.6, top_p 0.95, top_k 20, min_p 0.01, seed 42, 그리고 비활성화된 presence penalty를 사용합니다. Hermes 에이전트 프로파일은 repeat_penalty 1.05를 사용하며, 코딩/정밀 작업은 repeat penalty를 비활성화합니다. Thinking-mode 일반 사용 시에는 temperature 0.95와 동일한 top_p, top_k, min_p, seed, 그리고 비활성화된 페널티를 사용합니다. Non-thinking 창의적 일반 사용 시에는 temperature 0.7, top_p 0.8, top_k 20, min_p 0.01, seed 42, 그리고 비활성화된 페널티를 사용합니다.Genesis 프로세스 (유지보수자가 설명한 바): 유지보수자는 이 프로세스가 ssm_conv1d 텐서를 스캔하고 헤드 균형을 조정한다고 말합니다. 세 가지 매개변수를 사용하여 청크 단위로 텐서 블록을 스캔하고, 0인 청크를 선택된 청크로 대체한 다음, Marchenko–Pastur 법칙을 사용한 사용자 정의 SVD(Singular Value Decomposition)를 통해 학습 노이즈를 감지하고 줄입니다. 이 프로세스는 token_embd.weight와 output.weight를 제외합니다.
, 1D 텐서(tensors), 바이어스(biases), 및 노름(norms). 유지 관리자는 이 모델이 전체 모델을 재훈련하거나 미세 조정할 필요 없이 Python과 무료 Google Colab Tesla T4 GPU를 사용하여 GGUF로 실행된다고 말합니다.학습 및 데이터: README는 HauhauCS uncensored 모델을 기반으로 하고, Hermes Qwen3.5 GGUF 미세 조정을 전송된 데이터의 출처로 식별합니다. 이는 두 개의 FFN 전문가 텐서(expert tensors)에서 나온 약 2,000개의 블록을 보고합니다. 기본 모델에 대한 학습 단계 수, 전체 데이터셋 크기 또는 학습 컴퓨팅은 제공하지 않습니다.성능 및 메모리: 측정된 초당 토큰 수, 지연 시간(latency), 배치 크기 가이드라인, 또는 정확한 VRAM 요구 사항이 제공되지 않았습니다. 8 GB와 12 GB 수치는 APEX Compact를 사용하라는 유지 관리자의 권장 사항일 뿐이며, 모든 컨텍스트 길이 또는 실행 구성에 맞을 것이라는 보장은 아닙니다.
모델 입력 및 출력
입력(Inputs)
텍스트: 제공된 채팅 템플릿을 사용하는 프롬프트 및 대화 메시지. llama.cpp에서는 적절한 템플릿 처리를 위해 --jinja를 활성화해야 합니다.이미지: 모델 카드에 따라 네이티브 모달리티(modality)로 지원됩니다. GGUF 비전 사용에는 일치하는 mmproj 파일이 필요합니다. README는 이미지 형식이나 해상도 제한을 명시하지 않습니다.비디오: 네이티브 모달리티로 나열되어 있습니다. README는 비디오 컨테이너 형식, 프레임 처리 또는 제한 사항을 명시하지 않습니다.컨텍스트: 네이티브 컨텍스트는 262K 토큰입니다. YaRN 확장은 1M까지 가능하다고 언급되었지만, 카드에서는 사고 능력을 유지하기 위해 최소 128K를 권장합니다.
출력(Outputs)
텍스트: 코딩, 일반, 창의적 및 에이전트 스타일 응답을 포함한 생성된 어시스턴트 응답.구조화된 텍스트: 모델 카드는 에이전트 작업에 대해 제공된 스키마 플레이스홀더가 있는 JSON 시스템 프롬프트를 권장합니다. 구조화된 출력 보장이나 검증률은 보고하지 않습니다.멀티모달 응답: 이 모델은 네이티브 멀티모달로 설명되지만, README는 비전 입력을 위한 mmproj 요구 사항 외에 출력 모달리티나 후처리 요구 사항을 명시하지 않습니다.
시작하기(Getting Started)
README에는 런타임 및 샘플링 설정은 제공되지만, Python 로딩 또는 추론 예시는 없으며, Python 추론 라이브러리나 API를 식별하지 못합니다. 따라서 신뢰할 수 있는 복사-붙여넣기 가능한 Python 예시를 제공된 정보만으로는 도출할 수 없습니다. 문서화된 로컬 설정을 위해서는 llama.cpp, LM Studio 또는 koboldcpp와 같은 GGUF 호환 런타임을 사용하십시오. llama.cpp에서는 --jinja를 전달하고 비전 기능을 사용할 때는 mmproj 파일을 포함하십시오. 권장 시스템 프롬프트로 시작하고, 사고 모드에 대한 유지 관리자의 지침을 따르려면 컨텍스트 길이를 128K 이상으로 유지하십시오.
자주 묻는 질문 (FAQ)
질문: Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-GGUF를 상업적으로 사용할 수 있나요?
답변: 명시된 라이선스는 Apache-2.0입니다. 제공된 자료는 모든 업스트림 구성 요소나 양자화 아티팩트의 라이선스를 명확히 하지 않으므로, 상용 배포 전에 해당 약관들을 검토하십시오.
질문: 이를 실행하는 데 필요한 하드웨어 또는 VRAM은 무엇인가요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기