Qwythos-9B-v2, 추론 능력을 저해하지 않으면서 AI 반복 문제를 해결하다
요약
empero-ai가 개발한 Qwythos-9B-v2는 FTPO 기술을 통해 모델의 추론 능력을 유지하면서도 반복적인 출력 문제를 완벽히 해결한 9B 파라미터 모델입니다. 100만 토큰의 긴 컨텍스트 창과 높은 코드 생성 능력을 갖추고 있으며, 기술적 주제에 대해 과도한 검열 없이 정확한 정보를 제공합니다.
핵심 포인트
- FTPO 기법 적용으로 탐욕적 디코딩 시 루핑 비율을 6.7%에서 0%로 감소
- Qwen3.5-9B 아키텍처 기반의 하이브리드 주의 집중 방식 채택
- 1,048,576 토큰의 방대한 컨텍스트 창 지원
- HumanEval 77.4% 기록 등 강력한 코드 생성 및 기술적 추론 능력
- 연구 및 임상 문서를 위한 낮은 거부율(0%) 유지
개요 (Overview)
Qwythos-9B-v2는 empero-ai가 개발한 90억 파라미터(9-billion-parameter) 텍스트 생성 모델로, 기존 Qwythos의 추론 능력을 유지하면서 반복적인 출력 문제를 해결했습니다. Qwen3.5-9B 아키텍처(3:1 Gated-DeltaNet 선형 주의 집중(linear-attention)과 전체 주의 집중(full attention) 블록이 결합된 하이브리드 방식)를 기반으로 구축되었으며, 이 모델은 네이티브 멀티 토큰 예측(multi-token-prediction) 헤드, YaRN RoPE 스케일링을 통한 1,048,576 토큰의 컨텍스트(context), 그리고 연구 및 기술 작업을 위해 의도적으로 제한을 두지 않은 성능을 제공합니다. 핵심 혁신은 FTPO (Final-Token Preference Optimization)로, 이는 v1에서 발생했던 루핑/반복 문제를 제거하는 타겟 미세 조정(fine-tuning) 방법입니다(탐욕적 디코딩(greedy decoding) 시 루핑 비율이 6.7%에서 0%로 감소). 이 과정에서 벤치마크 전반에 걸친 지식이나 추론 능력은 저하되지 않았습니다. 이 모델은 Hugging Face의 transformers 라이브러리에서 safetensors 형식의 bfloat16 가중치로 실행되며, Qwen3.5 네이티브 ChatML 스타일의 토크나이저(tokenizer)를 사용합니다.
최적의 사용 사례 (Best use cases)
긴 컨텍스트 추론 및 분석: 이 모델은 100만 토큰의 컨텍스트 창(context window)과 보존된 추론 성능(Chain-of-thought 적용 시 MMLU 83.8%, GSM8K 93.6%) 덕분에 긴 문서나 코드베이스에 대해 확장된 사고 사슬(chain-of-thought)을 요구하는 문제에 탁월합니다. 전체 연구 논문, 여러 소스 파일, 또는 복잡한 다단계 수학 문제를 잘림 없이 추론해야 하는 경우, 이 모델의 컨텍스트 길이와 추론 흔적(reasoning traces)은 더 작은 컨텍스트를 가진 대안들보다 실질적으로 더 강력한 성능을 발휘합니다. 루핑 수정 덕분에 인위적인 반복 페널티 없이 긴 생성 과정 동안 추론의 일관성을 유지할 수 있습니다.
코드 생성 및 기술적 문제 해결 (Code generation and technical problem-solving): HumanEval에서 77.4%의 pass@1을 기록하고, expand-around-center 알고리즘 예시에서 올바른 알고리즘 선택과 설명을 보여줌으로써, 이 모델은 타당한 설명과 함께 작동 가능한 코드를 생성합니다. Claude 트레이스(traces)를 통한 학습 덕분에 단순히 구문(syntax)을 생성하는 것에 그치지 않고 특정 접근 방식이 왜 작동하는지를 설명하는 경향이 있어, 기능적인 코드와 교육적인 출력이 모두 필요한 상황에서 유용합니다. 1M-토큰 컨텍스트(context)는 전체 프로젝트 리팩토링(refactoring)이나 다중 파일 코드 이해에 특히 가치가 있습니다.
검열되지 않은 기술 및 임상 문서 (Uncensored technical and clinical documentation): 이 모델은 나록손(naloxone)의 메커니즘, 약리학(pharmacology), 화학(chemistry), 생물학(biology), 사이버 보안 연구와 같은 정당한 기술적 주제에 대해 과도하게 거부하지 않습니다. 민감한 주제에 대해 거부 반응으로 무너지는 많은 오픈 소스 모델들과 달리, Qwythos-9B-v2는 0%의 거부율을 유지하면서 연구 수준의 질문에 직접적으로 대응합니다. 이는 콘텐츠 필터링보다 정확한 정보가 더 중요한 교육 자료, 임상 요약 및 보안 연구 문서에 적합합니다.
페널티 우회 방식 없이 가능한 탐욕적 및 저온 디코딩 (Greedy and low-temperature decoding without penalty workarounds): 루핑(looping) 문제가 학습을 통해 제거되었기 때문에, repetition_penalty(반복 페널티)를 핵심적인 안전 장치로 의존하지 않고도 탐욕적 디코딩(greedy decoding)이나 저온 샘플링(low-temperature sampling, 0.6)을 사용할 수 있습니다. 이는 반복 페널티가 유발할 수 있는 품질 저하 없이 결정론적이거나 안정적인 출력을 원하는 프로덕션 서빙(production serving) 환경에서 가치가 있습니다. 모델은 온도(temperature) 0.6에서 직접적으로 깨끗하고 반복 없는 출력을 생성합니다.
추측적 디코딩 및 효율적인 서빙 (Speculative decoding and efficient serving): (v2에서 복구된) 네이티브 멀티 토큰 예측 헤드(multi-token-prediction head)는 추측적 디코딩(speculative decoding) 설정을 가능하게 하여, 초안 모델(draft-model) 가속을 통한 더 빠른 토큰 생성을 허용합니다. 대규모 서빙을 위해, 현대적인 추론 최적화 기술과의 이러한 아키텍처적 호환성은 MTP 지원이 없는 모델보다 더 효율적인 성능을 제공합니다.
한계점 (Limitations)
루핑 수정(Looping fix)이 절대적인 능력을 향상시키지는 않습니다. 이번 릴리스는 명시적으로 위생(hygiene) 목적의 릴리스입니다. 이 모델은 추론 벤치마크에서 기본 Qwythos와 동일한 점수를 기록합니다. 즉, 승리 지점은 더 높은 원시 점수(raw scores)가 아니라 견고함(robustness)과 더 깔끔한 동작입니다. 특정 벤치마크에서 최대 성능이 필요하다면, v2가 기본 모델보다 뛰어날 것이라고 기대하기보다는 직접 측정해야 합니다.
HumanEval 성능이 약간 하락했습니다. pass@1 기준 77.4%를 기록하여, 원시 Qwen3.5-9B 기본 모델(81.7%) 및 기존 Qwythos(79.9%)보다 낮은 점수를 보였습니다. 이는 미세 조정(fine-tuning) 과정에서 발생하는 작지만 측정 가능한 비용입니다. 사용 사례에서 루핑(looping) 문제가 중요하지 않다면, 표준 벤치마크에서의 순수한 코드 생성 속도와 정확성을 위해 기본 Qwen3.5-9B를 사용하는 것이 더 선호될 수 있습니다.
MTP 헤드가 미세 조정된 가중치와 공동 학습(co-trained)되지 않았습니다. 멀티 토큰 예측(multi-token-prediction, MTP) 모듈은 FTPO 미세 조정과 함께 재학습되지 않고 기본 Qwen3.5-9B에서 복구되었습니다. 이는 MTP와 메인 가중치가 공동 최적화된 모델에 비해 투기적 디코딩(speculative-decoding) 수락률이 완만할 수 있음을 의미합니다. 속도를 위해 투기적 디코딩에 크게 의존한다면, 두 구성 요소가 함께 미세 조정된 아키텍처보다 가속 효과가 덜 드라마틱할 수 있음을 예상해야 합니다.
GPQA-diamond 성능이 하락했습니다. 모델은 GPQA-diamond에서 49.0%를 기록하여 기본 Qwythos의 52.0%와 비교되는 수치를 보였으며, 이는 미세 조정이 어려운 지식 질문에 대한 성능을 약간 저하시켰을 수 있음을 시사합니다. 이는 평가 노이즈(eval noise) 범위 내에 있지만, 사용 사례가 고도로 전문화된 과학적 추론인 경우 주목할 만한 사항입니다.
YaRN 정적 스케일링(static scaling)은 짧은 컨텍스트와의 트레이드오프를 수반합니다. 1M 토큰 컨텍스트는 정적 YaRN 스케일링(네이티브 262,144 윈도우의 4배)을 통해 활성화되었습니다. 이 스케일링은 측정 가능한 짧은 컨텍스트 트레이드오프를 수반합니다. 주로 짧은 프롬프트를 다룬다면, RoPE 스케일링이 없는 모델에 비해 성능이 약간 저하되는 것을 볼 수 있습니다. 유지 관리자들은 짧은 시퀀스가 중요한 경우, 실제로 사용하는 컨텍스트 길이에 맞춰 RoPE 계수(rope factor)를 스케일링할 것을 권장합니다.
의도적으로 검열되지 않음—책임감 있는 배포가 필요합니다. 이 모델은 다른 모델들이 거부하는 주제(약리학 합성, 사이버 보안 취약점 공격, 공격적인 코드 등)에 관여할 것입니다. 연구용으로는 적합하지만, 적용 가능한 법률 및 윤리적 가이드라인 내에서 배포되어야 합니다. 이는 능력의 한계가 아니라 책임감 있는 사용을 위한 요구 사항입니다.
공식 벤치마크가 아닌 내부 하네스(internal harness)를 통한 평가입니다. 보고된 수치(MMLU, ARC, GSM8K 등)는 지정된 샘플 크기(대부분 n=500, GPQA의 경우 n=198)를 가진 Empero AI의 내부 평가 프레임워크에서 도출되었습니다. 이는 표준 리더보드 평가 결과가 아니므로, 다른 보고된 점수와 직접 비교하기가 더 어렵습니다. 이 수치들은 Empero 모델 간의 상대적 비교를 위해 사용하되, 다른 모델 카드와 일대일 비교(apples-to-apples comparison)가 필요한 경우에는 공식 하네스(official-harness) 수치를 추가하십시오.
다운로드 수 67회에 불과합니다. 채택률이 매우 낮으며, 이는 Empero AI 외부에서의 실제 환경 테스트가 제한적임을 시사합니다. 커뮤니티 피드백과 알려진 실패 모드(failure modes)가 부족할 수 있습니다.
비교 분석
vs. Qwythos-9B-Claude-Mythos-5-1M: Qwythos-9B-v2를 선택하십시오.
기본 Qwythos에서 루핑(looping) 또는 반복 문제를 경험하거나, 반복 페널티(repetition penalties) 없는 탐욕적 디코딩(greedy decoding)이 필요한 경우에 해당합니다. 기본 Qwythos는 직접적인 이전 모델이며, v2는 동일한 추론 능력을 유지하면서 더 깔끔한 동작을 제공하는 즉시 교체 가능한(drop-in) 개선판으로 설계되었습니다. 이미 파라미터를 튜닝했으며 재튜닝을 원하지 않는 경우에만 기본 Qwythos를 유지하십시오.
vs. Qwythos-9B-Claude-Mythos-5-1M-GGUF: 소비자용 하드웨어 또는 VRAM이 최소화된 CPU에서 실행해야 하거나, llama.cpp, Ollama 또는 유사한 엔진 내에서 실행해야 하는 경우 GGUF 양자화(quantized) 버전을 선택하십시오. 전체 bfloat16 형식의 Qwythos-9B-v2는 GPU를 사용하거나 최대 정밀도가 중요한 배포를 위한 것이며, GGUF는 정밀도를 속도 및 메모리와 교환합니다. GGUF 모델은 v2가 아닌 기본 Qwythos의 양자화 변형이므로, 양자화된 형태에서도 루핑 수정 사항을 적용하고 싶다면 v2를 직접 양자화해야 합니다.
vs. Qwable-9B-Claude-Fable-5: 일반적인 추론 (reasoning), 수학, 그리고 분석 작업을 위해서는 Qwythos-9B-v2를 선택하세요.
만약 당신의 워크로드가 에이전트형 코딩 (agentic coding), 도구 사용 (tool-use), 또는 외부 함수 호출을 포함한 다회차 추론 (multi-turn reasoning)이라면 Qwable-9B-Claude-Fable-5를 선택하세요. 이 모델은 해당 특정 패턴을 목표로 하는 증류 방식 (distillation-style)의 미세 조정 (fine-tune) 모델입니다. 두 모델 모두 9B 규모이지만, Qwythos는 사고 사슬 (chain-of-thought) 추론에 집중하는 반면, Qwable은 에이전트 행동 (agent behavior) 및 도구 통합 (tool integration)에 집중합니다.
기술 사양 (Technical specifications)
아키텍처 (Architecture): 3:1 비율의 Gated-DeltaNet 선형 주의 (linear-attention) 레이어와 전체 주의 (full attention) 블록을 결합한 Qwen3.5-9B 하이브리드 모델입니다. 기본적으로 멀티모달 (multimodal) 능력을 갖추고 있으나 (실제로는 텍스트 전용), 복구된 네이티브 다중 토큰 예측 (multi-token-prediction, MTP) 헤드를 포함합니다.
파라미터 (Parameters): 90억 개 (9 billion), safetensors 형식의 bfloat16 정밀도로 저장됩니다.
컨텍스트 창 (Context window): 네이티브 262,144 토큰 창의 4배인 1,048,576 토큰을 사용하며, YaRN rope-scaling을 적용합니다. 정적 스케일링 (Static scaling)이 균일하게 적용되며, 특정 컨텍스트 길이에 대해 동적 스케일링 (dynamic scaling)을 구성할 수 있습니다.
학습 데이터 및 방법 (Training data and method): FTPO (Final-Token Preference Optimization)를 통해 약 2,000개의 선호도 튜플 (preference tuples)로 미세 조정되었습니다. 선호도 쌍 (Preference pairs)은 낮은 온도 (low temperature)에서 루핑 (looping)을 유도하고, 모델 자체의 분포에서 루프 시작 토큰과 일관성 있는 상위-k (top-k) 대안을 추출함으로써 자동 채굴되었습니다. 베이스 모델은 Qwythos-9B-Claude-Mythos-5-1M입니다.
학습 하이퍼파라미터 (Training hyperparameters):
- LoRA 랭크 (rank, r) = 256, 알파 (alpha, α) = 128
- 학습률 (Learning rate) = 1.5e-5
chosen_win ≥ 0.30에서 조기 종료 (early stopping)를 적용한 1 에포크 (epoch)- 모든 주의 투영 (attention projections), MLP 투영 (MLP projections), 그리고
lm_head를 학습 (이들에 대해 LoRA 적용) - 조기 종료 기준 (Early stopping criterion): 최소 0.30 이상의 선택 승리 마진 (chosen-win margin)
토크나이저 (Tokenizer): ChatML 스타일의 채팅 템플릿을 사용하는 Qwen3.5 네이티브 토크나이저.
라이브러리 지원 (Library support): Hugging Face transformers 라이브러리에서 실행됩니다 (AutoModelForImageTextToText 및 AutoTokenizer로 테스트됨). 서빙을 위해 vLLM과 호환됩니다 (--trust-remote-code 필요).
추론 최적화 (Inference optimization): 네이티브 다중 토큰 예측 (multi-token-prediction) 헤드를 통해 호환 가능한 서빙 스택에서 투기적 디코딩 (speculative-decoding) 가속을 지원합니다.
라이선스 (License): Apache-2.0 (허용적이며, 출처 표기 시 상업적 이용 가능).
모델 입력 및 출력 (Model inputs and outputs)
입력 (Inputs)
- ChatML 형식의 텍스트 프롬프트 (
tok.apply_chat_template()를 통해 자동 적용) {"role": "user"/"assistant", "content": "..."}딕셔너리 리스트로 전달되는 단일 턴(single-turn) 또는 다중 턴(multi-turn) 대화 기록- 샘플링 파라미터 (Sampling parameters): temperature (0.6 권장), top_p (0.95), top_k (20), repetition_penalty (1.05, 현재 선택 사항), max_new_tokens (추론 작업의 경우 최대 16384까지)
- 성능 저하 없이 탐욕적 디코딩 (greedy decoding, temperature=0, 샘플링 없음)과 호환 가능
출력 (Outputs)
- UTF-8 문자열로 디코딩된 생성된 텍스트 토큰
- 추론 스타일의 프롬프트가 주어질 경우 최종 답변과 교차되는 사고 사슬 (Chain-of-thought) 추론
- 구현 작업 요청 시 설명이 포함된 코드
- 민감한 주제에 대한 필터링되지 않은 기술적/임상적 콘텐츠 (안전 거부(safety refusals)가 적용되지 않음)
시작하기 (Getting started)
from transformers import AutoModelForImageTextToText, AutoTokenizer
model_id = "empero-ai/Qwythos-9B-v2"
tok = AutoTokenizer.from_pretrained(model_id)
...
대규모 서빙을 위해 vLLM을 지원합니다:
python -m vllm.entrypoints.openai.api_server \
--model empero-ai/Qwythos-9B-v2 \
--trust-remote-code \
...
자주 묻는 질문 (Frequently asked questions)
Q: Qwythos-9B-v2가 기본 Qwythos의 루핑(looping) 문제를 해결했나요?
A: 네. 탐욕적 디코딩 (greedy decoding) 시 루핑 발생률이 6.7%에서 0.0%로 감소했으며, temperature 0.6에서는 1.3%에서 0.7%로 감소했습니다. 이것이 v2 출시의 주요 목표였습니다. 이 해결책은 FTPO를 사용하여 루프를 시작하는 정확한 토큰을 타겟팅하고, 대신 일관된 연속성을 선호하도록 모델을 학습시킵니다.
Q: 이 모델을 상업적으로 사용할 수 있나요?
A: 네. Apache-2.0 라이선스는 라이선스 사본과 저작권 고지 사항을 포함하는 조건 하에 상업적 이용, 수정 및 배포를 허용합니다. 로열티나 별도의 허가는 필요하지 않습니다.
Q: Qwythos-9B-v2를 실행하려면 어떤 하드웨어가 필요한가요?
A: 이 모델은 bfloat16 형식의 9B 파라미터 모델로, 추론 (inference)을 위해 약 18 GB의 VRAM이 필요합니다. 단일 사용자 서빙에는 NVIDIA A100, RTX 4090 또는 유사한 GPU가 실용적입니다. 멀티 GPU 서빙이나 비용에 민감한 배포의 경우, 양자화 (quantized) 버전 (예: GGUF) 또는 더 작은 컨텍스트 윈도우 (context windows)를 사용하여 메모리 요구 사항을 줄일 수 있습니다. CPU 추론은 느리지만 양자화를 통해 가능합니다.
Q: 추론 (reasoning) 작업에서 v2는 기본 Qwythos와 비교해 어떤가요?
A: 평가 노이즈 (evaluation noise) 범위 내에서 MMLU, GSM8K, ARC, GPQA 점수는 동일합니다. 즉, v2는 성능(capability) 업그레이드가 아닙니다. 차이점은 v2가 임시방편으로서 repetition_penalty를 사용할 필요 없이, 탐욕적 디코딩 (greedy decoding) 또는 낮은 온도 (low-temperature) 디코딩 환경에서도 일관성을 유지한다는 점입니다. 기본 모델에서 루핑 (looping) 문제가 발생하지 않는다면, 추론 성능의 이득은 없습니다.
Q: 이 모델을 추가로 미세 조정 (fine-tune)할 수 있나요?
A: 네. 모델은 safetensors 형식으로 배포되며, peft 라이브러리를 통한 LoRA 미세 조정 (fine-tuning) 및 transformers를 통한 전체 파라미터 미세 조정 (full-parameter fine-tuning)과 호환됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기