Qwengram-0.8B: Qwen3.8 Flash-Next의 n-gram 메모리를 Qwen3.5-0.8B에 전이하여 검증된 퍼플렉서티를
요약
본 기사는 Qwen3.8 Flash-Next의 PLE n-gram 메모리를 더 작은 Qwen3.5-0.8B 모델에 전이하여 성능을 개선하는 실험 결과를 공유합니다. 이 연구는 제한된 리소스로 훈련되었으며, 퍼플렉서티를 약 5.05% 감소시키는 효과를 입증했습니다. 또한 PLE의 학습 방식과 아키텍처 요소(리더, 게이트)에 대한 심층적인 발견 사항들을 제시합니다.
핵심 포인트
- PLE n-gram 메모리를 작은 모델에 전이하여 성능 개선 가능성을 확인했습니다.
- 퍼플렉서티를 5%가량 감소시키는 구체적인 수치적 성과를 보여주었습니다.
- 리더 손실(Reader loss)은 지속적으로 개선되었으나, 균형을 위해 15M 토큰으로 설정되었습니다.
- 동적 토큰 수준의 중재(Dynamic token-level arbitration)가 성능 저하를 막는 핵심 요소입니다.
저는 Qwen3.8-Flash-Next의 사전 학습된 PLE n-gram 메모리가 훨씬 작은 Qwen3.5-0.8B 모델을 개선할 수 있는지 실험해 왔습니다. 이 0.8B 설정을 제한된 리소스로, 주로 무료 Kaggle notebook GPU를 사용하여 훈련했습니다. 이 설정은 Qwen3.5-0.8B 백본과 대략 51B 파라미터의 PLE 메모리를 모두 고정(frozen) 상태로 유지합니다. 디코더 레이어 3과 9에서 작은 R=1 리더가 훈련되었으며, 토큰 의존적 선형 게이트가 후기 주입을 제어합니다. 백본 미세 조정은 없습니다. 현재 균형 잡힌 체크포인트는 15M 토큰으로 훈련된 리더와 별도로 보정된 동적 게이트를 사용합니다.
고정된 전체 검증 세트에서:
Qwen3.5-0.8B 기본 NLL: 2.905585 PPL: 18.2759
Qwengram-0.8B NLL: 2.853786 PPL: 17.3534
퍼플렉서티 감소율: 5.05%
이는 언어 모델의 검증 결과일 뿐, 벤치마크 정확도가 5% 높다는 주장은 아닙니다. 최종 설계에 영향을 준 몇 가지 발견 사항은 다음과 같습니다:
- 실제 사전 학습된 PLE는 무작위 메모리(random-memory)와 순열화된 메모리(permuted-memory) 제어보다 성능이 우수했습니다.
- 리더 손실(Reader loss)은 5M 훈련 토큰을 훨씬 넘어서도 계속 개선되었습니다.
- 20M 리더는 전체 LM 손실을 더 개선했지만, 수학 분야에서 퇴보했기 때문에 15M이 균형 잡힌 체크포인트로 유지됩니다.
- 강력한 고정 후기 레이어 메모리 주입은 LAMBADA에 악영향을 미쳤습니다. 동적 토큰 수준의 중재(Dynamic token-level arbitration)가 그 트레이드오프의 상당 부분을 회복시켰습니다.
- 게이트는 진정으로 동적입니다: 학습된 상수처럼 행동하기보다는 토큰마다 메모리 강도가 크게 변합니다.
- 정확히 같은 메모리 예산으로는, 학습된 토큰 배치(learned token placement)가 섞인 배치(shuffled placement)보다 우수했습니다.
- 높은 불확실성 위치로 라우팅하는 메모리는 이점의 일부를 회복했지만, 여전히 학습된 게이트만큼은 아니었습니다.
- 따뜻하게 시작된 R=4 리더는 작은 전체 LM 손실 개선을 가져왔지만, 코드 및 수학 분야에서 퇴보를 유발했습니다. 따라서 균형 잡힌 아키텍처로 R=1을 유지했습니다. 또한 llama.cpp에 추론 경로를 구현했습니다.
공개 아티팩트는 다음과 같습니다: 모델 / GGUFs https://huggingface.co/Ninnix96/Qwengram-0.8B 훈련, 제어 및 평가 https://github.com/Ninnix/qwen-ple-transfer 수정된 llama.cpp 런타임 https://github.com/Ninnix/llama.cpp-qwengram 업데이트! 2b가 출시되었습니다! https://huggingface.co/Ninnix96/Qwengram-2B 동일한 레시피로, 작동합니다: 3.7–4% 낮은 퍼플렉서티. 백본(backbone)이 커질수록 이득은 작아지는 경향이 있습니다. 또한 제 llama.cpp 포크에서도 작동합니다. GGUF에는 Qwen3.5 백본에 학습된 리더 및 중재 텐서가 포함되어 있습니다. 대규모 PLE는 모델 GGUF 내부에 패킹되기보다는 외부 양자화 사이드카(sidecar)로 남아 있습니다. 별도의 고정 WikiText-2 GGUF 런타임 테스트에서 양자화 유지율도 테스트했습니다: Q8_0은 BF16 리더 NLL 이득의 99.1%를 유지합니다. 이것은 위에 제시된 동결된 Kaggle 검증 벤치마크가 아닌 별도의 런타임 측정입니다. 독자들이 리더, PLE 캐싱, 라우팅 또는 런타임을 재현하거나 개선하려는 시도를 환영합니다. 다음으로는 더 큰 Qwen 백본, 특히 35B-A3B MoE를 사용해 보고 싶습니다. 해당 규모의 실험은 무료 Kaggle 노트북이 제공할 수 있는 컴퓨팅 자원보다 훨씬 많은 계산 능력을 요구하지만, 0.8B 연구는 리더 스케일링 및 동적 메모리 중재에 대한 훨씬 명확한 레시피를 제공합니다. 공개 고지: 저는 Qwengram의 저자이자 연결된 저장소의 작성자입니다. 영어는 제 모국어가 아니므로 이 게시물에서 문법 교정 및 표현 개선을 위해 AI를 사용했습니다. 실험 자체도 구현, 디버깅, 실험 오케스트레이션 및 분석 지원을 위해 코딩 에이전트(coding agents), 주로 ChatGPT Sol의 도움을 받아 개발되었습니다. 저는 실험을 설계하고 연구 결정을 내렸으며, 결과를 검토했고, 최종 결론에 대한 책임이 있습니다. submitted by /u/Nicolodeva to r/LocalLLaMA [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기