24KB 단독 HTML-LLM으로 일관성 있는 이야기 생성
요약
본 기사는 24KB의 작은 HTML 파일 크기로도 일관성 있는 이야기를 생성하는 LLM을 구현한 과정을 설명합니다. 모델 자체를 극도로 압축하고, 적응형 양자화(Adaptive quantization)와 QAT(Quantization-Aware Training), 그리고 HTML/JS 패킹 기술을 결합하여 높은 효율성을 달성했습니다. 이러한 접근 방식은 외부 종속성 없이도 강력한 성능을 제공하며, 특히 작은 모델의 텐서 크기 최적화에 대한 깊이 있는 이해를 보여줍니다.
핵심 포인트
- 24KB 단독 HTML 파일로 LLM 구동 가능성을 입증함.
- Adaptive quantization 및 QAT를 활용하여 모델 압축 성공.
- HTML/JS 패킹과 구조적 스크립트 변경으로 효율성 극대화.
- 작은 모델의 텐서 최적화는 임베딩이나 일반적인 양자화 방식보다 복잡함을 강조.
https://preview.redd.it/7sknv6omnguh1.png?width=1023&format=png&auto=webp&s=4aef1dc464d008b00f104519eb5399ba6132ad69 사용해보고 싶으신가요? 여기로 가서 'New seed'를 많이 클릭해보세요. 다양한 이야기를 얻을 수 있습니다. 단지 몇 번의 클릭만 필요합니다 - 운 좋은 RNG 드로우: https://output.jsbin.com/nikupemuta/1 스마트폰으로도 초당 60 토큰 이상을 얻을 수 있을 것입니다. FAQ: 왜?! 가능하고 재미있기 때문입니다. 저의 원래 아이디어는 단순히 MacroStory와 LittleBit을 합치는 것이었지만, 그것은 전혀 작동하지 않았습니다. 관련이 있나요? 조금도 아닙니다! 외부 종속성을 가진 3MB짜리 HTML 파일이라도 1초 안에 로드될 수 있으며 훨씬 더 강력한 모델을 적은 노력으로 제공할 수 있습니다. 모델 자체를 0.01 KLD에서 20KB로 압축하는 것은 식은 죽 먹기였습니다. 출력 품질을 유지하면서 추가로 5KB를 절약하는 것은 많은 시간이 필요했습니다. 어떻게 했을까요? Local Qwen3.8, 몇 가지 아이디어, 그리고 많은 인내가 필요했습니다. 적응형 양자화(Adaptive quantization)와 QAT(Quantization-Aware Training) 덕분에 가능했고, LittleBit, Rotation 등은 오히려 상황을 악화시켰습니다. minify, zopfli 및 여러 구조적 스크립트 변경을 사용한 HTML/JS 패킹이 결과에 도움이 되었습니다. 이 모든 것을 당신이 만들었나요? 전혀 아닙니다. 81KB (FP32) MacroStory 모델 없이는 불가능했을 것입니다. 저는 '그냥' 그것을 가지고 이것저것 만져봤습니다. 관심 있는 분들을 위한 세부 정보: 크기 축소 규칙은 작은 모델과 큰 모델에 매우 다릅니다. 임베딩(embeddings)이 모델 크기의 60%를 차지하는 반면, 일반적인 크기의 LLM에서 텐서(tensors)가 가장 큰 부분을 차지합니다. 작은 모델의 텐서는 양자화에 극도로 민감하며, 특히 이 LLM의 Ouro looping transformer 형식과 관련이 있습니다. 하지만 임베딩에는 어느 정도 여유 공간이 있었습니다. LittleBit 접근 방식에서는 수학적으로 1비트 이하의 양자화로 공간을 절약하는 것은 불가능한데, 모델 행렬 자체가 너무 작아서 - 얻는 이득은 보정 데이터의 오버헤드로 인해 사라질 것입니다. GGUF K 양자화도 같은 이유로 도움이 되지 않을 것입니다: 모델 행렬이 도입된 오버헤드에 비해 단순히 너무 작기 때문입니다.
LittleBit으로 일부 텐서 크기를 줄일 수 있다 하더라도, 양자화 이득 3KB는 새로 필요한 safetensors 메타데이터 3KB에 의해 상쇄될 것입니다. 아무도 일반적인 크기의 LLM에서 메타데이터 크기에 대해 생각하지 않습니다. 하지만 그것 외에도: 적당한 4비트 LittleBit 양자화만으로도 모델이 깨질 수 있습니다. 한편, 현재 선택된 접근 방식은 편리하게 0.04 KLD를 제공합니다. 이는 이미 매우 가끔 중복 문장이나 일치하지 않는 이야기 시작을 유발합니다. MacroStory 모델에는 샘플러를 통해 단독으로는 절대 통과되지 않아 추가적인 크기 축소에 활용할 수 있는 몇 개의 데드 토큰이 있습니다. 여기까지 오셨으니 보너스가 있습니다: 로컬 Python 추론(YMMV) 및 비압축 HTML입니다. 이 이미지를 디스크에 저장하세요 (중요: '원본 이미지 다운로드'). 원래는 여기에 또는 imgur에 사용하고 싶었지만, 둘 다 허용하지 않았습니다. 7-Zip, WinRAR 등으로 열어 압축을 해제하세요. 또는 콘솔에서 - 심지어 Windows에서도 - 다음 중 하나를 사용하세요: tar -xf MS256story.png 7z e MS256story.png python -m zipfile -e MS256story.png submitted by /u/Chromix_ [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기