Deepseek v4 flash 0731 모델이 여전히 성능을 유지하지 못하는 이유
요약
Deepseek v4 flash 모델이 프롬프트와 규칙을 제대로 따르지 못하는 기술적 원인을 분석합니다. 모델의 레이어 구조가 컨텍스트를 압축된 요약 형태로 처리하면서 정확한 문구와 세부 정보를 유지하지 못하는 문제가 핵심입니다.
핵심 포인트
- Deepseek v4는 컨텍스트를 압축된 요약 형태로 저장함
- 레이어 구조상 프롬프트와 규칙의 정확한 문구가 유지되지 않음
- 압축된 레이어 처리가 모델의 지시 이행 능력을 저하시킴
- vLLM 인자 조정을 통한 컨텍스트 해상도 개선 시도 가능성
Preview 버전의 가장 큰 문제는 규칙(rules), 프롬프트(prompts), 스킬(skills)을 따르지 못한다는 점이었습니다. 무엇을 시도하든 이를 무시하는 것 같습니다. 1인칭과 2인칭을 모두 시도해 보았고, 중국어와 영어를 모두 시도해 보았습니다. 하지만 따르지 않습니다. 이것이 이 모델들의 유일한 문제이며, 이들이 단순히 벤치마크 점수만 높인(benchmaxxed) 모델일 뿐, 실제 프론티어(frontier) 수준이 아닌 이유입니다. 모든 사용자의 환경은 다르며, 모델의 동작과 행동을 규칙이나 프롬프트, 스킬을 통해 자신이 정확히 필요로 하는 대로 조정해야 합니다. 만약 모델이 이를 무시한다면 성능이 떨어지게 됩니다. 최신 버전의 flash 역시 preview 버전과 동일한 문제를 가지고 있으며, 이는 불행한 일입니다. 저는 이를 네이티브(native), 풀 프리시전(full precision)으로 로컬(locally)에서 실행하고 있습니다. 이 글을 올리기까지 망설였는데, 엄청난 비난을 받을 것을 알고 있기 때문입니다. 하지만 여러분이 실제로 모델을 로컬에서 실행하고, 벤치마크에 세뇌되지 않은 채 실제로 모델과 함께 코딩을 해본다면 그 허점들을 보게 될 것입니다. 저는 다시 qwen 27b로 돌아갑니다. 하...
수정: Deepseek이 왜 이렇게 작동하는지에 대해 신뢰할 수 있는 정보를 제공한 두 명의 사용자를 보았습니다. 조사를 좀 해보았고 이를 확인할 수 있었다고 생각합니다. 지난 4시간 동안 정말 힘들었습니다. Deepseek v4는 규칙/스킬/프롬프트를 원문 텍스트(raw text)가 아닌 압축된 요약(compressed summaries) 형태로 저장합니다. 43개의 레이어(layers) 중 20개는 전체 컨텍스트를 128 토큰(tokens) 안에 압축하여 단일 항목으로 봅니다. 21개는 4:1 비율로 보고, 단 두 개만이 완전히 밀집(fully dense)되어 있습니다. 모든 레이어는 마지막 128 토큰을 압축 해제된 상태로 받지만, 이는 전체 해상도 윈도우(full resolution window)에만 해당하며 프롬프트/스킬/규칙은 그 안에 포함되어 있지 않습니다. 따라서 그것들은 '생존'은 하지만, 정확한 문구(exact wording)는 유지되지 않습니다. vllm에 도움이 될 수도 있는 시작 인자(startup arg)가 있습니다: --hf--overrides '{"index_topk": 1024}'. 4:1 비율을 유지하는 21개의 레이어에서 모델은 토큰당 512개의 압축된 항목(컨텍스트 어디에서든 약 2,048 토큰 분량의 세부 정보)만을 선택합니다. 이 값을 1024로 높이면 그 두 배인 4,096 토큰까지 늘어납니다. 제가 opus 5에게 이것이 문제를 해결할 수 있을지 물어봤는데, opus는 아마도 아닐 것이라고 답했습니다.
어쨌든 저는 한번 시도해 보겠습니다. 제 TED 강연을 시청해 주셔서 감사합니다. /u/Juulk9087에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기