DeepSeek V4 Flash 정식 출시(GA), 자체 Pro Preview 성능 능가
요약
DeepSeek가 284B 파라미터 규모의 MoE 모델인 DeepSeek-V4-Flash를 정식 출시했습니다. 기존 Preview 모델의 구조를 유지하면서 사후 학습(post-training)을 통해 성능을 개선한 것이 특징입니다.
핵심 포인트
- 284B 총 파라미터 및 13B 활성 파라미터의 MoE 구조
- 1,048,576 토큰의 대규모 컨텍스트 윈도우 지원
- 하이브리드 어텐션 설계 및 Muon 옵티마이저 적용
- 구조 변경 없이 사후 학습만으로 성능 최적화
AI Tech Connect에 최초 게시됨.
7월 31일에 무엇이 바뀌었나 DeepSeek는 2026년 7월 31일에 DeepSeek-V4-Flash-0731을 퍼블릭 베타(public beta)로 출시했습니다. 이 모델은 총 파라미터(parameters) 284B, 토큰당 활성 파라미터(active parameters) 13B를 가진 희소 전문가 혼합(sparse Mixture-of-Experts) 모델이며, 1,048,576 토큰의 컨텍스트 윈도우(context window)와 최대 65,536 토큰의 출력을 지원합니다. 이 모델은 Pro 라인업과 함께 V4 제품군에 속하며, 압축 희소 어텐션(Compressed Sparse Attention)과 고도로 압축된 어텐션(Heavily Compressed Attention), mHC 연결 및 Muon 옵티마이저(optimiser)가 결합된 해당 제품군의 하이브리드 어텐션(hybrid attention) 설계를 공유합니다. 릴리스 노트에서 가장 흥미로운 엔지니어링 세부 사항은 바뀌지 않은 부분입니다. 0731 빌드는 V4-Flash-Preview의 정확한 구조와 크기를 유지합니다. 새로운 전문가 수(expert count)도, 재구성된 어텐션(re-shaped attention)도, 다른 텐서 레이아웃(tensor layout)도 없습니다. DeepSeek는 사후 학습(post-training)만을 다시 수행했을 뿐 그 외에는 아무것도 바꾸지 않았습니다. 이미 규모를 측정해 본 사람이라면...
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기