Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
DeepSeek V4 Flash 모델 사용 시 KV Cache를 Q8로 양자화할 경우 발생하는 품질 저하를 분석했습니다. PPL, KLD, 토큰 확률 변화를 통해 Qwen 397B 모델과 비교했을 때 DS4F의 양자화 민감도가 매우 높음을 입증했습니다.
중국 LLM의 정치적 편향성을 정량적으로 평가하기 위한 CCPBench를 소개합니다. 29개의 오픈 소스 모델을 대상으로 정치, 지리, 과학 분야의 질문을 던져 Gemini 1.5 Flash를 통해 편향성을 측정했습니다.
EdgeRazor는 엔트로피 가이드 증류를 활용하여 저비트 및 혼합 정밀도 환경에서 모델 성능을 극대화하는 새로운 양자화 기술입니다. 기존 QAT보다 효율적이면서도 매우 낮은 비트(최저 1.88비트)에서도 교사 모델의 역량을 효과적으로 보존합니다.

OpenRouter에서 제공하는 다양한 Qwen 모델 시리즈에 대해 35개의 프롬프트를 활용한 원샷(oneshots) 비교 테스트를 수행했습니다. 총 1,109개의 출력값을 생성하여 Qwen 2.5부터 최신 Qwen 3 시리즈까지의 성능을 검토한 결과물을 공유합니다.
DeepSeek-V4-Flash-0731 모델의 네 가지 추론 노력 모드(None, Low, High, Max)에 따른 토큰 사용량과 성능을 비교 분석했습니다. 실험 결과 'Low' 모드가 예상과 달리 매우 장황한 출력을 생성하는 특이 현상이 발견되었습니다.

Mac 환경에서 실행 가능한 Deepseek-V4-Flash-0731 Dwarfstar 모델에 관한 내용입니다. 해당 모델의 로컬 실행 가능성을 다룹니다.
Hugging Face의 safetensors 헤더 계산 방식을 이용해 실제 데이터 없이 16.5조 개의 파라미터를 선언한 'Vacuum 16T' 모델 사례를 분석합니다. 이 모델은 실제 데이터 전송량은 매우 적지만, 선언된 논리적 크기에 따라 저장 용량 할당량을 모두 소비하는 구조를 보여줍니다.
DeepSeek-V4-Flash-0731 모델의 전문가(expert) 텐서만을 IQ3 계층으로 재양자화하여 품질과 용량 사이의 균형을 맞춘 연구 결과입니다. 기존 UD-IQ3_S 방식보다 낮은 KLD와 높은 정확도를 기록하며, VRAM 용량이 부족해 CPU 스필이 발생하는 환경에서 3-bit 수준의 품질을 유지하는 데 최적화되었습니다.
Deepseek v4 flash 모델이 프롬프트와 규칙을 제대로 따르지 못하는 기술적 원인을 분석합니다. 모델의 레이어 구조가 컨텍스트를 압축된 요약 형태로 처리하면서 정확한 문구와 세부 정보를 유지하지 못하는 문제가 핵심입니다.
DeepSeek-V4-Flash 모델의 3-bit K_XL 양자화 버전에 대한 llama-bench 테스트 결과를 공유합니다. RTX 3090 GPU 3대를 활용하여 모델의 추론 성능(T/S)을 측정한 벤치마크 데이터입니다.

LongCat-Flash-Lite-Sparse 모델의 가중치가 공개되었습니다. 이 모델은 LongCat Sparse Attention(LSA)을 도입하여 최대 1M 토큰의 컨텍스트 길이를 네이티브로 지원합니다.

Poolside가 Laguna S 2.1 모델의 FP8 및 NVFP4 가중치 체크포인트를 업데이트했습니다. 컨텍스트 크기를 100만 토큰으로 확장하고 기존의 반복 생성 문제를 개선했습니다.

DeepSeek-V4-Flash-0731 모델이 최상위 프론티어 모델에 근접한 지능 점수를 기록했습니다. 이는 저렴한 하드웨어에서도 로컬로 고성능 모델을 실행할 수 있는 시대가 왔음을 시사합니다.
DeepSeek-V4-Flash 모델의 머신러닝 추론 능력과 코딩 품질을 리뷰한 내용입니다. 200K 컨텍스트 내에서 뛰어난 논리적 일관성과 도구 호출 능력을 보여주며, 복잡한 코드 감사 작업에서도 높은 정확도를 기록했습니다.

audio.cpp 0.5 버전이 출시되었습니다. 프롬프트를 통해 감정과 행동을 제어하는 DramaBox 모델과 교차 언어 음성 전이를 지원하는 Confucius4 모델이 포함되었습니다.
코딩을 제외한 모델의 프로젝트 이해도와 논리적 일관성을 측정하는 결정론적 벤치마크인 CrystalBench v1.0이 공개되었습니다. 모델이 구조화된 표현을 생성하고 함정 질문에 대응하는 능력을 테스트하며, 추론 능력이 높을수록 오히려 함정에 빠질 가능성이 있음을 보여줍니다.

MTP(Multi-Token Prediction) 기술이 적용된 LongCat-Flash-Lite, Jamba2-Mini, Nikusui 등 검열을 해제한 멀티 모델들을 출시했습니다. 각 모델의 거부율을 획기적으로 낮추었으며, 이를 지원하기 위한 최적화된 llama.cpp 포크와 GGUF 파일도 함께 제공합니다.
Nanbeige4.2 3B 모델의 추론 및 도구 호출 성능을 Gemma 4, Qwen3.5와 비교 벤치마킹했습니다. M5 Pro 환경에서 효율적인 메모리 사용량과 높은 추론 속도를 기록하며, OpenCode를 활용한 앱 제작에서도 우수한 성능을 보였습니다.

SenseNova가 성능이 향상된 U1.5-Lite-Preview 모델을 공개했습니다. 4K 네이티브 생성, 개선된 텍스트 렌더링, 구조화된 긴 프롬프트 처리 능력을 갖추었으며 이미지 편집 워크플로우가 강화되었습니다.

Meituan이 새로운 모델인 LongCat-Flash-Lite-Sparse를 출시했습니다. 해당 모델의 상세 사양과 기술적 특징에 대한 정보를 담고 있습니다.