Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Poolside가 Laguna S 2.1 모델의 FP8 및 NVFP4 가중치 체크포인트를 업데이트했습니다. 컨텍스트 크기를 100만 토큰으로 확장하고 기존의 반복 생성 문제를 개선했습니다.

DeepSeek-V4-Flash-0731 모델이 최상위 프론티어 모델에 근접한 지능 점수를 기록했습니다. 이는 저렴한 하드웨어에서도 로컬로 고성능 모델을 실행할 수 있는 시대가 왔음을 시사합니다.

OpenAI가 GPT-5.6 Luna의 가격을 90% 인하하며 시장 대응에 나섰으나, DeepSeek의 DS4F가 압도적인 가성비로 시장을 위협하고 있습니다. 현재 AI 모델 시장은 토큰 효율성과 가격 경쟁력이 핵심 지표로 부상하고 있습니다.
DeepSeek-V4-Flash 모델의 머신러닝 추론 능력과 코딩 품질을 리뷰한 내용입니다. 200K 컨텍스트 내에서 뛰어난 논리적 일관성과 도구 호출 능력을 보여주며, 복잡한 코드 감사 작업에서도 높은 정확도를 기록했습니다.

audio.cpp 0.5 버전이 출시되었습니다. 프롬프트를 통해 감정과 행동을 제어하는 DramaBox 모델과 교차 언어 음성 전이를 지원하는 Confucius4 모델이 포함되었습니다.

4B 모델을 활용한 분류 작업에서 하네스(harness) 설계 방식에 따라 정확도가 60%에서 82%까지 큰 차이를 보임을 입증했습니다. 프롬프트 내 규칙 배치와 참조 자료 순서 등이 성능에 결정적인 영향을 미친다는 연구 결과를 공유합니다.

오픈 소스 추론 엔진인 TensorSharp가 DeepSeek v4 Flash GGUF 모델을 지원하며, llama.cpp 대비 우수한 성능을 기록했습니다. 4x Nvidia A40 환경에서 TensorSharp의 CUDA 백엔드가 더 높은 prefill 및 decode 속도를 보여줍니다.
코딩을 제외한 모델의 프로젝트 이해도와 논리적 일관성을 측정하는 결정론적 벤치마크인 CrystalBench v1.0이 공개되었습니다. 모델이 구조화된 표현을 생성하고 함정 질문에 대응하는 능력을 테스트하며, 추론 능력이 높을수록 오히려 함정에 빠질 가능성이 있음을 보여줍니다.
NInfer 엔진이 RTX Pro 6000 환경에서 Qwen3.6-27B 모델을 구동할 때 llama.cpp 대비 압도적인 성능 향상을 보임을 입증했습니다. 특히 프리필(prefill) 단계에서 최대 3.53배 빠른 속도를 기록하며 효율적인 추론 성능을 보여줍니다.

MTP(Multi-Token Prediction) 기술이 적용된 LongCat-Flash-Lite, Jamba2-Mini, Nikusui 등 검열을 해제한 멀티 모델들을 출시했습니다. 각 모델의 거부율을 획기적으로 낮추었으며, 이를 지원하기 위한 최적화된 llama.cpp 포크와 GGUF 파일도 함께 제공합니다.
Nanbeige4.2 3B 모델의 추론 및 도구 호출 성능을 Gemma 4, Qwen3.5와 비교 벤치마킹했습니다. M5 Pro 환경에서 효율적인 메모리 사용량과 높은 추론 속도를 기록하며, OpenCode를 활용한 앱 제작에서도 우수한 성능을 보였습니다.
Gemma 모델 제품군을 기반으로 MLX M5+ 환경에서 동작하는 Hyperion 커널을 소개합니다. Rust와 Metal 인터페이스를 사용하여 구축되었으며, 현재 12B 모델 최적화에 집중하고 있습니다.

브라우저 환경에서 서버 없이 실행 가능한 시맨틱 검색 라이브러리 Semantra를 소개합니다. Snowflake의 Arctic-Embed-S 모델과 WebGPU를 활용하여 클라이언트 측에서 임베딩 및 유사도 검색을 수행합니다.

SenseNova가 성능이 향상된 U1.5-Lite-Preview 모델을 공개했습니다. 4K 네이티브 생성, 개선된 텍스트 렌더링, 구조화된 긴 프롬프트 처리 능력을 갖추었으며 이미지 편집 워크플로우가 강화되었습니다.

Meituan이 새로운 모델인 LongCat-Flash-Lite-Sparse를 출시했습니다. 해당 모델의 상세 사양과 기술적 특징에 대한 정보를 담고 있습니다.

Ling-3.0-flash 모델이 Blender MCP를 활용해 Python 코드로 3D 도시 환경을 구축하고 렌더링하는 과정을 리뷰합니다. 이 모델은 뛰어난 공간 추론 능력과 장기적인 도구 사용 능력을 보여줍니다.

TurboFieldfare 엔진을 Qwen 3.6 35B 모델에 포팅하여 1.4 GB의 RAM 환경에서 실행하는 데 성공했습니다. SSD 스트리밍 방식을 통해 메모리 사용량을 최소화하며, 모델의 구조적 특성에 따른 성능 변화를 분석했습니다.
로컬 LLM의 내부 작동 원리를 시각적으로 분석할 수 있는 기계론적 해석 가능성(Mechanistic Interpretability) 도구인 'CORTEX // MODEL OBSERVATORY'가 공개되었습니다. GPT2 및 Llama 아키텍처를 중심으로 설계되어 초보자부터 전문가까지 모델의 내부를 깊이 있게 관찰할 수 있도록 돕습니다.
AMD Radeon Pro V620 워크스테이션 카드를 ComfyUI 및 로컬 LLM 환경에서 사용한 성공 사례를 공유합니다. 속도는 빠르지 않지만 32GB의 VRAM을 활용해 이미지, 비디오 생성 및 LLM 구동에서 안정적인 성능을 보여줍니다.
Huawei가 Ascend 기반의 MoE 모델인 openPangu-2.0-Pro를 오픈소스로 공개했습니다. 505B 파라미터를 보유하며, 512k의 긴 컨텍스트 길이를 지원합니다. SFT와 강화학습(RL), 온-정책 증류 기술을 통해 사고 능력을 최적화했습니다.