Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
사용자는 새로 구축한 고성능 GPU 리그에서 Qwen3.6 27B 모델을 구동하며, 주변 사람들이 로컬 AI 워크플로우를 사용하도록 독려하고 있습니다. 기존의 Open WebUI는 기능적으로 개선되었음에도 불구하고, 기술적 지식이 부족한 사용자들에게는 여전히 복잡하게 느껴진다는 문제점을 발견했습니다.
AMD Ryzen AI MAX+ 395 iGPU (Strix Halo, gfx1151)에 DFlash 및 PFlash 기능을 지원하는 Luce 스택이 출시되었습니다. 이 기술을 사용하여 Qwen3.6-27B 모델의 디코딩 성능은 llama.cpp HIP 대비 2.23배 향상되었으며, 16K 컨텍스트에서의 프리필 속도는 3.05배 빨라져 엔드 투 엔드 성능이 총 2.5배 개선되었습니다. 이는 소비자용 GPU로는 접근하기 어려운 대규모 모델(최대 ~100 GiB)을 128 GiB 통합 메모리 환경에서 구동할 수 있게 합니다.
본 기사는 MI50s GPU 환경에서 Qwen 3.6 27B 모델을 vLLM과 ROCm 스택을 사용하여 구동한 성능 테스트 결과를 공유합니다. 이 테스트는 MTP, DFlash 미사용 및 전정밀도(full precision)로 진행되었음에도 불구하고 좋은 성능을 보여주었으며, 특히 총 토큰 처리량은 362.03 tok/s에 달했습니다. 작성자는 해당 모델이 Claude Code나 Hermes 같은 에이전트용 하네스와 충분히 사용 가능하다고 평가하며, PCIe 스위치 개선이나 최적화된 DFlash/MTP 구현 등을 통해 성능 향상 여지가 남아있다고 분석합니다.
본 논문은 Speculative Decoding 과정에서 발생하는 'attention drift'라는 새로운 현상을 식별했습니다. 이는 drafter 모델이 추측 체인 내에서 연속적인 토큰을 생성할 때, 어텐션 메커니즘이 입력 프롬프트로부터 점진적으로 자신이 최근에 생성한 토큰들로 이동하는 현상입니다. 연구진은 이 원인을 잔차 경로의 비정규화된 누적 증가와 연결 지었으며, 이를 해결하기 위해 drafter hidden state에 Post-norm 적용 및 RMSNorm을 제안했습니다. 이러한 구조적 개선을 통해 다양한 벤치마크에서 수락 길이 및 전반적인 성능 향상을 입증했습니다.
MagicQuant는 하이브리드 GGUF 양자화 혼합(quant mixes) 파이프라인을 구축하여, 기존의 단일 양자화 방식으로는 발견하기 어려운 최적의 성능-효율 균형점을 찾는 도구입니다. 이 시스템은 Unsloth 등의 학습 기법과 결합하여 모델 아키텍처별 특성을 분석하고, VRAM 제약 하에서 가장 가성비가 좋은 '승자'들만을 선별합니다. 이 프로젝트는 단순히 양자화된 모델을 나열하는 것을 넘어, KLD(Kullback–Leibler divergence) 변화 추이와 같은 미묘한 성능 트레이드오프를 분석하여 사용자에게 실제로 다운로드할 가치가 있는 최적의 지점을 제시하는 것이 핵심입니다.
Xiaomi가 1.02조 파라미터의 MiMo-V2.5-Pro 모델을 오픈 소스로 공개했으나, 실제 사용 사례(자율 코딩 세션)를 분석한 결과 API 기반 서비스가 경제적으로 우위를 점하고 있습니다. 이 모델은 지속적인 자율 개발 및 장기 컨텍스트 추론에 매우 뛰어나지만, 1.02T 파라미터 규모 때문에 일반 개발자가 로컬에서 구동하기는 하드웨어적 제약이 너무 큽니다.
TextGen은 기존의 웹 UI 기반 프로젝트에서 진화하여, 이제 Windows, Linux, macOS를 지원하는 설치가 필요 없는(no-install) 데스크톱 애플리케이션으로 출시되었습니다. 이 새로운 버전은 사용자가 포터블 빌드를 다운로드하고 실행하기만 하면 되며, 시스템에 어떠한 파일도 남기지 않는 독립적인 구조를 가집니다. 또한, 완전한 개인정보 보호 기능과 최신 양자화 기술을 지원하는 ik_llama.cpp 빌드, 내장 웹 검색 기능을 제공하여 사용자 경험과 보안성을 크게 향상시켰습니다.
Needle은 26M 파라미터 규모의 경량 함수 호출(tool calling) 모델을 오픈 소스로 공개했습니다. 이 모델은 소비자용 기기에서 높은 속도로 실행 가능하며, 도구 사용 과정을 근본적으로 검색 및 조립 과정으로 정의하여 Cross-attention만을 사용하여 FFN(Feed-Forward Network) 파라미터를 제거한 것이 특징입니다. Needle은 온디바이스 AI 환경을 목표로 하며, RAG나 도구 사용 등 외부 구조화된 지식 접근 작업 전반에 적용 가능한 원시 요소임을 제시합니다.
NVIDIA GPU 업그레이드 둔화와 CPU 및 메모리 가격 상승, 그리고 전반적인 공급망 압박이 결합되면서 PC DIY 시장이 심각한 침체기에 접어들었습니다. 주요 메인보드 제조업체들은 2026년 출하 목표를 대폭 하향 조정했으며, 특히 소비자용 CPU와 메모리의 부족 및 가격 상승이 판매 감소의 주된 원인으로 지목됩니다. AI 수요 증가로 인해 고성능 데이터 센터 플랫폼(Xeon, EPYC)에 생산 능력이 우선 배분되면서 일반 소비자용 부품의 공급이 어려워졌고, 게이밍 시장을 이끌던 NVIDIA 역시 AI GPU 매출 증대 덕분에 차세대 제품 업데이트가 지연되고 있습니다.
DeepSeek-V4-Flash 모델을 2개의 RTX PRO 6000 Max-Q 환경에서 구동했을 때, 524k 컨텍스트 길이에서 85.52 tok/s의 높은 처리 속도를 달성했습니다. 이 과정에서 MTP 헤드 로딩 문제와 vLLM의 CustomAllreduce 사용 시 발생하는 데드락 문제를 해결하기 위해 `--disable-custom-all-reduce` 플래그를 반드시 적용해야 합니다. 또한, 최적의 성능을 위해서는 특정 NCCL 튜닝과 패치된 vLLM 포크 사용이 필수적입니다.
Cull은 AI 이미지 데이터셋을 위한 오픈 소스 머신 큐레이션 엔진으로, 다양한 웹사이트(Civitai, X/Twitter, Reddit 등 약 340개)에서 이미지를 스크래핑하고 출처의 프롬프트를 함께 저장하는 기능을 제공합니다. 이 도구는 LoRA 학습이나 대규모 아카이브 구축에 필요한 이미지와 메타데이터를 체계적으로 수집하며, 자동 캡셔닝 및 분류 기능을 통해 사용자가 수동으로 프롬프트를 큐레이팅할 필요 없이 방대한 데이터를 효율적으로 준비할 수 있게 합니다.
최근 주목받았던 Mimo 모델의 프로 버전(v2.5 Pro)을 시험적으로 사용한 경험을 공유하는 글입니다. 작성자는 이 모델이 초기에는 매우 거칠고 성능이 떨어지는 모습을 보였으나, '애플 웹 디자이너' 역할을 부여하여 비평하게 하는 등 특정 프롬프트 엔지니어링 기법을 적용했을 때 개선된 결과를 얻었습니다. 전반적으로 다른 최신 로컬 및 상용 모델과 비교할 때 불안정하고 예측 불가능한 측면이 많아, 향후 사용에 대한 기대와 함께 주의가 필요함을 시사합니다.
Redis 개발자인 Salvatore Sanfilippo가 GitHub에 DS4라는 새로운 프로젝트를 공개했습니다. 이 프로젝트는 Mac Metal 하드웨어에서 1M 컨텍스트 창을 가진 DeepSeek V4 Flash 모델을 실행하는 것을 목표로 합니다. 또한, DGX와 같은 고성능 서버 환경에서도 작동하는 모습을 보여주었으며, 향후 Pro 6000 및 AMD 칩 등 다양한 플랫폼으로의 확장을 계획하고 있습니다.
이 기술 기사는 AI 에이전트가 웹 페이지의 내용을 효과적으로 이해하고 추론할 수 있도록 돕는 마크다운 기반 웹 렌더러 'TextWeb'에 대해 소개합니다. TextWeb은 비싼 스크린샷을 찍어 비전 모델에 입력하는 대신, 웹 페이지를 LLM이 네이티브하게 처리할 수 있는 마크다운 형식으로 변환합니다. 이 솔루션은 전체 JavaScript 실행과 상호작용 요소 주석 처리를 지원하며, CLI 및 MCP 서버 형태로 제공됩니다.
LLM의 성능은 모델 품질과 크기뿐만 아니라 실제 속도(토큰/초) 또한 매우 중요합니다. 하지만 단순히 수치로 제시되는 토큰/초는 사용자가 체감하는 실제 경험적 속도를 전달하기 어렵습니다. 이에 필자는 객관적인 수치를 주관적으로 이해하고 감을 잡을 수 있도록 돕는 스크립트를 개발하여 공유했습니다.
본 기사는 NVLink로 연결된 4개의 RTX 3090 GPU 환경에서 Qwen 3.6 27B 모델의 MTP(Multi-Tenancy Performance) 벤치마크 결과를 분석합니다. 특히, 두 개의 GPU 쌍을 NVLink로 고정하여 사용하는 것이 PCIe를 통해 동일한 구성을 구현하는 것보다 훨씬 높은 처리량을 보여주었습니다. 이 테스트는 대규모 언어 모델(LLM)의 멀티 테넌시 환경에서 하드웨어 연결 방식이 성능에 미치는 영향을 명확히 보여줍니다.
이 글은 특정 모델(Gemma4)을 '주력 모델'로 사용하며 MTP(아마도 Model Training Performance 또는 유사한 성능 지표)와 관련된 내용에 대한 기대감을 표현하고 있습니다. 작성자는 최신 mlx-vlm을 테스트했으나 실망했다고 언급하며, 코드 생성 작업 부하에서 MTP를 활성화했을 때 속도가 크게 향상되는 실험 결과를 제시하고 있습니다.
본 가이드는 Qwen3.5 및 Qwen3.6 모델에 NextN MTP(Multi-Token Prediction) 기술을 적용하여 디코딩 속도를 획기적으로 향상시키는 방법을 안내합니다. 이 기술은 기존 대비 최대 2.9배의 디코드 성능을 제공하며, 품질 저하 없이 고성능 추론이 가능하게 합니다. 구현을 위해서는 `llama.cpp`의 특정 PR(#22400 및 #22673)를 적용하고, NextN 최적화가 적용된 GGUF 모델(예: Q8nextn 변형)을 사용해야 하며, `--spec-type mtp` 플래그와 같은 새로운 실행 인자들을 활용해야 합니다. 최종적으로는 시스템 전력 튜닝까지 고려하여 최대의 성능과 효율성을 확보할 수 있습니다.
이 글은 구형 하드웨어(5년 된 노트북, RTX 2060 6GB VRAM)의 한계를 극복하고 대규모 언어 모델인 Qwen3.6-35B를 성공적으로 실행한 경험을 공유합니다. 작성자는 복잡하게 설정된 `llama-server` 명령줄 인수를 통해 이 거대한 모델을 로컬 환경에서 구동하는 상세 과정을 보여주며, 이를 통해 23 t/s와 같은 높은 추론 속도를 달성했음을 강조합니다. 이는 제한적인 자원에서도 최신 오픈 모델을 활용할 수 있는 실질적인 방법을 제시합니다.
새롭게 오픈 소스로 공개된 Atlas는 LLM 추론 엔진으로, 기존의 Python 기반 스택 병목 현상을 해결하기 위해 전체 스택을 재작성했습니다. Pure Rust와 CUDA만을 사용하여 vLLM 대비 최대 3배 이상의 높은 처리량(throughput)을 달성하며, 특히 DGX Spark (GB10) 환경에서 Qwen3.5-35B 모델의 경우 지속적으로 약 111 tok/s를 기록하는 등 뛰어난 성능을 보여줍니다. 이 엔진은 다양한 최신 LLM 아키텍처와 API를 지원하며, 커뮤니티 기여를 통해 계속 발전할 예정입니다.