Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Apple Silicon Mac에서 EXL3 양자화 모델을 실행, 추론 및 변환할 수 있게 되었습니다. 기존 CUDA 환경의 고가 GPU가 필요했던 작업이 64GB 이상의 메모리를 갖춘 Mac에서도 가능해져 로컬 LLM 접근성이 높아졌습니다.
AMD Strix Halo(gfx1151) 환경에서 hipBLASLt의 NT 및 TT 레이아웃 GEMM 커널 성능을 최적화하기 위해 진화 알고리즘 기반의 EvoTensile을 개발했습니다. 이를 통해 100개의 입력 형태에 대해 성능을 20 TFLOPS에서 40 TFLOPS 수준으로 대폭 향상시켰습니다.
eBay에서 판매되는 개조된 AMD Radeon Pro W6800(V620 기반)의 성능을 벤치마크한 결과입니다. W6800 펌웨어 플래싱을 통해 디스플레이 출력을 지원하며, Vulkan 및 ROCm 백엔드를 이용한 Qwen 2.5 27B 모델의 추론 성능을 측정했습니다.
AI 서버 구축을 위해 NVIDIA RTX 5060 Ti와 AMD RX 9060 XT 16GB 모델의 성능을 비교 벤치마크한 결과입니다. 다양한 LLM 모델을 대상으로 응답 및 프롬프트 토큰 생성 속도를 측정한 데이터를 공유합니다.

CUDA 의존성이 높은 EXL3 코덱을 Apple Silicon의 Metal 환경에서 실행할 수 있도록 포팅한 PonyExl3 프로젝트를 소개합니다. M1/M5 Max 환경에서 높은 추론 속도와 효율적인 메모리 관리를 구현했습니다.
M3 Max(96GB) 환경에서 특정 엔진과 GGUF 파일을 사용하여 Deepseek 4 flash 모델을 실행하는 방법을 소개합니다. SSD 스트리밍과 Metal 할당량 조절을 통해 RAM 용량 한계를 극복하고 구동하는 기술적 팁을 다룹니다.

Jetson Orin NX를 활용하여 Hermes Agent 벤치마킹을 위한 소형 서버를 구축한 사례입니다. Gemma 4 26B 모델과 MTP(Multi-Token Prediction) 기술을 적용하여 긴 컨텍스트 환경에서의 성능과 속도를 최적화했습니다.
Apple이 CoreML의 차세대 대체제인 CoreAI를 발표했습니다. 이는 Apple Silicon에 최적화된 온디바이스 추론 엔진으로, 기존 CoreML의 한계를 넘어 대규모 파라미터 모델과 확장된 연산 지원을 목표로 합니다.

한국 스타트업 Furiosa AI의 추론 전용 칩 RNGD가 로컬 LLM 시장의 게임 체인저가 될 가능성을 분석합니다. 높은 메모리 대역폭과 VRAM을 갖춘 이 칩이 llama.cpp 등 오픈소스 생태계와 협력한다면 강력한 경쟁력을 가질 것으로 전망합니다.

Jetson Orin Nano Super에서 1-bit 및 1.58-bit Bonsai LM 모델의 성능을 벤치마킹한 결과입니다. 다양한 전력 모드에서 토큰 생성 속도, 에너지 효율성(tok/J), 지연 시간 및 발열 상태를 심층 분석했습니다.
LLM 백업을 위해 장기 보존이 가능한 광학 저장 매체(Blu-Ray) 사용을 권장합니다. 특히 수명이 긴 아카이브 등급의 BD-R XL M-DISC 포맷이 적합하며, 휘발성 메모리보다 안정적입니다. 관련 라이터와 빈 디스크 구매 정보를 제공하고 있습니다.
과거 로컬 LLM 실험 초창기에는 일반적인 게이밍 GPU로도 충분히 접근성이 높았으나, 현재는 하이엔드 하드웨어 장벽이 높아져 개인의 실험 및 활용이 어려워지고 있다는 문제 제기입니다.
Strix Halo (Ryzen AI Max) 장치에서 NPU 활동을 모니터링하는 터미널 도구 xdna-top이 소개되었습니다. 이 도구는 iGPU 사용량과 컨텍스트별 NPU 제출/완료 카운터를 하나의 TUI에서 보여주어, NPU의 실제 작동 여부를 확인할 수 있게 합니다.
최신 TensorRT 11 빌드는 명시적인 INT8 양자화(Q/DQ)를 강제하여, 기존 auto-FP16 방식보다 성능이 우수함을 입증했습니다. RTX 5090에서 수행된 테스트 결과, 동일 하드웨어에서 이전 대비 약 1.8배 향상된 추론 속도(71k NPS vs 39.5k NPS)를 기록하며, 최신 GPU 아키텍처의 전용 INT8 경로 활용 가능성을 보여주었습니다.
Intel의 차세대 데이터 센터 GPU인 Xe3P를 탑재한 'Crescent Island' PCB 설계가 유출되었습니다. 이 설계는 HBM 부족 문제를 해결하기 위해 160GB의 대규모 LPDDR5X 메모리 구성을 채택한 것이 특징입니다.
본 테스트는 RTX 5090 환경에서 llama.cpp를 사용하여 Qwen3.6 모델의 MTP(Multi-Turn Prompting) 기능을 검증한 내용입니다. 특히, 동일한 GGUF 파일을 사용하면서 `--spec-type draft-mtp` 플래그만 변경하여 MTP 기능 자체에 대한 영향을 분석했습니다. 테스트는 짧은 스토리와 긴 코드 생성 등 다양한 길이의 프롬프트를 사용하여 모델의 일관성과 성능을 측정했습니다.
본 기사는 Strix Halo 하드웨어 환경에서 Llama.cpp를 사용하여 Qwen3.6 모델의 벤치마크 결과를 비교 분석합니다. 특히, MTP(Multi-Turn Prompting) 최적화가 적용된 버전과 기본 버전을 다양한 시나리오(15k 단일 턴 vs 5턴 연속 대화)에서 테스트했습니다. 그 결과, 27B 모델의 경우 MTP 적용이 전반적으로 속도 향상에 크게 기여했으나, 35B 모델에서는 성능 개선 폭이 미미하거나 오히려 느려지는 경향을 보였습니다.
본 글은 코딩 프리미티브 작업에 초점을 맞춰 Qwen 3.6 변체와 같은 로컬 양자화(local quants) 모델들이 최신 플래그십(frontier) 웹 기반 모델들과 비교했을 때 어느 정도의 성능을 보이는지 비교 분석한 내용입니다. 특히 라이브러리 없이 단일 HTML 파일로 사실적인 측면 주행 애니메이션을 구현하는 복잡한 코딩 작업에서, 로컬 27B 양자화 모델이 일부 플래그십 모델보다 더 자연스러운 움직임과 레이어링을 보여주며 기대 이상의 성능을 입증했습니다.
Qwen3.6-35B-A3B와 9B 모델이 공식 Terminal-Bench 2.0 리더보드에 진입하며 주목받고 있습니다. 특히 little-coder × Qwen3.6-35B-A3B 조합은 Gemini CLI 및 Terminus 2 등 경쟁 모델보다 높은 순위를 기록했습니다. 이 성과는 로컬 모델들이 어려운 에이전틱 벤치마크에서도 측정 가능한 수준임을 입증하며, 오픈 소스 커뮤니티의 기여를 강조합니다.
Jetson Orin NX SUPER 16GB 기반의 로봇 'Sparky'는 완전히 오프라인 환경에서 구동됩니다. 이 로봇은 llama.cpp와 Q4_K_M 방식의 Gemma 4 E4B 모델을 사용하여, 캐시된 TTFT 약 200ms 및 지속 속도 14-15 tok/s를 달성했습니다. STT(SenseVoiceSmall)와 TTS(Piper), 그리고 PixiJS 얼굴 구현 등 다양한 온디바이스 컴포넌트를 통합했으며, 특히 프롬프트 구조 최적화를 통해 캐시 안정성을 높여 성능을 크게 개선한 것이 핵심 성과입니다.