Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Thinking Machines Lab의 Inkling 모델이 미국 오픈 웨이트 모델 중 최고 수준으로 평가받으며 큰 주목을 받고 있습니다. 이 모델은 NVIDIA Nemotron Ultra를 포함한 다른 미국 오픈 모델들을 능가하며, 전체 오픈 웨이트 모델 순위에서 약 5위에 랭크되었습니다.

본 글은 Qwen 모델을 Anthropic의 Sonnet, Opus, Fable 등 클라우드 기반 최신 모델과 비교하는 미니 벤치마크 결과를 다룹니다. 비록 클라우드 모델이 전반적으로 우수하지만, 로컬 환경에서 구동 가능한 Qwen 35B MOE와 거대 클라우드 모델 간의 성능 격차가 예상보다 크게 줄어드는 현상에 주목하고 있습니다.

Linus Torvalds는 AI를 단순히 유용한 '도구'로 규정하며, 이에 반대하는 사람들의 주장을 일축했습니다. 그는 AI가 기술적 가치를 제공하므로 커널 프로젝트의 핵심이 될 것이며, 오픈 소스 정신은 부수적인 이점일 뿐이라고 강조합니다. 또한, AI의 문제점을 지적하기보다 실제로 사용해보고 해결책을 찾는 데 집중해야 한다고 주장합니다.

본 글은 대규모 언어 모델(LLM)의 지식을 소형 모델로 '증류(distill)'하고, 복잡한 작업을 작은 모델을 통해 라우팅 및 실행하는 새로운 프레임워크 A.L.F.R.E.D.를 제안합니다. 이를 통해 큰 모델에 대한 의존도를 줄이고 속도와 결정론적 검증 능력을 향상시키는 것이 목표입니다.
Graphene OS 환경에서 Hermes를 구동한 후기를 공유하며, 원격 게이트웨이와 로컬 LLM(Llama.cpp, Qwen 3.6 35b)을 결합한 고성능 세팅을 소개합니다. 휴대용 GPU와 eGPU 조합으로 높은 프롬프트 및 생성 처리 속도를 달성했으며, 전체 시스템이 100% 로컬로 작동하는 점을 강조했습니다.

Hy-Embodied-RxBrain-1.0은 체화된 인지(embodied cognition)를 위한 통합 멀티모달 파운데이션 모델입니다. 이 단일 모델은 언어 추론과 시각적 상상력을 결합하여, 질문 답변, 세계 상태 예측, 공동 하위 목표 계획 등 세 가지 핵심 기능을 제공합니다.
llama.cpp가 SYCL 및 Intel 관련 최신 업데이트를 제공하며, 여러 성능 향상과 기능 개선이 이루어졌습니다. 특히 Flash Attention을 통한 XMX 엔진 사용, Qwen3.6-27b 모델의 프리필 속도 대폭 향상 등이 포함되었습니다.
ExLlamaV3 v1.0.0이 프로덕션 버전으로 출시되며 대규모 성능 개선을 이루었습니다. 주요 업데이트에는 flash-attention-2 및 xformers 의존성 제거, Gemma4 포함 다수 모델의 텐서 병렬 지원 확장 등이 포함되었습니다. 또한 KV 양자화로 인한 속도 저하를 해결하고 다양한 최적화 커널이 추가되어 전반적인 성능과 안정성이 크게 향상되었습니다.
Bonsai 27B 모델에 대한 사용 후기 및 토론 내용입니다. 코딩 작업 시 사고 과정(thinking process)을 잘라내어 응답의 품질이 떨어지며, 간단한 C# 함수 작성 등에서도 성능 개선이 미미하다는 점을 지적합니다.
이 프로젝트는 서버나 WebGPU에 의존하지 않고, 순수 WebAssembly(WASM)를 사용하여 3억 5천만 개 매개변수의 LLM을 브라우저에서 완전히 온디바이스로 실행하는 방법을 제시합니다. 모델은 4비트로 양자화되었으며, WASM SIMD 커널과 배치 사전 채우기 기능을 포함하여 네이티브 백엔드 없이도 효율적인 추론이 가능합니다.

Supertonic 3 모델을 포함한 여러 TTS 모델이 C++/GGML 기반의 audio.cpp를 통해 높은 성능으로 구현되었습니다. 특히 RTX 5090 환경에서 10시간 분량의 오디오를 약 3분 만에 생성하는 등 압도적인 속도를 보여주었습니다. C++ 버전은 Python보다 빠르며, ONNX 사용 시 GPU 활용도가 떨어지는 문제점을 개선했습니다.

사용자가 직접 제작한 Qwen 3.5 122B Heretic ROCmFP4 iMatrix 관련 정보를 공유하고 있습니다. 이 모델은 특정 컴퓨팅 자원(Strix Halo)을 활용하여 구동되었으며, 성능 지표와 함께 다른 사용자들에게도 공유할 의향이 있음을 밝히고 있습니다.

GLM-5.2-Int4-Int8 모델을 GB10 8개 GPU 환경에서 구동했을 때의 성능 지표를 공유합니다. 전처리(prefill) 속도는 약 1,200 t/s이며, 평균 디코딩(decode) 속도는 일반 작업 시 33–54 t/s로 측정되었습니다.
본 글은 colibrì 엔진을 사용하여 GPU 없이도 대규모 MoE 모델인 GLM-5.2 (744B)를 로컬 단일 컴퓨터에서 구동하는 실습 과정을 다룹니다. 핵심 원리는 필요한 전문가(expert)만 디스크에서 RAM으로 스트리밍하여 메모리 부담을 줄이는 것입니다. 이 엔진은 사용 시간이 길어질수록 성능이 향상되는 특징을 보여줍니다.

DeepSeek V4 모델이 No Man's Sky와 Minecraft 하이브리드 게임을 원샷 코딩한 사례가 공유되었습니다. 이는 A/B 테스트를 통해 접근된 새로운 버전의 성능을 보여주며, 해당 기술의 활용 가능성에 대한 논의를 촉발하고 있습니다.
PrismML Bonsai 27B 모델을 Jetson Orin Nano 8GB 환경에서 구동하는 성능 지표를 공유합니다. 이 설정은 전력 소모가 약 25W로 효율적이며, 복잡한 작업을 수행하기에 충분히 유용함을 보여줍니다.
CUDA GPU 환경에서 llama.cpp를 직접 설정하고 사용하는 과정에서 발생하는 복잡한 오류 문제를 다루고 있습니다. 이 글은 LM Studio의 헤드리스 Linux 버전을 활용하여, 번들된 llama-server 바이너리를 직접 실행함으로써 CUDA 호환성 및 성능 문제를 우회하는 실용적인 방법을 제시합니다.

llama.cpp의 Multi Token Prediction(MTP) 구현이 BF16을 지원하지 않는 구형 GPU 아키텍처에서 cuBLAS 충돌 문제를 일으킬 수 있어, CUDA 백엔드가 패치되었습니다. 이 패치는 최신 GPU에 영향을 주지 않으면서도 구형 카드에서 MTP가 안정적으로 작동하도록 BF16/FP16/FP32 폴백 로직을 추가했습니다.

AMD의 새로운 Ryzen AI Halo (Strix Halo) 시스템을 활용하여 LLM 추론 성능을 개선하는 설정 방법을 공유합니다. 이 설정을 통해 로컬 환경에서 10~15%의 성능 향상을 얻을 수 있습니다.
Gemma-4-31B를 기반으로 개발된 AntiHal 모델은 요청의 잘못되거나 조작된 전제에 대해 단순히 따르지 않고 반박하도록 유도하는 새로운 변형 모델입니다. 이 모델은 '반환각지능 벤치마크(HalBench)'와 표현 조향(representation steering) 기법을 결합하여, 거짓 가정에 대한 반박 능력을 크게 향상시켰습니다.