Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
HRM 1B는 표준 베이스라인 대비 훨씬 적은 학습 토큰과 연산량을 사용하여 2~7B 규모의 모델과 경쟁하는 성능을 보여주는 베이스 모델입니다. 저자들은 학습 코드와 논문을 공개하였으며, 효율적인 사전 학습과 지시어 튜닝의 결합을 특징으로 합니다.
lemon-mlx-engine에 ROCm 7.13 통합이 완료되어 로컬 하드웨어에서 최신 ROCm을 사용할 수 있습니다. Qwen3 및 3.5/3.6 MoE 모델 관련 버그와 커널 수정 사항이 포함되었습니다.
개인 프로젝트용 로컬 TTS 도구 선택을 돕기 위해 직접 제작한 TTS 벤치마크 프로젝트를 소개합니다. Windows와 Mac 환경에서의 테스트 결과를 제공하며, GitHub를 통해 누구나 확인하고 참여할 수 있습니다.
Google Chrome 환경에서 GPU 없이 Gemma4(Gemini Nano) 모델을 로컬로 실행할 수 있는 Chrome 확장 프로그램을 소개합니다. 별도의 복잡한 설정 없이 16GB RAM과 Chrome만 있으면 초당 약 20토큰의 속도로 모델을 사용할 수 있습니다.
llama-server를 위한 독립형 로컬 웹 UI인 llampart 1.0.0이 출시되었습니다. llama.cpp 생태계를 기반으로 하며, 사용자 편의성을 높인 데스크톱 스타일의 인터페이스와 확장된 설정 기능을 제공합니다.
CPU 환경에서 Needle 26M과 Qwen3-0.6B 모델의 도구 호출(Function Calling) 성능을 비교 분석했습니다. Needle은 도구 선택 단계에서 실수가 잦지만 인자 추출이 정확한 반면, Qwen3는 호출 자체를 생략하는 경향을 보였습니다.
Cohere의 218B MoE 모델인 Command A+를 Apple Silicon에서 실행할 수 있도록 mlx-lm용 구현을 개발했습니다. Sigmoid 라우팅과 슬라이딩 윈도우 등 모델의 독특한 아키텍처를 반영하며, MLX 프레임워크를 통한 로컬 실행 최적화를 목표로 합니다.
AMD MI60 GPU 환경에서 Frigate 및 HomeAssistant 활용을 위한 llama.cpp 최적화 설정을 탐구합니다. 다양한 양자화 방식, KV 캐시, 배치 크기 및 ROCm 환경 변수를 조합하여 성능을 벤치마킹한 과정을 다룹니다.
Xiaomi 12 Pro 스마트폰을 활용하여 24/7 로컬 LLM 서버를 구축하는 DIY 프로젝트의 재설계 과정을 다룹니다. 냉각 시스템과 전원 공급 장치를 커스텀 제작하였으며, Llama.cpp를 이용한 Gemma-4 모델의 성능 벤치마크 결과를 공유합니다.
16GB AMD Radeon GPU 환경에서 llama.cpp와 ROCm/HIP를 활용한 로컬 LLM 실행 성능을 테스트하고 공유하는 리포지토리를 소개합니다. Qwen3.6 모델을 중심으로 컨텍스트 길이, KV 캐시, 전력 프로필 등 실용적인 벤치마크 데이터를 제공합니다.
llama.cpp 환경에서 Gemma4 31B 모델의 사고 과정(thinking process)을 안정적으로 유지하기 위한 실험적인 Jinja 템플릿을 소개합니다. 이 템플릿은 멀티턴 도구 호출 시 발생하는 사고 태그 누락이나 조기 종료 문제를 해결하는 데 중점을 둡니다.
LongCat-Video-Avatar 1.5는 오디오 기반의 고품질 인간 비디오 생성을 위한 오픈 소스 프레임워크입니다. Whisper-Large 인코더와 DMD2 기반 증류 기술을 통해 자연스러운 입술 움직임과 빠른 추론 속도를 제공하며, 다양한 도메인에 대한 일반화 성능을 갖추었습니다.
LlamaStation v0.9은 llama.cpp를 기반으로 한 Windows용 GUI 도구로, 명령줄 입력 없이도 모든 파라미터를 정밀하게 제어할 수 있습니다. TurboQuant와 MTP를 지원하여 긴 컨텍스트에서도 높은 성능을 유지하며, 멀티 백엔드와 음성 모드 등 다양한 기능을 제공합니다.
WebVoyager 벤치마크를 통해 브라우저 에이전트의 '실행 비용(Agent Execution Tax)' 개념을 분석했습니다. 단순히 토큰당 가격이 아닌, 재시도와 낭비된 추론을 포함한 작업당 실제 비용이 모델 성능 평가의 핵심 지표임을 강조합니다.
16GB VRAM NVIDIA GPU 사용자를 위해 최적화된 Qwen-27B 모델의 새로운 KS 양자화 버전을 소개합니다. ik_llama.cpp 프로젝트를 활용하여 모델 크기를 14.1GB로 줄이면서도 높은 성능과 105k의 컨텍스트 윈도우를 확보했습니다.
Strix Halo 시스템의 성능을 극대화하기 위해 듀얼 RTX 3090 eGPU와 NVLink를 결합한 하드웨어 모딩 실험을 다룹니다. 27B~31B 밀집 모델 실행 시 대역폭 제한을 완화하여 성능을 향상시키는 방법과 전력 효율성을 분석합니다.
프리필링과 디코딩 단계의 서로 다른 병목 현상과 양자화 특성을 분석한 논문을 소개합니다. 프리필링에는 W4A4 양자화를 적용해 속도를 높이되, 오류 누적에 민감한 디코딩 단계는 고정밀도를 유지하는 전략을 제안합니다.
LLM 모델들이 'One Night Werewolf' 게임을 플레이할 수 있도록 프롬프트와 도구 호출 시스템을 구축한 실험 사례입니다. 모델의 정체성 유지 문제와 전략적 사고를 위한 프롬프트 개선 과정을 다룹니다.
ml-intern 에이전트와 DeepSeek v4 Flash를 활용하여 브라우저용 프롬프트 인젝션 탐지 모델을 구축한 사례입니다. DistilBERT를 기반으로 합성 데이터셋을 학습시켜 F1 99%의 성능을 달성했으며, Transformers.js를 통해 클라이언트 측 실행을 구현했습니다.
Qwen3.5-VL을 기반으로 구축된 Marlin-2B는 비디오 내 이벤트의 '무엇'과 '언제'를 추출하는 데 특화된 2B 규모의 초소형 VLM입니다. 초 단위의 정밀한 타임스탬프와 구조화된 캡션을 생성하며, 특정 벤치마크에서 동급 최강의 성능을 보여줍니다.