Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Pangram의 EditLens 데이터셋을 활용하여 Qwen 3.5 0.8B 모델을 미세 조정해 AI 생성 콘텐츠 탐지기를 개발했습니다. 이 모델은 Chrome 확장 프로그램 'Slop Hammer'를 통해 로컬 환경에서 텍스트의 AI 생성 확률 분포를 즉시 확인할 수 있습니다.
Orange Pi AIPro(Ascend 310B) 환경에서 MiniCPM-V 4.6을 구동하기 위해 프레임워크 오버헤드를 제거한 커스텀 C++ 추론 엔진을 개발했습니다. AscendC 커널 최적화를 통해 기존 베이스라인 대비 추론 속도를 약 2배 향상시켰습니다.
RDNA3 아키텍처(7900 XTX 등)를 위해 최적화된 새로운 오픈 소스 ROCm 네이티브 LLM 추론 엔진인 hipEngine을 소개합니다. HIP/C++ 기반의 핫 패스와 AMD 네이티브 라이브러리를 활용하여 Qwen 3.6 모델에서 llama.cpp를 상회하는 프리필 성능을 보여줍니다.
llama.cpp의 llama-server에 추가된 네이티브 도구 기능을 활용하여 웹 RAG를 구현하는 방법을 설명합니다. firejail과 smolmachines를 이용한 다중 샌드박싱 환경을 구축하여 exec_shell_command를 안전하게 실행하는 워크플로우를 제안합니다.
lemon-mlx-engine에 ROCm 7.13 통합이 완료되어 로컬 하드웨어에서 최신 ROCm을 사용할 수 있습니다. Qwen3 및 3.5/3.6 MoE 모델 관련 버그와 커널 수정 사항이 포함되었습니다.
Google Chrome 환경에서 GPU 없이 Gemma4(Gemini Nano) 모델을 로컬로 실행할 수 있는 Chrome 확장 프로그램을 소개합니다. 별도의 복잡한 설정 없이 16GB RAM과 Chrome만 있으면 초당 약 20토큰의 속도로 모델을 사용할 수 있습니다.
llama-server를 위한 독립형 로컬 웹 UI인 llampart 1.0.0이 출시되었습니다. llama.cpp 생태계를 기반으로 하며, 사용자 편의성을 높인 데스크톱 스타일의 인터페이스와 확장된 설정 기능을 제공합니다.
Xiaomi 12 Pro 스마트폰을 활용하여 24/7 로컬 LLM 서버를 구축하는 DIY 프로젝트의 재설계 과정을 다룹니다. 냉각 시스템과 전원 공급 장치를 커스텀 제작하였으며, Llama.cpp를 이용한 Gemma-4 모델의 성능 벤치마크 결과를 공유합니다.
llama.cpp 환경에서 Gemma4 31B 모델의 사고 과정(thinking process)을 안정적으로 유지하기 위한 실험적인 Jinja 템플릿을 소개합니다. 이 템플릿은 멀티턴 도구 호출 시 발생하는 사고 태그 누락이나 조기 종료 문제를 해결하는 데 중점을 둡니다.
LlamaStation v0.9은 llama.cpp를 기반으로 한 Windows용 GUI 도구로, 명령줄 입력 없이도 모든 파라미터를 정밀하게 제어할 수 있습니다. TurboQuant와 MTP를 지원하여 긴 컨텍스트에서도 높은 성능을 유지하며, 멀티 백엔드와 음성 모드 등 다양한 기능을 제공합니다.
16GB VRAM NVIDIA GPU 사용자를 위해 최적화된 Qwen-27B 모델의 새로운 KS 양자화 버전을 소개합니다. ik_llama.cpp 프로젝트를 활용하여 모델 크기를 14.1GB로 줄이면서도 높은 성능과 105k의 컨텍스트 윈도우를 확보했습니다.
LLM 모델들이 'One Night Werewolf' 게임을 플레이할 수 있도록 프롬프트와 도구 호출 시스템을 구축한 실험 사례입니다. 모델의 정체성 유지 문제와 전략적 사고를 위한 프롬프트 개선 과정을 다룹니다.
ml-intern 에이전트와 DeepSeek v4 Flash를 활용하여 브라우저용 프롬프트 인젝션 탐지 모델을 구축한 사례입니다. DistilBERT를 기반으로 합성 데이터셋을 학습시켜 F1 99%의 성능을 달성했으며, Transformers.js를 통해 클라이언트 측 실행을 구현했습니다.
Qwen3.6 모델과 pi 에이전트를 활용하여 복잡한 개발 및 운영 작업을 자동화하는 워크플로우를 소개합니다. 메인 에이전트가 여러 개의 휘발성 하위 에이전트를 관리하며 작업을 분담하는 '매니저-직원' 구조의 에이전트 오케스트레이션 방식을 다룹니다.
vLLM, llama.cpp 등 주요 오픈 소스 AI 엔진들의 OpenAI 호환성 준수 여부를 확인할 수 있는 도구와 문서를 소개합니다. 다양한 모델 유형에 따른 API 시그니처 차이를 정리하여 AI 엔드포인트를 앱에 쉽게 연결할 수 있도록 돕습니다.
llama.cpp 환경에서 텍스트 전용 모델에 비전 기능을 통합하는 실험적인 방법을 다룹니다. Mistral의 Pixtral 인코더를 활용하여 기존 모델의 토크나이저에 포함된 이미지 관련 토큰을 수정함으로써, 모델이 이미지를 올바르게 인식하도록 만드는 과정을 설명합니다.
Hugging Face의 제한적인 검색 기능을 보완하기 위해 Qwen 3.6-27B를 활용하여 개발한 효율적인 모델 검색 유틸리티를 소개합니다. 이 도구는 날짜 범위, 파라미터 수, 저자별 정렬 기능을 제공하며, API 호출을 최적화하여 캐싱하는 단일 HTML 파일 형태의 웹 앱입니다.
본 글은 라이브러리 없이 순수 Python과 raw CUDA만을 사용하여 바닥부터 구축한 소규모 ML 컴파일러 스택의 설계 과정을 다룹니다. Transformer 모델을 6단계의 중간 표현(IR)을 통해 CUDA 커널로 변환하는 과정을 설명하며, 실험 결과 PyTorch 프로덕션 스택에 근접하는 성능과 일부 커널에서의 압도적인 속도 향상을 입증했습니다.
LM Studio의 최신 베타 버전(0.4.14 Build 2)에서 MTP Speculative Decoding 지원이 추가되었습니다. 이를 사용하려면 llama.cpp 엔진이 2.15.0 버전 이상이어야 하며, 모델 로드 시 수동 설정에서 MTP를 직접 활성화해야 합니다.
PrivateScribe.ai는 HIPAA 준수와 개인정보 보호를 최우선으로 설계된 완전 로컬 기반의 오픈 소스 AI 전사 플랫폼입니다. FasterWhisper, pyannote, Ollama를 활용하여 데이터 유출 걱정 없이 의료, 법률, 상담 분야에서 사용할 수 있도록 구축되었습니다.