Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Mac Studio의 메모리 제약 조건 하에서 Qwen3.5 122b와 같은 대규모 모델을 구동하는 최적화 기법을 소개합니다. Gated DeltaNet KV 캐시의 부분 저장 및 개선된 제거 전략 구현을 통해, 온디스크 KV 캐시 활용도를 극대화하여 프리필 컴퓨팅 부하를 크게 줄였습니다. 이를 통해 단일 Mac Studio에서 병렬성 없이도 여러 세션의 동시성을 성공적으로 달성할 수 있게 되었습니다.
OpenHire는 기존 채용 시장의 문제점(유령 공고, 이력서 블랙홀)을 해결하기 위해 개발된 AI 에이전트 기반 채용 검색 도구입니다. 96개 회사의 자체 ATS API에서 실시간으로 약 11,800개의 공고를 직접 색인화하여 제공합니다.

llama.cpp를 활용하여 Oracle Always-Free ARM 박스에서 7B MoE 모델을 CPU 기반으로 구동하는 실시간 데모 서버가 소개되었습니다. 이 서버는 활성 파라미터가 적은 MoE 구조 덕분에, 일반적인 9B 밀집 모델보다 훨씬 빠른 속도(초당 약 25 토큰)로 고품질 출력을 제공합니다. 이 시스템은 무료 호스팅 스택과 자동 튜닝 기능을 갖추고 있으며, 반복적이고 좁은 작업에 최적화되어 있습니다.

작성자는 기존 27b 모델을 주력 코딩 에이전트로 사용했을 때 발생하는 비효율적인 반복 작업과 진전 부족에 좌절감을 느꼈습니다. 이에 Gemma4-31b를 메인 코딩 에이전트로, 27b를 QA/리뷰어 에이전트로 활용하는 워크플로우로 전환한 결과, 프로젝트의 버그 해결 및 프로토타입 구축 속도가 크게 향상되었다고 경험을 공유했습니다.
오픈소스 스크린 모니터링 앱 'Observer'가 사용자 피드백을 바탕으로 대폭 개선되었습니다. 초기에는 설정이 복잡하고 수동적이었으나, 이제는 간단한 문장 입력만으로도 앱이 스스로 제어할 만큼 사용성이 향상되었습니다.
작은 LLM의 도구 호출 성공률을 높이기 위해 여러 가지 최적화 기법을 적용했습니다. 주요 방법으로는 노출되는 도구의 개수를 줄이고, 기능별로 그룹화하며, 도구 매개변수의 규칙을 완화하는 것입니다. 이러한 접근 방식은 컨텍스트 크기를 크게 줄여 성능과 속도를 개선하고 에이전트의 안정성을 높였습니다.

llama.cpp용 명령어 빌더인 llamacalc가 대규모 업데이트를 통해 다양한 운영체제 및 환경을 지원합니다. Linux/macOS 명령어, Windows PowerShell, Command Prompt 등 여러 플랫폼의 명령어를 생성할 수 있으며, 초보자 프리셋과 충돌 경고 기능이 추가되었습니다.
GPU 사양이 낮은 환경에서 느린 프롬프트 처리(PP) 속도를 개선하기 위한 원격 처리 방법을 제안합니다. 충분한 VRAM을 가진 고성능 GPU를 활용하여 대용량 프롬프트를 미리 처리하고, 이를 저장하여 호스트 기기로 전송한 후 토큰 생성을 시작하는 방식입니다.

개발자가 SearXNG 기능을 서브 에이전트로 구현하여 작업 공간 도구에 통합한 사례를 공유합니다. 이 에이전트는 WebResearch 래퍼를 통해 호출되며, 웹 검색과 가져오기 기능만을 사용하여 규칙 기반의 마크다운 보고서를 생성하는 것이 특징입니다.

로컬 환경에서 Huggingface speech-to-speech 및 Qwen3.6 모델을 활용하여 학습 도구를 구축하는 방법을 소개합니다. 이 시스템은 사용자가 개념을 설명하면, AI가 해당 지식의 '지식 발판(knowledge scaffolding)' 목록을 컴파일하고 사용자에게 추가 설명을 요청하여 학습 효과를 극대화합니다.

DFlash 기술은 Qwen3.6 27B 모델의 추론 속도를 최대 2.2배 향상시키는 방법을 제시합니다. 이 테스트는 quicksort, JSON 생성 등 구조화된 작업에서 DFlash가 매우 빠르지만, 창의적 글쓰기 같은 작업에서는 MTP 방식이 더 안정적임을 보여줍니다.
PHP CMS 프로젝트의 Queue 서브시스템 탐색을 목표로 한 자체 벤치마크 결과를 분석한 내용입니다. 여러 모델(gemma-4, qwen3.5/3.6 등)이 주어진 도구 세트와 시스템 프롬프트에 따라 코드베이스를 탐색하며 답변했습니다. 그 결과, 높은 점수를 받은 qwen3.6-35b-a3b@q5_k_xl과 gemma-4-26b-a4b-it-qat가 가장 정확하고 포괄적인 요약을 제공했음을 보여줍니다.

Huggingface의 모델 저장소(repo)를 사용자의 계정으로 쉽게 복제할 수 있는 도구인 HuggingMirror를 개발했습니다. 이 로컬 실행 도구는 URL을 입력하면 현재 스냅샷을 다운로드하여 사용자 HF 계정에 업로드하고, 진행 상황을 보여줍니다.
대용량 Hugging Face 모델(GGUF/safetensors) 다운로드 실패 문제를 해결하기 위해 단일 정적 Go 바이너리인 hftools를 제작했습니다. 이 도구는 재개 가능한 다운로드, 에어 갭 환경을 위한 해시 검증, 그리고 다양한 캐시 레이아웃 간의 변환 기능을 제공합니다.

로컬 LLM 환경에서 작동하는 새로운 지식 그래프 'Cortex'를 발표했습니다. Cortex는 단순 텍스트 패턴 인식의 한계를 넘어, 구조화된 지식과 복잡한 관계를 이해하고 추론할 수 있도록 설계되었습니다. 이를 통해 RAG 시스템을 보완하여 정확도와 성능을 획기적으로 향상시킬 수 있습니다.

이 플러그인은 Obsidian 볼트 내의 노트와 문서 전반에 걸쳐 질문하고 답변을 얻기 위해 로컬 AI 환경을 활용합니다. 클라우드 전송 없이 사용자의 기기에서 모델을 실행하며, 자체 노트 기반의 답변과 출처 인용 기능을 제공합니다.
Graphene OS 환경에서 Hermes를 구동한 후기를 공유하며, 원격 게이트웨이와 로컬 LLM(Llama.cpp, Qwen 3.6 35b)을 결합한 고성능 세팅을 소개합니다. 휴대용 GPU와 eGPU 조합으로 높은 프롬프트 및 생성 처리 속도를 달성했으며, 전체 시스템이 100% 로컬로 작동하는 점을 강조했습니다.
llama.cpp가 SYCL 및 Intel 관련 최신 업데이트를 제공하며, 여러 성능 향상과 기능 개선이 이루어졌습니다. 특히 Flash Attention을 통한 XMX 엔진 사용, Qwen3.6-27b 모델의 프리필 속도 대폭 향상 등이 포함되었습니다.
이 프로젝트는 서버나 WebGPU에 의존하지 않고, 순수 WebAssembly(WASM)를 사용하여 3억 5천만 개 매개변수의 LLM을 브라우저에서 완전히 온디바이스로 실행하는 방법을 제시합니다. 모델은 4비트로 양자화되었으며, WASM SIMD 커널과 배치 사전 채우기 기능을 포함하여 네이티브 백엔드 없이도 효율적인 추론이 가능합니다.

Supertonic 3 모델을 포함한 여러 TTS 모델이 C++/GGML 기반의 audio.cpp를 통해 높은 성능으로 구현되었습니다. 특히 RTX 5090 환경에서 10시간 분량의 오디오를 약 3분 만에 생성하는 등 압도적인 속도를 보여주었습니다. C++ 버전은 Python보다 빠르며, ONNX 사용 시 GPU 활용도가 떨어지는 문제점을 개선했습니다.