Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
DeepSeek의 뛰어난 코딩 능력을 유지하면서 시각 정보 처리 기능을 추가한 LocalEyes를 개발했습니다. 이 스킬은 로컬 Ollama 비전 모델(qwen2.5vl:7b)을 활용하여 DeepSeek에게 '눈'을 제공하며, 사용자가 직접 스크린샷을 찍어 분석하게 합니다. 모든 과정이 100% 로컬에서 작동하여 보안성과 비용 효율성이 높습니다.
Rewire Text는 Windows 및 macOS에서 단축키만으로 시스템 전체의 텍스트를 변환하는 도구입니다. 확정적 변환(대소문자 변경, 공백 정리 등)은 기기에서 즉시 실행되며, AI 기반 변환(스타일 재작성, 요약, 번역 등)은 로컬 AI 모델(Ollama, LM Studio 등) 또는 BYOK 원격 API를 통해 지원합니다.
텍스트 전용 LLM에 시각 기능을 부여하는 OpenAI 호환 프록시인 VisionBridge를 소개합니다. 별도의 학습 없이 도구 호출을 통해 추론 모델이 이미지를 분석할 수 있게 합니다.
Qwen3 TTS 0.6B 모델을 안드로이드 기기에서 온디바이스로 구동할 수 있는 앱 제작 사례를 소개합니다. 커스텀 GGML 기반 C++ 백엔드를 사용하여 Galaxy S25에서 실시간에 가까운 속도로 텍텍스트를 음성으로 변환합니다.
8xB200 노드에서 GLM-5.2 모델을 최적으로 서빙하기 위한 NVFP4 정밀도와 TP=4 복제본 구성의 이점을 분석합니다. 대역폭 제한 문제를 해결하기 위해 NVFP4를 사용하면 TP=8 설정보다 약 2배 높은 성능을 낼 수 있음을 보여줍니다.
llama.cpp에 새롭게 병합된 DFlash 기술을 Qwen 3.6 27B 모델에 적용하여 성능을 테스트했습니다. 투기적 디코딩(Speculative Decoding) 방식을 통해 36K 컨텍스트 환경에서 기존 대비 최대 4.44배의 속도 향상을 확인했습니다.
mistral.rs v0.9.0 업데이트를 통해 x86 및 ARM 환경에서 llama.cpp 대비 최대 1.8배 빠른 CPU 디코딩 속도를 달성했습니다. AVX2, AVX512, NEON 등 다양한 CPU 명령어 세트를 최적화하여 전반적인 성능을 향상시켰습니다.
Mac 환경에서 DeepSeek의 DSpark drafter를 무손실로 실행할 수 있는 MLX 포트인 mlx-dspark를 공개했습니다. Apple Silicon의 특성을 고려하여 최적화되었으며, 기존 mlx_lm 대비 약 1.4~1.6배의 속도 향상을 제공합니다.
4GB VRAM 환경에서 Gemma 4 E2B 모델을 활용해 비전, 오디오, 추론을 통합 수행하는 로컬 도구 ScreenMind를 소개합니다. pHash 캐싱과 최적화된 파이프라인을 통해 저사양 GPU에서도 효율적인 실시간 화면 모니터링 및 RAG 기능을 구현했습니다.
소형 로컬 모델과 대형 코딩 모델을 체이닝하여 VRAM을 효율적으로 관리하는 도구인 Prompt-Chaining을 소개합니다. 로컬 모델로 프롬프트를 최적화한 뒤 클라우드 모델로 코드를 생성하여 비용을 절감하고 효율을 높입니다.
llama.cpp에 Hy3 모델 지원을 위한 PR이 반영되었으며, GGUF 포맷 모델이 출시되었습니다. 사용자는 고사양 하드웨어 환경에서 안정적인 추론 속도를 확인했습니다.
Open Computer는 에이전트가 UI를 조작하고 앱을 설치할 수 있도록 설계된 오픈 소스 에이전트 전용 컴퓨터 환경입니다. 격리된 VM 내에서 작동하며, 인간이 관찰 가능한 인터페이스를 제공하면서도 에이전트의 효율적인 작업을 지원합니다.
ggml-cpu 프로젝트에서 ARM 프로세서의 NVFP4 내적 연산 성능을 높이기 위해 UE4M3 룩업 테이블(LUT) 최적화를 적용했습니다. 이를 통해 ARM 구현을 x86과 일치시키고 CPU 기반 추론 속도를 크게 향상시켰습니다.
대규모 트랜스포머 모델을 다룰 때 발생하는 메모리 부족 문제를 해결하기 위한 tftf 프로젝트를 소개합니다. 모든 연산을 텐서 단위로 수행하여 VRAM과 RAM 용량을 초과하는 모델도 효율적으로 처리할 수 있도록 설계되었습니다.
ggml-hip 빌드 시 -ffast-math 옵션을 활성화하여 AMD GPU(RDNA3.5)에서의 추론 성능을 개선한 벤치마크 결과입니다. Qwen 모델 시리즈를 대상으로 테스트한 결과, 다양한 컨텍스트 길이에 걸쳐 약 0.6%에서 최대 7.0%의 성능 향상을 확인했습니다.
멀티모달 모델의 반복적인 비디오 전송 비용을 줄이기 위해 로컬 우선(local-first) 비디오 인덱싱 파이프라인인 Watch Skill을 구축했습니다. 비디오에서 전사, OCR, 장면 경계 등을 추출하여 로컬 인덱스를 생성하고, LLM이 이를 검색하여 활용하도록 설계되었습니다.
로컬 모델의 신뢰성을 검증하기 위해 숨겨진 테스트 스위트를 활용하는 'eval gym' 파이프라인을 구축했습니다. gpt-oss:20b 모델이 이 테스트를 통과하여 에이전트 기반 앱 빌드 신뢰 등급을 획득했으며, 실제 업무 적용을 통해 모델의 한계와 버그를 식별하는 과정을 다룹니다.
Llama-Server의 KV 캐시 저장/복구 기능이 프로세스 재시작 시 메타데이터 유실로 인해 무용지물이 되는 문제를 분석하고 해결책을 제시합니다. 체크포인트 메타데이터를 사이드카 파일로 영속화하여 재시작 후에도 효율적인 롤백과 프리필 비용 절감이 가능하도록 개선했습니다.
SupraLabs가 코딩 에이전트의 복잡한 사고 흔적(thinking traces)을 JSON 형태로 요약해주는 800M 규모의 초소형 모델을 출시했습니다. 개발자는 이 모델을 통해 에이전트의 추론 과정을 사용자에게 더 직관적이고 구조화된 방식으로 전달할 수 있습니다.
LivePortrait 모델을 WebGPU 환경에서 실행하기 위해 모델 증류(Distillation)를 통해 경량화한 프로젝트입니다. Chrome 브라우저 내에서 25fps의 속도로 실시간 실행이 가능하도록 구현되었습니다.