Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LFM2.5 기반의 새로운 다국어 검색 모델인 Embedding-350M과 ColBERT-350M이 공개되었습니다. 두 모델 모두 11개 언어에서 높은 정확도를 제공하며, 기존 RAG 파이프라인에 즉시 적용 가능한 효율적인 추론 속도를 자랑합니다.
North Mini Code가 4-bit 양자화 버전을 출시하여 로컬 하드웨어에서의 실행 편의성을 높였습니다. 또한 Ollama, llama.cpp 기반 런타임 및 OpenRouter API를 지원하여 접근성을 대폭 강화했습니다.
rtk, headroom, caveman 등 LLM 토큰 절감 도구들이 실제 Claude Code 워크로드에서 어느 정도의 비용 절감 효과를 보이는지 분석합니다. 실험 결과, 특정 페이로드에서는 높은 절감률을 보이지만 실제 청구서 기준으로는 프롬프트 캐싱과 워크로드 특성으로 인해 절감 폭이 제한적임을 확인했습니다.
mistral.rs v0.8.10 업데이트를 통해 OpenAI 호환 에이전트 스킬(/v1/skills) 지원이 추가되었습니다. 이제 로컬 오픈 모델에서도 프론티어 API 없이 도메인 지침과 스크립트를 실행할 수 있습니다.
Java MCP SDK를 사용하여 타임존 기반의 날짜와 시간을 제공하는 stateless HTTP MCP 서버를 개발했습니다. 가상 스레드를 활용해 초당 약 35,000개의 쿼리를 처리하며, LLM이 정확한 시간 정보를 가져올 수 있도록 돕습니다.
llama.cpp가 API를 통해 모델의 로드, 언로드 및 다운로드를 지원하는 기능을 추가했습니다. 이를 통해 모델의 전체 라이프사이클을 llama.cpp만으로 관리하고 배포할 수 있는 환경이 마련되었습니다.
Lemonade v10.8 업데이트를 통해 동적 VRAM 관리, 클라우드 오프로드, MCP 게이트웨이 기능이 추가되었습니다. 로컬 모델과 클라우드 API를 유연하게 전환하며 사용할 수 있는 로컬 우선(Local-first) 환경을 제공합니다.
H200 GPU 환경에서 GLM-5.2 모델을 SGLang Docker를 통해 최적화하여 배포하는 방법을 공유합니다. 실험을 통해 262k 컨텍스트와 70t/s의 성능을 달성한 설정값과 주의사항을 다룹니다.
Fable 5가 최적화한 WebGPU 커널을 통해 Gemma 4 E2B 모델을 브라우저 환경에서 초당 255 토큰의 속도로 실행할 수 있게 되었습니다. M4 Max 환경에서의 성능 데모와 함께 관련 커널 및 모델이 공개되었습니다.
Microsoft의 TRELLIS.2 이미지 투 3D 모델을 Apple Silicon에서 네이티브로 실행할 수 있는 MLX 포트를 공개했습니다. M4 Max 환경에서 다양한 해상도를 지원하며 실제 워크플로우 활용에 최적화되었습니다.
오픈 소스 모델을 활용하여 로컬 환경에서 Alexa와 유사한 홈 음성 비서를 구축하기 위한 1년간의 도전과 시행착오를 다룹니다. 무엇이 성공적이었고 무엇이 실패했는지에 대한 실질적인 리뷰를 제공합니다.
LLM 에이전트의 메모리 문제를 단순 저장(Storage)이 아닌 관련성(Relevance)의 관점에서 접근하여 직접 구축한 사례를 다룹니다. HNSW 그래프 재배선, 양자화 오차 보정, 시간적 쇠퇴 모델 도입을 통해 에이전트의 기억력을 개선하는 기술적 방법론을 제시합니다.
LM Studio 대신 llama.cpp를 사용하여 로컬 LLM 에이전트 환경을 구축한 경험을 공유합니다. llama.cpp는 더 빠른 프롬프트 처리 속도와 효율적인 컨텍스트 관리를 제공하여 대규모 컨텍스트 작업에 유리합니다.
RAG 쿼리에 메타데이터를 제공하기 위해 로컬 Qwen 0.6B 모델을 질문 분류용으로 파인튜닝하는 실험 과정을 다룹니다.
Docker Sandbox를 활용하여 로컬 LLM(llama.cpp, MLX)을 호스트 환경으로부터 격리하여 실행하는 두 가지 가이드를 제공합니다. 모델 서버는 호스트 GPU를 사용하되, Pi는 마이크로 VM 내에서 추론 엔드포인트만 노출되도록 설계되었습니다.
Qwen3.6 27B 모델의 양자화 수준(Q8 vs IQ3 XXS)에 따른 코딩 성능 차이를 비교 실험했습니다. 실험 결과, 낮은 양자화 모델인 IQ3 XXS도 일반적인 코딩 작업에는 충분히 우수한 성능을 보여주었습니다.
Gemma 12b 모델의 추론 능력을 강화하기 위해 인지적 편향을 방지하는 시스템 지침(System Instruction)을 설계하고 테스트한 사례를 공유합니다. 이 지침은 모델이 불필요하게 과도한 추론을 하지 않으면서도 주어진 전제에 엄격하게 기반하여 답변하도록 유도합니다.
AI를 활용한 소프트웨어 개발 방식의 차이를 네 가지 유형(vibecoder, non-coder builder, traditional programmer, agentic engineer)으로 분류하고 분석합니다. 단순 코드 생성을 넘어 인간의 기술적 이해도와 AI 관여도를 어떻게 정의할 것인지에 대한 통찰을 제공합니다.
Intel A770 그래픽 카드를 위해 최적화된 Nex2 mini Phase Twin 모델이 출시되었습니다. 30B 모델임에도 16GB VRAM 환경에서 효율적으로 작동하며, 단일 또는 듀얼 GPU 구성에 따라 최적의 성능을 발휘합니다.
vLLM nightly 버전에 Qwen3+ 모델을 위한 새로운 스트리밍 파서가 추가되었습니다. 이를 통해 Qwen3.6-27b 모델의 대화 중단 현상과 스트리밍 도구 호출 실패 문제를 해결하여 에이전트 워크플로우의 안정성을 높였습니다.