Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
에이전트가 스스로의 자기 성찰(self-reflection) 인프라를 재구축하여 기존의 오류를 해결한 사례를 소개합니다. 에이전트가 스스로 필요한 시스템 프롬프트와 전략을 설계함으로써 셸 명령 오류와 공격적인 도구 사용 문제를 자가 교정했습니다.
4개의 RTX 3090과 192GB RAM 환경에서 GLM-5.2(744B) 모델을 구동한 성능 테스트 결과입니다. 양자화 비트를 낮추는 것보다 CPU 코어 수를 늘리는 것이 디코딩 속도 향상에 더 효과적임을 확인했습니다.
RTX 3090/4090 환경에서 DiffusionGemma 26B 모델을 vLLM으로 구동한 성능 테스트 결과입니다. 특정 조건에서 매우 높은 토큰 생성 속도를 기록했으나, 정확도 저하와 컨텍스트 유지 능력 부족이라는 한계가 확인되었습니다.
Dual Xeon CPU와 대용량 RAM 환경에서 GLM-5.2 양자화 모델을 로컬로 구동한 실험 사례입니다. ik_llama.cpp를 활용해 NUMA 노드 격리로 성능을 최적화하며, CPU 기반 추론의 실용성을 확인했습니다.
Ollama 대신 llama.cpp를 사용하여 AMD GPU 환경에서 로컬 LLM을 구동하는 초보자용 가이드입니다. Docker Compose를 활용해 llama.cpp 서버와 Open WebUI를 연동하는 설정 방법을 상세히 다룹니다.
에이전트 코딩 로그를 활용해 보정(Calibration)된 Qwopus3.6-27B-Coder의 2-bit GGUF 양자화 모델을 소개합니다. 10GB 미만의 소형 모델임에도 MTP 기술을 통해 SWE-rebench 벤치마크에서 60% 이상의 높은 통과율을 달성했습니다.
LFM2.5 기반의 새로운 다국어 검색 모델인 Embedding-350M과 ColBERT-350M이 공개되었습니다. 두 모델 모두 11개 언어에서 높은 정확도를 제공하며, 기존 RAG 파이프라인에 즉시 적용 가능한 효율적인 추론 속도를 자랑합니다.
North Mini Code가 4-bit 양자화 버전을 출시하여 로컬 하드웨어에서의 실행 편의성을 높였습니다. 또한 Ollama, llama.cpp 기반 런타임 및 OpenRouter API를 지원하여 접근성을 대폭 강화했습니다.
Laguna-M.1은 에이전트 기반 코딩과 장기 작업을 위해 설계된 225B 규모의 MoE 모델입니다. 256개의 전문가를 활용한 고용량 라우팅과 글로벌 어텐션 아키텍처를 통해 강력한 코딩 에이전트 성능을 제공합니다.
rtk, headroom, caveman 등 LLM 토큰 절감 도구들이 실제 Claude Code 워크로드에서 어느 정도의 비용 절감 효과를 보이는지 분석합니다. 실험 결과, 특정 페이로드에서는 높은 절감률을 보이지만 실제 청구서 기준으로는 프롬프트 캐싱과 워크로드 특성으로 인해 절감 폭이 제한적임을 확인했습니다.
mistral.rs v0.8.10 업데이트를 통해 OpenAI 호환 에이전트 스킬(/v1/skills) 지원이 추가되었습니다. 이제 로컬 오픈 모델에서도 프론티어 API 없이 도메인 지침과 스크립트를 실행할 수 있습니다.
8개의 LLM을 대상으로 4가지 전략적 과제에 대한 블라인드 테스트를 수행한 결과, 최상위권 모델들 간의 성능 격차가 매우 미미함을 확인했습니다. 특히 비용 대비 품질 측면에서 저렴한 모델이 프론티어 모델과 대등한 성능을 보여, 특정 작업에서는 고비용 모델 사용의 경제성이 낮음을 시사합니다.
Keye-VL-2.0-30B-A3B는 긴 영상 이해와 에이전트 역량에 특화된 30B급 플래그십 멀티모달 베이스 모델입니다. DSA 아키텍처를 통해 256K 초장기 문맥에서도 효율적이고 정확한 추론을 제공하며, 영상 벤치마크에서 Gemini-3-Flash와 대등한 성능을 보여줍니다.
GLM-5.2 모델의 API 성능과 특성을 분석한 리뷰입니다. 긴 컨텍스트에서의 일관성, 빠른 추론 속도, 그리고 불필요한 장황함이 없는 깔끔한 답변 능력을 높게 평가하며 프런티어 모델로서의 가능성을 제시합니다.
Java MCP SDK를 사용하여 타임존 기반의 날짜와 시간을 제공하는 stateless HTTP MCP 서버를 개발했습니다. 가상 스레드를 활용해 초당 약 35,000개의 쿼리를 처리하며, LLM이 정확한 시간 정보를 가져올 수 있도록 돕습니다.
llama.cpp가 API를 통해 모델의 로드, 언로드 및 다운로드를 지원하는 기능을 추가했습니다. 이를 통해 모델의 전체 라이프사이클을 llama.cpp만으로 관리하고 배포할 수 있는 환경이 마련되었습니다.
HTML 데이터 추출 작업에서 2B~35B 크기의 소형 모델들을 벤치마킹한 결과입니다. Qwen3.6 27B가 가장 우수한 성능을 보였으며, Gemma4 e2b 및 e4b 모델이 대형 모델보다 뛰어난 성과를 기록했습니다.
Lemonade v10.8 업데이트를 통해 동적 VRAM 관리, 클라우드 오프로드, MCP 게이트웨이 기능이 추가되었습니다. 로컬 모델과 클라우드 API를 유연하게 전환하며 사용할 수 있는 로컬 우선(Local-first) 환경을 제공합니다.
LLM이 주사위 굴리기 요청 시 특정 숫자에 편향되는 문제를 해결하기 위해 사후 학습(Post-training)을 진행했습니다. 모델이 기존의 패턴을 따르지 않고 확률적으로 탐색(Explore)할 수 있도록 만드는 강화학습적 접근법을 다룹니다.
H200 GPU 환경에서 GLM-5.2 모델을 SGLang Docker를 통해 최적화하여 배포하는 방법을 공유합니다. 실험을 통해 262k 컨텍스트와 70t/s의 성능을 달성한 설정값과 주의사항을 다룹니다.