Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Cohere에서 North Mini Code라는 오픈소스 에이전트 코딩 모델을 공개했습니다. 이 모델은 300억 개의 파라미터 중 30억 개만 활성화하여 높은 효율성을 보여줍니다. Apache 2.0 라이선스로 배포되어 접근성이 높습니다.
18년 된 RTOS와 90년대 CPU 에뮬레이터 환경에서 260K 파라미터 규모의 초소형 LLM을 실행하는 데 성공한 프로젝트입니다. FPU가 없는 환경을 극복하기 위해 INT8 양자화와 정수 연산 최적화 기법을 적용했습니다.
CUDA 없이 Triton만으로 구현한 Fused MoE dispatch kernel을 소개합니다. Megablocks 대비 89-131%의 성능을 달성했으며, 메모리 트래픽을 35% 절감하고 AMD MI300X에서도 코드 변경 없이 동작합니다.
ChatGPT의 프로젝트 폴더 기능 사용 시 컨텍스트 격리가 완벽하지 않아 정보가 유출되는 현상이 발견되었습니다. 프로젝트 폴더 내 정보가 이후 생성되는 모든 스레드에 영향을 미치는 메모리 유출(memory bleed) 문제가 확인되었습니다.
로컬 LLM 채팅 로그를 분석하여 스스로 성능을 개선하는 자기 최적화(Self-optimizing) 에이전트 파이프라인을 소개합니다. 성찰 및 재작성 단계를 통해 추출된 교훈을 시스템 프롬프트에 자동으로 반영하여 에이전트의 능력을 지속적으로 향상시킵니다.
16GB VRAM 환경에서 Qwen3.6:27B 모델을 최적화하여 실행하는 방법과 성능을 분석합니다. MTP 양자화 및 레이어 오프로딩 설정을 통해 음성 비서 서비스에 적합한 추론 속도를 확보하는 과정을 다룹니다.
llama.cpp의 최신 b9274 버전에서 MTP(Multi-Token Prediction) 모델 사용 시 발생하는 VRAM 누수 문제가 해결되었습니다. 서버가 sleep 상태로 진입할 때 해제되지 않던 draft 리소스들을 명시적으로 정리하여 메모리 부족 오류를 방지합니다.
에이전트 기반 코딩 시 컨텍스트 최적화를 위한 대화 기록 수정 과정에서 발생하는 전체 프롬프트 재처리 문제를 해결하기 위한 PR입니다. llama.cpp가 변경된 부분만 효율적으로 처리하도록 개선하여 에이전트의 반응성을 높였습니다.
llama.cpp 서버에 파일 읽기, 쓰기, 쉘 명령 실행 등 다양한 네이티브 도구가 포함된 실험적 플래그가 추가되었습니다. 이를 통해 별도의 복잡한 래퍼 없이도 llama-server를 미니 에이전트 하네스로 활용할 수 있습니다.
이번 주 급성장한 10개의 AI 관련 오픈소스 리포지토리를 소개합니다. AI 코딩 에이전트, 개인용 AI, 브라우저 자동화 및 로컬 개발 도구 등 최신 기술 트렌드를 반영한 프로젝트들이 포함되어 있습니다.
Llama.cpp가 Nvidia Blackwell GPU의 새로운 기능인 PDL(Programmatic Dependent Launch) 지원을 도입했습니다. 이를 통해 토큰 생성 단계에서 약 5~6%의 성능 향상을 기대할 수 있으며, 특정 빌드 플래그를 통해 활성화가 가능합니다.
llama.cpp에서 비대칭 KV 캐시 양자화 사용 시 CUDA 환경에서 성능이 저하되는 문제를 다룹니다. 컴파일 과정에서 다양한 양자화 조합을 포함하는 해결책이 제안되었으며, 메모리 절약과 정밀도 유지 효과가 확인되었습니다.
Cohere Transcribe 모델에 화자 분리(Diarization) 및 타임스탬프 기능을 추가하기 위한 파인튜닝 결과물을 소개합니다. 표준 타임스탬프 형식을 지원하며, 매우 높은 시간 정확도와 최대 32명의 화자 식별 능력을 갖추고 있습니다.
8GB VRAM을 가진 RTX 3070 Ti 환경에서 Qwen3.6-35B-A3B MoE 모델을 활용해 262k 컨텍스트를 구현하고 30tps 이상의 속도를 달성하는 최적화 방법을 소개합니다. 양자화 기법과 KV 캐시 관리, Ubuntu 환경 설정을 통해 저사양 GPU에서도 대규모 컨텍스트 추론이 가능함을 보여줍니다.
6GB VRAM 환경에서 Qwen3.6-35B-A3B 모델을 구동하기 위한 ByteShape 양자화 성능을 테스트했습니다. 실험 결과, ByteShape 양자화는 Unsloth 방식 대비 토큰 생성(TG) 속도가 30% 더 빠르며 효율적인 CPU 오프로딩 성능을 보여주었습니다.
BeeLlama v0.2.0이 출시되어 DFlash 구현 최적화와 Gemma 4 31B 지원을 포함한 대규모 업데이트를 선보였습니다. RTX 3090 환경에서 Qwen 3.6 27B 모델을 사용 시 최대 164 tps의 압도적인 추론 속도를 달성했습니다.
RTX 4070 Super 12GB 환경에서 ik_llama.cpp를 사용하여 Qwen3.6 35B 모델의 추론 속도를 110 tok/s까지 끌어올린 사례를 소개합니다. 기존 llama.cpp의 MTP 성능 저하 문제를 ik_llama.cpp의 CPU 오프로딩 최적화를 통해 해결했습니다.
1Password가 OpenAI와 협력하여 AI 코딩 에이전트 사용 시 발생할 수 있는 자격 증명 유출 문제를 해결하기 위한 새로운 보안 통합 기능을 출시했습니다. 이 솔루션은 비밀 정보를 프롬프트나 저장소로부터 격리하고, 사용자의 승인을 거쳐 런타임 시점에만 자격 증명을 주입함으로써 보안을 강화합니다.
작성자는 Codex CLI, Claude Code, Gemini CLI 등 다양한 에이전틱 코딩 도구를 사용해 본 결과, 가볍고 효율적인 'Pi'를 가장 선호한다고 밝혔습니다. Pi는 최소한의 도구로 구성되어 로컬 모델 활용에 최적화되어 있으며, 필요에 따라 패키지를 추가하여 기능을 확장할 수 있는 유연성을 갖추고 있습니다.
작성자는 ChatGPT와 Gemini를 협업시켜 San Francisco의 복잡한 임대차 법률을 분석함으로써, 집주인의 부당한 보증금 몰수 시도로부터 4,200달러를 지켜냈습니다. 두 모델을 교차 검증 및 Fact check 용도로 활용하고 전문적인 내용증명(Demand letter)을 작성하는 워크플로우를 통해 단 2시간 만에 문제를 해결했습니다.