Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Derpy Turtle: The Kokoro Trainer는 Kokoro 음성 검색과 RVC(Retrieval-based Voice Conversion) 기술을 결합하여 로컬 환경에서 고품질의 음성 변환 출력을 생성하는 Windows GUI 도구입니다. 이 앱은 대상 오디오를 기반으로 RVC 모델을 학습시키고, Kokoro 음성을 정교화한 후, 최종적으로 이를 연결하여 사용자가 복잡한 수동 과정을 거치지 않고도 완성된 `_rvc.wav` 파일을 얻을 수 있도록 워크플로우를 자동화합니다. 개발자는 높은 유사도 점수만을 쫓는 것보다, 깨끗한 음성 소스를 사용하여 RVC가 최종적인 음성 정체성을 처리하도록 하는 것이 더 효과적임을 발견했습니다. 이 도구는 사용자 친화적인 인터페이스와 CUDA 지원을 통해 로컬 음성 실험의 접근성을 크게 높였습니다.
Xiaomi가 1.02조 파라미터의 MiMo-V2.5-Pro 모델을 오픈 소스로 공개했으나, 실제 사용 사례(자율 코딩 세션)를 분석한 결과 API 기반 서비스가 경제적으로 우위를 점하고 있습니다. 이 모델은 지속적인 자율 개발 및 장기 컨텍스트 추론에 매우 뛰어나지만, 1.02T 파라미터 규모 때문에 일반 개발자가 로컬에서 구동하기는 하드웨어적 제약이 너무 큽니다.
TextGen은 기존의 웹 UI 기반 프로젝트에서 진화하여, 이제 Windows, Linux, macOS를 지원하는 설치가 필요 없는(no-install) 데스크톱 애플리케이션으로 출시되었습니다. 이 새로운 버전은 사용자가 포터블 빌드를 다운로드하고 실행하기만 하면 되며, 시스템에 어떠한 파일도 남기지 않는 독립적인 구조를 가집니다. 또한, 완전한 개인정보 보호 기능과 최신 양자화 기술을 지원하는 ik_llama.cpp 빌드, 내장 웹 검색 기능을 제공하여 사용자 경험과 보안성을 크게 향상시켰습니다.
Needle은 26M 파라미터 규모의 경량 함수 호출(tool calling) 모델을 오픈 소스로 공개했습니다. 이 모델은 소비자용 기기에서 높은 속도로 실행 가능하며, 도구 사용 과정을 근본적으로 검색 및 조립 과정으로 정의하여 Cross-attention만을 사용하여 FFN(Feed-Forward Network) 파라미터를 제거한 것이 특징입니다. Needle은 온디바이스 AI 환경을 목표로 하며, RAG나 도구 사용 등 외부 구조화된 지식 접근 작업 전반에 적용 가능한 원시 요소임을 제시합니다.
이 글은 Local LLM을 활용하여 자율적으로 Go 코드를 작성하는 AI 에이전트를 구축하고 평가한 경험을 공유합니다. 특히 SIEM 파이프라인용 로그 파서 생성이라는 실제 사용 사례를 바탕으로, 모델의 코드 생성 품질과 처리 속도를 객관적으로 측정할 수 있는 테스트 하네스(harness)를 개발했습니다.
NVIDIA GPU 업그레이드 둔화와 CPU 및 메모리 가격 상승, 그리고 전반적인 공급망 압박이 결합되면서 PC DIY 시장이 심각한 침체기에 접어들었습니다. 주요 메인보드 제조업체들은 2026년 출하 목표를 대폭 하향 조정했으며, 특히 소비자용 CPU와 메모리의 부족 및 가격 상승이 판매 감소의 주된 원인으로 지목됩니다. AI 수요 증가로 인해 고성능 데이터 센터 플랫폼(Xeon, EPYC)에 생산 능력이 우선 배분되면서 일반 소비자용 부품의 공급이 어려워졌고, 게이밍 시장을 이끌던 NVIDIA 역시 AI GPU 매출 증대 덕분에 차세대 제품 업데이트가 지연되고 있습니다.
DeepSeek-V4-Flash 모델을 2개의 RTX PRO 6000 Max-Q 환경에서 구동했을 때, 524k 컨텍스트 길이에서 85.52 tok/s의 높은 처리 속도를 달성했습니다. 이 과정에서 MTP 헤드 로딩 문제와 vLLM의 CustomAllreduce 사용 시 발생하는 데드락 문제를 해결하기 위해 `--disable-custom-all-reduce` 플래그를 반드시 적용해야 합니다. 또한, 최적의 성능을 위해서는 특정 NCCL 튜닝과 패치된 vLLM 포크 사용이 필수적입니다.
Hugging Face가 이론 물리학 연구 문제를 다루기 위해 'physics-intern'이라는 에이전트 기반 하네스를 출시했습니다. 이 프레임워크는 복잡한 연구 과정을 모방하여 계산, 주장 검토, 연구 전략 도전 등 여러 전문 서브에이전트에 작업을 분해하여 할당하는 멀티 에이전트 구조를 가지고 있습니다. 이를 통해 Gemini 모델의 CritPt 벤치마크 성능을 향상시키고 새로운 SOTA(State-of-the-Art) 기록을 달성했습니다.
Cull은 AI 이미지 데이터셋을 위한 오픈 소스 머신 큐레이션 엔진으로, 다양한 웹사이트(Civitai, X/Twitter, Reddit 등 약 340개)에서 이미지를 스크래핑하고 출처의 프롬프트를 함께 저장하는 기능을 제공합니다. 이 도구는 LoRA 학습이나 대규모 아카이브 구축에 필요한 이미지와 메타데이터를 체계적으로 수집하며, 자동 캡셔닝 및 분류 기능을 통해 사용자가 수동으로 프롬프트를 큐레이팅할 필요 없이 방대한 데이터를 효율적으로 준비할 수 있게 합니다.
최근 주목받았던 Mimo 모델의 프로 버전(v2.5 Pro)을 시험적으로 사용한 경험을 공유하는 글입니다. 작성자는 이 모델이 초기에는 매우 거칠고 성능이 떨어지는 모습을 보였으나, '애플 웹 디자이너' 역할을 부여하여 비평하게 하는 등 특정 프롬프트 엔지니어링 기법을 적용했을 때 개선된 결과를 얻었습니다. 전반적으로 다른 최신 로컬 및 상용 모델과 비교할 때 불안정하고 예측 불가능한 측면이 많아, 향후 사용에 대한 기대와 함께 주의가 필요함을 시사합니다.
Redis 개발자인 Salvatore Sanfilippo가 GitHub에 DS4라는 새로운 프로젝트를 공개했습니다. 이 프로젝트는 Mac Metal 하드웨어에서 1M 컨텍스트 창을 가진 DeepSeek V4 Flash 모델을 실행하는 것을 목표로 합니다. 또한, DGX와 같은 고성능 서버 환경에서도 작동하는 모습을 보여주었으며, 향후 Pro 6000 및 AMD 칩 등 다양한 플랫폼으로의 확장을 계획하고 있습니다.
이 기술 기사는 AI 에이전트가 웹 페이지의 내용을 효과적으로 이해하고 추론할 수 있도록 돕는 마크다운 기반 웹 렌더러 'TextWeb'에 대해 소개합니다. TextWeb은 비싼 스크린샷을 찍어 비전 모델에 입력하는 대신, 웹 페이지를 LLM이 네이티브하게 처리할 수 있는 마크다운 형식으로 변환합니다. 이 솔루션은 전체 JavaScript 실행과 상호작용 요소 주석 처리를 지원하며, CLI 및 MCP 서버 형태로 제공됩니다.
LLM의 성능은 모델 품질과 크기뿐만 아니라 실제 속도(토큰/초) 또한 매우 중요합니다. 하지만 단순히 수치로 제시되는 토큰/초는 사용자가 체감하는 실제 경험적 속도를 전달하기 어렵습니다. 이에 필자는 객관적인 수치를 주관적으로 이해하고 감을 잡을 수 있도록 돕는 스크립트를 개발하여 공유했습니다.
본 기사는 NVLink로 연결된 4개의 RTX 3090 GPU 환경에서 Qwen 3.6 27B 모델의 MTP(Multi-Tenancy Performance) 벤치마크 결과를 분석합니다. 특히, 두 개의 GPU 쌍을 NVLink로 고정하여 사용하는 것이 PCIe를 통해 동일한 구성을 구현하는 것보다 훨씬 높은 처리량을 보여주었습니다. 이 테스트는 대규모 언어 모델(LLM)의 멀티 테넌시 환경에서 하드웨어 연결 방식이 성능에 미치는 영향을 명확히 보여줍니다.
이 글은 특정 모델(Gemma4)을 '주력 모델'로 사용하며 MTP(아마도 Model Training Performance 또는 유사한 성능 지표)와 관련된 내용에 대한 기대감을 표현하고 있습니다. 작성자는 최신 mlx-vlm을 테스트했으나 실망했다고 언급하며, 코드 생성 작업 부하에서 MTP를 활성화했을 때 속도가 크게 향상되는 실험 결과를 제시하고 있습니다.
작성자는 다양한 채팅 UI를 테스트한 경험을 바탕으로 llama.cpp의 웹 UI에 대해 높은 만족도를 표현하며, 특히 사용된 컨텍스트 양을 정확히 계산해 주는 기능을 최고의 장점으로 꼽았습니다. 다만, 도구 호출(tool call) 실패 시 전체 대화가 중단되는 문제점과 이로 인한 불편함을 주요 개선 사항으로 지적했습니다.
MIT DB Group 출신 연구원 팀이 AI 에이전트 및 LLM 애플리케이션에 최적화된 임베디드 벡터 데이터베이스인 Caliby를 오픈소스로 공개했습니다. 이 데이터베이스는 텍스트와 벡터 데이터를 모두 지원하며, 기존의 pgvector보다 4배 빠른 성능을 자랑합니다. 특히 디스크 저장 시나리오에서는 FAISS를 크게 능가하는 고성능을 보여줍니다.
본 가이드는 Qwen3.5 및 Qwen3.6 모델에 NextN MTP(Multi-Token Prediction) 기술을 적용하여 디코딩 속도를 획기적으로 향상시키는 방법을 안내합니다. 이 기술은 기존 대비 최대 2.9배의 디코드 성능을 제공하며, 품질 저하 없이 고성능 추론이 가능하게 합니다. 구현을 위해서는 `llama.cpp`의 특정 PR(#22400 및 #22673)를 적용하고, NextN 최적화가 적용된 GGUF 모델(예: Q8nextn 변형)을 사용해야 하며, `--spec-type mtp` 플래그와 같은 새로운 실행 인자들을 활용해야 합니다. 최종적으로는 시스템 전력 튜닝까지 고려하여 최대의 성능과 효율성을 확보할 수 있습니다.
이 글은 구형 하드웨어(5년 된 노트북, RTX 2060 6GB VRAM)의 한계를 극복하고 대규모 언어 모델인 Qwen3.6-35B를 성공적으로 실행한 경험을 공유합니다. 작성자는 복잡하게 설정된 `llama-server` 명령줄 인수를 통해 이 거대한 모델을 로컬 환경에서 구동하는 상세 과정을 보여주며, 이를 통해 23 t/s와 같은 높은 추론 속도를 달성했음을 강조합니다. 이는 제한적인 자원에서도 최신 오픈 모델을 활용할 수 있는 실질적인 방법을 제시합니다.
새롭게 오픈 소스로 공개된 Atlas는 LLM 추론 엔진으로, 기존의 Python 기반 스택 병목 현상을 해결하기 위해 전체 스택을 재작성했습니다. Pure Rust와 CUDA만을 사용하여 vLLM 대비 최대 3배 이상의 높은 처리량(throughput)을 달성하며, 특히 DGX Spark (GB10) 환경에서 Qwen3.5-35B 모델의 경우 지속적으로 약 111 tok/s를 기록하는 등 뛰어난 성능을 보여줍니다. 이 엔진은 다양한 최신 LLM 아키텍처와 API를 지원하며, 커뮤니티 기여를 통해 계속 발전할 예정입니다.