Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Qwen3-TTS의 음성 복제 기능이 llama.cpp 메인라인에 공식 병합되었습니다. 이제 GGUF 형식을 통해 로컬 환경에서 다양한 언어로 짧은 참조 오디오를 활용한 음성 생성이 가능해졌습니다.
멀티 에이전트 AI 시스템을 활용하여 의료 기록에 대한 개방형 및 검증 가능한 연구 포트폴리오를 구축하는 방법론을 소개합니다. 독립적 분석, 적대적 비판, 종합 과정을 통해 AI의 답변 신뢰성을 높이고 반증 가능한 연구 결과물을 생성하는 프로세스를 다룹니다.
RTX 3090 환경에서 MoE 모델의 일부 레이어를 CPU로 오프로드하여 VRAM을 확보하고, 이를 통해 배치 사이즈를 키워 프롬프트 처리 속도를 2.36배 향상시킨 최적화 사례를 소개합니다.

OnePlus 13 모바일 기기에서 2.69B 파라미터 규모의 LFM2.5 모델을 순수 CPU만으로 실행하여 17 tok/s의 속도를 기록했습니다. 사용자가 직접 구축한 450kb 크기의 경량 추론 엔진을 통해 ADB 환경에서 구동되었습니다.

Ollama 0.32.6-rc0 버전에서 Apple Silicon 사용자를 위한 Qwen3.5 MTP(Multi-Token Prediction) 자동 활성화 기능이 추가되었습니다. MLX 백엔드를 통해 별도의 설정 없이도 추측적 디코딩을 지원하며, 적응형 깊이 컨트롤러를 통해 성능을 최적화합니다.
Llama.cpp의 새로운 PR을 통해 MTP 활성화 시 샘플링 과정을 CPU에서 GPU로 이동시켜 추론 성능을 개선했습니다. 테스트 결과 RTX 5090에서는 약 8%의 속도 향상을 보였으며, NVIDIA P40 환경에서도 약 4%의 성능 개선이 확인되었습니다.
RTX 5090 환경에서 Gemma4-12B 모델을 사용하여 vLLM 및 Llama.cpp보다 낮은 TTFT(첫 토큰 생성 시간)를 달성하는 실험적 추론 최적화 기법을 소개합니다. 새로운 커널을 통해 지연 시간을 단축하지만, TPOT(토큰 생성 속도)는 메모리 대역폭 제한으로 인해 큰 차이가 없음을 보여줍니다.
DS4 Flash 모델을 다중 GPU 환경에서 실행할 때 발생하는 Prompt Processing(PP) 성능 저하 문제를 분석하고, 특정 포크(fork) 버전을 통해 성능을 1000 t/s까지 개선한 사례를 다룹니다. 모델별 연산 프로파일링을 통해 DSV4와 Qwen3.5 122B의 커널 연산 차이를 비교 분석합니다.

AI가 매 대화마다 컨텍스트를 재구축하는 비효율을 해결하기 위해, 분산된 이벤트를 관찰하고 상황 모델을 형성하는 오픈 소스 프로젝트 'Twin'을 소개합니다. Twin은 Slack, GitHub 등의 데이터를 분석하여 지속적인 인지적 연속성을 제공하는 것을 목표로 합니다.

AI가 매번 새로운 대화에서 컨텍스트를 재구축하는 문제를 해결하기 위해, 분산된 이벤트를 관찰하고 상황 모델을 형성하는 오픈 소스 프로젝트 'Twin'을 소개합니다. Twin은 Slack, GitHub 등의 데이터를 상관관계로 연결하여 AI에게 인지적 연속성을 제공하는 것을 목표로 합니다.

12개의 서로 다른 LLM 에이전트가 생존을 위해 경쟁하는 'Deadlock' 벤치마크 실험을 소개합니다. 각 에이전트는 Docker 컨테이너 내에서 도구를 스스로 구축하며 게임을 수행하고, 시각적 구현을 위해 다양한 AI 도구와 3D 파이프라인을 활용했습니다.
Apple Silicon 환경에서 최적화된 새로운 MLX 기반 Qwen3.5-122B-A10B 양자화 모델인 WinterMix가 출시되었습니다. 기존 GGUF 대비 성능 손실을 최소화하면서도 MLX 환경에서 llama.cpp보다 훨씬 빠른 추론 속도를 제공합니다.

temperature=0 설정에서도 LLM의 비결정론적 특성으로 인해 임계값 경계에 있는 점수가 범주를 바꿀 수 있음을 실험을 통해 증명합니다. 특히 비전-LLM 워크플로에서 미세한 점수 차이가 안전 결정(Low/Medium)을 뒤집는 문제를 다룹니다.
Row-Bot은 이메일 및 캘린더 자동화를 지원하는 데스크톱 AI 워크벤치입니다. Gmail 요약, 답장 초안 작성, 캘린더 이벤트 생성 등 사용자 맞춤형 워크플로를 실행할 수 있는 다양한 도구와 기능을 제공합니다.
A100 GPU 환경에서 DeepSeek-V4-Flash-0731 모델을 Unsloth GGUF 형식으로 실행한 성능 결과입니다. VRAM 용량에 따라 전문가(experts) 배치 방식을 조절하여 최적의 추론 속도를 확보할 수 있습니다.

Row-Bot을 활용하여 대화형으로 고급 자동화 워크플로우를 생성하는 방법을 소개합니다. 검색, 모니터링, 데이터 필터링 및 Telegram 전송을 포함한 복합적인 에이전트 워크플로우 구축 과정을 다룹니다.
ganfs는 GAN(Generative Adversarial Network)을 활용하여 고차원 데이터셋의 특성 선택(Feature Selection)을 자동화하는 새로운 Python 패키지입니다. 도메인 전문가의 개입 없이 적대적 학습을 통해 데이터의 핵심 정보를 추출하며, scikit-learn 스타일의 API를 제공합니다.

단일 HTML 파일 내에 JSON 블록을 포함하여 오프라인에서도 편집, 발표, 저장이 가능한 슬라이드 도구 Bento를 소개합니다. 클라우드 로그인 없이 브라우저만으로 작동하며, LLM을 활용한 PPTX 변환과 암호화된 릴레이를 통한 실시간 협업 기능을 지원합니다.
LLM 기반 워크플로우에서 연구 단계의 모든 정보를 무분별하게 구현에 반영하는 문제를 해결하기 위해 '사양 게이트(specification gates)'를 도입했습니다. 연구 내용이 곧 구현이 되지 않도록 검토 및 편집 단계를 추가하여 엔지니어링 목표에 부합하는 정확한 구현을 보장합니다.
로컬 모델을 활용해 컨텍스트 엔지니어링의 핵심 요소를 학습할 수 있는 교육용 저장소를 구축했습니다. 시스템 지침부터 RAG, 상태 관리까지 14가지 예제를 통해 각 구성 요소가 모델 동작에 미치는 영향을 실험할 수 있습니다.