Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Gemma 4 QAT 모델의 추측적 디코딩(MTP) 성능을 최적화하기 위한 QAT 매칭 어시스턴트 헤드가 HuggingFace에 공개되었습니다. 또한 llama.cpp 및 Atomic 포크에서 발생하던 PARALLEL=2 충돌 문제를 수정하고 관련 벤치마크 수치를 업데이트했습니다.
ChatGPT의 새로운 메모리 시스템 업데이트 이후, 저장된 메모리를 정확히 검색하지 못하고 최근 컨텍스트에만 의존하는 심각한 오류가 보고되었습니다. 이전 시스템으로의 복구도 불가능하며, 약어나 개인적 설정 등 구체적인 정보를 잘못 추측하는 현상이 발생하고 있습니다.
open-deepthink가 지식 증류(Knowledge Distillation) 모드를 탑재한 beta-0.0.3 버전을 출시했습니다. 멀티 에이전트 토폴로지를 통해 폐쇄형 모델의 지식을 구조화된 JSON 데이터셋으로 추출하여 오픈 소스 모델 파인튜닝에 활용할 수 있습니다.
NVIDIA의 DVLT 3D 트랜스포머 모델을 위해 CUDA와 C++로 밑바닥부터 구현한 경량 추론 엔진입니다. 외부 런타임 의존성 없이 cuBLASLt와 cuTLASS만을 사용하여 단일 5MB 바이너리로 동작합니다.
지속적인 판타지 세계 시뮬레이션을 위한 고도화된 게임 마스터(GM) 프롬프트를 소개합니다. 인과관계와 세계 상태의 연속성을 유지하며, 플레이어의 행동과 독립적으로 움직이는 살아있는 세계를 구축하는 원칙을 다룹니다.

사용자의 자연어 명령을 실시간으로 실행 가능한 동작 프로그램으로 컴파일하여 3D 아바타를 제어하는 기술을 소개합니다. 평이한 영어 설명을 루프나 병렬 트랙 같은 논리적 구조로 변환하여 브라우저 로컬 환경에서 실행할 수 있습니다.
1,700개의 Arxiv LLM 논문을 연구 관점과 '탐구 라인(inquiring lines)'으로 연결한 큐레이션 컬렉션을 공개했습니다. 주제별 분류를 넘어 공유된 연구 질문을 바탕으로 논문 간의 관계를 구조화하여 제공합니다.
Parakeet에서 Nemotron 3.5 ASR로 전환하여 다국어 지원과 스트리밍 성능을 개선한 사례를 소개합니다. Docker를 통해 컨테이너화되었으며, CPU 환경에서도 onnxruntime-genai를 활용해 실시간보다 4.5배 빠른 속도를 구현했습니다.
Qwen 3.6 27B 모델을 대상으로 다양한 KV cache 양자화 방식(q8, q6, q5, q4 등)의 성능을 벤치마크한 결과입니다. BeeLlama.cpp 엔진을 사용하여 KVarN, TurboQuant 등 최신 양자화 기법의 효율성을 분석했습니다.
ASUS Zenbook Pro 14 환경에서 Qwen3.6 35B-A3B 모델을 로컬로 구동한 경험을 공유합니다. 개인정보 보호를 위해 클라우드 대신 로컬 모델을 '제2의 뇌'로 활용하며 얻은 성능과 설정 방법을 다룹니다.
DeepSWE 벤치마크에서 Qwen 3.6 27B 모델의 성능을 분석한 결과입니다. 이 모델은 Haiku 4.5 등을 상회하는 성능을 보였으며, 로컬 환경에서 가성비 좋은 SOTA 모델로서의 가능성을 보여주었습니다.
MoE 및 MoD 아키텍처를 지원하는 PyTorch 기반의 LLM 학습 프레임워크입니다. 커스텀 CUDA 커널을 통해 학습 속도를 대폭 향상시켰으며, 적응형 학습 오케스트레이터를 통해 효율적인 파라미터 및 메모리 관리를 제공합니다.
Galaxy Z Fold6를 로컬 추론 노드로 활용하기 위해 llama.cpp와 Vulkan 백엔드를 사용하는 Android 앱 'Pocket Node' 개발 사례를 소개합니다. SHA-256 모델 검증, 홈랩 텔레메트리 연동, Tailscale 기반 OpenAI 호환 API 노출 등 기술적 구현 상세를 다룹니다.
Gemma4_31b_fp8 모델이 테스트 환경에서 Sonnet_4.6_medium과 대등한 성능을 기록했습니다. 그래프 쿼리, 엔티티 추출, 에이전트 도구 호출 및 코드 작성 등 다양한 벤치마크에서 우수한 결과를 보였습니다.
최신 오픈 소스 이미지 생성 모델이 폐쇄형 API와의 성능 격차를 빠르게 좁히고 있다는 벤치마크 결과를 공유합니다. 특히 구성적 제어, 텍스트 렌더링, 생성 속도 측면에서 오픈 모델의 실질적인 경쟁력을 분석합니다.
NVIDIA RTX 5090 환경에서 Qwen3.6-27B 모델을 대상으로 DFlash Speculative Decoding과 KV Cache Compression을 결합한 벤치마크 결과입니다. q4_0/turbo4 전략 사용 시 성능 저하를 최소화하면서 최대 3.26배의 속도 향상을 달성했습니다.
NVLink 없이 2개의 RTX 3090을 사용했을 때 Qwen 2.5 모델의 추론 성능이 거의 선형적으로 향상되는 현상을 보고했습니다. P2P가 자동으로 활성화되어 텐서 병렬성(TP=2) 환경에서 높은 효율을 보였습니다.
Codex를 활용하여 회사의 브랜드 템플릿(DOCX, PPTX, XLSX)을 엄격히 준수하며 문서를 자동 생성하는 기술을 소개합니다. AI가 디자인 요소를 임의로 변경하지 않고 템플릿의 레이아웃과 스타일을 보존하며 가변적인 콘텐츠를 삽입하는 프로세스를 구현했습니다.
Meddies PII는 임상 텍스트에서 환자 식별 정보를 보호하면서도 임상적 유효성을 유지하는 오픈 멀티링구얼 비식별화 모델 및 데이터셋입니다. 합성 데이터를 활용해 다양한 언어와 무질서한 문서 형식에서도 안정적인 추출 성능을 목표로 합니다.
vllm-doctor는 vLLM 추론 서버의 메트릭을 분석하여 문제를 진단하는 CLI 도구입니다. 큐 압력, TTFT/TPOT, KV 캐시 상태 등을 규칙 기반으로 체크하여 원인과 권장 사항을 제공합니다.