Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
llama.cpp를 위한 NVFP4 및 MXFP6 GGUF 양자화 도구인 'advanced-quantizer-tool'을 소개합니다. 이 도구는 KLD 평가와 RSF 기술을 통해 모델 성능 손실을 최소화하며 최적의 양자화 블렌딩을 생성합니다.
SupraLabs가 사고 체인(Thinking chain)을 생성하는 추론 특화 모델인 Supra-50M-Reasoning을 출시했습니다. Qwen3 1.7B로 생성한 합성 데이터셋을 활용해 미세 조정되었으며, 향후 더 큰 파라미터 규모의 모델 출시를 계획하고 있습니다.
OpenAI가 ChatGPT의 '저장된 메모리' 기능을 'Dreaming' 업데이트로 교체하며 상세 정보가 요약된 형태로 축소되었습니다. 기존의 정교한 개인화 설정을 유지하려면 설정 메뉴에서 'legacy memories'를 통해 복구하고 백업해야 합니다.
LLM의 KV-cache를 f32 대비 36배 무손실로 압축할 수 있는 오픈 소스 기술인 proveKV를 소개합니다. PPL 저하 없이 메모리 효율을 극대화하며, 자동화된 감사 스크립트를 통해 수치의 투명성을 검증했습니다.
AMD EPYC 9575F와 4개의 RTX 3090을 탑재한 고성능 LLM 추론 서버 구축 사례를 소개합니다. vLLM과 llama.cpp를 활용하여 게임 개발을 위한 AI NPC 시스템을 운영할 계획입니다.
AMD Strix Halo APU 환경에서 Google Gemma 4 QAT(양자화 인식 학습) 모델의 로컬 추론 성능을 벤치마크한 결과입니다. llama.cpp의 Vulkan/RADV 백엔드를 사용하여 다양한 크기의 Gemma 4 GGUF 모델을 테스트했습니다.

OpenAI Codex Sites는 단순한 웹사이트 빌더를 넘어, 기존 워크스페이스의 데이터를 배포 가능한 웹 표면으로 전환하는 도구입니다. 프롬프트부터 배포까지 이어지는 루프를 통해 내부 도구 및 프로토타입을 즉시 생성할 수 있는 환경을 제공합니다.
AI가 진실이 아닌 일관된 연속성을 최적화하는 특성 때문에 발생하는 '자기 기만' 현상과 이를 방지하기 위한 프레임워크를 소개합니다. 항공 전자 공학의 보호 로직을 응용하여 AI의 과도한 확신과 논리적 비약을 탐지하는 방법을 제안합니다.
터미널 환경에서 사용할 수 있는 경량 코딩 에이전트 도구인 agent-sh를 소개합니다. 셸 내에서 문맥을 인식하여 명령어 제안 및 문제 해결을 도와주며, 로컬 모델과 연동하여 가볍게 사용할 수 있습니다.

수학이나 머신러닝 사전 지식이 없어도 GPT2 스타일의 트랜스포머를 직접 구축할 수 있는 워크숍 가이드입니다. 기초적인 퍼셉트론부터 최신 LLM 아키텍처, 사전 학습 및 지시어 튜닝까지 전 과정을 코드와 엑셀 예제로 다룹니다.
Gemma 4 12B 모델의 도구 호출(Tool Calling) 기능 오류를 해결하기 위한 특수 채팅 템플릿 사용법을 안내합니다. llama.cpp 환경에서 특정 Jinja 템플릿을 적용하면 모델의 코딩 및 도구 활용 능력을 정상적으로 평가할 수 있습니다.
Claude Code 사용 중 권한 승인 프롬프트를 놓치는 문제를 해결하기 위해 Garmin 스마트워치용 알림 앱을 개발했습니다. 이 앱은 도구 호출, 파일 수정, 세션 상태 등을 실시간으로 시계에서 확인할 수 있게 해줍니다.
RedNote(Xiaohongshu)에서 출시한 2B 파라미터 규모의 오픈 소스 TTS 모델인 dots.tts를 소개합니다. 코덱 토큰 없이 완전 연속 구조를 채택하여 48kHz 고음질 합성과 제로샷 음성 복제가 가능합니다.

OpenLumara는 기존의 비효율적인 에이전트 프레임워크와 달리, 밑바닥부터 직접 코딩하여 토큰 사용량을 극도로 최적화한 로컬 AI 에이전트입니다. 모듈형 구조와 강력한 보안, 사용자 제어권을 특징으로 하며 로컬 모델 환경에 최적화되어 있습니다.
AMD 7900 XTX 환경에서 Gemma 4 QAT(양자화 인식 학습) 모델의 성능을 벤치마크한 결과입니다. QAT 모델은 기존 양자화 모델 대비 품질 저하 없이 속도는 향상시키고 VRAM 사용량은 줄이는 탁월한 효율성을 보여주었습니다.
Gemma 4 12B QAT 모델과 MTP(Multi-Token Prediction) 기술을 활용하여 12GB VRAM 환경에서 초당 120 tok/s 이상의 추론 속도를 달성한 벤치마크 결과입니다. llama.cpp와 Unsloth의 양자화 모델을 결합하여 효율적인 추론 환경을 구축했습니다.
AMD Strix Halo 플랫폼에서 StepFun 3.7 Flash 모델의 MTP(Multi-Token Prediction) 성능을 벤치마크한 결과입니다. MTP 적용 시 프리필 성능 저하 없이 디코딩 속도가 약 27.5% 향상됨을 확인했습니다.
Domino는 Speculative Decoding 과정에서 인과적 모델링과 자기회귀 초안 작성을 활용하는 새로운 방법론을 제안합니다. 이를 통해 Qwen3 모델에서 최대 5.8배의 처리량 향상을 달 수 있음을 입증했습니다.
Cohere가 공식 출시 전 테스트를 위해 30B 규모의 새로운 코딩 모델을 Hugging Face에 공개했습니다. 이 모델은 3B의 활성 파라미터를 사용하여 로컬 환경에서도 효율적인 실행이 가능하며, 사용자 피드백을 통해 모델을 개선할 계획입니다.
Debian Testing 환경에서 AMD MI50 GPU를 사용하여 llama.cpp의 성능을 벤치마크한 결과입니다. ROCm과 Vulkan 백엔드 간의 성능 차이를 분석하며, 특히 MTP(Multi-Token Prediction) 적용 시 토큰 생성 속도가 크게 향상됨을 확인했습니다.