Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
대화 컨텍스트 제한 문제를 해결하기 위해 JLC 코덱을 활용하여 장기 기억을 유지하는 터미널 에이전트 'jarvis-code'를 개발했습니다. 매 턴마다 대화 기록을 압축된 상태로 변환하여 컨텍스트 사용량을 최소화하면서도 10,000턴 이상의 연속적인 세션을 유지하는 데 성공했습니다.
1-bit 모델인 Bonsai-8B와 IBM Granite의 CPU 도구 호출(tool calling) 성능을 비교 분석한 연구입니다. 1-bit 모델은 원시 상태에서는 성능이 낮지만, GBNF 문법을 적용할 경우 매우 높은 도구 호출 정확도를 보임을 확인했습니다.
Gemma 4 32B를 활용하여 음성 대화가 가능한 오픈 소스 파이프라인 데모를 소개합니다. Nvidia Parakeet, Cerebras 서빙, Qwen3TTS를 결합하여 OpenAI의 Realtime API를 대체할 수 있는 빠른 속도의 로컬 실행 환경을 구현했습니다.
PAiERA의 기술적 검증을 위해 실제 재현 가능한 런타임 데모 저장소를 공개했습니다. 합성 데이터와 SQLite를 사용하여 인물 식별, 안전 사실 투영, 데이터 유출 방지 기능을 로컬 환경에서 테스트할 수 있습니다.
클라우드 없이 로컬에서 작동하는 음성 기반 LLM NPC 백엔드를 오픈 소스로 공개했습니다. NPC 간의 자율적인 대화와 기억 능력을 통해 게임의 몰입감을 높이며, Unity와 연동 가능한 WebSocket 기반 구조를 갖추고 있습니다.
인포그래픽 생성 및 이미지 편집에 특화된 오픈 소스 SOTA 모델인 SenseNova-U1-8b-MoT-Infographic-V2가 출시되었습니다. Apache 2 라이선스를 채택하여 Ideogram 4와 경쟁하며, 일관된 테마의 이미지를 생성하는 Interleaved 모델도 함께 제공됩니다.
Ornith 35B 모델에 MTP(Multi-Token Prediction)를 이식하여 vLLM 환경에서 추론 속도를 18% 향상시킨 기술을 소개합니다. FP8 양자화와 256k 컨텍스트 윈도우를 지원하여 고성능 에이전틱 코딩 환경을 구축할 수 있습니다.
2026년 6월 기준 최신 오픈 모델 및 파인튜닝 모델들의 동향을 정리한 리포트입니다. NVIDIA, AMD, Intel 등 주요 하드웨어 제조사별 최적화 기술과 함께 다양한 신규 모델 출시 소식을 다룹니다.
Ascend에서 학습된 92B 파라미터 규모의 MoE 모델인 openPangu-2.0-Flash를 소개합니다. MLA, DSA, SWA를 결합한 효율적인 어텐션 구조와 MTP 헤드를 통한 빠른 추론 성능을 특징으로 합니다.
로컬 DeBERTa NER 모델을 사용하여 클라우드로 데이터가 전송되기 전 개인 식별 정보(PII)를 자동으로 제거하고 복원하는 데스크톱 AI 'Primnox'를 소개합니다. 지식 그래프 구축, 딥 리서치 모드, AI 액션이 포함된 Markdown 노트 등 다양한 생산성 기능을 제공합니다.
audio.cpp 제작자가 VibeVoice 1.5B 모델 지원을 발표하며, C++/ggml 기반의 로컬 오디오 런타임 성능을 공개했습니다. RTX 5090 기준 실시간보다 4.08배 빠른 생성 속도를 보여주며, 긴 형태의 다중 화자 TTS 최적화를 목표로 합니다.
llama.cpp에서 MoE 모델의 추론 속도를 최적화하기 위해 -fitt 옵션과 Claude를 활용하여 최적의 텐서 오버라이드 설정을 찾아내는 과정을 다룹니다. 사용자는 특정 텐서를 CUDA_Host로 할당함으로써 VRAM 사용량을 늘리고 추론 성능을 크게 향상시켰습니다.
Hugging Face에서 트렌딩 모델 4위를 기록 중인 Ornith-1.0-35B-uncensored-heretic 모델을 소개합니다. 이 모델은 매우 낮은 거부율(9/100)과 낮은 KLD(0.0019)를 특징으로 하는 검열되지 않은 모델입니다.
35B 파라미터 규모의 Qwen3.5-MoE 기반 에이전트 모델인 Agents-A1의 GGUF 양자화 버전을 소개합니다. Blackwell GPU를 위한 NVFP4 빌드와 투기적 디코딩을 위한 MTP(multi-token prediction) 결합을 통해 성능과 속도를 최적화했습니다.
AMD gfx900 아키텍처 GPU에서 dense prefill 성능을 높이기 위해 hipBLAS를 사용하고 MoE를 위한 MMQ를 유지하는 최적화 기술이 소개되었습니다. 이를 통해 Qwen 및 Gemma 모델에서 평균 약 40%의 성능 향상을 달성했습니다.
코딩 에이전트의 콜드 스타트 문제를 해결하기 위해 지속적 저장소 메모리 레이어인 Greplica를 제안합니다. SQLite 지식 그래프를 활용해 저장소의 맥락을 유지함으로써 토큰 사용량과 도구 호출 비용을 획기적으로 절감합니다.
2x4060 환경에서 DFlash와 MTP(Multi-Token Prediction) 기술을 비교 벤치마크한 결과, 현재는 MTP+Tensor 조합이 DFlash보다 더 빠른 성능을 보였습니다. Hugging Face의 DFlash 양자화 모델 사용 시 주의사항과 직접 빌드하는 과정을 공유합니다.
창의적인 도서 집필을 목적으로 설계된 PageStorm Research Preview 모델을 발표합니다. 이 모델은 LongPage 데이터셋을 기반으로 하며, 단일 턴으로 도서 규모의 긴 글을 작성할 수 있도록 구축되었습니다.
다양한 로컬 AI 하드웨어의 성능을 직접 비교 체험할 수 있는 'AI 월드 페어' 웹사이트를 소개합니다. MacBook, Strix Halo, RTX 6000 등 다양한 머신의 추론 속도와 비디오 생성 성능을 비교할 수 있습니다.
자율 개발 파이프라인인 Lullabeast를 오픈 소스로 공개하며, 로컬 4090 기반 모델과 클라우드 LLM의 성능을 비교했습니다. 에이전트 간 결정론적 게이트를 통해 오류를 제어하고, 재시도 및 단계 격상 메커니즘을 통해 안정성을 확보한 것이 특징입니다.