Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
DeepSeek V4 Flash 모델을 두 대의 DGX Sparks에서 실행하여 높은 추론 성능을 확보하는 방법을 공유합니다. ConnectX-7을 활용한 병렬 실행을 통해 단일 요청 시 40tk/s, 합계 350tk/s의 속도를 달성했습니다.
프런티어 AI 랩들의 IPO 참여가 하드웨어 가격 상승을 유도하여 로컬 LLM 생태계를 위협하고 있다고 주장합니다. 기업들이 높은 컴퓨팅 비용을 충당하기 위해 하드웨어 수요를 인위적으로 조절하며 기업 가치를 부풀리고 있다는 비판적 시각을 담고 있습니다.

SCAIL-2는 중간 포즈 표현 없이 드라이빙 비디오를 통해 캐릭터를 애니메이션화하는 오픈 소스 모델입니다. 통합 모션 전송 인터페이스를 통해 캐릭터 교체 및 다중 캐릭터 시나리오를 지원하며, 동물 드라이빙과 같은 창발적 능력을 보여줍니다.
지식 그래프와 하이브리드 검색을 결합하여 LLM의 멀티홉 추론 성능을 높이는 오픈소스 풀스택 파이프라인을 소개합니다. 벡터 검색의 한계를 극복하기 위해 그래프 탐색과 RRF 기반의 재순위화 과정을 거쳐 정확한 답변을 생성합니다.
새로운 Abliteration 도구인 Apostate의 성능을 Heretic, Huihui와 비교 분석한 연구 결과입니다. Qwen 2.5 7B 모델을 대상으로 거부 메커니즘 제거 성능과 파라미터 변화량을 벤치마크하여 각 도구의 효율성을 검증했습니다.

Hcompany가 Qwen 3.5를 기반으로 한 컴퓨터 사용 에이전트용 시각-언어 모델(VLM) 제품군인 Holo3.1을 출시했습니다. 웹, 데스크톱, 모바일을 지원하며 네이티브 함수 호출과 양자화된 체크포인트를 통해 로컬 배포에 최적화되어 있습니다.

Microsoft가 Microsoft Build 2026에서 온디바이스 최적화 모델인 Aion 1.0 Instruct와 Aion 1.0 Plan을 발표했습니다. Instruct는 효율적인 SLM으로 오픈 웨이트로 제공되며, Plan은 로컬 에이전트 추론 및 도구 호출에 특화된 모델입니다.

Google DeepMind가 텍스트, 이미지, 오디오를 처리하는 멀티모달 오픈 웨이트 모델 Gemma 4를 출시했습니다. 다양한 모델 크기와 MoE 아키텍처를 통해 온디바이스부터 서버까지 폭넓은 배포를 지원합니다.

Gemma 4 12B 모델을 VSCodium의 Pi Agent 확장에 적용하여 코딩 에이전트 성능을 테스트했습니다. 모델은 로그 분석, 스크립트 작성, 터미널 실행 및 검증까지의 전 과정을 단 한 번의 시도로 완벽하게 수행했습니다.

2x RTX 3090 환경에서 Qwen3.6-27B 모델을 llama.cpp와 vLLM 백엔드로 구동하며 성능을 비교 분석한 기술 리포트입니다. 각 백엔드별 양자화 방식에 따른 MTP 수락률, 추론 속도, 컨텍스트 길이를 실제 데이터를 통해 상세히 다룹니다.

Gemma 4 12b Heretic 모델을 활용하여 단 한 번의 프롬프트로 복잡한 레트로 게임 코드를 생성하는 성능을 테스트했습니다. llama.cpp 환경에서 8-bit KV 캐시를 적용하여 높은 캐시 재사용률과 안정적인 생성 속도를 유지하며 성공적인 결과를 얻었습니다.
mistral.rs가 Gemma 4 12B 모델 지원을 추가하여 멀티모달, 에이전트 기능 및 MTP 통합을 제공합니다. 웹 검색과 샌드박스 코드 실행을 지원하며, OpenAI 및 Anthropic 호환 HTTP 서버를 통해 간편하게 구축할 수 있습니다.
28가지 LLM 신뢰성 기술을 단일 API로 통합한 오픈소스 라이브러리 AgentCodec을 소개합니다. 통신 이론 프레임워크를 기반으로 적응형 라우터를 도입하여, 동일 품질 대비 추론 비용을 최대 56% 절감할 수 있음을 입증했습니다.

PapersWithCode에서 주목받는 최신 AI 연구 기술인 On-policy distillation(OPD)을 소개합니다. OPD는 모델의 롤아웃 과정 중 발생하는 특정 오류를 정밀하게 억제하기 위해 힌트 토큰을 활용하는 사후 학습 기술입니다.
llama.cpp의 포크 버전인 BeeLlama v0.3.1이 출시되었습니다. DFlash, MTP, Gemma 4 지원 및 멀티 GPU 최적화 등 대규모 아키텍처 업데이트를 통해 추론 성능과 VRAM 효율성을 크게 개선했습니다.

Huawei가 오픈 소스로 공개한 KVarN은 속도 저하 없이 KV-cache를 3~5배 압축하는 새로운 양자화 기술입니다. 기존 TurboQuant와 달리 처리량과 추론 품질을 동시에 유지하며, vLLM에서 단일 플래그로 즉시 적용 가능합니다.
KVarN은 Hadamard 회전과 분산 정규화를 결합하여 KV-Cache를 양자화하는 새로운 방법론입니다. AIME24와 같은 벤치마크에서 정확도 저하를 최소화하면서 3-4배의 압축률을 달성했으며, vLLM 환경에서 추론 속도 향상까지 입증했습니다.
RTX Pro 4500 Blackwell 32GB GPU의 성능을 기존 RTX 5060 Ti 16GB와 비교 분석한 글입니다. VRAM 용량 증가가 대규모 모델 구동 시 프롬프트 처리 및 토큰 생성 속도에 미치는 압도적인 성능 향상을 수치로 보여줍니다.
LLM 에이전트의 환각을 줄이기 위해 신뢰도와 정확성을 일치시키는 보정(Calibration)의 중요성을 다룹니다. 검증기를 활용한 계획 단계의 검증 패턴과 그에 따른 지연 시간 및 유용성 사이의 트레이드오프를 설명합니다.
Huawei의 새로운 KV-cache 양자화 기술인 KVarN을 llama.cpp 포크인 BeeLlama.cpp에 구현하고 KLD 벤치마크를 수행한 결과입니다. KVarN은 기존 TurboQuant 대비 높은 정밀도를 유지하며, 4-bit 설정에서도 q5 수준의 품질을 제공하여 VRAM 제약 환경에서 유용합니다.