Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

작성자는 모델 지원의 불편함에 지쳐 Zig 언어로 자체 LLM 추론 서버를 개발했습니다. 이 서버는 Python이나 Electron 없이 네이티브로 작동하며, MLX 및 GGUF 모델을 실행하고 OpenAI/Anthropic/Ollama API를 지원합니다. 특히 Gemma 4와 Qwen 3.6 등에서 기존 대비 최대 +48% 빠른 성능과 향상된 도구 호출 기능을 제공합니다.

PrismML이 Bonsai 27B 모델을 공개했으며, 이는 BitNet/Ternary 개념을 활용하여 Qwen3.6 27B에 적용한 것입니다. 이 새로운 방법론 덕분에 메모리 약 10GB만으로도 높은 성능의 27B 모델 구동이 가능해져, 기기에서 사용하기 매우 실용적입니다.
Zhipu AI의 창립자가 GLM 5.3 출시를 예고하며, 모델 개발 방향이 단순한 성능 향상을 넘어 네이티브 멀티모달 비전 구축에 집중됨을 시사합니다. 이는 에이전트가 스크린샷이나 문서 등 시각적 자산을 해석하는 능력을 크게 개선할 것으로 기대됩니다.

Qwen3 235B A22B Instruct 2507을 기반으로 메모리 파이프라인을 구축하여, 기존 시스템 대비 높은 성능과 효율성을 입증했습니다. 특히 LongMemEval-S에서 최고 점수를 기록하며 신뢰성 있는 비서(assistant) 구현에 성공했음을 공유합니다.

PrismML 팀이 Bonsai 27B 모델을 공개했습니다. 이 모델은 1비트 양자화를 통해 크기를 대폭 줄여(54GB → 3.8GB)도 성능 저하를 최소화한 것이 특징입니다. 커스텀 WebGPU 커널을 활용하여 브라우저 환경에서 로컬 구동이 가능합니다.

거대 기술 기업들이 인터넷 스크래핑을 통해 독점적인 최첨단 모델을 구축하고 높은 가격으로 제한하는 현상을 지적합니다. 이에 맞서 오픈 소스 커뮤니티가 '모델 증류' 기법을 활용하여 저렴한 대안을 만들고 있으며, 이는 빅테크의 규제 시도와 충돌하고 있습니다.

DeepSeek V4와 Kimi K3 등 오픈 가중치 모델들의 출시는 컴퓨팅 지능의 계산 비용을 급격히 낮추고 있습니다. 이에 따라 엔터프라이즈 환경에서는 순수 모델 성능보다, 자율적인 AI가 핵심 시스템에 미치는 실패 모드를 제어하는 '거버넌스'와 '제어 프레임워크' 구축이 가장 중요한 과제가 되고 있습니다.
llm 벤치마크 웹사이트 agentre-bench.ai 운영자가 Qwen 3.5 9b 모델을 기반으로 파인튜닝한 첫 번째 모델을 공개했습니다. 이 모델은 리버스 엔지니어링 및 사이버 보안 분야에 초점을 맞추었으며, 학습 및 연구 목적으로 활용 가능합니다.
LokalBot Mac 앱이 대규모 업데이트를 거쳐 로컬 에이전트 모드(Agent Mode)와 미팅 접근(MCP) 기능을 추가했습니다. 온디바이스 LLM의 메모리 관리 효율성을 개선하고, 시스템 전체 받아쓰기 및 TTS 기능 등 사용자 경험을 크게 향상시켰습니다.

KAT-Coder-Air V2.5 모델이 Openrouter에서 사용 가능하며, 관련 기술 보고서가 arXiv에 공개되었습니다. 이 모델은 코딩 분야의 최신 연구 성과를 담고 있어 개발자들의 관심을 받고 있습니다.
LLaMa.cpp를 활용하여 Qemu 환경에서 실행되는 LVGL 기반 HMI의 성능 프로파일링 과정을 보여주는 데모입니다. 이를 통해 로컬 AI 기술을 이용해 리눅스 프로그램의 자동화된 성능 분석 및 디버깅 방법을 제시합니다.

본 글은 Morris Elementary Effects와 Taguchi 방법을 활용하여 llama.cpp의 파라미터를 자동으로 최적화하는 방법을 소개합니다. 이 기법들은 복잡한 설정 조합을 스캔하여 로컬 모델에 가장 적합한 파라미터 세트를 찾는 데 도움을 주며, 효율적인 파라미터 탐색(parameter sweeps)을 가능하게 합니다.

본 글은 트레이너 에이전트(Qwen3.6-35B-A3B)를 사용하여 다른 작은 Qwen 모델들을 RL로 학습시키는 메타 학습 구조를 제시합니다. 이 시스템은 외부 루프에서 에이전트가 전체 훈련 작업을 설계하고, 내부 루프에서는 GRPO를 통해 실제 GPU 환경에서 모델을 개선하며 보상을 받는 방식으로 작동합니다.

본 논문은 LLM을 위한 강화 학습(RL)의 비효율적인 동기식 방식을 개선하기 위해 단일 롤아웃 비동기 최적화(SAO)를 제안합니다. SAO는 오프폴리시 문제를 해결하고 안정성을 높이기 위해 단일 롤아웃 샘플링과 토큰 레벨 클리핑을 도입했습니다. 이 방법은 코딩 및 추론 벤치마크에서 기존 모델보다 우수한 성능을 보였습니다.
NVIDIA가 개발한 Nemotron-3-Embed는 검색 및 의미 유사성 작업에 최적화된 다재다능한 텍스트 임베딩 모델입니다. 이 모델은 영어, 한국어 등 34개 언어를 지원하며, RAG 시스템의 핵심 구성 요소로 설계되었습니다. 최고 성능을 달성하여 상업적 사용이 가능합니다.
Qwen3-VL-30B-A3B 모델을 GBNF 문법 디코딩으로 사용할 때, 유효한 JSON 항목 하나에 고정되어 컨텍스트가 소진될 때까지 반복하는 문제가 발생했습니다. 이 문제는 양자화, 온도, 플래시 어텐션 등 다양한 샘플러 설정으로도 해결되지 않았으며, 다른 모델(dense 8B, gemma-4-31b)에서도 유사한 루프 현상이 보고되었습니다.

LLM의 출력은 배치 크기나 추론 스택의 특성상 불안정할 수 있습니다. 본 글에서는 LLM 출력을 테스트하는 방법을 제시하며, 반복 실행을 통해 통과율(pass rate)을 측정하고 Pydantic 같은 구조화 출력 기능을 활용하여 평가의 신뢰도를 높이는 방법을 다룹니다.

Google DeepMind의 Demis Hassabis가 프론티어 AI 시대에 대비하여 글로벌 AI 감시 기구 구축을 촉구했습니다. 그는 새로운 기술 패러다임과 그로 인한 사회적 변화를 언급하며, 국제적인 협력과 규제 프레임워크 마련이 시급함을 강조했습니다.

이 Pull Request는 Tencent의 Hy3(hy_v3) 모델을 포함하여, 다중 토큰 예측 헤드(multi-token-prediction head)를 draft-mtp speculative target으로 지원하는 내용을 담고 있습니다. 이는 효율적인 추론 속도를 높이는 데 기여할 것으로 보입니다.
본 프로젝트는 에이전트가 사용자에게 말하거나(호출) 상호작용하는 양방향 대화 시스템을 제공합니다. 기존의 일방적인 TTS나 받아쓰기 방식의 한계를 극복하며, 여러 프로필과 개성을 가진 에이전트를 구현할 수 있습니다.