Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Hugging Face가 역대 최대 규모의 오픈 소스 코드 데이터셋인 The Stack v3를 출시했습니다. 사용자는 품질 필터링과 개인정보 삭제가 완료된 학습용 데이터셋 또는 114TB 규모의 전체 코퍼스를 선택하여 활용할 수 있습니다.

RTX 5060 Ti 환경에서 Qwen3.5 35B 모델을 55 tok/s의 속도로 실행하기 위한 최적화 기법을 소개합니다. Gated Delta Network 커널을 적용하여 기존 llama.cpp의 Q8 양자화 방식보다 훨씬 빠른 성능을 구현했습니다.
swiss-ai가 완전 개방형 및 투명한 AI를 지향하는 Apertus-v1.5 8B 및 70B 모델을 출시했습니다. 이 모델들은 멀티모달 입력을 지원하며, 최대 262,144 토큰의 긴 컨텍스트와 사고 모드(thinking mode)를 통한 추론 능력을 갖추고 있습니다.

audio.cpp 0.4 버전이 출시되어 Higgs Audio v3 TTS 4B 등 고품질 모델 지원과 GGUF 포맷의 전면 도입을 발표했습니다. C++/GGML 기반의 최적화를 통해 실시간 대비 최대 10배 빠른 속도와 VRAM 절감 효과를 제공합니다.
업데이트된 Gemma 4 모델의 로컬 코딩 성능 테스트 결과를 공유합니다. M5 Pro 환경의 llama.cpp 서버에서 26B 모델이 OpenCode와 함께 안정적인 속도로 작동함을 확인했습니다.

Truss는 편의성과 보안에 초점을 맞춘 새로운 단일 사용자 로컬 하네스입니다. MCP(Model Context Protocol)를 기반으로 작동하며, 워크스페이스 모드를 통해 에이전트에게 안전한 파일 시스템 접근 권한과 도구 사용 환경을 제공합니다.
LLM의 확률적 추론에 의존하는 실행 결정 대신, 사전에 정의된 스키마를 통해 실행 권한을 모델 외부로 이동시키는 설계 원칙을 제안합니다. 존재 기반 검증(Presence-based Verification)을 통해 실행 상태를 표준화하고 제어 가능성을 높이는 방법을 다룹니다.

swe-verified 벤치마크를 활용하여 로컬 모델의 다양한 양자화 설정 및 파인튜닝 모델의 성능을 비교 분석했습니다. 수집된 데이터와 시각화 자료를 통해 베이스 모델별 성능 차이를 확인할 수 있습니다.

BigMoeOnEdge 프로젝트를 통해 12GB RAM을 탑재한 Xiaomi 12 Pro에서 Qwen 3.6 35B MoE 모델을 로컬로 실행하는 데 성공했습니다. RAM 제약으로 컨텍스트 길이는 제한적이지만, 엣지 디바이스에서 대규모 MoE 모델을 구동할 수 있음을 입증했습니다.
Laguna-S-2.1 모델이 llama.cpp 환경에서 무한 사고 루프에 빠지는 현상은 양자화 아티팩트 때문일 가능성이 높습니다. 이를 해결하기 위해 균일한 저비트 양자화 대신 정밀도를 타겟팅한 APEX 양자화 방식을 권장합니다.

Nvidia 4090d GPU 환경에서 DeepSeek-V4-Flash 모델을 vLLM으로 구동하기 위한 최적화 방법과 성능 분석을 다룹니다. Blackwell 전용 커널을 Triton으로 재구현하여 Ada 아키텍처에서도 성능을 극대화하는 기술적 접근법을 제시합니다.

Celeron N5095 기반 SBC인 Youyeetoo X1S에서 Ollama를 이용해 CPU 전용 LLM 추론 성능을 벤치마크했습니다. 0.6B 모델은 실용적인 속도를 보였으나, 8B 모델은 메모리 대역폭 한계로 인해 사용이 어려웠습니다.
open-deepthink 0.1.11 버전은 LLM을 뉴런처럼 활용하는 오픈 소스 멀티 에이전트 시스템입니다. 이번 업데이트에서는 비인접 레이어의 정보를 참조하는 정성적 자기 주의 집중 기능과 아이디어를 앱 프롬프트로 변환하는 확산 모드가 추가되었습니다.
개인정보 보호를 위해 개발된 Hearth는 로컬 환경에서 PC의 파일, 앱, 브라우저를 직접 제어하는 오픈 소스 AI 에이전트입니다. 9B 규모의 소형 모델에서도 안정적인 동작을 위해 도구 로드 최적화와 자동 대화 압축 기술을 적용했습니다.
금융 문서 처리를 위해 Mac의 MLX 환경에서 8B 모델을 0.6B 모델로 지식 증류(Distillation)한 사례를 공유합니다. 소형 모델이 RAG 인덱싱 전 요약 및 태깅 작업을 효율적으로 수행할 수 있음을 입증했습니다.

Silia-v2 신경망 구조에 대한 연구 내용을 소개합니다. 0.5M 파라미터 규모의 모델을 Fineweb-edu 데이터셋 1B 토큰으로 학습시켰으며, 이전 버전의 연산 효율성 문제를 개선했습니다.
Apple M5 실리콘의 INT8 활성화 함수 지원 기능을 활용하여 Gemma4 모델의 추론 속도를 개선한 사례를 다룹니다. 작성자가 직접 구축한 w8a8 커널을 통해 프리필(prefill) 성능을 기존 대비 약 1.4배 향상시켰습니다.

Dual DGX Spark 환경에서 DeepSeek V4 Flash DSpark를 활용한 최적의 성능 구현 사례를 소개합니다. Copilot보다 빠른 응답 속도와 Sonnet 4.6 수준의 높은 품질을 보여주며, 복잡한 작업 수행 능력이 탁월합니다.
Laguna S-2.1 모델의 GGUF 파일 업데이트 및 채팅 템플릿 개선 사항을 안내합니다. yarn_attn_factor 수정과 새로운 채팅 템플릿 적용을 통해 사고 과정 보존 및 도구 호출 성능이 향상되었습니다.

LLaDA2.2-flash는 Levenshtein Editing 기술을 도입한 에이전트 지향적 확산 언어 모델입니다. 128K의 긴 컨텍스트 창과 MoE 기반 블록 라우팅을 통해 효율적인 도구 사용 및 오류 수정 능력을 갖추었습니다.