Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
커스텀 WebGPU 커널을 활용하여 브라우저 환경에서 LFM2.5-230M 모델을 로컬로 실행하는 기술을 소개합니다. M4 Max 환경에서 초당 1,400 토큰의 빠른 추론 속도를 구현했습니다.
로컬 LLM의 환각 현상을 방지하기 위해 의료 위키피디아 데이터를 활용한 빠른 RAG API를 개발했습니다. MCP를 지원하며, 에이전트가 의료적 사실을 정확히 확인하도록 돕는 데 유용합니다.
DeepReinforce AI에서 다양한 파라미터 규모를 가진 Ornith-1.0 모델 시리즈를 Hugging Face에 출시했습니다. 9B부터 397B MoE 모델까지 포함하며, 여러 벤치마크에서 SOTA 성능을 기록했습니다.
Bash, jq, curl 등 표준 명령줄 도구만을 사용하여 의존성 없이 구축한 언어 모델 REPL 및 에이전트 루프 구현 사례를 소개합니다. Unix 철학을 바탕으로 모델 간 이식성이 높고 상태 관리가 투명한 에이전트 환경을 구축할 수 있습니다.
Unsloth 양자화 버전의 GLM 5.2 모델을 Threadripper Pro와 dual RTX 5090 기반의 컨슈머급 하드웨어에서 구동한 테스트 결과입니다. llama.cpp를 활용하여 최적화된 설정을 적용한 결과, 약 12t/s의 지속적인 추론 속도를 확인했습니다.
개인정보 보호를 위해 모든 데이터가 기기 내에서만 처리되는 macOS용 로컬 AI 앱 'Ka1zen'을 소개합니다. llama.cpp와 MLX를 기반으로 채팅, 비전, 이미지 생성, 웹 검색, RAG 기능을 하나의 네이티브 앱으로 통합했습니다.
Gemma-4-12B 모델의 지능 손실 없이 안전 필터를 제거한 Uncensored 모델이 출시되었습니다. 정밀한 어블레이션 기법과 CoT 미세 조정을 결합하여 복잡한 추론 능력을 유지하면서도 제한 없는 답변이 가능하도록 설계되었습니다.
새로운 샘플러와 검증기 기술을 통해 0.5B 초소형 모델의 코딩 성능을 2~4B급 모델 수준으로 끌어올리는 연구를 소개합니다. 가중치 변경 없이도 성능 향상이 가능하지만, 백트래킹 과정에서 디코딩 속도 저하와 VRAM 요구량 증가라는 트레이드오프가 존재합니다.
NVIDIA가 Nemotron 3 Nano 백본을 기반으로 한 확산 기반(diffusion-based) 언어 모델인 Nemotron-TwoTower-30B-A3B-Base-BF16을 출시했습니다. 이 모델은 기존 자기회귀 방식 대신 확산 디노이저 타워를 사용하여 생성 효율을 극대화했습니다.
SupraLabs가 표 형식의 기상 데이터를 분류하기 위한 소형 FT-Transformer 모델인 SupraWeather-Nano-Preview를 출시했습니다. 이 모델은 텍스트 입력 없이 숫자 기반의 기상 특징을 입력받아 기상 현상을 분류하는 아키텍처 실험용 모델입니다.
llampart는 llama-server 및 OpenAI 호환 API를 지원하는 경량 로컬 LLM용 Web UI 프로젝트입니다. 데스크톱 중심의 설계로 빠르고 쾌적한 사용성을 제공하며, 다양한 백엔드 연결과 다국어 및 테마 지원을 특징으로 합니다.
4× DGX Spark (GB10) 환경에서 GLM-5.2 모델을 MTP 추측적 디코딩과 sparse-MLA Triton 커널을 사용하여 성공적으로 구동한 기술 사례입니다. 공개되지 않은 빌드 레시피를 커널 재구성을 통해 복원하고, vLLM 버전 고정 및 AWQ 가중치 충돌 문제를 해결하는 구체적인 가이드를 제공합니다.
WebGPU를 활용하여 브라우저 확장 프로그램 형태로 로컬에서 SDXL 모델을 실행할 수 있는 오픈 소스 프로젝트를 소개합니다. 별도의 가상 환경이나 복잡한 설치 과정 없이 브라우저 내에서 ONNX 그래프를 통해 이미지를 생성할 수 있습니다.
에이전트적 사고 능력을 갖춘 Nex-N2-Mini-Ultra-Uncensored-Heretic 모델이 출시되었습니다. Abliteration 기술을 적용하여 모델의 거부율을 낮추는 데 성공했습니다.
GH200 시스템에서 GLM5.2 모델의 추론 속도를 2.5 tok/s에서 최대 55 tok/s로 대폭 향상시킨 최적화 사례를 소개합니다. MTP 헤드 이식과 vLLM 패치를 통해 메모리 스트리밍 효율을 극대화했습니다.
Apple의 MLX 프레임워크를 사용하여 MacBook Air에서 2,020만 개의 파라미터를 가진 Nano LLM을 바닥부터 구축하는 방법을 소개합니다. 이론을 넘어 실제 구현을 통해 Transformer, Attention, Tokenizer의 작동 원리를 깊이 있게 이해하는 것을 목표로 합니다.
Windows Copilot을 역공학하여 OpenAI API와 호환되는 무료 로컬 서버를 구축하는 방법을 소개합니다. Microsoft 계정 세션을 활용해 별도의 결제 없이 GPT-4를 API 엔드포인트로 사용할 수 있습니다.
Baidu가 단 한 번의 포워드 패스로 수십 페이지를 전사할 수 있는 Unlimited-OCR을 출시했습니다. 새로운 R-SWA 어텐션 메커니즘을 통해 KV 캐시 문제를 해결하고 대량의 문서 처리 효율을 극대화했습니다.
사용자가 llama.cpp에서 vLLM으로 전환하며 겪은 Qwen3.6 27B 모델의 성능 차이와 설정 과정을 다룹니다. 다중 사용자 환경을 위해 vLLM을 도입했으나, 기존에 튜닝된 llama.cpp 설정값과 비교했을 때 모델의 동작 성능이 기대에 미치지 못하는 문제를 논의합니다.
KaLM-Reranker-V1은 쿼리와 구절의 계산을 분리하여 효율성을 높인 새로운 재순위화 모델입니다. Matryoshka 임베딩 풀링과 교차 주의 집중을 결합하여, Late Interaction 방식이 아니면서도 그에 준하는 강력한 성능을 제공합니다.