Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Fable 5가 최적화한 WebGPU 커널을 통해 Gemma 4 E2B 모델을 브라우저 환경에서 초당 255 토큰의 속도로 실행할 수 있게 되었습니다. M4 Max 환경에서의 성능 데모와 함께 관련 커널 및 모델이 공개되었습니다.
LoopCoder-V2는 Parallel Loop Transformer(PLT)를 기반으로 한 7B 파라미터 규모의 코드 생성 모델입니다. 테스트 시간 계산 스케일링을 위해 공유된 트랜스포머 블록을 반복 적용하며, 최적의 성능을 위한 루프 횟수와 효율적인 메커니즘을 제안합니다.
Microsoft의 TRELLIS.2 이미지 투 3D 모델을 Apple Silicon에서 네이티브로 실행할 수 있는 MLX 포트를 공개했습니다. M4 Max 환경에서 다양한 해상도를 지원하며 실제 워크플로우 활용에 최적화되었습니다.
753B 규모의 대형 모델인 GLM-5.2의 사양과 로컬 실행을 위한 하드웨어 요구 사항을 분석합니다. MIT 라이선스로 공개된 이 모델은 강력한 코딩 에이전트 성능과 증류(Distillation)를 통한 소형 모델 개선 가능성을 제시합니다.
Qwen-35B-A3 모델을 PPO 학습을 통해 자동 조사 및 자율 에이전트용으로 최적화한 SIQ-1 모델을 소개합니다. 검증 가능한 보상을 활용한 PPO 학습의 효과를 입증하며, 주요 벤치마크에서 뛰어난 성능을 보여줍니다.
오픈 소스 모델을 활용하여 로컬 환경에서 Alexa와 유사한 홈 음성 비서를 구축하기 위한 1년간의 도전과 시행착오를 다룹니다. 무엇이 성공적이었고 무엇이 실패했는지에 대한 실질적인 리뷰를 제공합니다.
Codex의 기능을 유지하면서 macOS 네이티브 환경에서 사용할 수 있는 데스크톱 인터페이스인 Codesk를 소개합니다. 히스토리 관리, 모델 선택, 워크스페이스 및 승인 정책 관리 등 강력한 기능을 제공합니다.
LLM 에이전트의 메모리 문제를 단순 저장(Storage)이 아닌 관련성(Relevance)의 관점에서 접근하여 직접 구축한 사례를 다룹니다. HNSW 그래프 재배선, 양자화 오차 보정, 시간적 쇠퇴 모델 도입을 통해 에이전트의 기억력을 개선하는 기술적 방법론을 제시합니다.
eBay에서 판매되는 개조된 AMD Radeon Pro W6800(V620 기반)의 성능을 벤치마크한 결과입니다. W6800 펌웨어 플래싱을 통해 디스플레이 출력을 지원하며, Vulkan 및 ROCm 백엔드를 이용한 Qwen 2.5 27B 모델의 추론 성능을 측정했습니다.
AI 서버 구축을 위해 NVIDIA RTX 5060 Ti와 AMD RX 9060 XT 16GB 모델의 성능을 비교 벤치마크한 결과입니다. 다양한 LLM 모델을 대상으로 응답 및 프롬프트 토큰 생성 속도를 측정한 데이터를 공유합니다.
LM Studio 대신 llama.cpp를 사용하여 로컬 LLM 에이전트 환경을 구축한 경험을 공유합니다. llama.cpp는 더 빠른 프롬프트 처리 속도와 효율적인 컨텍스트 관리를 제공하여 대규모 컨텍스트 작업에 유리합니다.
Triple GPU(GTX-1070 8GiB x 3) 환경에서 Qwen 3.6 모델들의 추론 성능을 벤치마크한 결과입니다. 다양한 양자화 방식(GGUF)에 따른 실행 시간과 성능 지표를 비교 분석하였습니다.
RAG 쿼리에 메타데이터를 제공하기 위해 로컬 Qwen 0.6B 모델을 질문 분류용으로 파인튜닝하는 실험 과정을 다룹니다.
Glint Research에서 공개한 10,000 파라미터 규모의 초소형 언어 모델 Glimmer-1을 소개합니다. FineWeb-Edu 데이터셋 500K 토큰을 사용하여 학습되었으며, 표준 Llama 아키텍처를 기반으로 합니다.
VibeThinker-1.5B를 3B 규모로 확장하여 수학 및 코딩 분야에서 프론티어급 성능을 달리는 모델을 공개했습니다. 소형 모델(SLM)이 검증 가능한 추론 영역에서 스케일링 법칙을 보완할 수 있음을 입증했습니다.
Weibo AI가 출시한 VibeThinker-3B는 소규모 모델임에도 불구하고 AIME 2026에서 94.3점을 기록하며 거대 모델과 대등한 성능을 보였습니다. 초최적화된 학습 파이프라인을 통해 수학과 코딩 분야에서 압도적인 벤치마크 수치를 증명했습니다.
Docker Sandbox를 활용하여 로컬 LLM(llama.cpp, MLX)을 호스트 환경으로부터 격리하여 실행하는 두 가지 가이드를 제공합니다. 모델 서버는 호스트 GPU를 사용하되, Pi는 마이크로 VM 내에서 추론 엔드포인트만 노출되도록 설계되었습니다.
Qwen3.6 27B 모델의 양자화 수준(Q8 vs IQ3 XXS)에 따른 코딩 성능 차이를 비교 실험했습니다. 실험 결과, 낮은 양자화 모델인 IQ3 XXS도 일반적인 코딩 작업에는 충분히 우수한 성능을 보여주었습니다.
Gemma 12b 모델의 추론 능력을 강화하기 위해 인지적 편향을 방지하는 시스템 지침(System Instruction)을 설계하고 테스트한 사례를 공유합니다. 이 지침은 모델이 불필요하게 과도한 추론을 하지 않으면서도 주어진 전제에 엄격하게 기반하여 답변하도록 유도합니다.
Qwen이나 Claude의 데이터를 활용한 소규모 증류(Distillation) 모델들이 베이스 모델보다 성능이 낮을 수 있음을 경고합니다. 충분한 데이터 없이 진행된 미세 조정은 성능 개선보다는 환각 현상이나 일관성 저하를 초래할 위험이 큽니다.