Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
RTX 5090과 RTX 3090 Ti 조합에서 llama.cpp의 tensor split 모드를 활용해 Qwen3.6-27B 모델의 추론 속도를 100 t/s 이상으로 끌어올린 설정법을 공유합니다. 레이어 분할 방식 대신 텐서 분할을 사용하여 두 GPU의 연산 효율을 극대화했습니다.
MiniMax M3 EAGLE 디코더 모델이 llama.cpp에서 사용할 수 있도록 GGUF 형식으로 변환되었습니다. 양자화 버전을 활용하여 VRAM 최적화 설정을 적용할 경우 추론 속도를 향상시킬 수 있습니다.
SK hynix가 HBM3E 생산 라인 일부를 범용 DRAM 생산으로 전환하며 수익성 극대화를 노리고 있습니다. 이는 HBM4 전환을 지연시키는 대신 이익률이 높은 DRAM 시장 수요에 대응하여 추가 수익을 확보하려는 전략적 결정입니다.
6년 된 Xeon CPU 환경에서 llama.cpp 최적화를 통해 Gemma-4 모델을 초당 64토큰의 속도로 구동하는 데 성공했습니다. 이는 고가의 멀티 GPU 장비 없이도 에이전트 기반 코딩이 가능한 수준의 성능을 보여줍니다.
Apostate의 새로운 대조적 공벡터 편집(contrastive co-vector edit) 연산자를 소개합니다. 이 방식은 무해한 동작을 보존하면서 거부 방향만을 정밀하게 제거하여, Granite-3.3-8b 모델에서 거부율을 96%에서 5%로 대폭 낮추는 성과를 보였습니다.
로컬 AI 3D 생성을 위한 오픈 소스 데스크톱 앱 Modly v0.4.0이 출시되었습니다. 이번 업데이트에서는 Ollama를 직접 통합하여 앱 내부에서 로컬 에이전트와 채팅하며 3D 워크플로우를 보조받을 수 있는 Chat Mode가 추가되었습니다.
중국 해커들이 NVIDIA Tesla v100의 핀아웃을 역공학하여 하프 하이트 PCB에 구현한 'Tesla v100 v4'를 제작했습니다. 저렴한 가격으로 16G 및 32G 버전을 출시하여 주목받고 있습니다.
TMax는 터미널 에이전트 성능 향상을 위한 강력한 오픈 강화학습(RL) 레시피를 제안합니다. 14,600개의 고품질 RL 데이터셋인 TMax-15k와 결과 중심 RL 학습법을 통해 소규모 오픈 모델로도 대규모 폐쇄형 모델에 근접하는 성능을 달성했습니다.
NEX-N2-mini는 매우 적은 추론 토큰을 사용하면서도 3.5/3.6 수준의 뛰어난 추론 능력을 보여주는 새로운 MoE 모델입니다. 효율적인 추론 성능을 바탕으로 기존 모델들의 파레토 프런티어를 뛰어넘는 성능을 입증했습니다.
Gemma4-12B-QAT Uncensored Balanced 모델이 MTP(Multi-Token Prediction) 기술을 적용하여 출시되었습니다. 이 모델은 비검열화된 답변을 제공하며, MTP를 통해 품질 저하 없이 생성 속도를 약 60% 향상시킨 것이 특징입니다.
동일한 Qwen2.5-27B 모델과 프롬프트를 사용하여 네 가지 서로 다른 에이전트 스캐폴딩(pi, opencode, hermes, qwen code)의 코딩 성능을 비교 실험했습니다. 2D 태양계 시뮬레이션 구현을 통해 에이전트별 아키텍처 품질, 물리 엔진 정확도, 코드 견고성을 분석했습니다.
llama.cpp 환경에서 GLM-5.2 모델을 RTX 5090과 3090 Ti 조합으로 실행한 성능 테스트 결과입니다. 다양한 컨텍스트 길이에 따른 프리필(Prefill) 속도와 디코드(Decode) 속도를 상세히 측정하였습니다.
8GB VRAM 환경에서 작은 모델로 프롬프트를 정교화한 뒤 큰 모델로 코드를 생성하는 자동 VRAM 스왑 파이프라인을 소개합니다. Streamlit 기반의 이 도구는 모델 간 전환을 자동화하여 효율적인 워크플로우를 제공합니다.
RTX 3090 4장과 192GB RAM을 활용하여 GLM5.2 등 대규모 모델을 구동할 수 있는 가성비 홈 랩 시스템 구축 사례를 소개합니다. 소비자용 하드웨어를 최적화하여 기업용 워크플로우 자동화를 위한 로컬 AI 환경을 구축하는 방법을 다룹니다.
RTX 3090 환경에서 Qwen3.6-35B-A3B 모델의 성능을 극대화하기 위한 최적의 구성과 벤치마크 결과를 공유합니다. llama.cpp 포크 엔진과 APEX 모델 버전에 따른 속도 및 품질을 비교 분석했습니다.
GitHub Copilot 구독 방식 대신 Qwen 3.6 35B 모델을 활용하여 직접 구축한 로컬 코드 에이전트 사례를 소개합니다. SSD 오프로드 기술을 통해 24GB Mac Pro 환경에서도 원활하게 작동함을 확인했습니다.
멀티 GPU 환경을 구축하던 중 M.2 어댑터에 장착된 GPU가 vLLM에서 인식되지 않는 하드웨어 문제를 해결한 사례입니다. 원인은 ATX Y-splitter 케이블을 통한 전력 공유 문제였으며, 별도의 PSU를 추가하여 해결했습니다.
Ling and Ring 2.6 기술 보고서를 통해 조 단위 파라미터 규모에서도 효율적이고 즉각적인 에이전트 지능을 구현하는 기술을 소개합니다. Ling-2.6-flash(100B) 모델 출시와 함께 Ling-mini-2.0의 압도적인 추론 속도를 강조합니다.
Gemma 4 31B 모델에서 QAT(양자화 인식 학습)를 적용한 KV 캐시 양자화가 표준 양자화 방식보다 압도적인 성능을 보임을 입증했습니다. KL 발산 지표를 통해 QAT가 모델의 정보 손실과 이상치를 획기적으로 줄여줌을 확인했습니다.
GGML_CUDA_ALLREDUCE 설정을 제거함으로써 MTP(Multi-Token Prediction) 환경에서 TPS(Tokens Per Second) 성능이 크게 향상됨을 확인했습니다. 특정 환경에서 성능 저하를 일으키던 설정을 조정하여 최적화에 성공한 사례를 공유합니다.