Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
NVIDIA가 Star Elastic이라는 혁신적인 모델을 출시했습니다. 이 모델은 단일 체크포인트 내에 30B, 23B, 12B 등 여러 크기의 중첩된(nested) 추론 모델을 포함하며, Zero-Shot Slicing 기술을 활용합니다. 이는 마치 가변 비트레이트 비디오 코딩처럼 필요에 따라 모델의 규모를 동적으로 조절하여 '사고' 단계에는 작은 모델을, 최종 '답변' 단계에는 큰 모델을 할당함으로써 성능과 효율성을 극대화합니다. 이러한 탄력적 예산 제어(Elastic budget control) 덕분에 표준 방식 대비 정확도가 16% 향상되고 지연 시간은 1.9배 감소하는 등 상당한 이점을 얻었으며, 메모리 제약이 있는 하드웨어에서도 높은 처리량을 달성할 수 있습니다.
본 분석은 MTP(Model Type Parameterization)와 Speculative Inference (추측적 추론)를 사용하여 LLM의 디코딩 속도를 테스트한 결과를 다룹니다. 핵심 발견은 모델 양자화 수준과 작업 유형에 따라 성능 이득이 극명하게 달라진다는 것입니다. 특히, F16 같은 고정밀도 모델에서는 코딩 작업 시 MTP와 Speculative Decoding을 사용하는 것이 큰 속도 향상을 가져오지만, Q4_K_M 같은 저정밀도 모델의 창의적 글쓰기 작업에는 오히려 오버헤드가 발생하여 성능이 느려질 수 있습니다.
본 글은 MTP(Multi-Token Prediction) 모델을 실행하기 위한 llama.cpp Docker 이미지를 제공하며, 사용자가 자신의 하드웨어에 맞는 버전을 선택하여 쉽게 사용할 수 있도록 안내합니다. 또한, Unsloth에서 Qwen 3.6용 MTP 모델을 출시함에 따라 기존의 Grafted 모델들이 구식이 되었음을 알리며, 성능 비교 벤치마크 결과 Unsloth 모델 사용을 강력히 권장하고 있습니다. 최신 버전에서는 draft engine 이름이 `mtp`에서 `draft-mtp`로 변경되었으므로 `--spec-type draft-mtp`를 사용해야 합니다. 전반적인 벤치마크 결과와 사용자 편의성을 고려할 때, Unsloth 모델을 사용하는 것이 더 효율적입니다.
본 글은 단일 RTX 5080 GPU와 64GB RAM 환경에서 실제로 구동 가능한 로컬 LLM 기반 코딩 툴박스 구축 방법을 제시합니다. 자동 완성(Autocomplete)에는 Zeta 2.1 모델을, 에이전트 방식 코딩(Agentic Coding)에는 Qwen3.6-35B-A3B 모델을 활용하며, 각 모델의 선택 이유와 최적화된 구동 명령어 및 시스템 요구 사항을 상세히 설명합니다.
최근 50일 이상 동안 EU 지역의 주요 GPU 제품군(RTX 50xx, RX 9xxx 등)에 대한 가격 추적이 진행되었으며, 분석 결과 RTX 5090만이 예외적으로 가격이 상승하는 유일한 계층으로 나타났습니다. 다른 대부분의 중급형 및 하위 모델들은 전반적으로 가격 하락세를 보이고 있습니다. 분석가는 AI/워크스테이션 수요가 매우 높아 5090의 공급을 빠르게 흡수하고 있어, 일반적인 제품처럼 가격이 떨어지기를 기대하기는 어렵다고 조언합니다. 또한, 일부 GPU는 하루 평균 여러 번의 미세한 가격 조정(Micro-adjustments)을 경험하는 것으로 관찰되었습니다.
AllenAI는 5B 파라미터 규모의 시각-언어-행동(VLA) 모델인 MolmoAct2를 개발하여 로봇 제어 분야에서 뛰어난 성능을 보여주고 있습니다. AllenAI는 일반적인 작업, 상호작용형 작업, 절대 관절 포즈 제어 등 다양한 목적에 맞춘 미세 조정 모델들을 지속적으로 공개하고 있습니다. 특히 이 모델들은 가중치뿐만 아니라 전체 학습 데이터셋, 소스 코드, 기술 논문까지 완전한 오픈 소스로 제공하여 연구 및 개발 커뮤니티의 활용도를 극대화했습니다.
본 문서는 Qwen3.6과 LDLM (Open-Diffusion-Large-Language-Model)을 결합한 아키텍처를 RTX 5090 환경에서 테스트하고, 추론 처리량(Inference Throughput)에 대한 수치를 제시합니다. 특히 Qwen3.6-35B-A3B 모델은 학습되지 않은 가중치 상태에서도 10단계 확산 과정에서 약 3,238 tok/s의 높은 처리량을 달성할 것으로 예측되었습니다. 이 테스트는 복잡한 아키텍처를 구현하는 데 필요한 기술적 세부 사항과 여러 가지 가정 및 주의사항을 포함하고 있습니다.
이 글은 llama-server 세션을 구성하고 관리하기 위한 WebUI를 소개하며, Python과 JavaScript를 사용하여 직접 제작했음을 밝히고 있습니다. 이 도구는 로컬 환경에서 여러 llama-server 인스턴스를 고정된 포트에서 실행하여 홈 개발 및 실험적 빌드 비교 등 다양한 용도로 활용할 수 있게 합니다. 주요 기능으로는 모델별 JSON 설정 저장, 검색 기능을 갖춘 실행 인자 브라우저, GPU 리소스(VRAM 모니터링, 로드/온도) 확인, VRAM 계산기, 그리고 휴대폰에서도 사용 가능한 간편한 모바일 인터페이스 등이 포함되어 있습니다.
본 글은 Qwen 3.6 35B (MTP 버전) 모델을 사용하여 대규모 컨텍스트(Context Window) 환경에서의 성능 테스트 결과를 공유합니다. 특히, 여러 파일과 방대한 코드를 포함하는 프로젝트를 다루면서도 높은 속도와 완벽한 품질을 유지하는 것을 목표로 했습니다. 테스트 결과, 300k 컨텍스트에서도 오류 없이 매우 빠른 처리 속도를 보여주었으며, 이는 로컬 LLM 분야의 큰 진전을 의미한다고 강조합니다.
InternLM은 35B 파라미터의 과학 멀티모달 파운데이션 모델인 Intern-S2-Preview를 공개했습니다. 이 모델은 기존의 파라미터 스케일링을 넘어, 전문 과학 과업의 난이도와 범위를 확장하는 '태스크 스케일링' 방식을 채택하여 개발되었습니다. 그 결과, 35B라는 비교적 작은 크기에도 불구하고 여러 핵심 전문 과학 과업에서 조 단위 규모 모델에 필적하는 성능과 강력한 일반 추론 및 에이전트 역량을 갖추게 되었습니다.
작성자는 dual RTX 3090 환경에서 DeepSeek을 오케스트레이터로 사용하고 Qwen 3.6 35B 서브 에이전트 4개를 로컬에서 병렬로 구동하는 시스템을 구현했습니다. 이 시스템은 각 서브 에이전트가 최대 컨텍스트 크기 131,072를 가지는 등 고성능의 복잡한 AI 아키텍처를 보여줍니다.
이 게시물은 RTX 5060 Ti 16GB 하드웨어에서 로컬 LLM을 설정하고 테스트하기 위한 공개 저장소를 소개합니다. 이 저장소는 Qwen3.6 모델의 다양한 양자화 버전(NVFP4/MTP, Q4/Q6)을 vLLM 및 llama.cpp를 사용하여 서빙하는 구체적인 설정 노트와 실행 예시를 제공합니다. 목표는 단순히 성능 수치 대신 재현 가능한 상세한 설정 정보와 벤치마크 도구를 공유하여 실용성을 높이는 것입니다.
Ring-2.6-1T는 실제 세계의 복잡한 작업 시나리오를 위해 설계된 1조 파라미터 규모의 플래그십 추론 모델입니다. 이 모델은 단순 질의응답을 넘어, 에이전트 워크플로, 엔지니어링 개발, 과학 연구 분석 등에서 문맥 이해, 단계 계획, 도구 호출 및 장기적인 작업 수행 능력을 갖추도록 설계되었습니다. 주요 업그레이드로는 다단계 작업을 위한 에이전트 실행 능력 강화, 작업 복잡도에 따른 추론 강도 조절(high/xhigh), 그리고 비동기 강화학습 훈련 패러다임 도입 등이 있습니다.
본 벤치마크는 vLLM을 사용하여 Gemma 4 26B 모델에 DFlash 투기적 디코딩(speculative decoding)이 미치는 성능 향상을 검증했습니다. RTX 5090 환경에서 DFlash를 최적으로 설정했을 때, 기본(Baseline) 대비 약 2.56배의 속도 향상과 높은 처리량(throughput)을 달성할 수 있었습니다. 특히, 단순히 가장 빠른 평균 속도가 아닌, p95 지연 시간까지 고려한 최적의 서빙 설정을 찾는 것이 중요함을 보여주었습니다.
본 프로젝트는 단일 GPU 환경에서 영어 문장 하나만으로 캐릭터, 스토리, 음악, 보이스오버가 포함된 완성도 높은 영화적 릴(reel)을 생성하는 오픈 소스 파이프라인을 구축했습니다. 이 8단계의 엔드 투 엔드 시스템은 Qwen3.5-35B를 이용한 기획부터 FLUX.2 기반 키프레임 및 애니메이션, 그리고 전문적인 오디오/비전 크리틱 단계를 거칩니다. 성능 최적화 덕분에 AMD Instinct MI300X에서 720p 클립당 소요 시간이 크게 단축되었습니다.
본 기사는 KV-cache 양자화(Quantization) 기술에 대한 종합적인 연구 결과를 제시합니다. FP8을 사용한 KV-cache 양자화는 정확도 손실이 미미하면서 메모리 용량을 2배 늘려 서빙 성능을 실질적으로 향상시키는 최적의 기본 설정으로 확인되었습니다. 반면, TurboQuant k8v4나 4bit-nc 같은 변형들은 추가적인 메모리 절감 효과를 얻는 대신 정확도 및 처리량/지연 시간 측면에서 감수하기 어려운 비용을 초래하여 프로덕션 환경에 적합하지 않다는 결론입니다.
본 기사는 다양한 모델과 양자화(Quantization) 기술을 사용하여 체스판 SVG 생성 품질을 비교 분석한 결과를 담고 있습니다. Qwen 3.6 35B-A3B MLX oQ4는 제목, 라벨 등에서 거의 완벽한 출력을 보였으나, 일부 커서 표시가 혼란스러울 수 있다는 점이 지적되었습니다. 또한 ZAYA1 8B와 같은 오픈 웨이트 모델은 로컬 환경에서의 추론 엔진 준비가 필요하며, Qwen 3.6 27B의 경우 양자화 비트(Q6, Q3.5)에 따라 성능 차이를 보였습니다.
Hugging Face에서 오픈 소스 라이브러리 및 Hub 인프라와 에이전트(agents)의 통합을 돕는 하네스인 ml-intern을 공개했습니다. 이 도구는 원래 Claude Opus를 위해 개발되었으나, 최근 llama.cpp 또는 ollama를 통해 로컬 모델로 실행할 수 있는 기능을 추가하여 접근성을 높였습니다. 이를 통해 Qwen3.6-35B-A3B와 같은 오픈 모델을 활용해 CPU/GPU 샌드박스 및 작업을 오케스트레이션하며 엔드 투 엔드 SFT가 가능한 AI 연구원을 구축할 수 있습니다.
작성자는 1년 전 Reddit에 출시하여 자신이 진행하는 오픈 소스 프로젝트 중 가장 활발하게 운영되는 MCP 서버 작업을 시작했음을 알리고 있습니다. 이 프로젝트는 작성자에게 매우 중요한 성과를 가져다준 핵심적인 오픈 소스 활동입니다.
opendesk는 AI 에이전트가 커스텀 워크플로우와 통합 가능한 computer use MCP를 사용하여 여러 대의 컴퓨터(Mac, Linux, Windows)를 제어할 수 있게 해주는 오픈 소스 도구입니다. 이 시스템은 WiFi를 통해 원격으로 다른 컴퓨터에 접속하여 클릭, 타이핑, 탐색 등의 작업을 수행하며, 모든 통신은 로컬 네트워크 내에서 암호화되어 이루어집니다.