Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 기사는 5090RTX 그래픽카드를 사용하여 LLM 추론 과정에서 프롬프트 파싱(Prompt Parsing, PP)과 토큰 생성(Token Generation, TG) 성능을 다양한 전력 제한(Power Limit) 조건 하에 비교 분석한 벤치마크 결과입니다. 테스트는 Qwen3.6-27B 모델과 복잡한 30k 프롬프트를 사용했으며, 전력 제한이 PP에는 민감하게 영향을 미치는 반면 TG에는 거의 선형적인 관계를 보였습니다. 특히, 4090RTX 대비 5090RTX는 단순히 더 높은 전력 소비량 이상의 성능 차이를 보였으며, 이 성능 격차는 PP와 TG에 동일하게 적용되지 않는다는 점을 데이터 테이블로 제시했습니다.
Nexidion은 개인정보 보호에 중점을 둔 개인용 지식 저장소 프로젝트로, 오픈 소스로 공개되었습니다. 이 시스템은 Docker를 활용하여 Postgres DB, 백엔드, 프론트엔드, 그리고 AI 태스크 러너를 단일 명령어로 쉽게 배포할 수 있도록 설계되었습니다. 특히 VRAM 제약이 있는 환경에서도 35B 모델을 구동하는 상세한 기술적 가이드와 최적화된 실행 방법을 제공합니다.
본 기사는 4개의 RTX 3090 GPU를 사용하여 Qwen3.6-27B 모델을 구동할 때의 성능 및 효율성 테스트 결과를 공유합니다. 전력 제한에 따른 출력, 프롬프트 처리, 총 처리량 등의 데이터를 분석한 결과, 약 220W 지점에서 최고의 효율(Sweet Spot)을 달성하는 것을 확인했습니다. 또한, 전력을 250W 이상으로 높여도 성능 향상 폭이 줄어드는 수익 체감 현상이 발생함을 보여줍니다.
NVIDIA가 Star Elastic이라는 혁신적인 모델을 출시했습니다. 이 모델은 단일 체크포인트 내에 30B, 23B, 12B 등 여러 크기의 중첩된(nested) 추론 모델을 포함하며, Zero-Shot Slicing 기술을 활용합니다. 이는 마치 가변 비트레이트 비디오 코딩처럼 필요에 따라 모델의 규모를 동적으로 조절하여 '사고' 단계에는 작은 모델을, 최종 '답변' 단계에는 큰 모델을 할당함으로써 성능과 효율성을 극대화합니다. 이러한 탄력적 예산 제어(Elastic budget control) 덕분에 표준 방식 대비 정확도가 16% 향상되고 지연 시간은 1.9배 감소하는 등 상당한 이점을 얻었으며, 메모리 제약이 있는 하드웨어에서도 높은 처리량을 달성할 수 있습니다.
본 분석은 MTP(Model Type Parameterization)와 Speculative Inference (추측적 추론)를 사용하여 LLM의 디코딩 속도를 테스트한 결과를 다룹니다. 핵심 발견은 모델 양자화 수준과 작업 유형에 따라 성능 이득이 극명하게 달라진다는 것입니다. 특히, F16 같은 고정밀도 모델에서는 코딩 작업 시 MTP와 Speculative Decoding을 사용하는 것이 큰 속도 향상을 가져오지만, Q4_K_M 같은 저정밀도 모델의 창의적 글쓰기 작업에는 오히려 오버헤드가 발생하여 성능이 느려질 수 있습니다.
본 글은 MTP(Multi-Token Prediction) 모델을 실행하기 위한 llama.cpp Docker 이미지를 제공하며, 사용자가 자신의 하드웨어에 맞는 버전을 선택하여 쉽게 사용할 수 있도록 안내합니다. 또한, Unsloth에서 Qwen 3.6용 MTP 모델을 출시함에 따라 기존의 Grafted 모델들이 구식이 되었음을 알리며, 성능 비교 벤치마크 결과 Unsloth 모델 사용을 강력히 권장하고 있습니다. 최신 버전에서는 draft engine 이름이 `mtp`에서 `draft-mtp`로 변경되었으므로 `--spec-type draft-mtp`를 사용해야 합니다. 전반적인 벤치마크 결과와 사용자 편의성을 고려할 때, Unsloth 모델을 사용하는 것이 더 효율적입니다.
본 글은 단일 RTX 5080 GPU와 64GB RAM 환경에서 실제로 구동 가능한 로컬 LLM 기반 코딩 툴박스 구축 방법을 제시합니다. 자동 완성(Autocomplete)에는 Zeta 2.1 모델을, 에이전트 방식 코딩(Agentic Coding)에는 Qwen3.6-35B-A3B 모델을 활용하며, 각 모델의 선택 이유와 최적화된 구동 명령어 및 시스템 요구 사항을 상세히 설명합니다.
최근 50일 이상 동안 EU 지역의 주요 GPU 제품군(RTX 50xx, RX 9xxx 등)에 대한 가격 추적이 진행되었으며, 분석 결과 RTX 5090만이 예외적으로 가격이 상승하는 유일한 계층으로 나타났습니다. 다른 대부분의 중급형 및 하위 모델들은 전반적으로 가격 하락세를 보이고 있습니다. 분석가는 AI/워크스테이션 수요가 매우 높아 5090의 공급을 빠르게 흡수하고 있어, 일반적인 제품처럼 가격이 떨어지기를 기대하기는 어렵다고 조언합니다. 또한, 일부 GPU는 하루 평균 여러 번의 미세한 가격 조정(Micro-adjustments)을 경험하는 것으로 관찰되었습니다.
AllenAI는 5B 파라미터 규모의 시각-언어-행동(VLA) 모델인 MolmoAct2를 개발하여 로봇 제어 분야에서 뛰어난 성능을 보여주고 있습니다. AllenAI는 일반적인 작업, 상호작용형 작업, 절대 관절 포즈 제어 등 다양한 목적에 맞춘 미세 조정 모델들을 지속적으로 공개하고 있습니다. 특히 이 모델들은 가중치뿐만 아니라 전체 학습 데이터셋, 소스 코드, 기술 논문까지 완전한 오픈 소스로 제공하여 연구 및 개발 커뮤니티의 활용도를 극대화했습니다.
본 문서는 Qwen3.6과 LDLM (Open-Diffusion-Large-Language-Model)을 결합한 아키텍처를 RTX 5090 환경에서 테스트하고, 추론 처리량(Inference Throughput)에 대한 수치를 제시합니다. 특히 Qwen3.6-35B-A3B 모델은 학습되지 않은 가중치 상태에서도 10단계 확산 과정에서 약 3,238 tok/s의 높은 처리량을 달성할 것으로 예측되었습니다. 이 테스트는 복잡한 아키텍처를 구현하는 데 필요한 기술적 세부 사항과 여러 가지 가정 및 주의사항을 포함하고 있습니다.
본 글은 로컬 LLM 에이전트가 최신 실제 금융 데이터를 활용하는 데 필요한 'Equibles'라는 셀프 호스팅 MCP 서버를 소개합니다. Equibles는 미국의 SEC 공시, 13F/내부자 거래, 공매도 데이터, FRED 경제 지표 등 광범위한 공개 금융 데이터를 스크래핑하여 제공하며, 이를 모든 클라이언트가 직접 쿼리할 수 있는 도구(Tools)로 노출합니다. 이 시스템은 클라우드 의존성, API 키, 텔레메트리가 전혀 없어 사용자의 로컬 환경에서 완전히 구동됩니다.
이 글은 llama-server 세션을 구성하고 관리하기 위한 WebUI를 소개하며, Python과 JavaScript를 사용하여 직접 제작했음을 밝히고 있습니다. 이 도구는 로컬 환경에서 여러 llama-server 인스턴스를 고정된 포트에서 실행하여 홈 개발 및 실험적 빌드 비교 등 다양한 용도로 활용할 수 있게 합니다. 주요 기능으로는 모델별 JSON 설정 저장, 검색 기능을 갖춘 실행 인자 브라우저, GPU 리소스(VRAM 모니터링, 로드/온도) 확인, VRAM 계산기, 그리고 휴대폰에서도 사용 가능한 간편한 모바일 인터페이스 등이 포함되어 있습니다.
본 글은 Qwen 3.6 35B (MTP 버전) 모델을 사용하여 대규모 컨텍스트(Context Window) 환경에서의 성능 테스트 결과를 공유합니다. 특히, 여러 파일과 방대한 코드를 포함하는 프로젝트를 다루면서도 높은 속도와 완벽한 품질을 유지하는 것을 목표로 했습니다. 테스트 결과, 300k 컨텍스트에서도 오류 없이 매우 빠른 처리 속도를 보여주었으며, 이는 로컬 LLM 분야의 큰 진전을 의미한다고 강조합니다.
고객 지원용 RAG 챗봇의 성능 평가를 진행한 결과, 단순히 비싼 모델이 최고의 성능을 보장하지 않으며, 실제 유의미한 개선은 검색(Retrieval) 단계와 데이터 전처리 과정에서 발생했습니다. 핵심 교훈으로는 LLM의 응답 품질보다 먼저 검색된 컨텍스트 자체를 면밀히 분석해야 하며, 휴리스틱 평가기 대신 LLM judge를 활용하는 것이 효과적입니다. 또한, 청크 중복 제거 로직을 추가하여 노이즈를 줄이고, 모델 스윕(model sweep)을 통해 비용 대비 성능이 우수한 최적의 모델 조합을 찾는 것이 중요합니다. 궁극적으로는 엔드투엔드 품질과 비용 모두에서 큰 개선을 달성할 수 있었습니다.
InternLM은 35B 파라미터의 과학 멀티모달 파운데이션 모델인 Intern-S2-Preview를 공개했습니다. 이 모델은 기존의 파라미터 스케일링을 넘어, 전문 과학 과업의 난이도와 범위를 확장하는 '태스크 스케일링' 방식을 채택하여 개발되었습니다. 그 결과, 35B라는 비교적 작은 크기에도 불구하고 여러 핵심 전문 과학 과업에서 조 단위 규모 모델에 필적하는 성능과 강력한 일반 추론 및 에이전트 역량을 갖추게 되었습니다.
본 글은 로컬 LLM(Large Language Model)이 실제로 매우 유용하게 활용될 수 있음을 구체적인 사용 사례를 통해 입증합니다. 필자는 임베딩 모델을 이용해 지속성 메모리 시스템에 시맨틱 검색 프로토콜을 적용하여 자연스러운 메모리 회상을 구현하고 있습니다. 특히, Qwen3.6-35B-A3B와 같은 로컬 LLM을 활용하여 데이터베이스 평가, 이메일 기반 작업 흐름 관리, 문서 생성 및 Google Doc 푸시, 그리고 최종 PDF 변환에 이르는 복잡한 반복 작업을 완벽하게 수행하는 워크플로우를 구축하고 있습니다.
작은 로컬 LLM 기반 에이전트 사용 시 웹 검색의 어려움을 해결하기 위해 'TinySearch'라는 오픈 소스 도구가 개발되었습니다. 이 도구는 웹 검색과 크롤링을 수행한 후, 전체 페이지 텍스트를 제공하는 대신 유용한 부분을 청킹(chunking), 검색(retrieval), 재순위화(reranking)하여 훨씬 작은 컨텍스트 덩어리를 에이전트에게 제공합니다. 이는 복잡한 백엔드 구축 없이 로컬에서 정보 탐색 기능을 추가하려는 에이전트 빌더들에게 유용한 '로컬 리서치 레이어' 역할을 합니다.
작성자는 dual RTX 3090 환경에서 DeepSeek을 오케스트레이터로 사용하고 Qwen 3.6 35B 서브 에이전트 4개를 로컬에서 병렬로 구동하는 시스템을 구현했습니다. 이 시스템은 각 서브 에이전트가 최대 컨텍스트 크기 131,072를 가지는 등 고성능의 복잡한 AI 아키텍처를 보여줍니다.
이 게시물은 RTX 5060 Ti 16GB 하드웨어에서 로컬 LLM을 설정하고 테스트하기 위한 공개 저장소를 소개합니다. 이 저장소는 Qwen3.6 모델의 다양한 양자화 버전(NVFP4/MTP, Q4/Q6)을 vLLM 및 llama.cpp를 사용하여 서빙하는 구체적인 설정 노트와 실행 예시를 제공합니다. 목표는 단순히 성능 수치 대신 재현 가능한 상세한 설정 정보와 벤치마크 도구를 공유하여 실용성을 높이는 것입니다.
본 기술 보고서는 밑바닥부터 LLM을 개발하는 과정을 다루며, VRAM 사용량을 최적화한 DeepSeek 아키텍처를 기반으로 합니다. 저자는 오픈 소스 생태계가 대기업의 개발 속도를 능가할 수 있다고 믿으며, 모든 최상위 1T 파라미터 모델에 필적하는 LLM을 구축하는 것을 목표로 하고 있습니다. 현재는 DOLMA/RedPajama 데이터셋을 활용하여 수학, 문학, 물리학 등 다양한 분야로 학습시키고 있으며, 향후 에이전트 앙상블 배포를 계획하고 있습니다.