Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
한국 WIRobotics가 6800만 달러 규모의 투자를 유치했습니다. 이들은 ALLEX라는 인공인간 로봇을 개발했으며, 특히 손 부분 데모를 통해 뛰어난 정밀도와 생체 모방 기능을 선보였습니다.
본문은 transformers 라이브러리에서 continuous batching을 활용하여 비동기 CPU 및 GPU 추론(inference)을 수행하는 방법에 대한 블로그 글을 소개합니다. 이 기술은 효율적인 리소스 관리를 통해 모델 추론 성능을 향상시키는 것을 목표로 합니다.
NVIDIA가 80개 이상의 다양한 인공지능(AI) 모델에 대해 무료 API 접근 권한을 제공하고 있다는 사실이 주목받고 있습니다. 이에는 MiniMax M2.7, GLM 5.1, Kimi 2.5, DeepSeek 3.2, GPT-OSS-120B 등 여러 주요 모델들이 포함되어 있습니다. 이러한 광범위한 접근성은 개발자들이 다양한 최신 AI 기술을 쉽게 실험하고 활용할 수 있도록 지원합니다.
NVIDIA가 Star Elastic이라는 혁신적인 모델을 출시했습니다. 이 모델은 단일 체크포인트 내에 30B, 23B, 12B 등 여러 크기의 중첩된(nested) 추론 모델을 포함하며, Zero-Shot Slicing 기술을 활용합니다. 이는 마치 가변 비트레이트 비디오 코딩처럼 필요에 따라 모델의 규모를 동적으로 조절하여 '사고' 단계에는 작은 모델을, 최종 '답변' 단계에는 큰 모델을 할당함으로써 성능과 효율성을 극대화합니다. 이러한 탄력적 예산 제어(Elastic budget control) 덕분에 표준 방식 대비 정확도가 16% 향상되고 지연 시간은 1.9배 감소하는 등 상당한 이점을 얻었으며, 메모리 제약이 있는 하드웨어에서도 높은 처리량을 달성할 수 있습니다.
본 분석은 MTP(Model Type Parameterization)와 Speculative Inference (추측적 추론)를 사용하여 LLM의 디코딩 속도를 테스트한 결과를 다룹니다. 핵심 발견은 모델 양자화 수준과 작업 유형에 따라 성능 이득이 극명하게 달라진다는 것입니다. 특히, F16 같은 고정밀도 모델에서는 코딩 작업 시 MTP와 Speculative Decoding을 사용하는 것이 큰 속도 향상을 가져오지만, Q4_K_M 같은 저정밀도 모델의 창의적 글쓰기 작업에는 오히려 오버헤드가 발생하여 성능이 느려질 수 있습니다.
본 글은 MTP(Multi-Token Prediction) 모델을 실행하기 위한 llama.cpp Docker 이미지를 제공하며, 사용자가 자신의 하드웨어에 맞는 버전을 선택하여 쉽게 사용할 수 있도록 안내합니다. 또한, Unsloth에서 Qwen 3.6용 MTP 모델을 출시함에 따라 기존의 Grafted 모델들이 구식이 되었음을 알리며, 성능 비교 벤치마크 결과 Unsloth 모델 사용을 강력히 권장하고 있습니다. 최신 버전에서는 draft engine 이름이 `mtp`에서 `draft-mtp`로 변경되었으므로 `--spec-type draft-mtp`를 사용해야 합니다. 전반적인 벤치마크 결과와 사용자 편의성을 고려할 때, Unsloth 모델을 사용하는 것이 더 효율적입니다.
본 글은 단일 RTX 5080 GPU와 64GB RAM 환경에서 실제로 구동 가능한 로컬 LLM 기반 코딩 툴박스 구축 방법을 제시합니다. 자동 완성(Autocomplete)에는 Zeta 2.1 모델을, 에이전트 방식 코딩(Agentic Coding)에는 Qwen3.6-35B-A3B 모델을 활용하며, 각 모델의 선택 이유와 최적화된 구동 명령어 및 시스템 요구 사항을 상세히 설명합니다.
본 기술 기사는 Ethernet LAN을 통해 두 개의 GPU에 FLUX 2 모델을 분산하는 커스텀 NVENC 인코더 브릿지 구축 경험을 공유합니다. 이 시스템은 초기에는 Flux 2 Dev 및 Klein 9b를 지원하며, Tailscale과 같은 VPN을 이용해 원격 환경(카페 노트북-집 데스크톱)에서도 테스트가 가능함을 보여줍니다. 또한, 32B 및 70B LLM 모델 분산 버전도 개발하여 출시할 예정입니다.
Pixal3D는 단일 이미지를 입력받아 고충실도의 3D 에셋을 생성하는 모델입니다. 기존 방식이 이미지 특징을 느슨하게 주입했던 것과 달리, Pixal3D는 역투영(back-projection) 기법을 사용하여 픽셀 특징을 3D 공간으로 명시적으로 들어 올려 직접적인 픽셀-3D 대응 관계를 구축합니다. 이를 통해 상세한 기하학적 구조와 PBR 텍스처를 갖춘, 재구성 수준에 근접한 높은 충실도의 결과물을 얻을 수 있습니다.
최근 50일 이상 동안 EU 지역의 주요 GPU 제품군(RTX 50xx, RX 9xxx 등)에 대한 가격 추적이 진행되었으며, 분석 결과 RTX 5090만이 예외적으로 가격이 상승하는 유일한 계층으로 나타났습니다. 다른 대부분의 중급형 및 하위 모델들은 전반적으로 가격 하락세를 보이고 있습니다. 분석가는 AI/워크스테이션 수요가 매우 높아 5090의 공급을 빠르게 흡수하고 있어, 일반적인 제품처럼 가격이 떨어지기를 기대하기는 어렵다고 조언합니다. 또한, 일부 GPU는 하루 평균 여러 번의 미세한 가격 조정(Micro-adjustments)을 경험하는 것으로 관찰되었습니다.
AllenAI는 5B 파라미터 규모의 시각-언어-행동(VLA) 모델인 MolmoAct2를 개발하여 로봇 제어 분야에서 뛰어난 성능을 보여주고 있습니다. AllenAI는 일반적인 작업, 상호작용형 작업, 절대 관절 포즈 제어 등 다양한 목적에 맞춘 미세 조정 모델들을 지속적으로 공개하고 있습니다. 특히 이 모델들은 가중치뿐만 아니라 전체 학습 데이터셋, 소스 코드, 기술 논문까지 완전한 오픈 소스로 제공하여 연구 및 개발 커뮤니티의 활용도를 극대화했습니다.
본 문서는 Qwen3.6과 LDLM (Open-Diffusion-Large-Language-Model)을 결합한 아키텍처를 RTX 5090 환경에서 테스트하고, 추론 처리량(Inference Throughput)에 대한 수치를 제시합니다. 특히 Qwen3.6-35B-A3B 모델은 학습되지 않은 가중치 상태에서도 10단계 확산 과정에서 약 3,238 tok/s의 높은 처리량을 달성할 것으로 예측되었습니다. 이 테스트는 복잡한 아키텍처를 구현하는 데 필요한 기술적 세부 사항과 여러 가지 가정 및 주의사항을 포함하고 있습니다.
이 글은 llama-server 세션을 구성하고 관리하기 위한 WebUI를 소개하며, Python과 JavaScript를 사용하여 직접 제작했음을 밝히고 있습니다. 이 도구는 로컬 환경에서 여러 llama-server 인스턴스를 고정된 포트에서 실행하여 홈 개발 및 실험적 빌드 비교 등 다양한 용도로 활용할 수 있게 합니다. 주요 기능으로는 모델별 JSON 설정 저장, 검색 기능을 갖춘 실행 인자 브라우저, GPU 리소스(VRAM 모니터링, 로드/온도) 확인, VRAM 계산기, 그리고 휴대폰에서도 사용 가능한 간편한 모바일 인터페이스 등이 포함되어 있습니다.
본 글은 Qwen 3.6 35B (MTP 버전) 모델을 사용하여 대규모 컨텍스트(Context Window) 환경에서의 성능 테스트 결과를 공유합니다. 특히, 여러 파일과 방대한 코드를 포함하는 프로젝트를 다루면서도 높은 속도와 완벽한 품질을 유지하는 것을 목표로 했습니다. 테스트 결과, 300k 컨텍스트에서도 오류 없이 매우 빠른 처리 속도를 보여주었으며, 이는 로컬 LLM 분야의 큰 진전을 의미한다고 강조합니다.
BeeLlama.cpp는 llama.cpp를 개선한 오픈 소스 프로젝트로, 동일한 VRAM 환경에서 대규모 모델의 추론 속도를 3배 향상시키고 컨텍스트 용량을 7.5배 확장하는 성능을 제공합니다. 이 글은 로컬 환경에서 대규모 언어 모델(LLM)을 운영하는 사용자들에게 BeeLlama.cpp를 소개하며, 추가적으로 토큰 비용 절감을 위한 OpenSquilla와 같은 프로젝트도 언급하고 있습니다.
이 프로젝트는 ESP32를 기반으로 하는 다중 프로토콜(multi-protocol) 무선 보안 툴킷입니다. 해당 툴킷은 다양한 통신 프로토콜을 지원하며, 무선 환경의 보안 취약점을 테스트하고 분석하는 데 사용될 수 있습니다. GitHub 링크를 통해 소스 코드를 확인할 수 있습니다.
미국 정부가 2026년 5월 14일, Nvidia의 중국 시장 점유율을 0으로 만들었던 금지 조치를 뒤집고 10개 중국 기업에 대한 H200 판매를 승인했습니다. 이 결정은 Nvidia가 최신 Blackwell 아키텍처와 같은 핵심 기술을 노출하지 않으면서도 제한적인 방식으로 중국 매출을 회복할 수 있게 합니다. 전문가들은 이번 승인이 단순한 정책 변화라기보다는, 국가 안보 리스크를 최소화하며 수익을 창출하기 위한 정교하게 계산된 전략적 움직임으로 분석하고 있습니다.
본 기사는 AI 에이전트가 가정이라는 사적 영역에 도입될 때 발생할 수 있는 권한 집중 및 불이익 문제를 다루며, '어디서 멈추어야 하는가'라는 질문을 던진다. 가정은 이미 다양한 작은 판단과 권한의 움직임으로 이루어져 있어, 모든 것을 처리하는 일체형 AI는 편리하지만 위험할 수 있다. 따라서 AI 에이전트의 능력을 나누기보다, 각 기능별로 '권한의 경계(Boundary of Authority)'를 명확히 분리하여 설계하는 것이 중요함을 강조한다.
단어 임베딩(Word Embedding)은 단어를 고차원 공간의 벡터로 표현하여 그 위치가 의미를 인코딩하는 기술입니다. 이 기사는 'King'과 'Queen'처럼 유사한 의미를 가진 단어가 공간상에서 가까운 거리에 배치되는 원리를 설명합니다. 또한, 두 단어 간의 관계를 측정하기 위해 유클리드 거리와 코사인 유사도를 사용하며, 벡터 산술을 통해 '왕 - 남자 + 여자 ≈ 여왕'과 같은 방식으로 추론이 가능함을 보여줍니다.
본 기사는 자율 AI 에이전트를 활용하여 포괄적인 침투 테스트(penetration tests)를 수행하는 방법을 다룹니다. 이를 통해 사람이 수동으로 진행하기 어려운 광범위하고 자동화된 보안 취약점 점검을 가능하게 합니다. 구체적으로 GitHub의 특정 저장소 링크를 제시하며 실습 자료를 제공합니다.