Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
OpenAI의 전 CTO이자 '챗GPT의 어머니'로 불리는 미라 무라티(Mira Murati)가 설립한 Thinking Machines Lab에서 새로운 인터랙션 모델을 발표하며 AI 시장에 큰 변화를 예고하고 있습니다. 기존 AI 모델들이 사용자의 행동이나 대화 흐름을 실시간으로 인지하지 못하는 한계를 극복하여, 사용자가 말을 하거나 움직이는 순간순간의 미묘한 정보까지 포착해 자연스럽게 반응하는 것이 핵심입니다. 이는 단순한 챗봇 기능을 넘어, AI와 인간이 협업하는 방식 자체를 근본적으로 재편할 잠재력을 가지고 있습니다.
이번 릴리스는 대규모 업데이트를 포함하며, 특히 KV Offloading 서브시스템이 하이브리드 메모리 할당기(HMA)와 통합되고 추측적 디코딩에 '사고 예산' 개념이 도입되어 정확도가 향상되었습니다. vLLM은 PyTorch 호환성을 위해 C++20 빌드를 요구하는 Breaking Change가 발생했습니다. 또한, Blackwell GPU를 위한 새로운 TOKENSPEED_MLA 백엔드와 MiMo-V2.5, Laguna XS.2 등 다양한 최신 아키텍처 및 모델 지원이 추가되었습니다.
Prime Intellect가 AI 연구 자동화 분야에서 새로운 이정표를 세웠습니다. 그들은 Claude Code (Opus 4.7)와 Codex (GPT 5.5) 모델을 활용하여 유휴 컴퓨팅 파워로 nanoGPT speedrun의 optimizer track에서 약 1만 번의 실험을 자율적으로 수행했습니다. 이 과정에서 총 1.4만 H200 시간이 소모되었으며, Opus가 현재 인간 기준 기록(2990 스텝) 대비 2930 스텝으로 기록을 보유하고 있습니다.
neilsonks가 Claude Code 전용의 완전한 3D 생성 툴킷을 오픈 소스로 공개했습니다. 이 툴킷은 단일 이미지를 입력받아 환경, 메쉬, 물리, 조명, 오디오 등 상호작용 가능한 전체 3D 세계로 자동 분해하는 기능을 제공합니다. 이 파이프라인은 이미지 생성과 3D를 결합하여 작동하며, 상세한 단계별 프로세스를 거칩니다.
휴머노이드 로봇이 거의 24시간 동안 쉬지 않고 작동하는 모습이 공개되었습니다. 이 로봇은 실제 패키지를 분류하는 작업을 수행하며, 인간에 근접한 성능을 보여주었습니다. 또한, 이 과정 전체가 라이브로 방송되고 있어 주목받고 있습니다.
OpenAI가 Codex 기능을 모바일 환경과 결합하여, 사용자가 주머니 속에서도 독립적으로 작동하는 자율 에이전트 시스템을 구축할 수 있게 했습니다. 이를 통해 사용자는 원격으로 AI의 활동을 모니터링하고 제어할 수 있습니다.
Android 15의 강화된 seccomp 보안 필터로 인해 기존의 PRoot를 사용한 Debian/glibc 바이너리 실행이 어려워졌습니다. 이 글은 patchelf와 LD_PRELOAD= 환경 변수를 활용하여, Root 권한 없이도 네이티브하게 Linux (Debian/glibc) 바이너리를 직접 실행하는 3단계 해결책을 제시합니다. 이를 통해 Android 기기에서 클라우드 의존성 없이 다양한 개발 도구(GCC, Python 등)를 사용하는 진정한 리눅스 개발 환경 구축이 가능해집니다.
본 기사는 AI 팩토리 시대에 필요한 스토리지의 변화를 다루며, 에이전틱 AI의 복잡한 워크플로우가 메모리와 스토리지에 대한 새로운 수요를 창출하고 있음을 설명합니다. 이러한 수요를 충족하기 위해 업계는 기존의 직접 연결/네트워크 연결 방식 외에 플래시 스토리지를 활용하는 '미들 티어' 계층을 구축하고 있습니다. 또한, 데이터 센터의 효율성을 극대화하기 위한 액체 냉각 기술과 GPU 중심에서 벗어나 스토리지 자체가 핵심적인 요소가 되는 '익스트림 공동 설계'의 중요성이 강조됩니다.
이 기술 기사는 HIP를 사용하여 RDNA3 아키텍처에서 CUDA mma FA 커널을 지원하고 AMD 튜닝을 개선한 내용을 다룹니다. 특히 VKQ(Vector Quantization)의 FP16 누산 작업 시 RDNA3 텐서 코어를 활용하기 위해 타일 크기 조건을 정의했으며, 헤드 크기에 따른 적절한 누산 방식을 적용했습니다. 또한 RDNA3/4 및 CDNA1에 대한 커널 파라미터 튜닝을 통해 성능 개선 사항과 제약 조건(예: 헤드 크기가 128보다 클 때의 성능 한계)을 발견하고 새로운 데이터 레이아웃 항목을 추가했습니다.
fsnotify는 Windows, Linux, macOS 등 다양한 운영체제에서 크로스 플랫폼 파일 시스템 알림 기능을 제공하는 Go 라이브러리입니다. 이 라이브러리는 inotify와 같은 백엔드를 사용하여 디렉토리 변경 사항을 감지하며, 사용자는 특정 이벤트(예: CHMOD)를 무시하거나 상위 디렉토리를 감시하여 관심 없는 파일을 필터링할 수 있습니다. 다만, NFS/SMB 프로토콜이나 가상 파일 시스템은 네트워크 수준 지원이 제한적이며, Linux 환경에서는 `sysctl`을 통해 inotify의 최대 감시(watch) 및 인스턴스 수를 조정해야 할 필요가 있을 수 있습니다.
본 벤치마크는 vLLM을 사용하여 Gemma 4 26B 모델에 DFlash 투기적 디코딩(speculative decoding)이 미치는 성능 향상을 검증했습니다. RTX 5090 환경에서 DFlash를 최적으로 설정했을 때, 기본(Baseline) 대비 약 2.56배의 속도 향상과 높은 처리량(throughput)을 달성할 수 있었습니다. 특히, 단순히 가장 빠른 평균 속도가 아닌, p95 지연 시간까지 고려한 최적의 서빙 설정을 찾는 것이 중요함을 보여주었습니다.
본 프로젝트는 단일 GPU 환경에서 영어 문장 하나만으로 캐릭터, 스토리, 음악, 보이스오버가 포함된 완성도 높은 영화적 릴(reel)을 생성하는 오픈 소스 파이프라인을 구축했습니다. 이 8단계의 엔드 투 엔드 시스템은 Qwen3.5-35B를 이용한 기획부터 FLUX.2 기반 키프레임 및 애니메이션, 그리고 전문적인 오디오/비전 크리틱 단계를 거칩니다. 성능 최적화 덕분에 AMD Instinct MI300X에서 720p 클립당 소요 시간이 크게 단축되었습니다.
NVIDIA가 Moonshot AI의 Kimi-K2.6 및 Kimi 2.5 모델을 NVFP4 포맷으로 양자화하여 출시했습니다. 이 모델들은 최적화된 Transformer 아키텍처를 사용하는 자기회귀 언어 모델이며, Model Optimizer를 통해 양자화되었습니다. 제공된 벤치마크 결과에 따르면, NVFP4 버전은 Baseline (INT4) 대비 전반적으로 높은 성능을 보여주며 상업적/비상업적 용도로 사용 가능합니다.
이 프로젝트는 ESP32-CAM을 Model Context Protocol (MCP) 서버로 변환하여 강력하고 원격 제어 가능한 AI 지원 카메라 시스템으로 만듭니다. 이를 통해 Copilot, Home Assistant 등 다양한 AI 어시스턴트가 MCP를 통해 카메라 캡처, LED/플래시 제어, WiFi 및 시스템 상태 정보 등을 얻거나 설정할 수 있습니다. 특히, 이 서버는 표준 MCP 프로토콜을 준수하며 JSON 스키마 검증, 자동 재연결, OTA 업데이트 등 엔터프라이즈급의 안정성과 기능을 제공합니다.
Qwen-Image-VAE-2.0은 재구성 충실도와 확산 가능성 모두를 개선한 고압축 Variational Autoencoder(VAE)입니다. 이 모델은 Global Skip Connections (GSC), 비대칭 및 Attention-Free 백본, 그리고 의미론적 정렬 전략을 도입하여 압축 병목 현상을 해결하고 효율성을 높였습니다. 특히 대규모 합성 렌더링 학습과 OmniDoc-TokenBench 평가를 통해 OCR이 풍부한 문서 시나리오에서 최첨단 재구성 성능을 입증했습니다.
OpenAI가 코드를 작성하고 컴퓨터용 애플리케이션 개발에 사용되던 Codex를 ChatGPT 모바일 앱에 탑재할 예정입니다. 이는 Anthropic의 Claude Code 등 경쟁사들의 성장에 대응하여, OpenAI가 데스크톱 '슈퍼앱' 구축이라는 야망을 실현하기 위한 중요한 움직임으로 해석됩니다.
본 기사는 KV-cache 양자화(Quantization) 기술에 대한 종합적인 연구 결과를 제시합니다. FP8을 사용한 KV-cache 양자화는 정확도 손실이 미미하면서 메모리 용량을 2배 늘려 서빙 성능을 실질적으로 향상시키는 최적의 기본 설정으로 확인되었습니다. 반면, TurboQuant k8v4나 4bit-nc 같은 변형들은 추가적인 메모리 절감 효과를 얻는 대신 정확도 및 처리량/지연 시간 측면에서 감수하기 어려운 비용을 초래하여 프로덕션 환경에 적합하지 않다는 결론입니다.
Halluminate는 AI 연구소들이 컴퓨터 사용 에이전트를 학습시키기 위한 고품질 시뮬레이션 환경을 제공합니다. 이 플랫폼은 Westworld라는 완전 시뮬레이션된 인터넷을 기반으로 하며, 에이전트가 실제 경제적 가치가 있는 작업(예: 항공권 예약, 재무 모델링)을 수행하도록 훈련시킵니다. Halluminate는 '작업(task)'과 이를 검증하는 '검증기(verifier)'를 결합하여 강화학습(RL)의 신뢰성을 높이고 있으며, 이로써 AI 에이전트가 현실 세계에서 필요한 복잡한 컴퓨터 사용 능력을 향상시키는 것을 목표로 합니다.
LLaMA.cpp는 Multi-Token Prediction (MTP) 및 TurboQuant를 결합하여 Qwen 모델의 로컬 추론 성능을 크게 향상시켰으며, 이는 소비자용 하드웨어에서의 사용성을 높였습니다. 또한, 1조 개의 파라미터를 가진 Ring-2.6-1T 모델이 Ollama를 통해 오픈 소스로 공개되어 코딩 에이전트 작업에 강력한 옵션을 제공합니다. 마지막으로, AMD RDNA 4 GPU에서 Ollama가 CPU 대신 GPU 가속을 제대로 활용할 수 있도록 하는 실용적인 설정 가이드가 공유되었습니다.
추론 비용 상승과 데이터 보호 규제 강화로 인해 클라우드 기반 생성형 AI의 한계가 드러나면서, 온디바이스 및 로컬 환경에서의 모델 구동 필요성이 커지고 있습니다. 본 글은 NPU 칩이 탑재된 기기에서 Microsoft Local Foundry CLI를 사용하여 로컬 추론을 실행하는 방법을 안내합니다. 특히 PowerShell 스크립트를 활용하여 Foundy의 REST API를 자동화하고 통합하는 과정을 상세히 다룹니다.