Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
NVIDIA B200 GPU 환경에서 Gemma-4-31B 모델의 디코딩 처리량 실험 결과를 공유합니다. 단일 요청 시 약 186 tokens/s의 성능을 확인했으며, vLLM 기반의 백엔드 최적화 작업을 진행 중입니다.

FPGA를 활용하여 LLM 추론에 최적화된 독자적인 AI 가속기 아키텍처를 설계하는 연구 프로젝트를 소개합니다. AMD/Xilinx Alveo U50을 기반으로 특수 양자화 포맷인 DMC3를 적용하여 하드웨어와 알고리즘을 공동 설계합니다.
AI 추론 성능을 결정하는 핵심 요소로 코어 수보다 메모리 대역폭과 통합 RAM의 중요성을 분석합니다. 특히 단일 스트림 디코딩 시 메모리 바운드 특성과 MoE 모델에서의 연산 바운드 변화를 비교 설명합니다.
Nvidia DGX Spark, Strix Halo, M5 Max 환경에서 다양한 GPU 라이브러리와 양자화 포맷을 활용한 LLM 추론 성능을 비교 분석합니다. 각 하드웨어별 지원 포맷과 토큰 생성 속도(tok/s) 데이터를 제공합니다.

GPU 라이브러리 지원과 VRAM 사용량에 따른 파인튜닝의 기술적 한계를 분석합니다. 특히 AMD 및 MLX 환경에서의 VRAM 부족 문제와 대역폭 병목 현상을 다루며, Nvidia의 고대역폭 솔루션이 가진 강점을 설명합니다.

NVIDIA의 Nemotron-3-Ultra 모델과 4x DGX Spark (430 GB Vram) 조합의 성능을 언급하며, 토큰/초(tok/sec) 향상에 대한 계획을 공유하고 있습니다. 또한, 개발 도구를 오픈소스로 공개할 예정임을 밝히고 있습니다.

AKD1000 Brain Chip을 활용한 뉴로모픽 프로세서 연구와 JarvisX 홈 어시스턴트 적용 사례를 소개합니다. TSMC 28nm 공정 기반의 이 칩은 SNN과 CNN을 모두 지원하며, 초저전력 웨이크 워드 인식(KWS) 구현에 최적화되어 있습니다.

TSMC 28nm 공정으로 제작된 AKD1000 뉴로모픽 프로세서에 대한 소개입니다. Cortex-M4 호스트와 80개의 NPU를 탑재하여 SNN과 CNN을 모두 지원합니다.
Atlas 로봇이 50파운드 무게의 미니 냉장고를 운반하는 데 성공했습니다. 이 과정에서 가상 환경을 통해 수백만 시간 동안 동작을 연습했으며, 단순한 손 동작을 넘어 전신을 활용하는 훈련 정책을 적용했습니다.
대형 모델 서빙 시, 70B FP8 모델을 단일 Blackwell GPU에 배포할 경우 약 70GB의 가중치와 26GB의 KV 캐시가 필요합니다. 반면, 4개의 NVIDIA RTX 3090 카드를 사용할 경우 네이티브 FP8 지원이 어려워 AWQ INT4를 사용해야 하며, 이 과정에서 카드 간 텐서 병렬 처리 및 PCIe 동기화가 발생하여 Blackwell 대비 낮은 처리량과 높은 지연 시간을 보입니다.
Qwen3.5-TurboQuant-MLX-LM v0.2 Modernization Preview가 Cursor에서 출시되었으며, 이를 통해 52배의 속도 향상과 추가 50%의 압축을 달성했습니다. 이 모델은 Apple M5 Max / 64 GB 환경에서 Qwen3.5-9B-MLX-4bit를 사용하여 성능이 측정되었습니다.
본 글은 PCIe를 사용하여 여러 개의 GPU(Multi-GPU) 시스템을 구축할 때 발생하는 단점에 대해 다루고 있습니다. 특히, 고성능 단일 GPU(예: RTX Pro 6000) 대신 저가형 또는 구형 GPU를 여러 개 연결하는 클러스터 구성이 성능 면에서 잘못된 결정일 수 있음을 경고합니다.
Nvlink 인프라와 이를 지원하는 GPU가 부족할 경우 클러스터 시스템은 항상 병목 현상을 겪게 됩니다. 이는 DGX Spark에서 지적되는 낮은 대역폭 문제와 관련이 있으며, 특히 장치의 200 GbE QSFP 입력과 전송 대역폭 간의 불일치가 원인으로 언급됩니다.
한국의 WIRobotics가 약 6,800만 달러($68M) 규모의 투자를 유치했습니다. 이 회사는 WIM 웨어러블 로봇과 ALLEX 휴머노이드 플랫폼을 주력으로 하며, 올해 모바일 ALLEX 연구용 플랫폼 공급을 계획하고 있습니다. 궁극적으로는 2027년 말까지 초기 상용화를 목표로 하고 있습니다.
Apple Silicon 환경에서 MLX 생태계를 활용하여 Gemma 4 31B MTP 모델 제품군을 구동할 수 있는 오픈 소스 로컬 API 게이트웨이 프로젝트가 개발되었습니다. 이 프로젝트는 특히 Gemma4-31B-it 모델의 경우 기존 대비 1.42배의 속도 향상을 달성했습니다. 이는 Google의 Gemma 4 제품군과 연계되어 사용될 수 있습니다.
본 기사는 10,313개의 패키지를 분류하는 실시간 패키지 분류(package sorting) 실험의 결과를 다루고 있습니다. 이 과정은 Figure 03에서 처음으로 실행되었으며, 궁극적으로는 휴머노이드 로봇이 배송하는 패키지를 처리할 수 있는 시스템을 목표로 합니다.
AMD 하드웨어에서 학습된 최초의 확산 언어 모델(Diffusion Language Model)인 ZAYA1-8B-Diffusion-Preview를 공개했습니다. 이 모델은 기존 자기회귀(Autoregressive) 방식과 달리 블록 단위의 병렬 생성을 통해 추론 속도를 획기적으로 개선했습니다.
Gemma-4-26B-A4B-NVFP4 모델이 단일 RTX 5090 GPU에서 65k 컨텍스트 길이로 구동되는 것이 확인되었습니다. 또한, 두 개의 별도 RTX 5090을 사용하여 두 개의 모델을 서빙하는 것도 가능함을 보여줍니다. 특히, vLLM을 이용해 64k 컨텍스트 환경에서 단일 RTX 5090으로 구동 시 초당 약 109.89 토큰의 속도를 기록했습니다.
Xynova가 2세대 하이브리드 다재다능한 손인 Flex 2를 출시했으며, 이 제품은 23 DOF, ±0.1mm의 반복 정밀도 등 뛰어난 사양을 자랑합니다. 또한 Xiaomi는 Xynova의 엔젤 및 Pre-A 라운드에 투자하며 전략적 파트너십을 구축하고 있습니다. 이는 Xiaomi가 휴머노이드 로봇이 실제 일상 과업을 수행하는 데 필수적인 핵심 부품 계층(component layer)에 집중적으로 자금을 투입하고 있음을 시사합니다.
Helix-02를 활용하여 인간 수준의 수행 능력을 갖춘 휴머노이드 로봇 팀이 8시간 교대 근무를 자율적으로 수행하는 모습을 보여줍니다. 이 시스템은 소형 패키지 분류라는 특정 사용 사례에 적용되어, 바코드 감지, 패키지 집기, 방향 재설정 등의 작업을 연속적으로 처리합니다.