Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Figure AI는 시각, 언어, 행동을 통합한 대규모 행동 모델(LAM) 'Helix'를 기반으로 범용 휴머노이드 로봇을 개발하는 기업입니다. OpenAI, NVIDIA, BMW 등과의 파트너십을 통해 기술력을 입증하며 제조 및 로보틱스 분야의 혁신을 주도하고 있습니다.
AI 추론의 중심이 클라우드에서 스마트폰, 자동차 등 로컬 기기로 이동하는 Edge AI 패러다임의 전환을 설명합니다. 지연 시간 감소, 개인정보 보호, 신뢰성 확보를 위해 NPU와 모델 압축 기술이 핵심 동력으로 작용하고 있습니다.
RTX 4090과 RTX 5060 Ti를 조합한 듀얼 GPU 환경에서 llama.cpp를 활용한 LLM 추론 성능 벤치마크 결과입니다. 35B-A3B 모델에서 최대 206 t/s, 122B 모델에서도 시스템 RAM 활용을 통해 37-41 t/s의 높은 속도를 달성했습니다.

휴머노이드 로봇의 핵심 관건은 걷는 기술보다 액추에이터의 가격과 물량 확보에 있습니다. 한국의 로보티즈, 에스피지, 삼현 등 부품사들이 액추에이터 양산 및 기술 경쟁을 통해 시장 진입을 본격화하고 있습니다.
LLM 서빙의 에너지 효율을 높이기 위해 차세대 M3D 메모리 기술을 활용한 교차 계층 시뮬레이션 프레임워크 LLMET을 제안합니다. 연구 결과, 온칩 캐시 용량을 확장함으로써 데이터 이동을 줄여 GPU 환경 및 엣지 플랫폼에서 상당한 에너지 절감 효과를 거둘 수 있음을 입증했습니다.
2.8T 파라미터 규모의 Kimi K3 모델을 Mac Studio에서 구동할 수 있도록 최적화한 사례를 소개합니다. 스트리밍 컨버터와 REAP 프루닝 기술을 통해 모델 용량을 1.6TB에서 350GB로 압축하여 Apple Silicon 환경에서 실행 가능하게 만들었습니다.

Nvidia의 Vera Rubin 아키텍처는 단순 연산 성능(FLOPS)을 넘어 시스템 수준의 AI 인프라 성능에 집중합니다. 메모리 대역폭과 상호 연결 패브릭을 개선하여 대규모 모델 학습의 병목 현상인 데이터 이동 문제를 해결하고자 합니다.
클라우드 기반 AI에서 온디바이스 AI로의 패러다임 전환을 다룹니다. NPU 성능 향상을 통해 지연 시간을 줄이고 개인정보 보호를 강화하며, 최신 모바일 칩셋의 기술적 진보를 설명합니다.
Linux 7.3에 Intel Xe3 Panther Lake 그래픽을 위한 'Peak Bandwidth Threshold' 기능이 추가되었습니다. 이 기능은 디스플레이 대역폭 요구사항이 낮을 때 패브릭 주파수를 낮추어 전력을 절감합니다.
AI 산업의 급격한 성장으로 인해 데이터 센터의 전력 수요가 기하급수적으로 증가하며 전력망 및 인프라 병목 현상이 심화되고 있습니다. GPU 공급망과 제조 시설 확충에도 불구하고, 전력 공급과 칩 생산 리드 타임의 장기화가 AI 하드웨어 확장의 주요 과제로 부상했습니다.

CPU와 GPU의 설계 철학 차이를 통해 CUDA의 작동 원리를 설명합니다. 지연 시간 최적화된 CPU와 달리, GPU는 대규모 병렬 연산에 최적화된 구조를 가짐을 다룹니다.

Seagate가 2027년 말 50TB 용량의 HDD 인증을 시작하고 2028년 출하할 계획이라고 발표했습니다. AI 및 클라우드 수요 급증으로 인해 2028년 물량까지 이미 매진된 상태입니다.

CPU 환경에서 디코딩 속도는 전체 파라미터가 아닌 토큰당 활성 파라미터에 의해 결정된다는 이론을 제시합니다. MoE(Mixture of Experts)나 ternary weights를 활용해 모델 용량을 키워도 속도 저하 없이 확장 가능한 아키텍처 설계 가능성을 논합니다.

Lenovo가 AI 서버 수요 폭증에 대응하기 위해 미국 노스캐롤라이나주 휘셋 시설의 제조 라인을 대폭 확장했습니다. 이번 투자를 통해 생산 면적을 두 배로 늘리고 현지 인프라 및 R&D 역량을 강화하여 고객에게 신뢰할 수 있는 AI 인프라를 제공할 계획입니다.
MDTransformer는 모드 분할 광학 기술을 활용하여 트랜스포머 추론을 가속화하는 새로운 하드웨어-소프트웨어 공동 설계 방식입니다. 역설계된 광학 텐서 코어를 통해 기존 광학 가속기 대비 면적, 전력 및 에너지 효율을 획기적으로 개선했습니다.
벡터 프로세서에서 Transformer 추론 성능을 극대화하기 위한 Ventaglio 아키텍처를 제안합니다. RVV ISA 확장을 통해 희소 텐서 수축을 Roofline 성능 한계치까지 끌어올려 LLaMA-3-8B 모델의 추론 속도를 크게 향상시켰습니다.
65nm 단일 폴리 플로팅 게이트 아날로그 인메모리 컴퓨팅에서 발생하는 데이터 유지 손실 문제를 회로 및 알고리즘 수준의 기술로 완화하는 연구입니다. 실험 결과, 프로그래밍 60일 후에도 추론 정확도를 기준치 대비 2-4% 이내로 유지할 수 있음을 입증했습니다.

GPU Solutions라는 서비스 업체가 RTX 2080 Ti의 VRAM을 11GB에서 22GB로 업그레이드해 주는 서비스를 제공합니다. 이 서비스는 하드웨어 모딩을 통해 메모리 용량을 확장하며, 새로운 BIOS 지원을 포함합니다.

Intel, Qualcomm, Apple, AMD의 최신 노트북을 대상으로 전원 연결 여부에 따른 성능 변화를 비교 테스트했습니다. 테스트 결과 Apple과 Intel은 배터리 상태에서도 일관된 성능을 보였으나, AMD 기반 시스템은 전원 차단 시 성능 저하가 두드러졌습니다.

Intel의 Panther Lake 아키텍처를 탑재한 MSI Cubi NUC AI+ 3MG 미니 PC 리뷰입니다. 컴팩트한 디자인과 강력한 Core Ultra 프로세서 성능, 그리고 사용자 편의를 고려한 외부 전원 스위치 등의 특징을 다룹니다.