Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

중국 AI 개발사 Z.ai가 Nvidia 칩 없이 자국산 칩만으로 구축한 1GW 규모의 대규모 AI 데이터 센터 가동을 시작했습니다. 이 시설은 GLM 모델 학습을 위해 10,000개 이상의 칩을 갖춘 클러스터 여러 개를 운영할 예정입니다.
AMD Ryzen AI Halo 장치의 LED 제어를 위한 'amd_halo_led' 드라이버가 Linux 7.3 커널에 도입될 예정입니다. 이 드라이버를 통해 사용자는 LED의 온/오프는 물론 색상과 밝기까지 조절할 수 있게 됩니다.
RAG의 병목 현상인 밀집 벡터 검색을 해결하기 위해 하드웨어-소프트웨어 공동 설계된 인-스토리지 가속기 D-NOVA를 제안합니다. NAND 메모리 내부에 검색 기능을 직접 통합하여 데이터 이동을 최소화하고 에너지 효율을 극대화했습니다.
AI 모델의 의도를 제어하기 위해 하드웨어 수준에서 성능을 동적으로 제한하는 새로운 마이크로아키텍처 메커니즘을 제안합니다. L2 캐시 및 공유 메모리 포트 제어를 통해 소프트웨어 보안 우회를 방지하는 최후의 방어선을 구축합니다.

SMIC의 3세대 7nm(N+3) 공정이 EUV 없이도 Intel 18A보다 작은 금속 피치와 TSMC N6보다 높은 트랜지스터 밀도를 기록했다는 분석 결과가 나왔습니다. 하지만 세부 지표의 부재로 인해 Intel이나 TSMC의 차세대 공정과 직접적인 경쟁력을 완전히 비교하기에는 한계가 있습니다.

Google이 Gemini 모델 아키텍처를 실리콘에 직접 구현한 'Frozen v2' 서버용 칩을 개발 중입니다. 이 칩은 기존 TPU보다 전력 효율을 6~10배 높여 AI 컴퓨팅 부족 문제를 해결하는 것을 목표로 합니다.
AMD가 Zen 6 프로세서의 성능 모니터링 및 프로파일링 강화를 위해 EILVT 레지스터를 기존 4개에서 8개로 확장할 계획입니다. 이를 지원하기 위해 Linux 커널에서 레지스터 수를 동적으로 추적하는 패치 작업이 진행 중입니다.

LLM 아키텍처의 변화 속도와 효율성을 중심으로 ASIC 하드웨어의 중요성과 SaaS 기업의 위기론을 분석합니다. 모델 성능이 상향 평준화됨에 따라 GPU를 넘어선 맞춤형 칩(ASIC)과 로컬 구동 환경이 미래 AI 생태계의 핵심이 될 것으로 전망합니다.
Intel GPU의 하드웨어 오류를 해결하기 위해 Linux 커널에 Cold Reset Recovery 기능이 도입되었습니다. 시스템 전체 재부팅 없이도 전원 사이클을 통해 장치 상태를 초기화하고 복구할 수 있는 메커니즘을 제공합니다.

OpenAI와 Broadcom이 추론(Inference) 특화 ASIC인 Jalapeño 칩을 공개했습니다. 이 칩은 모델 학습이 아닌 답변 출력 작업의 효율성을 높이기 위한 것이며, Nvidia GPU에 대한 의존도를 일부 낮추려는 전략적 시도로 분석됩니다.

휴머노이드 로봇의 핵심 과제는 제한된 배터리 에너지 내에서 지능과 구동 사이의 균형을 맞추는 '줄 전쟁(Joule Wars)'입니다. 에너지 효율이 단순한 비용 문제를 넘어 로봇의 설계 제약 조건이 됨에 따라, 모델 경량화와 효율적인 NPU 설계가 미래 로보틱스의 승패를 결정할 것입니다.

Colibri라는 단일 C 파일 기반 엔진을 통해 25GB RAM 노트북에서 744B 파라미터의 GLM-5.2 MoE 모델을 실행하는 데 성공했습니다. MoE 구조의 특성을 활용해 토큰당 활성화되는 파라미터만 스트리밍하는 방식으로 대규모 모델의 로컬 추론 가능성을 증명했습니다.
Microsoft가 Azure 클라우드에 AMD의 Helios 랙 스케일 AI 가속기를 대규모로 배포할 예정입니다. Radeon Instinct MI455X GPU와 Epyc Venice CPU를 기반으로 하며, 이를 통해 Nvidia에 대한 의존도를 낮추고 공급망 다각화를 추진합니다.
B200급 장치 사용자를 위해 CUDA v12 프리셋에 연산 능력(compute capability) 10.0을 추가합니다. 이를 통해 CUDA v13 최소 요구 사항을 충족하지 않는 드라이버 환경에서도 cuda_v12 백엔드를 사용할 수 있습니다.

NVIDIA DGX Spark 환경에서 Qwen3.5 모델을 대상으로 N-Gram, MTP, EAGLE3, DFlash 등 네 가지 추측적 디코딩(Speculative Decoding) 기법을 벤치마킹했습니다. LLM 추론의 메모리 대역폭 병목 현상을 해결하기 위한 최적화 방안과 각 기법의 성능 특성을 분석합니다.

Cerebras 하드웨어에서 GPT-5.6 Sol이 750 token/s의 속도를 기록했다는 주장이 제기되었습니다. 하지만 해당 모델의 공식 출시나 구체적인 벤치마크 데이터는 확인되지 않은 상태입니다.
Intel이 Xeon 6 및 Xeon 6+ 서버를 위한 메모리 옵션 확대를 발표했습니다. 2027년 초 2세대 MRDIMM 지원을 통해 대역폭을 높이고, 8월 중 BIOS 업데이트로 8000 MT/s RDIMM 지원을 활성화할 예정입니다.

MSI가 Computex에서 차세대 AMD EPYC Venice 플랫폼을 지원하는 CD182-S6091-X2 (DLC) 서버 노드를 공개했습니다. 이 시스템은 고밀도 설계를 위해 직접 액체 냉각(DLC) 기술을 채택한 것이 특징입니다.
RTX GPU 환경에서 FlashAttention-3/4의 최적화 기술 적용 가능성을 실험한 결과, 소비자용 GPU에서는 FA-2가 성능 한계치임을 확인했습니다. FA-3의 핵심인 WGMMA 명령어 부재와 RTX 5090의 텐서 코어 제한 특성으로 인해 최신 최적화 기법들이 유의미한 성능 향상을 이끌어내지 못했습니다.
NVIDIA는 AI 계산 수요의 중심이 사전 학습에서 지속적인 포스트 트레이닝으로 이동하고 있다고 선언했습니다. 차세대 Vera Rubin 플랫폼은 Blackwell 대비 GPU 효율을 4배 높이면서도, 에이전틱 워크로드의 무한 루프를 통해 전체 계산 수요를 더욱 확대할 전망입니다.