Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 대규모 언어 모델(LLM)과 자율 시스템 등에서 중요성이 커지고 있는 신경-기호 AI (Neuro-Symbolic AI)의 하드웨어 구현 한계를 극복하기 위한 새로운 통합 아키텍처 'Overmind'를 제안합니다. Overmind는 비선형 활성화 함수에 Padé 근사(Padé approximations) 기법을 적용하고, 비용이 많이 드는 온칩 캐시를 우회하는 사전 예방적 메모리 바이패스(preemptive memory bypass) 기능을 도입했습니다. 이를 통해 기존 플랫폼의 높은 전력 소모와 낮은 효율성 문제를 해결

ChatGPT 이후 AI 붐을 주도하는 데이터센터 인프라 구축으로 인해 DRAM과 플래시 메모리 수요가 공급을 크게 초과하며 가격이 급등하고 있습니다. 특히 HBM(High Bandwidth Memory)은 서버의 필수 구성 요소로 자리 잡았으며, 플래시는 AI 슈퍼컴퓨팅 아키텍처에서 G3(노드 레벨) 및 G4(네트워크 스토리지) 등 계층적 스토리지를 담당하며 핵심적인 역할을 수행합니다. 이러한 수요 급증 추세는 메모리 제조사들에게 높은 수익성을 가져다주고 있습니다.
LLM을 활용한 레지스터 전송 레벨(RTL) 하드웨어 설계는 가능성을 보여주었으나, 단일 생성 방식으로는 기능적 정확성과 전력 효율성 최적화가 어렵습니다. 본 논문은 시뮬레이티드 어닐링 (Simulated Annealing) 기반의 제어 프레임워크인 HYPERHEURIST를 제안합니다. 이 시스템은 LLM이 생성한 RTL을 최종 결과물이 아닌 중간 후보군으로 간주하고, 기능 검증(compilation, structural checks, simulation)을 거친 후 PPA (Power-Performance-Area) 최적화를 단계

본 글은 메타 플랫폼스(Meta Platforms)가 대규모 AI 시스템 구축 과정에서 겪는 컴퓨팅 자원 확보의 어려움과 그에 따른 엔비디아(Nvidia) 의존도 변화를 분석합니다. 과거에는 자체 개발한 Open Compute Project (OCP) 설계를 포기하고 엔비디아의 GPU 및 인프라 솔루션을 대규모로 도입해왔습니다. 최근 메타는 MTIA v2 추론 가속기나 AMD와의 협력을 통해 독립성을 확보하려 노력하지만, 결국 이번 거래에서는 다시 엔비디아의 Blackwell 및 Rubin GPU를 구매하고 자사 네트워크 OS(FB
본 연구는 LLM 기반 에이전트가 수행하는 하드웨어 검증(Hardware Verification)의 효율성 한계를 체계적으로 분석합니다. 기존 방식들이 커버리지 갭을 단순히 채우는 데 그쳤다면, 본 프레임워크는 '방법론적 한계'와 '추론적 경계'를 구분하여 근본적인 난이도를 식별합니다. 특히 시스템의 토큰 사용량을 6가지 범주로 추적하고 도메인 특화(domain-specialized) 에이전트를 적용함으로써, 일반 목적 LLM 대비 최대 13배 적은 토큰과 2~4배 빠른 속도로 높은 커버리지(95-99%)를 달성함을 입증했습니다.

스타트업 Taalas는 기존 컴퓨팅 아키텍처의 한계를 극복하기 위해 AI 모델의 가중치(weights)를 칩 트랜지스터 자체에 직접 '각인(etch)'하는 혁신적인 방식을 제시합니다. 이는 소프트웨어 의존성을 제거하고, 메모리와 연산 장치 간의 물리적 경계(memory wall)를 근본적으로 해소하여 AI 추론 속도와 밀도를 극대화합니다. Taalas는 마스크 ROM (mask ROM)과 SRAM을 결합한 아키텍처를 통해 80억 개 이상의 파라미터를 온칩에 구현하며, 기존 GPU/XPU 대비 압도적인 효율성을 목표로 합니다.
본 논문은 제조 과정의 고유한 변동성을 활용하는 SRAM 물리적 비식별 함수(PUF)를 이용해 제한된 산업용 사물인터넷(IIoT) 장치에 대한 임계값 기반 인증 방안을 제시합니다. 특히, 기존 SRAM PUF가 가진 신뢰성 문제를 Hamming 코드 (HC) 오류 정정 (EC)과 시간적 다수결 투표 (TMV)의 효율적인 조합으로 해결했습니다. 이 접근 방식은 인증 후 비트 오류율(BER)을 1% 미만으로 안정적으로 유지할 수 있게 합니다. 또한, 신뢰성과 보안 제약 조건 사이의 '임계값 간극'을 설계 예산으로 재정의하여, 자원 효율

로봇 공학(Robotics)을 포함하는 물리적 AI (Physical AI)가 현실 세계에 배치되면서 기존의 클라우드 인프라로는 더 이상 스케일업이 불가능해졌습니다. Physical AI는 LLM처럼 인터넷 텍스트 데이터가 아닌, LiDAR, 비디오, 센서 스트림 등 환경 특화된 멀티모달 데이터를 요구합니다. 따라서 물리적 AI를 지원하는 인프라는 ① 대규모 시뮬레이션과 학습을 위한 GPU 클러스터 최적화, ② 노이즈가 많고 시간 민감한 데이터의 자동화된 색인화 및 쿼리 시스템, ③ 실시간 반응(밀리초)을 보장하는 고대역폭 데이터/
LLM을 엣지 디바이스에 배포할 때 발생하는 자원 제약 문제를 해결하기 위해, 본 논문은 메모리 내 연산(Compute-in-Memory, CIM) 기반의 어텐션 가속기 'CIMple'을 제안합니다. 기존 CIM 구조가 정적 MAC 연산만 지원하여 비선형 연산 구현에 한계가 있었던 문제를 해결하고자 했습니다. CIMple은 8비트 병렬 가중치 피딩과 LUT(Look-Up Table) 기반의 고정 소수점 분할 소프트맥스(split softmax)를 도입하여, 트랜스포머 모델의 핵심인 셀프 어텐션 연산을 효율적으로 처리합니다. 28nm
EquivFusion은 고수준의 알고리즘 모델(PyTorch, C/C++)부터 저수준 하드웨어 넷리스트까지 이질적인 추상화 레벨 간의 기능적 일관성을 검증하는 통합 도구입니다. 기존 방식처럼 파편화된 도구를 사용하는 대신, MLIR 기반의 검증 지향적인 (verification-oriented) 로어링(lowering) 파이프라인을 활용하여 다양한 입력 포맷을 공통 중간 표현(Intermediate Representation, IR)으로 통일합니다. 이를 통해 SMT-LIB, BTOR2, AIGER와 같은 표준 형식으로 자동 변환된

본 글은 현재 수백~수만 큐비트 수준에 머무는 개별 양자 컴퓨터를 '양자 네트워크 스위치'를 통해 연결하여 거대한 분산형 양자 컴퓨팅 시스템으로 확장하는 Cisco의 비전을 다룹니다. Cisco는 Universal Quantum Switch라는 프로토타입을 공개하며, 서로 다른 방식(Superconducting, Neutral Atom, Trapped Ion 등)으로 작동하는 다양한 벤더의 양자 시스템들을 하나의 네트워크로 통합할 수 있음을 입증했습니다. 이는 단일 대형 시스템 구축 대신 'Scale Out' 방식을 채택하여, 궁극
본 논문은 급증하는 에이전트 기반 LLM 워크로드의 요구사항(용량 및 대역폭)을 충족하기 위해, 이종 가속기 시스템에 최적화된 메모리 아키텍처를 설계하는 방법론 'MemExplorer'를 제안합니다. MemExplorer는 온칩 SRAM부터 HBM, LPDDR 등 다양한 계층의 메모리 기술을 통합적으로 모델링할 수 있는 통일된 추상화를 제공하며, NPU 디자인(예: 행렬 엔진 크기)과 메모리 시스템 설계를 동시에 최적화합니다. 실험 결과에 따르면, MemExplorer는 에이전트 워크로드 전반에서 기존 NPU 대비 최대 2.3배의,

본 기사는 AMD가 개발 중인 'Helios' 랙 기반의 차세대 AI 컴퓨팅 플랫폼과 MI400 시리즈 GPU에 대한 최신 정보를 다룹니다. AMD는 이 시스템이 Meta Platforms와 Open Rack Wide v3 사양을 기반으로 하며, MI455X UALoE72 시스템의 엔지니어링 샘플은 2026년 하반기(H2 2026)에, 양산은 2027년 2분기(Q2 2027)에 순차적으로 출시될 예정이라고 밝혔습니다. AMD는 과거 제기되었던 열 설계 문제(thermal issue) 루머를 일축하며, 이미 충분한 테스트와 시뮬레이션
본 논문은 슈퍼컴퓨터와 데이터센터의 핵심 요소인 상호연결 네트워크(interconnection network)가 직면하는 통신 병목 현상을 다룹니다. 특히, 고성능 컴퓨팅(HPC), 딥러닝 학습 등 실제 애플리케이션에서 발생하는 복잡한 트래픽 패턴으로 인한 혼잡(congestion) 문제를 해결하기 위한 방법론을 제시합니다. 기존의 VEF Traces 프레임워크를 확장하여, NEST, GROMACS, LAMMPS, PATMOS와 같은 대표적인 과학 계산 프로그램들을 여러 슈퍼컴퓨터에서 실행한 실제 데이터를 분석했습니다. 이를 통해,

대규모 AI 모델 학습 비용을 단순히 'GPU 시간당 가격'으로 산정하는 것은 잘못된 접근 방식입니다. 수백만 달러에 달하는 학습 과정의 총소유비용(TCO)은 클러스터의 효율성, 가동 중단 시간(downtime), 그리고 인프라가 제공하는 최적화 수준에 의해 결정됩니다. GPU 활용률이 100%가 아니며, 체크포인팅 오버헤드와 장애 복구 시간이 비용에 큰 영향을 미칩니다. 따라서 단순히 가격을 비교하기보다, 고성능 네트워킹, 높은 신뢰성, 그리고 자동화된 복구 기능을 갖춘 인프라의 효율성을 평가하는 것이 핵심입니다.
최근 출시된 인텔 와일드캣 레이크(Wildcat Lake) CPU가 탑재된 노트북이 실제 환경에서 포착되었습니다. 이 기기는 맥북 네오와 경쟁할 목적으로 설계되었으며, 알루미늄 섀시와 함께 최대 11W의 팬리스 모드를 지원하는 것이 특징입니다. 와일드캣 레이크는 PL1(17W) 및 팬리스 모드(11W), 그리고 PL2(35W) 등 다양한 전력 설정을 통해 성능과 효율성을 모두 잡으려는 전략을 보여줍니다.

VMware를 인수한 Broadcom은 시장 변화에 대응하여 '프라이빗 클라우드'를 미래 핵심 동력으로 제시하고 있습니다. 특히, AI 워크로드 증가로 인한 하드웨어 공급난 시대에 소프트웨어 기반의 현대적인 프라이빗 클라우드 구축을 강조합니다. 이들은 VMware Cloud Foundation (VCF)을 중심으로 쿠버네티스(Kubernetes) 기능을 확장하며, VKS 3.6 버전 출시를 통해 다중 클러스터 관리, 다양한 OS 지원(RHEL 9 등), 그리고 CNCF 오픈소스 서비스를 통합하여 엔터프라이즈 고객의 요구에 대응하고,

본 리뷰는 게이밍 시장을 겨냥한 외장 하드 드라이브인 Seagate FireCuda X Vault 8TB를 심층 분석합니다. 이 제품은 단일 USB-C 케이블로 전원과 데이터를 모두 공급하며, RGB 조명 기능과 2년간의 데이터 복구 서비스가 장점입니다. 실제 테스트에서 쓰기 속도는 약 200 MB/s에 그쳐 최신 SSD와 비교하면 느리지만, Sandisk Desk Drive (8TB 기준 $740) 대비 MSRP $269로 가격 경쟁력이 높습니다. 단일 USB-C 전원 공급이 가능해 편리하지만, 15W 이상의 전력을 요구하며 크기

본 기사는 엔비디아가 GPU 중심의 이미지를 넘어선 '플랫폼 기업'으로서의 가치를 강조하며, 최신 AI 인퍼런스 성능 기록을 발표했습니다. 특히 CUDA 플랫폼과 Grace Blackwell 같은 컴퓨트 복합체(compute complexes)를 기반으로 소프트웨어와 하드웨어를 결합한 코디자인 전략이 핵심 동력임을 역설합니다. MLPerf Inference v6.0 벤치마크에서 DeepSeek-R1, GPT-OSS-120B 등 최신 워크로드를 테스트하며 토큰 생성 속도(token generation)와 시간 단축을 입증했습니다. 엔

영국 정부 통신 본부(GCHQ)가 국가 사이버 보안 센터(NCSC)를 통해 'SilentGlass'라는 새로운 하드웨어 장치를 공개했습니다. 이 장치는 디스플레이와 PC 간의 HDMI 및 DisplayPort 케이블을 통해 전송되는 악성 트래픽을 차단하는 것이 주 목적입니다. 특히 공공 기관이나 방위 산업체처럼 기밀 정보가 오가는 고위험 환경에서 시스템 보안을 강화하기 위해 설계되었습니다. 비록 일반 사용자에게는 과도한 조치로 보일 수 있으나, 국가 수준의 적대 세력(nation-states)이 노리는 공급망 공격 및 물리적 접근을