Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
PolySim은 CiM(Compute-in-Memory) 하드웨어에서 확률적 임베딩을 효율적으로 처리하기 위한 결정론적 다항식 대리 모델 프레임워크입니다. 몬테카를로 샘플링 대신 저차 다항식 기저를 사용하여 확률적 정보를 보존하면서도 단일 행렬-벡터 곱셈으로 추론이 가능하게 합니다.
칩렛 기반 AI SoC의 신뢰성을 높이기 위해 기존 KGD 선별 방식을 넘어선 KGRD(Known Good Reliable Die) 선별 방법론을 제안합니다. 베이지안 확률 모델과 제약된 추론을 통해 조립 전 데이터를 바탕으로 조립 후의 고장 가능성을 예측하고 보증하는 연구입니다.
유연 소자(FE) 내 혼성 신호 회로 테스트를 위한 분산 지연 기반 BIST 프레임워크를 제안합니다. IGZO-TFT 기반의 링 발진기와 VCO를 활용하여 기존 설계 대비 면적과 전력을 획기적으로 줄였습니다.
RAG의 병목 현상인 밀집 벡터 검색을 해결하기 위해 하드웨어-소프트웨어 공동 설계된 인-스토리지 가속기 D-NOVA를 제안합니다. NAND 메모리 내부에 검색 기능을 직접 통합하여 데이터 이동을 최소화하고 에너지 효율을 극대화했습니다.
AI 모델의 의도를 제어하기 위해 하드웨어 수준에서 성능을 동적으로 제한하는 새로운 마이크로아키텍처 메커니즘을 제안합니다. L2 캐시 및 공유 메모리 포트 제어를 통해 소프트웨어 보안 우회를 방지하는 최후의 방어선을 구축합니다.
OpenROAD 프로젝트의 일부로 개발된 ORRAM은 표준 셀을 활용하여 RAM 블록을 생성하는 통합 메모리 생성기입니다. PDK에 종속되지 않고 사용자 정의 비트셀 없이도 배치 및 라우팅이 완료된 RAM을 생성하여 ASIC 설계 흐름을 최적화합니다.
임베디드 시스템의 안전성을 위해 Systolic Array 기반의 새로운 하드웨어 및 양자화 방식을 제안합니다. MSB를 우선 처리하는 좌측-우측 산술을 통해 실시간 적응형 정밀도 양자화와 결함 주입 공격에 대한 회복탄력성을 동시에 확보합니다.
부채널 공격 방어용 하드웨어 설계를 위해 개발된 오픈 소스 Verilog 시뮬레이터 Vogls를 소개합니다. 기존 시뮬레이터보다 빠르고 정확한 풀-타이밍 시뮬레이션을 지원하며, Python 인터페이스를 통해 효율적인 트레이스 수집이 가능합니다.
상위 수준 명세로부터 FPGA용 효율적인 하드웨어 파서를 자동 생성하는 오픈 소스 도구를 제안합니다. PIR(Parsing Intermediate Representation)을 통해 최적화된 SystemVerilog를 생성하며, 기존 방식 대비 높은 동작 주파수와 적은 리소스 사용량을 달성했습니다.
ExaGEMM은 저비트 GEMM을 위한 CPU 네이티브 탐색 프레임워크를 제시합니다. 이 프레임워크는 레지스터에 상주하는 LUT 실행을 활용하여, 기존 SIMD 데이터 경로가 처리할 수 있는 영역과 추가적으로 필요한 하드웨어(선택/피딩 메커니즘)의 비용을 분석합니다. 이를 통해 시뮬레이션 전에 후보 공간을 효과적으로 가지치기하고 최적화된 ISA 사양 및 커널을 생성하여, LLM 워크로드에서 지연 시간을 크게 개선할 수 있습니다.
본 논문은 웨어러블 기기에서 전력 효율적인 부정맥 탐지 방안을 제시합니다. 기존 DL 모델의 높은 전력 소비 문제를 해결하기 위해 데이터 정밀도 감소 및 근사 곱셈 같은 기술을 적용했습니다. 그 결과, 제안된 아키텍처는 기존 대비 에너지 소비를 크게 줄이면서도 충분한 분류 성능(정확도 93.7%, 민감도 92.1%)을 유지함을 입증했습니다.
본 논문은 엣지 디바이스에서 비디오 확산 모델(VDMs)을 빠르게 구동하기 위한 새로운 알고리즘-하드웨어 공동 설계 아키텍처 CODA를 제안합니다. 기존의 캐싱 기법이 메모리 제한과 연산자 의존성 문제에 직면했던 것을 해결하고자 합니다. CODA는 컴퓨트와 캐시 연산자를 분리하고, 이를 근접 메모리 엔진에 배치하여 속도 및 에너지 효율성을 크게 향상시킵니다.
본 논문은 기존 IMC의 한계점(정적 가중치 및 ADC 의존성)을 극복하기 위해, 비선형 연산을 본질적으로 수행하는 ACAMs 기반의 새로운 FPGA 아키텍처를 제안합니다. 이 아키텍처는 FPGA-aware 탐색과 효율적인 매핑 방식을 통해 DIMM 연산까지 IMC 영역으로 확장했습니다. 그 결과, CNN 및 Transformer 모델에서 높은 에너지/면적 효율성 향상을 입증하며 FPGA DL 추론 성능을 크게 개선했습니다.
Valinor는 물리 메모리 할당 오버헤드를 줄이기 위해 설계된 새로운 아키텍처 지원 시스템입니다. 기존 방식은 작은 페이지 폴트 발생 시 긴 할당 단계와 높은 에너지 소비를 유발했습니다. Valinor는 프로그래밍 가능한 하드웨어 할당 엔진을 도입하여 소프트웨어의 유연성과 하드웨어 수준의 성능을 결합합니다.
최신 딥러닝 워크로드가 요구하는 저정밀도 마이크로 스케일 부동소수점(MXFP) 형식에 대한 FPGA 구현 방안을 연구했습니다. 본 논문은 Altera Agilex-5 FPGA에서 MXFP 내적 구현의 다양한 전략을 분석하고, 텐서 모드의 산술 밀도를 평가합니다.
본 논문은 중성 원자 양자 컴퓨팅(NAQC)의 느린 실행 속도 문제를 해결하기 위해 FPGA 기반 제어 아키텍처인 AtomFlow를 제안합니다. 이 아키텍처는 형광 이미지 분석과 원자 재배열 알고리즘을 단일 Zynq UltraScale+ 장치에 통합하여, 기존 파이프라인의 왕복 지연 시간을 제거하고 스트리밍 방식으로 작동합니다.
본 논문은 자율주행 차량과 같은 Physical AI 시스템을 위해 이기종 엣지 GPU 환경에서 Vision Transformer 모델의 효율적인 배포 방법을 제시합니다. 'Heterogeneous Frame Dispatch Scheduling (H-FraDS)' 방법론을 통해 GPU와 DLA 코어 전반에 걸쳐 프레임을 라우팅하여 활용도를 개선했습니다. 이를 통해 낮은 전력 및 지연 시간 제약 조건 하에서도 높은 처리량과 실시간 작동이 가능함을 입증했습니다.
AMD Ryzen AI NPU 프로그래밍을 위한 시각적 데이터플로우 설계 환경인 IRONSmith를 소개합니다. 이 도구는 사용자가 코딩 없이 인터랙티브 캔버스에서 와이어 연결 블록으로 ML 데이터플로우를 설계할 수 있게 합니다. IRONSmith는 구조적 완성, 종속성 관리 등을 자동 처리하여 AMD Ryzen AI NPU에서 실행 가능한 IRON Python 코드로 변환합니다.
본 논문은 엣지 장치에 DNN 배포 시 필수적인 HW 인식 신경망 구조 탐색(HW-NAS) 과정에서 발생하는 지연 시간 측정의 병목 현상을 해결하는 방법을 제시합니다. 연구진은 그래프 어텐션 네트워크 기반의 고정밀, 저비용 지연 시간 예측기인 HiFi-LLP를 개발했습니다. 이를 통해 NAS 프로세스의 정확도를 높이고 하이브리드 프레임워크를 구축하여 기존 대비 높은 속도 향상을 달성했습니다.
본 기사는 LLM 추론 시 HBM 용량 제약을 극복하기 위한 새로운 공동 설계 시스템인 FlashAccel을 소개합니다. FlashAccel은 HBF(고대역폭 플래시)를 HBM 기반 GPU에 통합하여 접근 지연 시간을 완화하고, 특수 데이터 레이아웃 및 스토리지 관리 계층을 통해 대역폭 활용률과 이기종 자원 관리를 개선했습니다.