Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
임베디드 시스템의 안전성을 위해 Systolic Array 기반의 새로운 하드웨어 및 양자화 방식을 제안합니다. MSB를 우선 처리하는 좌측-우측 산술을 통해 실시간 적응형 정밀도 양자화와 결함 주입 공격에 대한 회복탄력성을 동시에 확보합니다.
부채널 공격 방어용 하드웨어 설계를 위해 개발된 오픈 소스 Verilog 시뮬레이터 Vogls를 소개합니다. 기존 시뮬레이터보다 빠르고 정확한 풀-타이밍 시뮬레이션을 지원하며, Python 인터페이스를 통해 효율적인 트레이스 수집이 가능합니다.
상위 수준 명세로부터 FPGA용 효율적인 하드웨어 파서를 자동 생성하는 오픈 소스 도구를 제안합니다. PIR(Parsing Intermediate Representation)을 통해 최적화된 SystemVerilog를 생성하며, 기존 방식 대비 높은 동작 주파수와 적은 리소스 사용량을 달성했습니다.
ExaGEMM은 저비트 GEMM을 위한 CPU 네이티브 탐색 프레임워크를 제시합니다. 이 프레임워크는 레지스터에 상주하는 LUT 실행을 활용하여, 기존 SIMD 데이터 경로가 처리할 수 있는 영역과 추가적으로 필요한 하드웨어(선택/피딩 메커니즘)의 비용을 분석합니다. 이를 통해 시뮬레이션 전에 후보 공간을 효과적으로 가지치기하고 최적화된 ISA 사양 및 커널을 생성하여, LLM 워크로드에서 지연 시간을 크게 개선할 수 있습니다.
본 논문은 웨어러블 기기에서 전력 효율적인 부정맥 탐지 방안을 제시합니다. 기존 DL 모델의 높은 전력 소비 문제를 해결하기 위해 데이터 정밀도 감소 및 근사 곱셈 같은 기술을 적용했습니다. 그 결과, 제안된 아키텍처는 기존 대비 에너지 소비를 크게 줄이면서도 충분한 분류 성능(정확도 93.7%, 민감도 92.1%)을 유지함을 입증했습니다.
본 논문은 엣지 디바이스에서 비디오 확산 모델(VDMs)을 빠르게 구동하기 위한 새로운 알고리즘-하드웨어 공동 설계 아키텍처 CODA를 제안합니다. 기존의 캐싱 기법이 메모리 제한과 연산자 의존성 문제에 직면했던 것을 해결하고자 합니다. CODA는 컴퓨트와 캐시 연산자를 분리하고, 이를 근접 메모리 엔진에 배치하여 속도 및 에너지 효율성을 크게 향상시킵니다.
본 논문은 기존 IMC의 한계점(정적 가중치 및 ADC 의존성)을 극복하기 위해, 비선형 연산을 본질적으로 수행하는 ACAMs 기반의 새로운 FPGA 아키텍처를 제안합니다. 이 아키텍처는 FPGA-aware 탐색과 효율적인 매핑 방식을 통해 DIMM 연산까지 IMC 영역으로 확장했습니다. 그 결과, CNN 및 Transformer 모델에서 높은 에너지/면적 효율성 향상을 입증하며 FPGA DL 추론 성능을 크게 개선했습니다.
Valinor는 물리 메모리 할당 오버헤드를 줄이기 위해 설계된 새로운 아키텍처 지원 시스템입니다. 기존 방식은 작은 페이지 폴트 발생 시 긴 할당 단계와 높은 에너지 소비를 유발했습니다. Valinor는 프로그래밍 가능한 하드웨어 할당 엔진을 도입하여 소프트웨어의 유연성과 하드웨어 수준의 성능을 결합합니다.
최신 딥러닝 워크로드가 요구하는 저정밀도 마이크로 스케일 부동소수점(MXFP) 형식에 대한 FPGA 구현 방안을 연구했습니다. 본 논문은 Altera Agilex-5 FPGA에서 MXFP 내적 구현의 다양한 전략을 분석하고, 텐서 모드의 산술 밀도를 평가합니다.
본 논문은 중성 원자 양자 컴퓨팅(NAQC)의 느린 실행 속도 문제를 해결하기 위해 FPGA 기반 제어 아키텍처인 AtomFlow를 제안합니다. 이 아키텍처는 형광 이미지 분석과 원자 재배열 알고리즘을 단일 Zynq UltraScale+ 장치에 통합하여, 기존 파이프라인의 왕복 지연 시간을 제거하고 스트리밍 방식으로 작동합니다.
본 논문은 자율주행 차량과 같은 Physical AI 시스템을 위해 이기종 엣지 GPU 환경에서 Vision Transformer 모델의 효율적인 배포 방법을 제시합니다. 'Heterogeneous Frame Dispatch Scheduling (H-FraDS)' 방법론을 통해 GPU와 DLA 코어 전반에 걸쳐 프레임을 라우팅하여 활용도를 개선했습니다. 이를 통해 낮은 전력 및 지연 시간 제약 조건 하에서도 높은 처리량과 실시간 작동이 가능함을 입증했습니다.
AMD Ryzen AI NPU 프로그래밍을 위한 시각적 데이터플로우 설계 환경인 IRONSmith를 소개합니다. 이 도구는 사용자가 코딩 없이 인터랙티브 캔버스에서 와이어 연결 블록으로 ML 데이터플로우를 설계할 수 있게 합니다. IRONSmith는 구조적 완성, 종속성 관리 등을 자동 처리하여 AMD Ryzen AI NPU에서 실행 가능한 IRON Python 코드로 변환합니다.
본 논문은 엣지 장치에 DNN 배포 시 필수적인 HW 인식 신경망 구조 탐색(HW-NAS) 과정에서 발생하는 지연 시간 측정의 병목 현상을 해결하는 방법을 제시합니다. 연구진은 그래프 어텐션 네트워크 기반의 고정밀, 저비용 지연 시간 예측기인 HiFi-LLP를 개발했습니다. 이를 통해 NAS 프로세스의 정확도를 높이고 하이브리드 프레임워크를 구축하여 기존 대비 높은 속도 향상을 달성했습니다.
본 기사는 LLM 추론 시 HBM 용량 제약을 극복하기 위한 새로운 공동 설계 시스템인 FlashAccel을 소개합니다. FlashAccel은 HBF(고대역폭 플래시)를 HBM 기반 GPU에 통합하여 접근 지연 시간을 완화하고, 특수 데이터 레이아웃 및 스토리지 관리 계층을 통해 대역폭 활용률과 이기종 자원 관리를 개선했습니다.
본 논문은 대규모 트랜스포머 모델을 저전력 엣지 디바이스에 배포하기 위한 적응형 모델 압축(AMC) 프레임워크를 제안합니다. 이 시스템은 토큰 중요도에 따라 하드웨어 자원을 동적으로 할당하여, 중요한 정보는 고정밀로 처리하고 덜 중요한 데이터는 비트 폭을 줄여 에너지 효율성을 극대화했습니다.
본 논문은 하드웨어 검증의 복잡성 증가에 대응하여 LLM의 의미론적 추론 능력을 활용한 새로운 퍼징 프레임워크인 ChipFuzzer를 제안합니다. ChipFuzzer는 커버리지 가이드와 버그 가이드를 결합한 2단계 워크플로우로, 테스트 케이스 생성 및 우선순위화에 LLM을 적용하여 검증 효율성을 극대화했습니다.
본 논문은 대규모 언어 모델(LLMs)의 메모리 및 연산 요구 증가에 따른 병목 현상을 해결하기 위한 아키텍처 개선 방안인 StreamDQ를 제안합니다. StreamDQ는 HBM 베이스 다이에 DeQuantization Blocks (DQBs)를 통합하여, 온디바이스 디양자화를 인라인으로 수행함으로써 고처리량 LLM 추론 가속을 목표로 합니다.
본 논문은 하드웨어 검증 작업인 논리 동치 검사(LEC)의 성능 저하 문제를 해결하기 위한 miter-aware 매핑 프레임워크를 제안합니다. 이 방법은 기존 넷리스트 대신 LUT 기반의 miter를 구성하여 구조적 대응 관계와 고수준 논리 관계를 명시적으로 보존합니다. 이를 통해 SAT 솔버가 효율적으로 작동하도록 LEC 성능을 크게 향상시킬 수 있음을 입증했습니다.
아날로그 인메모리 컴퓨팅(IMC)을 활용하여 대규모 MIMO 시스템의 비선형 최적화 문제를 해결하는 새로운 아키텍처를 제안합니다. 연속 시간 비선형 폐루프 방식을 통해 물리적 시스템의 동역학 내에서 직접 디코딩 솔루션을 도출하며, 혼합 정밀도 기법으로 하드웨어의 정밀도 한계를 극복합니다.
AIGOR는 다양한 하드웨어 환경에 대응할 수 있는 모듈형 이벤트 기반 뉴로모픽 아키텍처를 제안합니다. 패킷 교환 통신과 매개변수화된 IP 블록을 통해 뉴런 모델과 정밀도를 인스턴스별로 구성할 수 있는 유연성을 제공합니다.