Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
GoldenFloat(GF)은 Lucas-Exact 정수 항등식을 활용하여 GF4부터 GF256까지 확장 가능한 정적 분할 부동 소수점 제품군입니다. RTL 생성기, 정수 기반 누산기 경로, 그리고 FPGA 코덱 구현을 통해 하드웨어 지향적 설계를 제시합니다.
아날로그 인메모리 컴퓨팅(AIMC) 가속기의 효율성을 높이기 위한 이기종 매핑 통합 워크플로우를 제안합니다. DNN 워크로드를 아날로그 타일과 디지털 장치에 최적으로 분할하는 4단계 프로세스를 구축하고 GPT-2 모델을 통해 검증했습니다.
MRAM 기반 인메모리 컴퓨팅의 오류와 처리량 문제를 해결하기 위한 CRAM-ER 아키텍처를 제안합니다. 하드웨어-소프트웨어 공동 설계를 통해 스핀트로닉스 소자의 확률적 오류를 완화하고, 기존 CPU/GPU+HBM 구조보다 뛰어난 에너지 효율과 낮은 지연 시간을 달성했습니다.
ARM 기반 엣지 디바이스에서 Transformer 모델의 효율적인 추론을 위해 ARM Compute Library(ARM-CL) 내 새로운 커널을 구현했습니다. CPU와 GPU를 협력적으로 활용하는 방식을 통해 기존 방식 대비 최대 3배 빠른 속도와 지연 시간 감소를 달성했습니다.
GPU 워크로드에서 발생하는 Dead-entry L2 TLB 미스 현상을 분석하고, 이를 방어하기 위한 DEPOT 메커니즘을 제안합니다. 연구 결과, 특정 워크로드에서 IPC를 최대 72% 향상시키는 효과를 확인했습니다.
OpenEye는 DNN 추론을 위해 설계된 FPGA 기반의 확장 가능한 오픈 소스 하드웨어 가속기입니다. 희소성 인식(sparsity-aware) 기능을 통해 불필요한 계산을 줄이며, 클러스터와 PE 수를 조절하여 다양한 자원 제약에 대응할 수 있는 고도의 파라미터화된 아키텍처를 제공합니다.
NIST 양자 내성 암호 표준 후보인 HQC의 디코딩 과정을 Qualcomm Hexagon NPU(HVX) 환경에 최적화하여 구현하는 연구를 다룹니다. 벡터화된 연산 재설계를 통해 Snapdragon 8 Gen 2 하드웨어에서 에너지 효율을 최대 18.13배 향상시켰습니다.
초저전력 에지 환경에서 Transformer 모델 추론을 가속화하기 위한 MCU인 Chimera를 소개합니다. 22nm FDX 공정 기반의 이 칩은 고대역폭 L2 메모리 서브시스템과 QoS 보장 기능을 통해 지연 시간을 획기적으로 줄였습니다.
FREESS는 RISC-V 기반 슈퍼스칼라 프로세서의 명령어 수준 병렬성(ILP)을 학습할 수 있는 웹 기반 오픈 소스 시뮬레이터입니다. Tomasulo 알고리즘을 활용하여 레지스터 리네이밍부터 커밋까지의 전 과정을 사이클 단위로 상세히 시각화합니다.
SRAM 기반 아날로그 컴퓨팅 인메모리(CIM)의 ADC 오버헤드, 지연 시간, 전압 제한 문제를 해결하기 위한 재구성 가능한 인메모리 매크로를 제안합니다. IMADC, BSCHA, 듀얼 8T 비트셀 기술을 통해 면적 효율성과 연산 속도, 선형성을 크게 개선했습니다.
CKKS 완전 동형 암호(FHE)의 연산 효율을 높이기 위해 ASIC과 NMP의 장점을 결합한 이기종 xPU-xMU 아키텍처인 $HE^2$를 제안합니다. DFG 최적화와 그룹 수준 파이프라인을 통해 이기종 간 통신 병목을 해결하여 성능과 에너지 효율을 대폭 개선했습니다.
3D-IC 및 칩렛 시스템에서 TSV로 인해 발생하는 기판 노이즈가 RF 블록의 스펙트럼 순도에 미치는 영향을 분석합니다. 22nm FD-SOI 공정 기반의 링 VCO를 활용하여 TSV의 기생 결합 경로를 모델링하고 노이즈 주입 영향을 정량화했습니다.
뉴로모픽 하드웨어를 활용하여 생물정보학의 에피스타시스 탐지 문제를 효율적으로 해결하는 상수 깊이 임계값 회로를 제안합니다. LIF 뉴런과 파이프라인 방식을 통해 복잡도 오버헤드 없이 로그-선형 공간 내에서 계산을 수행합니다.
모바일 SoC 환경에서 LLM 추론 시 CPU와 NPU의 성능을 스테이지별로 분석한 연구입니다. 프리필 단계에서는 CPU가, 디코드 단계에서는 NPU의 효율이 제한적임을 밝히고 NPU 설계 가이드라인을 제시합니다.
에이전트형 AI 워크로드의 높은 에너지 소비 문제를 지적하며, NVIDIA의 최신 Edge AI 하드웨어가 프로세스 단위의 에너지 관측 가능성을 지원하지 않는 문제를 분석합니다. 연구 결과, 현재 플랫폼은 CPU 에너지 정보를 노출하지 않아 정밀한 에너지 귀속이 불가능함을 밝히고 표준화된 요구 사항을 제안합니다.
Apple Silicon에서 FP16을 활용한 고성능 FFT 및 SAR 이미징 구현 방법을 제안합니다. 단순 FP16 사용 시 발생하는 오버플로 문제를 Block-Floating-Point(BFP) 스케줄링으로 해결하여, FP32 수준의 품질을 유지하면서도 처리량을 2.2배 향상시켰습니다.
확산 샘플링의 효율성을 높이는 Kuramoto drift를 가속하기 위한 전용 시스톨릭 어레이인 SA-Kura를 제안합니다. 기존 CNN 가속기가 처리하기 어려운 비선형 스텐실 연산을 최적화하여 지연 시간과 에너지 소모를 획기적으로 줄였습니다.
Posit 수 체계를 위한 에너지 효율적인 근사 곱셈-나눗셈 유닛 설계를 제안합니다. LUT와 단일 뺄셈을 활용해 역수를 근사하며, 기존 설계 대비 면적과 전력 지연 곱(PDP)을 획기적으로 개선했습니다.
AGI 경쟁의 핵심 병목인 AI 데이터 센터의 전력 관리 프로세스를 다룹니다. 150MW 규모의 GB200 GPU 클러스터를 대상으로 초기 계획부터 동적 런타임 최적화까지의 엔드 투 엔드 사례를 제시합니다.
zkVM의 성능 병목인 트레이스 생성 단계를 해결하기 위한 이기종 가속기 아키텍처 ZK-Tracer를 제안합니다. 메인 및 병렬 치환 트레이스 유닛을 통해 효율적인 작업 오프로딩을 지원하며, ASIC 구현 결과 CPU 대비 압도적인 성능 향상을 입증했습니다.