Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 TSMC 16 nm FinFET 공정을 기반으로 양의 피드백 부가직(PFAL)을 조사했습니다. 전력-클럭 파형 최적화를 통해, 최소 에너지 동작은 기존 사다리꼴보다 삼각형 형태에 가까워짐을 발견했습니다. 이를 활용하여 설계된 조합 회로는 정적 CMOS 대비 높은 에너지 효율과 낮은 에너지를 달성했습니다.
본 논문은 영지식 증명(ZKPs)의 핵심 요소인 타원 곡선 점 덧셈(PADD) 하드웨어 설계를 최적화하고 탐색하는 프레임워크 'Locus'를 제안합니다. Locus는 임의 타원 곡선 매개변수를 기반으로 PADD의 ASIC 및 FPGA 구현을 자동 생성하여 설계 공간의 체계적인 탐색을 가능하게 합니다. 이를 통해 기존 대비 높은 성능 향상과 면적 감소를 입증했습니다.
본 논문은 아날로그 EML 하드웨어 패브릭의 비용 결정 요인이 계산 능력보다 구성 가능성에 있음을 제시합니다. 특정 연산자(eml)를 구현한 네 개의 양극 접합 기반 패브릭은 디지털 경로 대비 전력 효율성이 높지만, 증폭기 및 비이상성으로 인해 셀당 비용이 매우 높아 경제적이지 않다는 분석을 담고 있습니다.
본 문서는 Diffusion Transformer의 추론 가속기인 WMHA(World Model Hardware Accelerator)를 소개합니다. 이 장치는 지연 시간 최적화를 목표로 하며, 16x16 이중 점 배열과 온라인 softmax 어텐션 파이프라인을 활용하여 FP8 및 BF16 축약 연산을 스트리밍합니다. SystemVerilog로 구현되어 UVM 환경에서 검증되었으며, 기존 대비 MSE를 크게 감소시키는 성능을 입증했습니다.
본 논문은 FPGA 환경에서 양자화된 신경망(QNNs)의 효율적인 배포를 위한 FINNAS 프레임워크를 제안합니다. 이 프레임워크는 MLP 깊이, 너비 및 정밀도 설정을 공동으로 탐색하며, 하드웨어 자원 사용량과 대리 검증 정확도를 기반으로 후보 모델을 순위화합니다. CERNBox 작업에서 테스트된 결과, FINNAS가 기존 설계 대비 높은 정확도와 현저히 낮은 LUT/지연 시간 감소를 달성했습니다.
본 논문은 실시간 다중 스케일 초해상도(SR) 처리를 위해 완전 병렬 구성이 가능한 LUT 기반 가속기인 ScaleLUT를 제안합니다. ScaleLUT는 YUV 도메인의 하드웨어 친화적 전략과 2의 거듭제곱 커널을 결합하여, 기존 대비 메모리 사용량을 줄이고 수용 영역 커버리지를 개선했습니다. Xilinx ZCU102 FPGA에 구현되어 실시간 4K SR을 높은 프레임률로 달성하며 에너지 효율성을 입증했습니다.
본 연구는 엣지 장치의 실시간 워크로드를 위해 고효율적이고 유연한 CGRA를 제안합니다. 핵심은 처리 요소(PEs)에 설정 가능한 MAC 유닛을 통합하여, 단일 사이클 내에서 ADD, MUL, 또는 MAC 연산을 수행할 수 있게 한 것입니다. 이 CGRA는 40nm CMOS 기술로 구현되어 420.6 GOPS/W의 높은 에너지 효율을 달성했습니다.
본 논문은 GPU 기반 컴퓨팅 플랫폼의 비효율성을 해결하기 위해 FastPair라는 새로운 GPU 디코더를 제안합니다. 기존 사전 코딩 방식이 분산 읽기 및 짧은 출력 쓰기로 인해 GPU 하드웨어와 잘 맞지 않는 문제를 개선했습니다. FastPair는 조회 과정을 재구성하고 부분 문자열을 모아 연속적인 출력 쓰기를 수행함으로써 성능을 크게 향상시켰습니다.
본 논문은 Dynamic-vision-sensor (DVS) 카메라의 이벤트를 처리하는 초저지연 그래프 신경망 프로세서 ETHEREAL을 제안합니다. ETHEREAL은 스플라인 컨볼루션 엔진과 공간-시간 캐싱 메커니즘을 통합한 2D/3D 분할 메모리 계층 구조를 갖추고 있습니다. 이를 통해 최신 워크로드에서 이벤트당 1.7μJ의 낮은 에너지 소비와 25.6μs의 초저지연 추론 성능을 달성했습니다.
5단계 소프트 프로세서에서 주변 장치를 아키텍처 레지스터에 직접 매핑하여 명령 없이 센서 값을 읽는 특화 설계 사례를 다룹니다. PWM 채널을 하드웨어로 오프로드하여 소프트웨어의 부담을 줄이고 제어 루프의 효율성을 극대화했습니다.
물리 설계(PD) IP 보호를 위해 Kerckhoffs 원칙을 준수하는 새로운 워터마킹 프레임워크 PDMarks를 제안합니다. 배치, CTS, 라우팅 등 여러 단계에 걸쳐 소유권 증거를 임베딩하여 보안성을 높였습니다.
이기종 DRAM-PIM-GPU 시스템의 LLM 추론 효율성을 높이기 위한 세 가지 핵심 설계 원칙을 제시합니다. 정적 전력 소비의 중요성, 채널 수에 따른 성능 변화, 그리고 시스템 전반의 공동 최적화 필요성을 강조합니다.
FPGA의 부분 재구성(Partial Reconfiguration)을 활용하여 LLM 가속에 필수적인 비선형 함수를 효율적으로 구현하는 PWL 보간 프레임워크를 제안합니다. 이 방식은 하드웨어 면적을 크게 절감하면서도 유연한 연산 지원이 가능함을 입증했습니다.
GPU 가속을 통해 미분 가능한 스위칭 전력 분석 및 최적화를 수행하는 DiffPower 프레임워크를 소개합니다. 바이트코드 표현과 자동 미분을 활용하여 CPU 대비 최대 1,002배 빠른 속도와 높은 정확도를 달성했습니다.
데이터센터 워크로드에서 메모리 대역폭 낭비를 줄이기 위한 새로운 하드웨어-소프트웨어 인터페이스인 Themis를 제안합니다. 소프트웨어가 페이지 수준의 힌트를 제공하여 하드웨어 프리페처의 부정확한 액세스를 필터링함으로써 성능을 최적화합니다.
MNIST 분류에 최적화된 시분할 방식의 SNN 가속기 설계 및 FPGA 구현에 관한 연구입니다. 파이프라인형 판독 모듈과 시분할 스파이크 피딩 메커니즘을 통해 FPGA의 물리적 제약을 극복하고 성능을 크게 향상시켰습니다.
멀티 다이 GPU 시스템에서 발생하는 비균일 네트워크 액세스(NUNA) 문제를 해결하기 위한 새로운 연구를 소개합니다. NUNA 인식 라우팅(NAR)과 배치(NAP) 기술을 통해 GPU 간 통신 지연을 최적화하고 머신러닝 추론 성능을 향상시킵니다.
아날로그 Compute-In-Memory(CIM) 시스템에서 LLM 추론 시 발생하는 하드웨어 노이즈 문제를 해결하기 위한 연구입니다. 중요 토큰은 디지털로 처리하고 대량의 KV 캐시는 아날로그로 처리하는 계층적 보호 전략을 제안합니다.
유연한 전자 공학(FE) 플랫폼을 위해 a-IGZO TFT 기술을 활용한 저전력 PLL 기반 클록 안정화 기술을 제안합니다. 기존 발진기 방식의 전력 소모와 PVT 드리프트 문제를 해결하여, 매우 낮은 전력과 면적으로 안정적인 클록 생성을 가능하게 합니다.
에지 비전 시스템의 전력 및 대역폭 제약을 해결하기 위한 저전력 희소 합성곱 가속기를 제안합니다. IFTA 스케줄링과 비트맵 기반 압축 방식을 통해 연산 효율을 높였으며, 16nm 공정에서 검증되었습니다.