Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 TSMC 16 nm FinFET 공정을 기반으로 양의 피드백 부가직(PFAL)을 조사했습니다. 전력-클럭 파형 최적화를 통해, 최소 에너지 동작은 기존 사다리꼴보다 삼각형 형태에 가까워짐을 발견했습니다. 이를 활용하여 설계된 조합 회로는 정적 CMOS 대비 높은 에너지 효율과 낮은 에너지를 달성했습니다.
본 논문은 고정된 와이어 예산 내에서 트래픽 인식 익스프레스 링크를 추가하는 'Budgeted Express-Mesh'라는 토폴로지-라우팅 공동 설계 방식을 제안합니다. 이 방식은 시뮬레이션 가이드 어닐링을 통해 배치 과정을 개선하며, 최적화된 경로는 높은 부하 처리량과 안정성을 보여줍니다.
본 논문은 LLM 서비스에 필요한 메모리 용량을 해결하기 위해 HBFlex라는 유연 메모리 시스템을 제안합니다. HBFlex는 KV 캐시의 읽기, 쓰기, 회수 과정에 최적화된 조정 기법을 적용하여 HBF의 평면 활용도를 개선했습니다. 이를 통해 기존 대비 높은 처리량 속도 향상을 달성하며 LLM 서비스 효율성을 높입니다.
본 논문은 하드웨어 구성 언어(HCLs)의 효과를 정량적으로 비교합니다. 엣지 Physical-AI 추론의 핵심 블록인 OCP MXFP4 내적을 동일한 고정 디자인에 적용하여, SystemVerilog, Chisel, SpinalHDL 등 여러 HCL과 C++ 기반 HLS를 비교했습니다. 그 결과, HCL들은 면적 및 타이밍 측면에서 수작업 RTL과 유사하거나 우수한 성능을 보였으며, 선택은 QoR보다 생태계 적합성에 달려있음을 제시합니다.
본 연구는 혼성 신호 SoC의 아날로그 핀 방향성이 보안 속성으로 충분히 다루어지지 않는 문제를 지적하며, 데이터 종속적인 회로 오프셋 변조를 이용한 새로운 데이터 유출 공격 클래스를 식별하고 시연했습니다. 이 공격은 명목상 입력 전용 핀을 외부 정보 채널로 전환하여 생체 신호(PPG) AFE에서 최대 10kbps의 비트율로 데이터를 유출할 수 있음을 실리콘 측정으로 입증합니다.
본 논문은 영지식 증명(ZKPs)의 핵심 요소인 타원 곡선 점 덧셈(PADD) 하드웨어 설계를 최적화하고 탐색하는 프레임워크 'Locus'를 제안합니다. Locus는 임의 타원 곡선 매개변수를 기반으로 PADD의 ASIC 및 FPGA 구현을 자동 생성하여 설계 공간의 체계적인 탐색을 가능하게 합니다. 이를 통해 기존 대비 높은 성능 향상과 면적 감소를 입증했습니다.
본 논문은 DNN 추론의 오차를 줄이는 근사 곱셈기 평가의 어려움을 해결하기 위해 FPGA 기반 플랫폼 FAME을 제안합니다. FAME은 하드웨어에 직접 구현하여 기존 CPU/GPU 방식 대비 평가 시간을 크게 단축하며, 패턴 기반 재학습 기법으로 정확도 저하까지 효과적으로 개선했습니다.
본 논문은 공정성(fairness)을 고려한 모델 압축에 필요한 다양한 기법들을 통합한 에이전트 프레임워크인 FairCompressAgent (FCA)를 제안합니다. FCA는 가지치기, 양자화, 희소 저랭크 분해 등의 방법을 하나의 인터페이스로 묶어 최적의 압축 구성을 선택하고 평가할 수 있습니다.
본 논문은 아날로그 EML 하드웨어 패브릭의 비용 결정 요인이 계산 능력보다 구성 가능성에 있음을 제시합니다. 특정 연산자(eml)를 구현한 네 개의 양극 접합 기반 패브릭은 디지털 경로 대비 전력 효율성이 높지만, 증폭기 및 비이상성으로 인해 셀당 비용이 매우 높아 경제적이지 않다는 분석을 담고 있습니다.
본 문서는 Diffusion Transformer의 추론 가속기인 WMHA(World Model Hardware Accelerator)를 소개합니다. 이 장치는 지연 시간 최적화를 목표로 하며, 16x16 이중 점 배열과 온라인 softmax 어텐션 파이프라인을 활용하여 FP8 및 BF16 축약 연산을 스트리밍합니다. SystemVerilog로 구현되어 UVM 환경에서 검증되었으며, 기존 대비 MSE를 크게 감소시키는 성능을 입증했습니다.
본 논문은 재생 에너지 및 EV 충전으로 인한 전력망 고조파 왜곡 문제를 해결하기 위해 효율적인 광범위 학습(EBL) 프레임워크를 제안합니다. EBL은 BLS 스타일 하모닉 추정을 위한 양자화된 FPGA 가속 프레임워크로, 높은 정확도와 초저지연성을 제공합니다. 특히 폐쇄형 해법 기반의 온라인 전이 학습을 통해 빠른 적응성과 효율적인 자원 사용률을 입증했습니다.
본 논문은 FPGA 환경에서 양자화된 신경망(QNNs)의 효율적인 배포를 위한 FINNAS 프레임워크를 제안합니다. 이 프레임워크는 MLP 깊이, 너비 및 정밀도 설정을 공동으로 탐색하며, 하드웨어 자원 사용량과 대리 검증 정확도를 기반으로 후보 모델을 순위화합니다. CERNBox 작업에서 테스트된 결과, FINNAS가 기존 설계 대비 높은 정확도와 현저히 낮은 LUT/지연 시간 감소를 달성했습니다.
본 연구는 FPGA 기반 SmartNIC에 머신러닝 기반 침입 탐지 시스템(IDS) 아키텍처를 제안합니다. 이 시스템은 P4와 RTL로 구현된 LogicNets IDS 모델을 통합하여, 낮은 지연 시간과 높은 자원 효율성을 유지하면서 실시간 고속 트래픽 검사를 가능하게 합니다. 특히 상태 저장 흐름 기반 접근 방식을 통해 패킷 수준에서 놓치기 쉬운 행위 패턴까지 포착하며, 기존 대비 탐지 정확도를 크게 향상시켰습니다.
본 논문은 실시간 다중 스케일 초해상도(SR) 처리를 위해 완전 병렬 구성이 가능한 LUT 기반 가속기인 ScaleLUT를 제안합니다. ScaleLUT는 YUV 도메인의 하드웨어 친화적 전략과 2의 거듭제곱 커널을 결합하여, 기존 대비 메모리 사용량을 줄이고 수용 영역 커버리지를 개선했습니다. Xilinx ZCU102 FPGA에 구현되어 실시간 4K SR을 높은 프레임률로 달성하며 에너지 효율성을 입증했습니다.
본 연구는 엣지 장치의 실시간 워크로드를 위해 고효율적이고 유연한 CGRA를 제안합니다. 핵심은 처리 요소(PEs)에 설정 가능한 MAC 유닛을 통합하여, 단일 사이클 내에서 ADD, MUL, 또는 MAC 연산을 수행할 수 있게 한 것입니다. 이 CGRA는 40nm CMOS 기술로 구현되어 420.6 GOPS/W의 높은 에너지 효율을 달성했습니다.
본 논문은 사양 기반 제약 조건을 활용하여 LLM의 Verilog 코드 생성 성능을 향상시키는 자동화 프레임워크 SpecLens를 제안합니다. SpecLens는 행동적 발산을 분석해 사양 기반 제약을 도출하고, 생성 과정에서 오직 원본 사양만을 의미론적 소스로 사용합니다. 이를 통해 기존 SOTA 방식 대비 높은 기능 통과율 및 구문적 정확성을 달성했습니다.
본 논문은 자원 제약적인 엣지 환경에서 CNN 추론 시 발생하는 소프트 에러를 감지하는 새로운 기법인 carry-through checksum을 제안합니다. 이 방법은 컨볼루션 레이어에 전용 필터를 내장하여 체크섬을 계산하고, 이를 통해 단일 출력 검증만으로 엔드투엔드 오류 감지를 가능하게 합니다.
본 논문은 CHERI 같은 Capability 기반 아키텍처가 추측 실행(speculative execution)에 의존하는 현대 프로세서 환경에서 보안을 유지하기 어렵다는 점을 지적합니다. 연구진은 형식적 프레임워크를 개발하여 잠재적인 정보 누출을 입증하고, 이를 해결한 새로운 프로세서 설계인 SCHERI를 제시했습니다.
본 논문은 다채널 시계열 데이터의 시간적 불일치 문제를 해결하기 위해 최소 설명 길이(MDL) 기반의 진단 방법을 제안합니다. 이 방법은 센서 그룹 간의 상대적 지연을 측정하여, 기존 솔루션이 놓칠 수 있는 잠재적인 동기화 오류를 식별할 수 있습니다. 이는 훈련 및 배포 환경 모두에서 시계열 분류 성능 저하의 원인을 진단하는 범용 도구 역할을 합니다.
본 논문은 GPU 기반 컴퓨팅 플랫폼의 비효율성을 해결하기 위해 FastPair라는 새로운 GPU 디코더를 제안합니다. 기존 사전 코딩 방식이 분산 읽기 및 짧은 출력 쓰기로 인해 GPU 하드웨어와 잘 맞지 않는 문제를 개선했습니다. FastPair는 조회 과정을 재구성하고 부분 문자열을 모아 연속적인 출력 쓰기를 수행함으로써 성능을 크게 향상시켰습니다.