Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 스파이킹 신경망(SNNs)의 하드웨어 구현 문제를 해결하기 위해 ReSCom이라는 재구성 가능한 가속기를 제안합니다. ReSCom은 확률적 컴퓨팅을 활용하여 뉴런 동역학의 곱셈 연산에 적용함으로써 하드웨어 복잡도를 줄이고 안정적인 추론을 유지합니다. Xilinx Artix-7 FPGA 실험 결과, 낮은 에너지 소비와 높은 분류 정확도를 달성하며 기존 최첨단 구현보다 우수한 효율성을 입증했습니다.
본 논문은 AI 및 과학 계산 요구에 따라 주목받는 현대 아날로그 컴퓨팅을 다룹니다. 미분 방정식 풀이, 행렬 방정식 풀이 등 세 가지 핵심 원시 요소를 식별하고, 이를 CMOS 회로와 저항성 메모리 배열을 이용한 하드웨어 구현 방식을 검토합니다. 궁극적으로 아날로그 컴퓨팅의 응용 분야, 한계점 및 인메모리 컴퓨팅과의 관계를 논하며 차세대 컴퓨팅 프런티어로서의 가능성을 제시합니다.
본 논문은 캐시 사이드 채널 공격 방어를 위한 새로운 구조적 방법인 SCP(Secure and Coherent Partitioning)를 제안합니다. SCP는 태그만 분할하고 데이터 풀을 공유하며, 쓰기 공유 일관성을 유지하여 기존의 설계 문제를 해결했습니다. 이 방식은 Prime+Probe 및 Flush+Reload 같은 정교한 캐시 공격을 완화하면서도 성능 저하가 미미하고 하드웨어 비용 증가율이 낮음을 입증했습니다.
Raspberry Pi 5의 VideoCore VII QPU를 활용한 QPU 우선 ML 런타임 스택을 제안합니다. 타일형 행렬 곱셈과 정수 실행 최적화를 통해 NumPy 및 PyTorch 대비 높은 처리량을 달성했습니다.
RowHammer 취약점에 대응하기 위해 Q-learning 기반의 적응형 스로틀링 메커니즘인 ARTA를 제안합니다. 하드웨어 수정 없이 메모리 액세스를 모니터링하여 비트플립을 효과적으로 억제하며, 기존 방어책 대비 높은 성능 향상을 입증했습니다.
SPARX는 RISC-V SoC 기반의 보안 및 개인정보 보호 인지형 근사 CNN 가속화 프레임워크를 제안합니다. 근사 컴퓨팅을 통해 하드웨어 효율성을 높이면서도, 차분 노이즈 기반 개인정보 보호와 인증 메커니즘을 통합하여 엣지 AI의 보안 제약을 해결합니다.
RNS(나머지 수 체계) 환경에서 twit 표현을 활용한 범용 Modulo-$(2^n ext{±} ext{δ})$ 곱셈기 구조를 제안합니다. 피연산자 분할과 캐리-세이브 누적 방식을 통해 기존 설계의 긴 임계 경로 문제를 해결했습니다.
3D-TCAD 시뮬레이션을 활용하여 사이버 물리 시스템(CPS)용 조합 논리 표준 셀의 결함 특성을 분석한 연구입니다. 결함 에너지와 인접 효과 등 다양한 시나리오를 통해 취약 영역을 식별하고, 이를 개선한 강화된 NAND 셀을 제안합니다.
GNN 기반 하드웨어 보안 시스템을 무력화하기 위한 새로운 백도어 공격 방식인 GRAFT를 제안합니다. 회로의 원래 기능을 유지하면서 graphlet 기반 트리거를 삽입하여 하드웨어 트로이목마 탐지를 효과적으로 회피합니다.
LLM을 진화 연산자로 활용하여 비전형적 하드웨어에 최적화된 신경망 구조를 탐색하는 UH-NAS 프레임워크를 제안합니다. 에너지 효율과 물리적 제약 조건을 동시에 고려하며, 광학 MZI 하드웨어 테스트를 통해 기존 방식보다 강건한 아키텍처를 발견함을 입증했습니다.
타일 기반 가속기에서 자율 주행 시스템(ADS)의 지연 시간 제약을 준수하기 위한 새로운 스케줄링 프레임워크 ADS-Tile을 제안합니다. 구성 가능한 격리와 탄력적 예약을 통해 DNN 재할당 비용을 최소화하고 자원 효율성을 극대화합니다.
자원 제한적 디바이스에서 OTT 권한 확인 지연을 줄이기 위한 하이브리드 에지-클라우드 아키텍처를 제안합니다. AEC-PR 알고리즘과 로컬 캐싱을 통해 지연 시간을 95.6% 단축하고 보안성을 강화했습니다.
FPGA의 DSP 슬라이스 활용도를 높이기 위해 임의의 비트 너비를 가진 데이터를 동적으로 패킹하는 새로운 산술 패킹 방법을 제안합니다. DSP 내부의 pre-adder를 활용하여 행렬-벡터 곱셈 및 컨볼루션 연산에 최적화된 아키텍처를 구현했습니다.
양자 오류 정정(QEC)의 정확도와 지연 시간을 개선하기 위해 알고리즘과 하드웨어를 공동 설계한 새로운 디코더를 제안합니다. 코셋 앙상블 디코딩과 도메인 특화 아키텍처를 통해 기존 방식보다 높은 성능과 낮은 자원 소비를 달성했습니다.
SECDA-DSE는 LLM을 활용하여 FPGA 기반 AI 가속기의 설계 공간 탐색(DSE)을 자동화하는 프레임워크입니다. RAG와 CoT 프롬프팅을 통해 복잡한 하드웨어 아키텍처를 생성하며, 인간의 개입을 최소화하면서도 효율적인 설계를 제안합니다.
머신러닝 하드웨어의 다양한 수치 형식(FP8, BF16, MXFP4 등) 간의 일관성을 확보하기 위한 84가지 형식의 수치 카탈로그를 제안합니다. 비트 단위로 일치하는 참조 자료를 제공하여 가속기 간 모델 이식 시 발생하는 수치적 발산 문제를 해결하고자 합니다.
엣지 디바이스의 에너지 효율적인 추론을 위한 NVFP4 양자화 기법을 분석한 연구입니다. FP8 블록 스케일링과 FP32 텐서 스케일링을 통해 초저정밀도에서도 정확도를 유지하며, 하드웨어-소프트웨어 공동 설계의 가이드라인을 제시합니다.
NISQ 프로세서의 한계를 극복하기 위해 하드웨어 인지형 컴파일과 데이터 기반 양자 오류 탐지(QED)를 통합한 프레임워크를 제안합니다. 노이즈 가중치 비용 함수와 다목적 스케줄러를 통해 큐비트 매핑과 오류 탐지 오버헤드 간의 균형을 최적화합니다.
DRAM의 읽기 방해(Read Disturbance) 현상을 증폭시키는 새로운 액세스 패턴인 ScaleDisturb를 제안하는 연구입니다. 공격자 행의 오픈 시간을 비대칭적으로 조절하여 기존 방식보다 적은 활성화로도 비트 플립을 유도할 수 있음을 증명했습니다.
AttentionCap은 Transformer를 활용하여 첨단 공정 노드에서 커패시턴스 행렬을 학습하는 새로운 프레임워크입니다. 기존 CNN 방식보다 오차는 낮고 추론 속도는 192배 빠르며, 공정 노드 임베딩을 통해 미학습 노드에 대한 강력한 전이 학습 성능을 보여줍니다.