Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
DNN 가속의 효율성과 유연성 사이의 트레이드오프를 해결하기 위해 재구성 가능한 ISA 기반 아키텍처를 제안합니다. 동적 정밀도와 분리된 실행 제어를 통해 높은 에너지 효율과 프로그래밍 가능성을 동시에 달성했습니다.
확률적 계산의 효율성을 높이기 위해 분포 파라미터와 샘플을 직접 저장하는 통합 메모리 프리미티브인 p-MEM을 제안합니다. p-MEM은 기존 방식 대비 높은 처리량과 낮은 지연 시간, 에너지 효율을 제공하여 신뢰할 수 있는 에지 인텔리전스 구현을 지원합니다.
표준 셀 라이브러리에 하드웨어 트로이잔(HT)을 삽입하여 보안을 위협하는 새로운 공격 모델과 위험 평가 방법을 제안합니다. Saed32nm 및 Sky130nm 라이브러리를 활용해 공격의 효능을 입증하고 설계 특성 분석을 통해 이를 탐지하는 연구를 수행했습니다.
MxGLUT는 혼합 정밀도 GEMM 연산을 위해 설계된 재구성 가능한 LUT 중심 브로드캐스트 데이터플로우 가속기입니다. 별도의 FP 데이터패스 없이 단일 LUT 메커니즘으로 FP8-INT4 및 FP8-FP8 연산을 통합 지원하여 하드웨어 효율성을 극대화합니다.
LLM 서빙 시 발생하는 프리필-디코드(PD) 분리 기술과 텐서 병렬성(TP) 간의 트래픽 경합 문제를 해결하기 위한 3DLS 아키텍처를 제안합니다. 3D 적층 칩렛 구조를 통해 KV-캐시 전송과 TP 통신을 물리적으로 분리하여 성능을 극대화합니다.
FPGA 환경에서 Vision Transformer(ViT)의 셀프 어텐션 연산을 효율적으로 수행하기 위한 BRAM-free 근사 어텐션 가중치 산출 방식을 제안합니다. 분산 LUT 패브릭을 활용한 구간 선형 함수로 소프트맥스를 근사하여 자원 소모를 최소화하면서도 높은 정확도를 유지합니다.
양자 내성 암호(PQC)의 핵심 연산인 NTT를 가속하기 위한 고성능 하드웨어 아키텍처를 제안합니다. 중복 수 표현과 통합 버터플라이 유닛을 통해 연산 오버헤드를 줄이고 FPGA 리소스 효율성을 극대화했습니다.
양자 오류 정정(QEC) 신드롬 전송의 대역폭 및 전력 문제를 해결하기 위한 극저온 압축 프레임워크 CryoZip을 제안합니다. 22nm FDSOI 공정에서 구현된 이 설계는 기존 압축기 대비 높은 압축률과 에너지 효율을 달성했습니다.
FPGA 상에서 초음파 빔포밍을 위한 새로운 MSDF(최상위 자릿수 우선) 가산기 트리 아키텍처를 제안합니다. 기존 방식 대비 LUT 사용량을 2.5배 줄이고 동적 전력을 23% 절감하며, 런타임 시 동적 정밀도 조절이 가능합니다.
에지 디바이스에서 Vision Transformer(ViT)를 효율적으로 실행하기 위한 FPGA 기반 가속기 FlexViT를 제안합니다. 하드웨어-소프트웨어 공동 설계를 통해 다양한 레이어 구성을 지원하며, CPU 대비 최대 1.40배의 엔드 투 엔드 속도 향상을 달성했습니다.
양자 내성 암호(PQC) 표준인 ML-KEM의 캡슐화 해제 검증 과정에서 발생하는 부채널 공격 취약성을 연구했습니다. FPGA와 마이크로컨트롤러 환경에서 마스킹 기법의 효과를 비교 분석하여 하드웨어 구현 시의 보안 과제를 제시합니다.
NVIDIA Blackwell GPU의 10비트 4:2:2 하드웨어 인코더를 활용하여 고충실도 V-PCC 스트리밍을 가속화하는 연구를 다룹니다. 분할 프레임 인코딩(SFE) 방식을 통해 8K 해상도와 122 fps의 처리량을 달성하며 실시간 볼륨 비디오 스트리밍의 가능성을 입증했습니다.
엣지 디바이스의 AI 칩 유휴 자원을 활용하여 범용 연산 효율을 높이는 프레임워크를 제안합니다. NAS를 통해 일반 연산을 신경망 모델로 변환하고, AI 엔진의 유휴 시간에 이를 배치하여 전체 시스템 성능을 향상시킵니다.
Mega는 에너지 효율적인 에지 비전 처리를 위해 설계된 22nm 컨볼루션 스파이킹 신경망(SNN) 디지털 아키텍처입니다. 기존 SNN 가속기의 병렬성 부족과 메모리 유연성 문제를 해결하여 기존 기술 대비 4배 향상된 에너지 효율을 달성했습니다.
모바일 기기에서 PIM(Processing-in-Memory)과 CPU의 동시 실행을 최적화하는 협력적 스케줄링 프레임워크 COSM을 제안합니다. CPU의 메모리 액세스 유휴 시간을 활용하여 PIM 명령을 통합함으로써, CPU 성능 저하를 최소화하면서 PIM 처리량을 대폭 향상시킵니다.
Snapdragon 8 Elite SoC 환경에서 모바일 VLM 추론의 단계별 하드웨어 특성을 분석한 연구입니다. NPU 활용 시 프리필과 디코드 단계의 성능 차이, 열 안정성 및 에너지 효율성을 검증하고 최적화된 포팅 방법을 제시합니다.
하드웨어 성능 측정값의 신뢰성을 보장하기 위해 해시 연결 증거 그래프를 활용한 자가 검증형 기록 방식을 제안합니다. 이 방식은 변조 방지가 가능하며, 독립적인 감사와 확률적 항등식을 통해 하드웨어의 조용한 오류를 효과적으로 탐지합니다.
Intel의 3.5D 이종 패키징 기술을 위한 사전 실리콘 펌웨어 및 하드웨어 공동 최적화 연구를 다룹니다. 열-전기 공동 시뮬레이션을 통해 워크로드 밀도 기반의 열 힌팅 기술이 전압 안정성과 HBM 누설 전류 억제에 미치는 효과를 입증했습니다.
CVA6 코어를 실시간 시스템에 최적화하여 확장한 CVA6-RT 프로세서를 소개합니다. TLB 파티셔닝과 스크래치패드 모드 등을 통해 실행 가변성을 줄이고 결정론적 성능을 제공합니다.
첨단 패키징 환경에서 발생하는 하드웨어 보안 위협에 대응하기 위해 나노전기기계 시스템(NEMS)을 활용한 새로운 보안 메커니즘을 제안합니다. NEMS 기반의 PUF와 공진 지문 등을 통해 역공학 및 부채널 공격에 강한 물리적 보안 솔루션을 제공합니다.