Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
GPU 메모리 계층의 NUMA 아키텍처를 분석하기 위한 새로운 방법론인 DGNA를 제안합니다. NVIDIA A100 및 H100 GPU를 대상으로 마이크로벤치마킹과 가우시안 혼합 모델을 활용해 L2 캐시 및 DRAM의 지연 시간과 메모리 할당 전략을 규명했습니다.
본 논문은 순차적 프로그래밍 모델을 유지하면서도 세밀한 파이프라인 제어가 가능한 새로운 HLS 도구를 제안합니다. 가시성 제어(Visibility Control) 기술을 통해 스톨링, 바이패싱 등 해저드 해결 전략을 통합하여 RTL 수준의 성능을 달성합니다.
CPU 기반 CKKS 완전 동형 암호(FHE) 연산 시 발생하는 하드웨어 결함에 대응하기 위한 효율적인 결함 허용 체계를 제안합니다. 세 가지 수준의 최적화를 통해 오버헤드를 최소화하면서도 100%의 결함 탐지율을 달성했습니다.
유연 소자(FE) 내 혼성 신호 회로 테스트를 위한 분산 지연 기반 BIST 프레임워크를 제안합니다. IGZO-TFT 기반의 링 발진기와 VCO를 활용하여 기존 설계 대비 면적과 전력을 획기적으로 줄였습니다.
격자 기반 양자 내성 암호(PQC)를 위한 새로운 NTT 가속기 PIP-NTT를 제안합니다. 메모리 병렬화 전략과 곱셈 없는 리스케일링 아키텍처를 통해 면적 효율성을 극대화했습니다. FPGA 실험 결과, 기존 가속기 대비 뛰어난 면적-시간 곱(ATP) 효율성을 입증했습니다.
LLM을 활용한 RTL 설계 생성 시 발생하는 이해 오류를 줄이기 위해 명세 정제 단계를 도입한 VeriRefine 연구를 소개합니다. 명세를 점진적으로 구체화하고 5단계 감사를 거쳐 Verilog 생성 전 오류를 수정함으로써 합성 가능한 설계를 보장합니다.
자원 제약 환경에서 CNN 추론 효율을 높이기 위한 FPGA 기반 가속기 SparHiXcel-v2를 제안합니다. 열 기반 커널 압축과 하드웨어-알고리즘 공동 설계 프레임워크를 통해 희소성 유연성과 하드웨어 효율성 사이의 균형을 최적화했습니다.
동형 암호(HE) 환경에서 신경망의 신뢰성을 보장하며 효율적으로 프루닝하는 PSAP 기법을 제안합니다. 가중치 크기와 다항식 민감도를 결합하여 결함 허용 영역에 프루닝을 집중함으로써, 성능 저하를 최소화하고 비트 오류에 대한 취약성을 크게 낮춥니다.
엣지 플랫폼에서 LLM 추론 효율을 높이기 위해 연산자 형태와 백엔드 전환 비용을 고려한 '전이 인지형 백엔드 디스패치' 기술을 제안합니다. NVIDIA Jetson 환경에서 실험한 결과, 기존 정적 정책 대비 지연 시간과 에너지 소비를 크게 개선했습니다.
컨테이너 및 VM 환경에서 공유 스토리지의 페이지 캐시(Page-Cache)를 통해 발생하는 사이드 채널 공격 취약성을 분석합니다. I/O 경로가 공유될 때 발생하는 타이밍 신호를 통해 격리 경계를 넘어 데이터 존재 여부를 파악할 수 있음을 입증했습니다.
LLM 기반 에이전트의 EDA 워크플로우 자동화 능력을 평가하기 위한 벤치마크인 FluxBench를 제안합니다. RTL 생성부터 GDS 도달까지의 엔드투엔드 과정을 분석하며, 에이전트 아키텍처와 비용 효율성(Token ROI)의 중요성을 입증합니다.
RAG의 병목 현상인 밀집 벡터 검색을 해결하기 위해 하드웨어-소프트웨어 공동 설계된 인-스토리지 가속기 D-NOVA를 제안합니다. NAND 메모리 내부에 검색 기능을 직접 통합하여 데이터 이동을 최소화하고 에너지 효율을 극대화했습니다.
질량 분석(MS)의 개방형 수정 검색(OMS) 워크로드를 가속하기 위한 다양한 컴퓨팅 플랫폼 간의 성능 및 트레이드오프를 분석한 연구입니다. 이진 하이퍼디멘셔널 컴퓨팅(HDC)을 활용하여 차세대 메모리 및 스토리지 중심 아키텍처에서 높은 효율성을 달성했습니다.
광 OFDM 트랜시버의 FFT IP 코어를 위해 저정밀도 부동 소수점 형식을 적용하는 새로운 공동 설계 방법론을 제안합니다. 12nm FinFET 공정 실험 결과, 기존 고정 소수점 방식 대비 전력은 최대 19.8%, 면적은 12.0% 절감하면서도 우수한 성능을 입증했습니다.
SEAM-V는 RISC-V 벡터 확장을 위한 하이브리드 분리형 실행 아키텍처를 제안합니다. 태스크 수준의 분리와 실행 패킷(EP) 컨텍스트를 활용하여 벡터 명령어 공급 공백을 줄이고 처리량을 극대화합니다.
AI 모델의 의도를 제어하기 위해 하드웨어 수준에서 성능을 동적으로 제한하는 새로운 마이크로아키텍처 메커니즘을 제안합니다. L2 캐시 및 공유 메모리 포트 제어를 통해 소프트웨어 보안 우회를 방지하는 최후의 방어선을 구축합니다.
자원이 제한된 엣지 장치에서 효율적인 온디바이스 모델 적응을 위해 Hailo-8L 가속기를 활용한 이기종 적응 파이프라인을 제안합니다. 백본은 가속기에서 INT8로 실행하고 분류 헤드만 CPU에서 미세 조정하여 연산 효율과 에너지 절감을 동시에 달성했습니다.
CV-QKD의 고속 LDPC 디코딩을 위한 고정 소수점 산술 기반의 하드웨어 가속 프레임워크를 연구합니다. SPA, MSA, NMS 디코더의 성능을 수치 정밀도와 비교 분석하여 최적의 균형점을 제시합니다.
OpenROAD 프로젝트의 일부로 개발된 ORRAM은 표준 셀을 활용하여 RAM 블록을 생성하는 통합 메모리 생성기입니다. PDK에 종속되지 않고 사용자 정의 비트셀 없이도 배치 및 라우팅이 완료된 RAM을 생성하여 ASIC 설계 흐름을 최적화합니다.
FPGA SoC 환경에서 CNN 가속기의 결함 허용을 위해 제안된 계층적 디지털 트윈 프레임워크인 EIR을 소개합니다. 프로세싱 시스템(PS)의 유휴 자원을 활용하여 하드웨어 중복 없이도 효율적인 결함 탐지와 정밀한 복구를 구현합니다.