Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 대규모 트랜스포머 모델을 저전력 엣지 디바이스에 배포하기 위한 적응형 모델 압축(AMC) 프레임워크를 제안합니다. 이 시스템은 토큰 중요도에 따라 하드웨어 자원을 동적으로 할당하여, 중요한 정보는 고정밀로 처리하고 덜 중요한 데이터는 비트 폭을 줄여 에너지 효율성을 극대화했습니다.
본 논문은 하드웨어 검증의 복잡성 증가에 대응하여 LLM의 의미론적 추론 능력을 활용한 새로운 퍼징 프레임워크인 ChipFuzzer를 제안합니다. ChipFuzzer는 커버리지 가이드와 버그 가이드를 결합한 2단계 워크플로우로, 테스트 케이스 생성 및 우선순위화에 LLM을 적용하여 검증 효율성을 극대화했습니다.
본 논문은 대규모 언어 모델(LLMs)의 메모리 및 연산 요구 증가에 따른 병목 현상을 해결하기 위한 아키텍처 개선 방안인 StreamDQ를 제안합니다. StreamDQ는 HBM 베이스 다이에 DeQuantization Blocks (DQBs)를 통합하여, 온디바이스 디양자화를 인라인으로 수행함으로써 고처리량 LLM 추론 가속을 목표로 합니다.
본 논문은 하드웨어 검증 작업인 논리 동치 검사(LEC)의 성능 저하 문제를 해결하기 위한 miter-aware 매핑 프레임워크를 제안합니다. 이 방법은 기존 넷리스트 대신 LUT 기반의 miter를 구성하여 구조적 대응 관계와 고수준 논리 관계를 명시적으로 보존합니다. 이를 통해 SAT 솔버가 효율적으로 작동하도록 LEC 성능을 크게 향상시킬 수 있음을 입증했습니다.
아날로그 인메모리 컴퓨팅(IMC)을 활용하여 대규모 MIMO 시스템의 비선형 최적화 문제를 해결하는 새로운 아키텍처를 제안합니다. 연속 시간 비선형 폐루프 방식을 통해 물리적 시스템의 동역학 내에서 직접 디코딩 솔루션을 도출하며, 혼합 정밀도 기법으로 하드웨어의 정밀도 한계를 극복합니다.
AIGOR는 다양한 하드웨어 환경에 대응할 수 있는 모듈형 이벤트 기반 뉴로모픽 아키텍처를 제안합니다. 패킷 교환 통신과 매개변수화된 IP 블록을 통해 뉴런 모델과 정밀도를 인스턴스별로 구성할 수 있는 유연성을 제공합니다.
DNN 가속의 효율성과 유연성 사이의 트레이드오프를 해결하기 위해 재구성 가능한 ISA 기반 아키텍처를 제안합니다. 동적 정밀도와 분리된 실행 제어를 통해 높은 에너지 효율과 프로그래밍 가능성을 동시에 달성했습니다.
확률적 계산의 효율성을 높이기 위해 분포 파라미터와 샘플을 직접 저장하는 통합 메모리 프리미티브인 p-MEM을 제안합니다. p-MEM은 기존 방식 대비 높은 처리량과 낮은 지연 시간, 에너지 효율을 제공하여 신뢰할 수 있는 에지 인텔리전스 구현을 지원합니다.
표준 셀 라이브러리에 하드웨어 트로이잔(HT)을 삽입하여 보안을 위협하는 새로운 공격 모델과 위험 평가 방법을 제안합니다. Saed32nm 및 Sky130nm 라이브러리를 활용해 공격의 효능을 입증하고 설계 특성 분석을 통해 이를 탐지하는 연구를 수행했습니다.
MxGLUT는 혼합 정밀도 GEMM 연산을 위해 설계된 재구성 가능한 LUT 중심 브로드캐스트 데이터플로우 가속기입니다. 별도의 FP 데이터패스 없이 단일 LUT 메커니즘으로 FP8-INT4 및 FP8-FP8 연산을 통합 지원하여 하드웨어 효율성을 극대화합니다.
LLM 서빙 시 발생하는 프리필-디코드(PD) 분리 기술과 텐서 병렬성(TP) 간의 트래픽 경합 문제를 해결하기 위한 3DLS 아키텍처를 제안합니다. 3D 적층 칩렛 구조를 통해 KV-캐시 전송과 TP 통신을 물리적으로 분리하여 성능을 극대화합니다.
FPGA 환경에서 Vision Transformer(ViT)의 셀프 어텐션 연산을 효율적으로 수행하기 위한 BRAM-free 근사 어텐션 가중치 산출 방식을 제안합니다. 분산 LUT 패브릭을 활용한 구간 선형 함수로 소프트맥스를 근사하여 자원 소모를 최소화하면서도 높은 정확도를 유지합니다.
양자 내성 암호(PQC)의 핵심 연산인 NTT를 가속하기 위한 고성능 하드웨어 아키텍처를 제안합니다. 중복 수 표현과 통합 버터플라이 유닛을 통해 연산 오버헤드를 줄이고 FPGA 리소스 효율성을 극대화했습니다.
양자 오류 정정(QEC) 신드롬 전송의 대역폭 및 전력 문제를 해결하기 위한 극저온 압축 프레임워크 CryoZip을 제안합니다. 22nm FDSOI 공정에서 구현된 이 설계는 기존 압축기 대비 높은 압축률과 에너지 효율을 달성했습니다.
FPGA 상에서 초음파 빔포밍을 위한 새로운 MSDF(최상위 자릿수 우선) 가산기 트리 아키텍처를 제안합니다. 기존 방식 대비 LUT 사용량을 2.5배 줄이고 동적 전력을 23% 절감하며, 런타임 시 동적 정밀도 조절이 가능합니다.
에지 디바이스에서 Vision Transformer(ViT)를 효율적으로 실행하기 위한 FPGA 기반 가속기 FlexViT를 제안합니다. 하드웨어-소프트웨어 공동 설계를 통해 다양한 레이어 구성을 지원하며, CPU 대비 최대 1.40배의 엔드 투 엔드 속도 향상을 달성했습니다.
양자 내성 암호(PQC) 표준인 ML-KEM의 캡슐화 해제 검증 과정에서 발생하는 부채널 공격 취약성을 연구했습니다. FPGA와 마이크로컨트롤러 환경에서 마스킹 기법의 효과를 비교 분석하여 하드웨어 구현 시의 보안 과제를 제시합니다.
NVIDIA Blackwell GPU의 10비트 4:2:2 하드웨어 인코더를 활용하여 고충실도 V-PCC 스트리밍을 가속화하는 연구를 다룹니다. 분할 프레임 인코딩(SFE) 방식을 통해 8K 해상도와 122 fps의 처리량을 달성하며 실시간 볼륨 비디오 스트리밍의 가능성을 입증했습니다.
엣지 디바이스의 AI 칩 유휴 자원을 활용하여 범용 연산 효율을 높이는 프레임워크를 제안합니다. NAS를 통해 일반 연산을 신경망 모델로 변환하고, AI 엔진의 유휴 시간에 이를 배치하여 전체 시스템 성능을 향상시킵니다.
Mega는 에너지 효율적인 에지 비전 처리를 위해 설계된 22nm 컨볼루션 스파이킹 신경망(SNN) 디지털 아키텍처입니다. 기존 SNN 가속기의 병렬성 부족과 메모리 유연성 문제를 해결하여 기존 기술 대비 4배 향상된 에너지 효율을 달성했습니다.