Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
NVIDIA Jetson Orin Nano를 대상으로 엣지 ML 추론 지연 시간 추정 시 CPU/GPU 주파수 외에 메모리 클록과 테일 효과가 미치는 영향을 분석한 연구입니다. 메모리 클록의 중요성과 미스율의 클러스터링 현상, 그리고 주파수 전환 시 발생하는 지연 시간을 규명했습니다.
MCMC 기법의 높은 계산 비용과 병렬화 문제를 해결하기 위해 Intel 16nm 공정으로 설계된 맞춤형 RISC-V SoC인 AIA를 제안합니다. AIA는 16개의 맞춤형 RISC-V 코어와 2D 메시 구조를 통해 에지 디바이스에서 효율적인 근사 추론을 지원합니다.
영지식 증명(ZKP)의 핵심 구성 요소인 NTT와 SumCheck 프로토콜을 하드웨어-시스템 수준에서 비교 분석한 연구입니다. 두 방식의 연산 효율성과 하드웨어 가속기 설계 시의 트레이드오프를 통합 아키텍처 프레임워크를 통해 규명했습니다.
확률적 그래픽 모델(PGM)의 MCMC 알고리즘을 가속하기 위한 16nm 멀티코어 SoC인 AIA를 제안합니다. 비정규화 Knuth-Yao 샘플링과 코어 간 레지스터 공유를 통해 기존 가속기 대비 속도와 에너지 효율을 대폭 향상했습니다.
임베디드 장치의 물리적 제약을 극복하기 위해 하드웨어 피드백을 활용하는 'Hardware-in-the-loop' 에이전트 프레임워크를 소개합니다. LLM 에이전트가 실제 하드웨어에서 컴파일과 측정을 반복하며 모델과 펌웨어를 자율적으로 최적화합니다.
MPX는 행렬 곱셈과 다항식 곱셈을 하나의 하드웨어 패브릭에서 모두 지원하는 이중 모드 시스톨릭 어레이 설계입니다. 기존 AI 하드웨어의 웨이브프런트 데이터플로우를 활용하여 암호화 워크로드(FHE, PQC)를 효율적으로 처리합니다.
NeuronFabric은 온칩(On-Chip) Transformer 학습을 위해 로컬 Adam 업데이트를 지원하는 소프트웨어 참조 아키텍처입니다. BF16W 구성을 통해 메모리 요구 사항을 줄여 FPGA 및 ASIC 구현에 최적화된 구조를 제안합니다.
베이지안 신경망의 엣지 환경 추론을 위해 산술 연산 대신 상수 비교기를 사용하는 혁신적인 이진 트리 가우시안 난수 생성기(TreeGRNG)를 제안합니다. 기존 방식 대비 에너지 효율과 처리량을 획기적으로 높였으며, 확률 분포의 유연한 조정이 가능합니다.
자원 제한적인 FPGA 환경에서 DNN 배포를 위해 가중치를 델타(deltas) 형태로 저장하는 효율적인 압축 기술을 제안합니다. 고정 참조 델타 방식을 통해 메모리 사용량을 약 50% 절감하면서도 준수한 정확도를 유지하는 하드웨어 가속기 성능을 입증했습니다.
DataGuard는 시스톨릭 어레이 기반 가속기에서 차분 프라이버시(DP)와 연합 학습(FL)을 결합하여 하드웨어 수준에서 프라이버시를 보호하는 메커니즘을 제안합니다. 제3자 애플리케이션을 신뢰하지 않고도 설정된 프라이버시 예산을 초과하지 않도록 보장하며, 매우 낮은 면적 및 성능 오버헤드를 입증했습니다.
NYU Ultracomputer부터 현대 엑사스케일 시스템까지, 병렬 컴퓨팅 아키텍처와 네트워크 기술의 진화를 다룹니다. 인네트워크 컴퓨팅, 메시지 패싱, 하드웨어 동기화 메커니즘의 역사적 변천과 현대 딥러닝 하드웨어 매핑을 심도 있게 분석합니다.
지속 가능한 실리콘 시스템 설계를 지원하는 Architecture Carbon Tool v3(ACT3)를 소개합니다. ACT3는 탄소 비용을 고려한 설계 공간 탐색을 위해 강화된 모델링 기능과 분석 텔레메트리를 제공하는 확장 가능한 플랫폼입니다.
강유전체 컴퓨팅 인 메모리(CIM) 기술을 활용하여 실시간 시계열 예측을 수행하는 아날로그 뉴로모픽 시스템 FerroNDS를 소개합니다. 이 시스템은 페로다이오드를 기반으로 연속 시간 동역학을 효과적으로 처리하며, 기존 디지털 시스템 대비 면적과 에너지 효율을 크게 개선했습니다.
Long-context LLM 서빙 시 발생하는 KV 캐시 오프로딩의 비효율성을 해결하기 위한 통합 KV 풀링 기술을 제안합니다. 여러 메모리와 SSD를 하나의 논리적 풀로 통합하고 커널 파일 시스템을 우회하여 TTFT를 획기적으로 단축했습니다.
512MB 미만의 저사양 임베디드 장치를 위한 하드웨어 인식 신경망 구조 탐색(HW NAS) 기술을 제안합니다. IoT 및 웨어러블 기기용 초소형 CNN을 생성하여 프라이버시를 보호하면서도 최첨단 성능을 달성합니다.
KATANA는 상용 NPU를 활용하여 칼만 필터(LKF, EKF)를 고속·저전력으로 실행하는 매핑 기술을 제안합니다. 대수적 그래프 재작성을 통해 연산의 100%를 NPU 행렬 엔진에서 처리함으로써 CPU 대비 에너지 효율을 극대화합니다.
IEC 61131-3 래더 다이어그램(LD)을 지원하는 최초의 오픈 소스 형식 검증기인 ESBMC-PLC를 제안합니다. SMT 기반 모델 체킹을 통해 PLC 프로그램의 안전 속성을 검증하며, 기존 도구와 차별화된 네이티브 LD 지원 및 k-유도 기능을 제공합니다.
SiMRA(동시 다중 행 활성화)를 활용하여 상용 DRAM 칩에서 고유한 시그니처를 생성하는 SiMRA-PUF 기술을 제안합니다. 실험을 통해 DDR4 DRAM에서 높은 반복 가능성과 장치 간 고유성을 입증하였으며, 기존 기술 대비 낮은 지연 시간을 확인했습니다.
MoE 기반 LLM의 추론 시 발생하는 전문가 로딩 오버헤드를 해결하기 위한 ST-MoE 프레임워크를 제안합니다. 전문가 활성화 패턴의 시공간적 상관관계를 분석하여, 예측 메커니즘과 하드웨어 설계를 통해 전문가를 선제적으로 로딩함으로써 추론 성능과 에너지 효율을 높입니다.
LLM 가중치의 낮은 내재적 무작위성을 활용하여 가중치 값의 손실 없이 저장 공간을 획기적으로 줄이는 무손실 압축 연구를 소개합니다. ANS 기반의 실시간 압축 해제 프레임워크를 통해 GPU 추론 성능과 처리량을 크게 개선했습니다.