Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
AUTOGATE는 LLM과 ML을 결합하여 RTL 설계의 동적 전력을 최적화하는 에이전트 기반 프레임워크입니다. 파형 분석과 계층적 멀티 에이전트 아키텍처를 통해 대규모 코드베이스에서도 효율적인 클록 게이팅을 수행합니다.
CERN LHC의 jet tagging을 위해 AMD Versal AI Engine에 최적화된 양자화된 Transformer 구현을 제안합니다. Python 모델 설명으로부터 Vitis 그래프 코드를 자동 생성하는 재사용 가능한 소프트웨어 프레임워크를 소개합니다.
HAMON은 장기 시계열 예측을 위해 학습 가능한 위상 마스크와 자유 공간 회절을 활용하는 수동형 광학 시퀀스 혼합 기술을 제안합니다. 디지털 시퀀스 혼합 레이어 없이 수동형 광학 전파만으로 예측을 수행하며, 주요 벤치마크에서 기존 디지털 베이스라인보다 우수한 성능을 입증했습니다.
멀티 칩렛 GPU 환경에서 LLM의 GEMM 연산 시 발생하는 리모트 HBM 트래픽을 최소화하기 위한 타일 수준의 로컬리티 시뮬레이터를 제안합니다. 시뮬레이션 결과, CTA 순회 방식과 데이터 배치 전략에 따라 트래픽 차이가 극명하게 나타남을 확인했습니다.
스마트 AR 글래스의 효율적인 1인칭 시점 인지를 위한 시스템 프레임워크 EPIC을 제안합니다. 시선, 포즈, 관성 신호를 활용해 정보량이 많은 데이터만 선별적으로 처리함으로써 메모리와 에너지 소비를 획기적으로 줄이는 알고리즘-하드웨어 공동 최적화 기술을 다룹니다.
NVIDIA Jetson Orin Nano를 대상으로 엣지 ML 추론 지연 시간 추정 시 CPU/GPU 주파수 외에 메모리 클록과 테일 효과가 미치는 영향을 분석한 연구입니다. 메모리 클록의 중요성과 미스율의 클러스터링 현상, 그리고 주파수 전환 시 발생하는 지연 시간을 규명했습니다.
영지식 증명(ZKP)의 핵심 구성 요소인 NTT와 SumCheck 프로토콜을 하드웨어-시스템 수준에서 비교 분석한 연구입니다. 두 방식의 연산 효율성과 하드웨어 가속기 설계 시의 트레이드오프를 통합 아키텍처 프레임워크를 통해 규명했습니다.
NeuronFabric은 온칩(On-Chip) Transformer 학습을 위해 로컬 Adam 업데이트를 지원하는 소프트웨어 참조 아키텍처입니다. BF16W 구성을 통해 메모리 요구 사항을 줄여 FPGA 및 ASIC 구현에 최적화된 구조를 제안합니다.
NYU Ultracomputer부터 현대 엑사스케일 시스템까지, 병렬 컴퓨팅 아키텍처와 네트워크 기술의 진화를 다룹니다. 인네트워크 컴퓨팅, 메시지 패싱, 하드웨어 동기화 메커니즘의 역사적 변천과 현대 딥러닝 하드웨어 매핑을 심도 있게 분석합니다.
512MB 미만의 저사양 임베디드 장치를 위한 하드웨어 인식 신경망 구조 탐색(HW NAS) 기술을 제안합니다. IoT 및 웨어러블 기기용 초소형 CNN을 생성하여 프라이버시를 보호하면서도 최첨단 성능을 달성합니다.
IEC 61131-3 래더 다이어그램(LD)을 지원하는 최초의 오픈 소스 형식 검증기인 ESBMC-PLC를 제안합니다. SMT 기반 모델 체킹을 통해 PLC 프로그램의 안전 속성을 검증하며, 기존 도구와 차별화된 네이티브 LD 지원 및 k-유도 기능을 제공합니다.
MoE 기반 LLM의 추론 시 발생하는 전문가 로딩 오버헤드를 해결하기 위한 ST-MoE 프레임워크를 제안합니다. 전문가 활성화 패턴의 시공간적 상관관계를 분석하여, 예측 메커니즘과 하드웨어 설계를 통해 전문가를 선제적으로 로딩함으로써 추론 성능과 에너지 효율을 높입니다.
LLM 가중치의 낮은 내재적 무작위성을 활용하여 가중치 값의 손실 없이 저장 공간을 획기적으로 줄이는 무손실 압축 연구를 소개합니다. ANS 기반의 실시간 압축 해제 프레임워크를 통해 GPU 추론 성능과 처리량을 크게 개선했습니다.
LLM4RTL은 RTL(Register Transfer Level) 코드 생성을 위해 고품질 학습 데이터를 정제하는 JRCRC 파이프라인과 도구 지원 아키텍처를 제안합니다. 이를 통해 작은 모델로도 GPT-4o에 필적하는 VerilogEval 성능을 달성했습니다.
PANDA는 설계 의도와 레이아웃 생성을 연결하는 LLM 강화 아날로그 설계 프레임워크입니다. 토폴로지 합성, 사이징, 레이아웃 생성을 통합 관리하여 설계 성능을 높이고 작업 시간을 획기적으로 단축합니다.
LLM을 활용하여 계층적 하드웨어 형식 검증을 수행하는 통합 스위트 HierSVA를 제안합니다. RTL 전처리와 LLM을 결합해 SystemVerilog Assertions를 생성하며, 데이터셋과 벤치마크를 통해 LLM의 검증 성능을 다각도로 분석합니다.
Tiara는 원격 메모리 액세스 시 발생하는 간접 참조 장벽(Indirection Wall) 문제를 해결하기 위해 제안된 프로그래밍 가능한 라인 레이트 ISA입니다. 메모리 측 NIC에서 실행되는 명령어를 통해 다중 RTT 의존성을 단일 라운드 트립으로 압축하여 성능을 극대화합니다.
현대 DRAM의 동작 특성을 분석하여 성능, 보안, 에너지 효율을 향상시키기 위한 대규모 연구 인프라 'DRAM Bender'를 소개합니다. 새로운 실험 유형 지원과 인터페이스 표준 확장, 대규모 환경 최적화 업데이트를 포함합니다.
LLM 기반의 계층적 소스 레벨 대리 모델인 BigPower를 제안합니다. CPU 설계 단계에서 시뮬레이션 없이 소스 레벨 정보만으로 미세 모듈 단위의 전력 소비를 정확하게 추정할 수 있습니다.
Ramulator 2.0 DRAM 시뮬레이터의 정확도에 대한 기존 연구(Mess 논문)의 오류를 입증하고, 올바른 시뮬레이션 설정 및 사용 모범 사례를 제안합니다. 시뮬레이션 도구 사용 시 발생할 수 있는 오류를 방지하기 위한 가이드라인과 재현 가능한 연구 환경을 제공합니다.