Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
도메인 특화 FPGA의 하드블록을 HLS 환경에서 효율적으로 프로그래밍하기 위한 새로운 방법론을 제안합니다. RTL 블랙박스를 C-레벨 연산자로 추상화하여 컴파일러 수정 없이도 하드웨어 가속기를 최적화할 수 있는 접근 방식을 다룹니다.
RAG 시스템의 TTFT(첫 토큰 생성 시간) 지연 문제를 해결하기 위해 어텐션 불변성을 활용한 SIFT 기술을 제안합니다. KV 텐서를 저장하는 대신 압축된 비트 벡터를 사용하여 디스크 전송 병목을 없애고 연산 효율을 극대화합니다.
등가 회로 모델을 활용하여 SRAM 아키텍처와 트랜지스터 크기를 동시에 최적화하는 오픈 소스 프레임워크 OpenOpt를 제안합니다. 높은 정확도를 유지하면서 시뮬레이션 속도를 최대 61.4배 향상시켰으며, 다양한 최적화 알고리즘을 통해 면적과 전력을 크게 개선했습니다.
FP8 Attention 연산 시 발생하는 정밀도 저하 문제인 'P-붕괴' 현상을 분석하고, 이를 해결하기 위한 역방향 반복 방식과 최적의 정적 스케일링 인자(S=256)를 제안합니다. 해당 최적화는 FlashAttention-3/4에 적용되어 성능을 입증했습니다.
에너지 효율적인 에지 추론을 위해 LUT 기반의 NVFP4 프레임워크를 제안하는 연구입니다. 4비트 활성화 함수와 2단계 스케일링을 결합하여 정확도를 유지하면서도 하드웨어 에너지 소비를 획기적으로 줄이는 방법을 다룹니다.
MailoHLS는 HLS Pragma 최적화를 위해 LLM의 의미론적 추론과 GNN의 구조적 모델링을 결합한 하이브리드 프레임워크입니다. Pareto 기반 최적화와 LoRA 어댑터를 통해 코드 구조와 설계 트레이드오프를 동시에 고려하여 고성능 FPGA 설계를 생성합니다.
이기종 DNN 가속기 환경에서 실시간 멀티-DNN 워크로드의 마감 시간 미준수 문제를 해결하기 위한 Terastal 프레임워크를 제안합니다. 레이어 변형(layer variants) 기술을 도입하여 가속기 간 지연 시간 격차를 줄이고 스케줄링 효율을 최적화합니다.
CXL 기반 메모리 풀링에서 발생하는 지속성 지연 시간과 확장성 문제를 해결하기 위해 분산 지속성 도메인(DPD) 모델을 제안합니다. CXL 스위치 수준에서 지속성을 지원하는 Persistent CXL Switch 아키텍처를 통해 데이터 정확성을 유지하며 성능을 크게 향상시켰습니다.
소형 위성의 제한된 임베디드 환경에서 양자화된 AI 추론 성능을 특성화하는 연구를 다룹니다. Cortex-M 플랫폼을 기준으로 임베디드 비전 워크로드의 실행 시간, 데이터 이동, 명령어 효율성을 분석하여 설계 기준점을 제시합니다.
CASS-RTL은 LLM의 내부 어텐션 메커니즘을 활용하여 정확한 RTL 코드를 생성하는 새로운 프레임워크입니다. 모델 재학습 없이 저차원 서브스페이스 스티어링을 통해 RTL 생성의 논리적 정확도를 높입니다.
본 연구는 2.5D 및 3D FPGA의 성능 향상을 위한 멀티 다이 라우팅 아키텍처 모델링 및 최적화 방법을 제안합니다. 오픈 소스 FPGA CAD 도구인 VTR을 개선하여 다이 간 연결 밀도와 지연 시간 문제를 해결하고 설계 공간을 탐색했습니다.
BIDENT는 엣지 SoC의 CPU, GPU, NPU 등 이기종 프로세싱 유닛을 활용하기 위해 연산자 수준에서 최적의 매핑을 수행하는 프레임워크입니다. 실행 특성을 기반으로 지연 시간과 에너지를 최소화하는 최단 경로 문제로 스케줄링을 공식화하여 성능을 극대화합니다.
확산 모델의 활성화 희소성이 하드웨어 구조(systolic-array)에서 어떻게 다르게 나타나는지 분석한 연구입니다. 요소 수준의 희소성이 실제 하드웨어 효율성을 과장할 수 있음을 지적하며, 워크로드별 컬럼 수준의 특성을 체계적으로 제시합니다.
보청기용 임베디드 FPGA 환경에서 SuDoRM-RF++ 아키텍처를 활용한 음성 향상 기술의 타당성을 연구했습니다. AMD-Xilinx Kria KV260을 통해 지연 시간과 전력 제약 조건 내에서의 성능을 분석했습니다.
AI 에이전트가 큐레이션한 오픈 소스 VLSI 벤치마크 스위트인 HighTide를 소개합니다. 다양한 설계 언어와 기술 노드를 지원하며, 12가지 에이전트 기술을 통해 설계 수명 주기 전반을 최적화합니다.
StepPRM-RTL은 RTL 코드 생성의 정확성을 높이기 위해 단계별 프로세스 보상 모델링(PRM)과 RAFT를 결합한 새로운 프레임워크입니다. MCTS를 통해 고품질 추론 궤적을 생성하며, 기존 방식 대비 기능적 정확도와 추론 충실도를 10% 이상 향상시켰습니다.
신경망 프로세서 설계 시 네트워크 학습, 칩 매핑, 제조, 자원 할당을 통합하는 엔드 투 엔드 공동 설계 프레임워크를 제안합니다. 단조 공동 설계 이론을 통해 각 설계 블록의 독립성을 유지하면서도 불확실성을 최적화 가능한 자원으로 다룹니다.
GPU 마이크로아키텍처에서 발생하는 Dead-Entry TLB 미스 현상을 분석하고, 이를 방지하기 위한 DEPOT 메커니즘을 제안합니다. 연구 결과, 특정 워크로드에서 최대 72%의 IPC 개선 효과를 확인했습니다.
컴퓨터 구조 분야의 논문 20개를 대상으로 AI 리뷰가 논문 작성 과정을 개선할 수 있는지 실증적으로 연구했습니다. AI 리뷰가 인간의 리뷰와 유사한 문제를 지적하면서도 새로운 관점을 제시할 수 있음을 확인했습니다.
AURA-Mem은 엣지 하드웨어의 제한된 메모리 환경을 위해 설계된 로봇 정책용 메모리 기술입니다. 액션 게이트를 통해 필요한 순간에만 정보를 기록함으로써, 일정한 VRAM 사용량을 유지하면서도 KV-cache 대비 쓰기 횟수를 획기적으로 줄입니다.