Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Deltoris는 효율적인 확산 기반 VLA 모델 추론을 위한 알고리즘-하드웨어 공동 설계 프레임워크입니다. 비트 수준 희소성과 추측적 추론 기술을 통해 에지 디바이스의 지연 시간과 에너지 제약을 해결합니다.
병렬-순차 컴퓨팅 패턴을 가진 워크로드의 메모리 병목 현상을 해결하기 위한 MCHA 아키텍처를 제안합니다. 계층적 통신 전략과 새로운 프로그래밍 모델을 통해 데이터 전송 지연을 줄이고 메모리 대역폭 부담을 최소화합니다.
Mamba와 같은 상태 공간 모델(SSM)의 FPGA 배포 시 발생하는 메모리 및 대역폭 병목 현상을 해결하기 위한 LowRank-SSM 프레임워크를 제안합니다. SVD 기반의 가중치 분해 소프트웨어 알고리즘과 이중 경로 투영을 지원하는 하드웨어 가속기를 공동 설계하여 효율성을 극대화했습니다.
FPGA 및 ASIC 가속기에서 비선형 활성화 함수를 효율적으로 근사하기 위한 재구성 가능한 유닛인 CAMTA를 제안합니다. CAMTA는 재합성 없이도 다양한 함수의 대칭성과 꼬리 동작을 지원하며, 기존 방식 대비 높은 정확도와 유연성을 제공합니다.
LACE는 RISC-V의 명령어 집합 아키텍처(ISAX) 확장을 자동화하기 위한 LLM 기반 멀티 에이전트 프레임워크입니다. 자연어 의도를 IR로 번역하고 RTL 편집 및 검증을 수행하여, 기존 방식 대비 생성 정확도를 72.8%까지 대폭 향상시켰습니다.
Fovea는 웨이퍼 스케일 시스템의 설계 공간 탐색(DSE)을 최적화하기 위한 새로운 방법론을 제시합니다. 물리적 영향을 고려한 설계 공간 정식화와 결정 도메인 가이드 교차 충실도 정제를 통해, 정확도를 유지하면서도 탐색 속도를 대폭 향상시킵니다.
Ternary LLM의 효율적인 어텐션 연산을 위해 부호 있는 자리수(Signed-Digit) 기반의 통합 룩업 테이블 추론 방식을 제안합니다. K/V 캐시를 스케일링된 다중 평면 방식으로 저장하여 캐시 저장소와 연산 사이의 밀집된 실체화 과정을 생략하고 하드웨어 효율성을 높입니다.
저비트 LLM 추론의 정확도 손실을 줄이기 위해 양자화 이질성을 고려한 새로운 마이크로스케일링 방식인 AdaMX를 제안합니다. AdaMX는 추가적인 비트 폭 증가 없이 블록 및 피연산자별로 최적의 정밀도를 선택하여 정확도를 크게 개선합니다.
검색 기반 희소 어텐션을 지원하기 위해 KV 캐시를 GPU 외부로 재배치하는 범용 PNM 설계인 KARAT을 제안합니다. GPU와 PNM 노드를 분리하여 연산 효율을 높이고, 스케줄링 최적화를 통해 파이프라인 버블을 최소화합니다.
ComFuse는 현대적 GPU 아키텍처를 위해 연산 집약적 연산자와 메모리 집약적 서브그래프를 결합하는 새로운 자동화된 GPU 컴파일 시스템입니다. 기존 컴파일러의 경직된 융합 경계를 극복하여 연산과 메모리 작업을 동시에 실행함으로써 성능을 최적화합니다.
3D 중성 원자 양자 컴퓨터를 위한 새로운 컴파일러 프레임워크인 Piqasso를 소개합니다. 기존 평면 구조의 한계를 넘어 수직축을 활용함으로써 원자 수송 거리를 단축하고 실행 속도와 충실도를 크게 향상시켰습니다.
3D Gaussian Splatting(3DGS) 가속기의 확장성 문제를 해결하기 위해 분리된 데이터플로우를 사용하는 DeGS 아키텍처를 제안합니다. 워크로드 파싱과 재구성을 통해 PE 활용도를 높여 기존 가속기 대비 높은 처리량과 에너지 효율을 달성했습니다.
LLM 추론 시 가중치와 활성화의 이중 희소성을 효율적으로 처리하기 위한 Celty 시스템을 제안합니다. RLC-CSC 포맷과 Sparse SIMT 마이크로아키텍처를 공동 설계하여 메모리 액세스를 최적화하고 추론 속도를 대폭 향상했습니다.
LEAP는 VLSI 설계의 전력 분석 효율성을 높이기 위해 제안된 자기 지도 학습 기반의 사이클별 토글 전파 예측 모델입니다. 그래프 트랜스포머를 활용하여 기존 EDA 도구보다 7.6배 빠른 속도와 높은 정확도를 동시에 달성했습니다.
커스텀 8단계 RISC-V 소프트 프로세서에서 FreeRTOS를 구현하고 RV32와 RV64 간의 지연 시간 차이를 분석한 연구입니다. RV64가 트랩 프레임 및 데이터 구조 확장으로 인해 태스크 스위칭과 선점에서 더 높은 오버헤드를 보임을 입증했습니다.
머신러닝 기반 예측기가 프로세서 성능 추정에서 보이는 한계를 분석한 연구입니다. 구조적 파라미터와 행동 정책 영역에서 ML 모델이 직관에 반하는 결과를 내거나 미세한 성능 차이를 구분하지 못하는 문제를 정보 이론적 관점에서 규명합니다.
현대 프로세서의 다양한 마이크로아키텍처 정책(프리페처, 교체 규칙 등) 간의 상호작용과 동적 선택 가능성을 연구한 논문입니다. SPEC CPU 벤치마크를 통해 정적 정책의 한계를 분석하고, 실행 성능 피드백과 수동 수요 모니터링을 통한 효율적인 정책 선택 메커니즘을 제안합니다.
차세대 가속기를 위한 에이전트 기반 커널 생성 프레임워크인 Zomboss를 제안합니다. 컴파일러의 심볼릭 인터페이스를 활용해 신경망 에이전트가 검증된 설계 공간 내에서 워크로드별 최적의 매핑을 결정하도록 합니다.
LLM이 금융 컴퓨팅용 FPGA 하드웨어 설계를 수행할 수 있는지 평가하는 벤치마크 FinHardBench를 제안합니다. 실험 결과, LLM은 시스템 수준의 설계 공간 탐색(DSE)에서 기존 최적화 알고리즘보다 높은 신뢰성을 보였으나, 코드 생성 성능과 아키텍처 최적화 성능 사이에는 차이가 있었습니다.
Forbench는 시뮬레이션의 직관성과 형식 검증의 수학적 엄격함을 결합한 심볼릭 시뮬레이션 프레임워크입니다. 기존 시뮬레이션의 한계인 코너 케이스 탐색 문제를 해결하며, Python 인터페이스를 통해 사용 편의성과 검증 속도를 대폭 향상시켰습니다.