Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
CVA6 코어를 실시간 시스템에 최적화하여 확장한 CVA6-RT 프로세서를 소개합니다. TLB 파티셔닝과 스크래치패드 모드 등을 통해 실행 가변성을 줄이고 결정론적 성능을 제공합니다.
SOLAR는 PyTorch 및 JAX 소스 코드로부터 AI 모델의 이론적 최소 실행 시간인 광속(Speed-of-Light) 경계를 자동으로 도출하는 프레임워크입니다. LLM과 결정론적 흐름을 결합하여 검증된 경계를 생성하며, 모델 최적화 및 하드웨어 프로비저닝을 위한 통찰력을 제공합니다.
기밀 가상 머신(CVM) 환경에서 발생하는 데이터베이스 쿼리 성능 저하 문제를 해결하기 위해 CVM 인지 비용 보정 방식을 제안합니다. 기존 옵티마이저의 비용 모델이 비암호화 VM에 맞춰져 있는 문제를 물리적 프록시를 통한 모델링으로 해결하여 성능을 최대 48% 개선했습니다.
첨단 패키징 환경에서 발생하는 하드웨어 보안 위협에 대응하기 위해 나노전기기계 시스템(NEMS)을 활용한 새로운 보안 메커니즘을 제안합니다. NEMS 기반의 PUF와 공진 지문 등을 통해 역공학 및 부채널 공격에 강한 물리적 보안 솔루션을 제공합니다.
GRAINS는 대규모 게놈 그래프 분석 시 발생하는 데이터 이동 오버헤드를 줄이기 위해 스토리지 인식 알고리즘-아키텍처 공동 설계를 제안합니다. 인스토리지 및 인플래시 프로세싱을 통해 기존 시스템 대비 성능과 에너지 효율을 획기적으로 개선했습니다.
SegFold는 SpGEMM(희소 행렬-행렬 곱셈)의 효율성을 높이기 위해 미세 조정된 동적 데이터플로우를 사용하는 새로운 가속기입니다. 동적 스케줄링과 리매핑 기술을 통해 데이터 재사용을 최적화하고 부하 균형 문제를 해결합니다.
Apple M4 Pro 칩셋에서 GPU 작업 종료 후 남겨지는 잔류 캐시 상태를 분석한 연구입니다. GPU 커널 실행 후 CPU 성능에 미치는 캐시 변위 현상을 규명하고, 이를 완화할 수 있는 소프트웨어 복구 메커니즘을 제안합니다.
초저전력 에지 컴퓨팅을 위해 IMPLY 기반 멤리스티브 인메모리 컴퓨팅(IMC) 아키텍처와 ISA를 제안합니다. 폰 노이만 병목 현상을 해결하기 위해 RV32I 표준을 기반으로 설계되었으며, 시뮬레이션을 통해 기존 마이크로컨트롤러 대비 에너지 효율성을 입증했습니다.
CHIA는 에이전트 기반 AI를 활용하여 하드웨어와 소프트웨어를 공동 설계할 수 있는 오픈 소스 프레임워크입니다. 복잡한 설계 워크플로우를 유향 순환 그래프 형태인 'CHIA 루프'로 구조화하여 대규모 시스템 설계 연구를 지원합니다.
본 논문은 에지 컴퓨팅 환경에서 CGRA의 설계 요소인 프로세싱 엘리먼트의 이질성과 Scratchpad Memory(SPM)가 연산 성능에 미치는 영향을 분석합니다. FFT, GEMM 및 트랜스포머 워크로드를 통해 데이터 이동 최적화와 에너지 효율성 간의 트레이드오프를 평가합니다.
VR 헤드셋의 전력 소비를 줄이기 위해 시야(FoV) 외 영역의 비트를 절단하는 SPORT 프레임워크를 제안합니다. WS-PSNR 최적화를 통해 화질 저하를 최소화하면서 메모리 전력과 대역폭을 최대 51.6%까지 절감할 수 있음을 입증했습니다.
클라우드 GPU 환경에서 특권 권한 없이도 물리적 가속기의 신원, 하드웨어 토폴로지 및 위치를 검증할 수 있는 소프트웨어 기반 인증서 기술을 제안합니다. CUDA 프로브와 지연 시간 측정을 통해 Blackwell 등 최신 GPU의 물리적 지문을 정확히 식별합니다.
SafeGen은 자동차 칩 설계의 기능 안전을 위해 LLM과 하이퍼 지식 그래프(HyperKG)를 결합한 새로운 프레임워크입니다. 설계 문서와 RTL 정보를 활용해 검증 가능한 어설션을 생성하고, 결함의 중요도를 의미론적으로 평가합니다.
FPGA 네트워크를 활용하여 100만 개의 p-bits를 갖춘 대규모 프로그래밍 가능한 확률적 컴퓨터를 구현했습니다. 단일 칩의 용량 한계를 극복하고 초당 1조 번 이상의 Gibbs 샘플링 속도를 달성하며, 분산 시스템의 성능을 결정하는 설계 규칙을 제시합니다.
GB-scale Last-Level Cache(LLC)를 활용하여 LLM 추론 성능을 극대화하는 새로운 캐시 상주 실행 모델을 제안합니다. 가중치 중심 연산자와 KV-캐시 관리를 분리하여 파이프라인 깊이와 관계없이 효율적인 추론이 가능하도록 설계되었습니다.
물리적 제약 조건을 고려하지 못하는 기존 에이전트의 한계를 극복하기 위해, 하드웨어 준수 컴퓨팅 시스템을 자율 설계하는 멀티 에이전트 엔진을 제안합니다. 진화적 지식 그래프와 알고리즘적 사고의 사슬을 활용하여 하드웨어-소프트웨어 공동 설계의 새로운 패러다임을 제시합니다.
FPGA 상에서 MSDF Digit-Serial 산술 연산을 활용하여 U-Net 아키텍처를 에너지 효율적으로 가속하는 MMA(Merged Multiply-Add) 구조를 제안합니다. 통합 파이프라인 설계를 통해 연산 지연을 줄이고 처리량을 높여, 기존 CPU 대비 최대 10배 높은 에너지 효율을 달성했습니다.
Croc는 RISC-V 플랫폼을 기반으로 한 엔드투엔드 오픈 소스 SoC 설계 및 제작 흐름을 제공합니다. 폐쇄형 EDA 도구 대신 오픈 소스 IP와 PDK를 활용하여 도메인 특화 칩 설계 교육을 가능하게 합니다.
숙련된 로봇 손을 위해 방향성 강성을 조절할 수 있는 파라메트릭 이중 나선(PDS) 순응형 관절을 제안합니다. 나선형 템플릿과 비대칭 비율을 통해 강성을 맞춤화하며, 내장형 유도성 고유 수용 감각을 통해 정밀한 상태 추정이 가능합니다.
Kolmogorov-Arnold 네트워크(KAN)에서 영감을 받아, 아날로그 소자의 비선형성을 활용한 저전력 물리적 신경망 구조를 제안합니다. 이 방식은 연속 제어 및 로봇 운동학 분야에서 기존 MLP보다 적은 노드로 효율적인 계산이 가능하며, CMOS 구현 시 약 30μW의 초저전력 동작을 목표로 합니다.