Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 다채널 시계열 데이터의 시간적 불일치 문제를 해결하기 위해 최소 설명 길이(MDL) 기반의 진단 방법을 제안합니다. 이 방법은 센서 그룹 간의 상대적 지연을 측정하여, 기존 솔루션이 놓칠 수 있는 잠재적인 동기화 오류를 식별할 수 있습니다. 이는 훈련 및 배포 환경 모두에서 시계열 분류 성능 저하의 원인을 진단하는 범용 도구 역할을 합니다.
본 논문은 GPU 기반 컴퓨팅 플랫폼의 비효율성을 해결하기 위해 FastPair라는 새로운 GPU 디코더를 제안합니다. 기존 사전 코딩 방식이 분산 읽기 및 짧은 출력 쓰기로 인해 GPU 하드웨어와 잘 맞지 않는 문제를 개선했습니다. FastPair는 조회 과정을 재구성하고 부분 문자열을 모아 연속적인 출력 쓰기를 수행함으로써 성능을 크게 향상시켰습니다.
본 논문은 Dynamic-vision-sensor (DVS) 카메라의 이벤트를 처리하는 초저지연 그래프 신경망 프로세서 ETHEREAL을 제안합니다. ETHEREAL은 스플라인 컨볼루션 엔진과 공간-시간 캐싱 메커니즘을 통합한 2D/3D 분할 메모리 계층 구조를 갖추고 있습니다. 이를 통해 최신 워크로드에서 이벤트당 1.7μJ의 낮은 에너지 소비와 25.6μs의 초저지연 추론 성능을 달성했습니다.
본 논문은 전자 설계 자동화(EDA) 분야에서 LLM을 활용하는 통합적인 워크플로우를 제시합니다. 특히, 모호성을 줄인 '제어된 자연어(CNL)' 사양과 형식 속성 검증(FPV)을 결합한 'FV Gherkin 시나리오'를 도입했습니다. 이 방법론은 기존 LLM 기반 방식보다 하드웨어 설계의 기능적 정확도와 어설션 커버리지를 크게 향상시켰습니다.
본 연구는 스파이킹 신경망(SNNs)의 온라인 STDP 학습을 위한 완전 아날로그 메모리 저항 시냅스 회로를 제안합니다. 이 시냅스는 외부 디지털 제어 없이도 전/후 스파이크로부터 직접 시간 의존적 컨덕턴스 업데이트를 생성하며, 130 nm CMOS 기술 기반으로 구현되었습니다.
EdgeXpert는 MoE와 추측적 디코딩을 결합할 때 발생하는 호환성 문제를 해결하기 위한 소프트웨어-하드웨어 공동 설계 가속기입니다. 프롬프트 단위의 전문가 재사용과 깊이 인식 전문가 병합 기술을 통해 메모리 액세스를 최소화합니다. 이를 통해 정확도를 유지하면서 지연 시간과 에너지 소비를 획기적으로 줄였습니다.
PowerScope는 RTL 시뮬레이션 트레이스를 활용하여 서브 클록 사이클 단위의 전력을 추정하는 최초의 ML 기반 프레임워크입니다. 기존 게이트 레벨 분석 대비 약 80배 빠른 속도를 제공하며, 높은 정확도로 전력 부채널 보안 평가에도 활용 가능합니다.
5단계 소프트 프로세서에서 주변 장치를 아키텍처 레지스터에 직접 매핑하여 명령 없이 센서 값을 읽는 특화 설계 사례를 다룹니다. PWM 채널을 하드웨어로 오프로드하여 소프트웨어의 부담을 줄이고 제어 루프의 효율성을 극대화했습니다.
PLoRA는 Multi-LoRA 서빙의 메모리 병목 문제를 해결하기 위해 NDP(Near-Data Processing)와 풀드 메모리(Pooled-Memory)를 결합한 시스템입니다. CXL 및 NVLink 환경에서 어댑터와 KV 캐시를 효율적으로 관리하여 디코딩 지연 시간을 획기적으로 단축합니다.
양자 제어 시스템의 메모리 병목 현상을 해결하기 위해 DRAM과 BRAM을 통합한 새로운 메모리 계층 구조인 Ant-Q를 제안합니다. Ant-Q는 결정론적 타이밍을 보장하며 파이프라인 방식의 양자 회로 실행을 지원하여 회로 로딩 및 판독 오버헤드를 획기적으로 줄입니다.
Deltoris는 효율적인 확산 기반 VLA 모델 추론을 위한 알고리즘-하드웨어 공동 설계 프레임워크입니다. 비트 수준 희소성과 추측적 추론 기술을 통해 에지 디바이스의 지연 시간과 에너지 제약을 해결합니다.
병렬-순차 컴퓨팅 패턴을 가진 워크로드의 메모리 병목 현상을 해결하기 위한 MCHA 아키텍처를 제안합니다. 계층적 통신 전략과 새로운 프로그래밍 모델을 통해 데이터 전송 지연을 줄이고 메모리 대역폭 부담을 최소화합니다.
물리 설계(PD) IP 보호를 위해 Kerckhoffs 원칙을 준수하는 새로운 워터마킹 프레임워크 PDMarks를 제안합니다. 배치, CTS, 라우팅 등 여러 단계에 걸쳐 소유권 증거를 임베딩하여 보안성을 높였습니다.
이기종 DRAM-PIM-GPU 시스템의 LLM 추론 효율성을 높이기 위한 세 가지 핵심 설계 원칙을 제시합니다. 정적 전력 소비의 중요성, 채널 수에 따른 성능 변화, 그리고 시스템 전반의 공동 최적화 필요성을 강조합니다.
단일 호출 방식에서 벗어나 스스로 계획하고 도구를 사용하는 에이전트형 AI 워크플로우의 아키텍처적 변화를 분석합니다. 자율적 루프, 상태 관리, 도구 통합 등 복잡한 시스템 설계의 필요성을 다룹니다.
Mamba와 같은 상태 공간 모델(SSM)의 FPGA 배포 시 발생하는 메모리 및 대역폭 병목 현상을 해결하기 위한 LowRank-SSM 프레임워크를 제안합니다. SVD 기반의 가중치 분해 소프트웨어 알고리즘과 이중 경로 투영을 지원하는 하드웨어 가속기를 공동 설계하여 효율성을 극대화했습니다.
FPGA 및 ASIC 가속기에서 비선형 활성화 함수를 효율적으로 근사하기 위한 재구성 가능한 유닛인 CAMTA를 제안합니다. CAMTA는 재합성 없이도 다양한 함수의 대칭성과 꼬리 동작을 지원하며, 기존 방식 대비 높은 정확도와 유연성을 제공합니다.
FPGA의 부분 재구성(Partial Reconfiguration)을 활용하여 LLM 가속에 필수적인 비선형 함수를 효율적으로 구현하는 PWL 보간 프레임워크를 제안합니다. 이 방식은 하드웨어 면적을 크게 절감하면서도 유연한 연산 지원이 가능함을 입증했습니다.
LACE는 RISC-V의 명령어 집합 아키텍처(ISAX) 확장을 자동화하기 위한 LLM 기반 멀티 에이전트 프레임워크입니다. 자연어 의도를 IR로 번역하고 RTL 편집 및 검증을 수행하여, 기존 방식 대비 생성 정확도를 72.8%까지 대폭 향상시켰습니다.
Fovea는 웨이퍼 스케일 시스템의 설계 공간 탐색(DSE)을 최적화하기 위한 새로운 방법론을 제시합니다. 물리적 영향을 고려한 설계 공간 정식화와 결정 도메인 가이드 교차 충실도 정제를 통해, 정확도를 유지하면서도 탐색 속도를 대폭 향상시킵니다.