Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 AI 에이전트가 하드웨어 아키텍처를 설계할 때, 단순히 성능 개선을 넘어 '왜' 개선되었는지 이해하는지 탐구합니다. AutoTuring이라는 새로운 평가 방식을 도입하여, 명시적 지식(named knobs)과 익명 변수(anonymous variables)로 구성된 동일한 가속기 공간에서 에이전트를 테스트했습니다. 그 결과, 아키텍트가 모델링된 H200보다 높은 성능을 보였으나, 구조화된 비평은 오히려 대체재처럼 작동하는 경향을 발견했습니다.
Rosetta는 연구 논문 PDF를 입력받아 제1원리 분석 모델을 자동으로 생성하는 다중 에이전트 LLM 파이프라인입니다. 이 시스템은 수학적 명세, 실행 가능한 Python 코드, 그리고 영어 해석본을 인간의 개입 없이 자율적으로 산출합니다. 특히 형식화 과정 자체가 논문의 암묵적인 가정을 표면화하고 누락된 매개변수를 식별하는 데 큰 가치를 제공합니다.
본 논문은 고정된 와이어 예산 내에서 트래픽 인식 익스프레스 링크를 추가하는 'Budgeted Express-Mesh'라는 토폴로지-라우팅 공동 설계 방식을 제안합니다. 이 방식은 시뮬레이션 가이드 어닐링을 통해 배치 과정을 개선하며, 최적화된 경로는 높은 부하 처리량과 안정성을 보여줍니다.
본 논문은 LLM 서비스에 필요한 메모리 용량을 해결하기 위해 HBFlex라는 유연 메모리 시스템을 제안합니다. HBFlex는 KV 캐시의 읽기, 쓰기, 회수 과정에 최적화된 조정 기법을 적용하여 HBF의 평면 활용도를 개선했습니다. 이를 통해 기존 대비 높은 처리량 속도 향상을 달성하며 LLM 서비스 효율성을 높입니다.
본 논문은 하드웨어 구성 언어(HCLs)의 효과를 정량적으로 비교합니다. 엣지 Physical-AI 추론의 핵심 블록인 OCP MXFP4 내적을 동일한 고정 디자인에 적용하여, SystemVerilog, Chisel, SpinalHDL 등 여러 HCL과 C++ 기반 HLS를 비교했습니다. 그 결과, HCL들은 면적 및 타이밍 측면에서 수작업 RTL과 유사하거나 우수한 성능을 보였으며, 선택은 QoR보다 생태계 적합성에 달려있음을 제시합니다.
본 연구는 혼성 신호 SoC의 아날로그 핀 방향성이 보안 속성으로 충분히 다루어지지 않는 문제를 지적하며, 데이터 종속적인 회로 오프셋 변조를 이용한 새로운 데이터 유출 공격 클래스를 식별하고 시연했습니다. 이 공격은 명목상 입력 전용 핀을 외부 정보 채널로 전환하여 생체 신호(PPG) AFE에서 최대 10kbps의 비트율로 데이터를 유출할 수 있음을 실리콘 측정으로 입증합니다.
본 논문은 DNN 추론의 오차를 줄이는 근사 곱셈기 평가의 어려움을 해결하기 위해 FPGA 기반 플랫폼 FAME을 제안합니다. FAME은 하드웨어에 직접 구현하여 기존 CPU/GPU 방식 대비 평가 시간을 크게 단축하며, 패턴 기반 재학습 기법으로 정확도 저하까지 효과적으로 개선했습니다.
본 논문은 공정성(fairness)을 고려한 모델 압축에 필요한 다양한 기법들을 통합한 에이전트 프레임워크인 FairCompressAgent (FCA)를 제안합니다. FCA는 가지치기, 양자화, 희소 저랭크 분해 등의 방법을 하나의 인터페이스로 묶어 최적의 압축 구성을 선택하고 평가할 수 있습니다.
본 논문은 재생 에너지 및 EV 충전으로 인한 전력망 고조파 왜곡 문제를 해결하기 위해 효율적인 광범위 학습(EBL) 프레임워크를 제안합니다. EBL은 BLS 스타일 하모닉 추정을 위한 양자화된 FPGA 가속 프레임워크로, 높은 정확도와 초저지연성을 제공합니다. 특히 폐쇄형 해법 기반의 온라인 전이 학습을 통해 빠른 적응성과 효율적인 자원 사용률을 입증했습니다.
본 연구는 FPGA 기반 SmartNIC에 머신러닝 기반 침입 탐지 시스템(IDS) 아키텍처를 제안합니다. 이 시스템은 P4와 RTL로 구현된 LogicNets IDS 모델을 통합하여, 낮은 지연 시간과 높은 자원 효율성을 유지하면서 실시간 고속 트래픽 검사를 가능하게 합니다. 특히 상태 저장 흐름 기반 접근 방식을 통해 패킷 수준에서 놓치기 쉬운 행위 패턴까지 포착하며, 기존 대비 탐지 정확도를 크게 향상시켰습니다.
본 논문은 사양 기반 제약 조건을 활용하여 LLM의 Verilog 코드 생성 성능을 향상시키는 자동화 프레임워크 SpecLens를 제안합니다. SpecLens는 행동적 발산을 분석해 사양 기반 제약을 도출하고, 생성 과정에서 오직 원본 사양만을 의미론적 소스로 사용합니다. 이를 통해 기존 SOTA 방식 대비 높은 기능 통과율 및 구문적 정확성을 달성했습니다.
본 논문은 자원 제약적인 엣지 환경에서 CNN 추론 시 발생하는 소프트 에러를 감지하는 새로운 기법인 carry-through checksum을 제안합니다. 이 방법은 컨볼루션 레이어에 전용 필터를 내장하여 체크섬을 계산하고, 이를 통해 단일 출력 검증만으로 엔드투엔드 오류 감지를 가능하게 합니다.
본 논문은 CHERI 같은 Capability 기반 아키텍처가 추측 실행(speculative execution)에 의존하는 현대 프로세서 환경에서 보안을 유지하기 어렵다는 점을 지적합니다. 연구진은 형식적 프레임워크를 개발하여 잠재적인 정보 누출을 입증하고, 이를 해결한 새로운 프로세서 설계인 SCHERI를 제시했습니다.
본 논문은 다채널 시계열 데이터의 시간적 불일치 문제를 해결하기 위해 최소 설명 길이(MDL) 기반의 진단 방법을 제안합니다. 이 방법은 센서 그룹 간의 상대적 지연을 측정하여, 기존 솔루션이 놓칠 수 있는 잠재적인 동기화 오류를 식별할 수 있습니다. 이는 훈련 및 배포 환경 모두에서 시계열 분류 성능 저하의 원인을 진단하는 범용 도구 역할을 합니다.
본 논문은 전자 설계 자동화(EDA) 분야에서 LLM을 활용하는 통합적인 워크플로우를 제시합니다. 특히, 모호성을 줄인 '제어된 자연어(CNL)' 사양과 형식 속성 검증(FPV)을 결합한 'FV Gherkin 시나리오'를 도입했습니다. 이 방법론은 기존 LLM 기반 방식보다 하드웨어 설계의 기능적 정확도와 어설션 커버리지를 크게 향상시켰습니다.
본 연구는 스파이킹 신경망(SNNs)의 온라인 STDP 학습을 위한 완전 아날로그 메모리 저항 시냅스 회로를 제안합니다. 이 시냅스는 외부 디지털 제어 없이도 전/후 스파이크로부터 직접 시간 의존적 컨덕턴스 업데이트를 생성하며, 130 nm CMOS 기술 기반으로 구현되었습니다.
EdgeXpert는 MoE와 추측적 디코딩을 결합할 때 발생하는 호환성 문제를 해결하기 위한 소프트웨어-하드웨어 공동 설계 가속기입니다. 프롬프트 단위의 전문가 재사용과 깊이 인식 전문가 병합 기술을 통해 메모리 액세스를 최소화합니다. 이를 통해 정확도를 유지하면서 지연 시간과 에너지 소비를 획기적으로 줄였습니다.
PowerScope는 RTL 시뮬레이션 트레이스를 활용하여 서브 클록 사이클 단위의 전력을 추정하는 최초의 ML 기반 프레임워크입니다. 기존 게이트 레벨 분석 대비 약 80배 빠른 속도를 제공하며, 높은 정확도로 전력 부채널 보안 평가에도 활용 가능합니다.
PLoRA는 Multi-LoRA 서빙의 메모리 병목 문제를 해결하기 위해 NDP(Near-Data Processing)와 풀드 메모리(Pooled-Memory)를 결합한 시스템입니다. CXL 및 NVLink 환경에서 어댑터와 KV 캐시를 효율적으로 관리하여 디코딩 지연 시간을 획기적으로 단축합니다.
양자 제어 시스템의 메모리 병목 현상을 해결하기 위해 DRAM과 BRAM을 통합한 새로운 메모리 계층 구조인 Ant-Q를 제안합니다. Ant-Q는 결정론적 타이밍을 보장하며 파이프라인 방식의 양자 회로 실행을 지원하여 회로 로딩 및 판독 오버헤드를 획기적으로 줄입니다.