Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM4RTL은 RTL(Register Transfer Level) 코드 생성을 위해 고품질 학습 데이터를 정제하는 JRCRC 파이프라인과 도구 지원 아키텍처를 제안합니다. 이를 통해 작은 모델로도 GPT-4o에 필적하는 VerilogEval 성능을 달성했습니다.
PANDA는 설계 의도와 레이아웃 생성을 연결하는 LLM 강화 아날로그 설계 프레임워크입니다. 토폴로지 합성, 사이징, 레이아웃 생성을 통합 관리하여 설계 성능을 높이고 작업 시간을 획기적으로 단축합니다.
LLM을 활용하여 계층적 하드웨어 형식 검증을 수행하는 통합 스위트 HierSVA를 제안합니다. RTL 전처리와 LLM을 결합해 SystemVerilog Assertions를 생성하며, 데이터셋과 벤치마크를 통해 LLM의 검증 성능을 다각도로 분석합니다.
Tiara는 원격 메모리 액세스 시 발생하는 간접 참조 장벽(Indirection Wall) 문제를 해결하기 위해 제안된 프로그래밍 가능한 라인 레이트 ISA입니다. 메모리 측 NIC에서 실행되는 명령어를 통해 다중 RTT 의존성을 단일 라운드 트립으로 압축하여 성능을 극대화합니다.
현대 DRAM의 동작 특성을 분석하여 성능, 보안, 에너지 효율을 향상시키기 위한 대규모 연구 인프라 'DRAM Bender'를 소개합니다. 새로운 실험 유형 지원과 인터페이스 표준 확장, 대규모 환경 최적화 업데이트를 포함합니다.
LLM 기반의 계층적 소스 레벨 대리 모델인 BigPower를 제안합니다. CPU 설계 단계에서 시뮬레이션 없이 소스 레벨 정보만으로 미세 모듈 단위의 전력 소비를 정확하게 추정할 수 있습니다.
Ramulator 2.1은 현대적인 DRAM 표준과 메모리 컨트롤러 기능을 지원하는 구성 가능한 메모리 시스템 시뮬레이터입니다. Python 기반 인터페이스를 도입하여 사용성과 확장성을 높였으며, HBM3/4 및 LPDDR5/6 등 최신 규격을 지원합니다.
Ramulator 2.0 DRAM 시뮬레이터의 정확도에 대한 기존 연구(Mess 논문)의 오류를 입증하고, 올바른 시뮬레이션 설정 및 사용 모범 사례를 제안합니다. 시뮬레이션 도구 사용 시 발생할 수 있는 오류를 방지하기 위한 가이드라인과 재현 가능한 연구 환경을 제공합니다.
하드웨어 설계 보안 검증을 자동화하기 위해 RTL 트레이스 데이터로부터 정보 흐름 경로를 구축하는 새로운 접근 방식을 제안합니다. 기존 연구가 레지스터 간 정보 흐름 탐지에 국한되었던 한계를 넘어, 민감한 정보의 전체 전파 경로를 재현하는 데 집중합니다.
SPEAR는 저비트 LLM 서빙 시 발생하는 양자화 오차를 줄이기 위한 적응형 복구 시스템입니다. 토큰별 게이트와 경량 오차 보상기를 활용해 모델 성능 저하를 최소화하면서도 효율적인 서빙을 가능하게 합니다.
반도체 제조 공정에서 물리적 제약 조건을 준수하는 생성형 AI 구축의 중요성을 다룬 논문입니다. 사후 필터링 대신 모델 구축 단계부터 물리 법칙을 통합하는 아키텍처와 통합 패턴을 제안합니다.
AMD XDNA2 NPU에서 AWQ와 같은 양자화된 LLM을 효율적으로 추론하기 위한 커널 라이브러리 TileFuse를 제안합니다. 혼합 정밀도 커널과 데이터플로우 설계를 통해 성능과 에너지 효율을 획기적으로 개선했습니다.
멀티 칩렛 GPU 환경에서 LLM의 GEMM 연산 시 발생하는 칩렛 간 트래픽을 최소화하기 위한 타일 수준의 로컬리티 시뮬레이터를 제안합니다. 시뮬레이션 결과, CTA 순회 순서와 데이터 배치가 원격 트래픽에 결정적인 영향을 미침을 확인했습니다.
멀티 칩렛 GPU의 비균일 메모리 환경에서 데이터 지역성을 최적화하기 위한 Chiplet-Contiguous Layout을 제안합니다. 이 방식은 OS나 하드웨어 변경 없이 페이지 단위 배치와 호환되며, LLM 연산 시 원격 HBM 트래픽을 획기적으로 감소시킵니다.
엣지 바이오일렉트로닉스 시스템을 위해 에너지 효율을 극대화한 준-확률적 시스톨릭 아키텍처 BenDi를 제안합니다. BenDi는 다단계 최적화를 통해 기존 기술 대비 면적과 에너지 효율을 획기적으로 개선하면서도 높은 CNN 정확도를 유지합니다.
분산 AI 워크로드의 멀티-GPU 네트워크 통신 트래픽을 정밀하게 모델링하는 시뮬레이션 프레임워크 Eidola를 소개합니다. gem5를 확장하여 사이클 수준의 정밀도로 피어 투 피어 GPU 통신과 동기화 동작을 에뮬레이션할 수 있습니다.
웨어러블 기기의 제한된 연산 및 에너지 자원 환경에서 EEG 신호를 분석하기 위한 딥러닝 모델의 복잡도 감소 방안을 연구합니다. 파라미터 양자화와 전극 감소 기술을 통해 모델의 정확도와 연산 복잡도 사이의 트레이드오프를 분석합니다.
상온에서 작동하는 10,000 노드 p-큐비트 기반 뉴로모픽 프로세서 'Apollo'를 소개합니다. 양자 엔트로피를 활용해 초고속 확률론적 전이를 구현하며, 기존 극저온 양자 어닐러보다 효율적인 최적화 성능을 보여줍니다.
본 논문은 기존 딥러닝 하드웨어 패러다임이 요구하는 고비용의 부동소수점 연산(FP)에 도전하는 새로운 프레임워크를 제시합니다. 이 프레임워크는 8비트 정수 경계 내에서 작동하며, 비모수적이고 학습이 필요 없는 이중 매니폴드 매핑을 통해 FP 곱셈기 없이도 고성능 추론을 구현합니다.
본 기사는 스파이킹 신경망(SNN)의 병렬성을 극대화하기 위한 하드웨어-소프트웨어 공동 설계 프레임워크인 SupraSNN을 소개합니다. SupraSNN은 시냅스와 뉴런 계산을 물리적으로 분리하여 높은 시냅스 레벨 병렬성을 달성하는 슈퍼스칼라 아키텍처를 채택했습니다. 이 아키텍처는 Multi-Cast Tree와 Merge Tree를 활용하며, FPGA 구현 결과 이전 대비 낮은 지연 시간과 높은 에너지 효율을 입증했습니다.