Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
MoE 모델의 전문가 라우팅 패턴을 GPU 텔레메트리로 분석하여 유해성을 탐지하는 비침습적 감사 프레임워크 RouteScan을 제안합니다. 이 방식은 프롬프트 내용에 직접 접근하지 않고도 높은 정확도로 악의적 입력을 식별하며 개인정보 보호 성능도 우수합니다.
자율 주행 시나리오를 바탕으로 이기종 시스템에서의 오버레이와 커스텀 가속 아키텍처 간의 트레이드오프를 분석합니다. 워크로드 변동과 재구성 지연 시간 등 실제 조건을 고려하여 최적의 배포 전략을 제시합니다.
DAE4HLS는 고수준 합성(HLS)에서 메모리 수준 병렬성을 극대화하기 위해 요청과 응답을 명시적으로 분리하는 새로운 프로그래밍 모델을 제안합니다. 이를 통해 기존 HLS가 처리하기 어려웠던 복잡한 메모리 접근 패턴을 가진 대규모 데이터셋 워크로드의 성능을 획기적으로 개선합니다.
ACALSim은 현대 GPU 및 AI 가속기 설계를 위한 확장 가능한 병렬 시뮬레이션 프레임워크입니다. 플러그형 스레드 관리와 공유 메모리 모델을 통해 기존 SST 대비 14배 이상의 속도 향상과 낮은 메모리 사용량을 달성했습니다.
Masked Diffusion 모델의 계산 중복 문제를 해결하기 위해 하드웨어-소프트웨어 공동 설계 가속기인 MASQ를 제안합니다. 단계별 다중 정밀도 양자화와 타임스텝 인지 스케줄링을 통해 이미지 품질을 유지하며 연산 속도와 에너지 효율을 대폭 향상했습니다.
UniSpike는 뉴로모픽 시스템에서 SNN 가속 시 발생하는 패킷 기반 스파이크 통신의 주소 중복 문제를 해결하는 하드웨어-소프트웨어 공동 설계 방식입니다. 목적지 중심 스케줄링과 패킷 조립 기술을 통해 트래픽을 줄이고 에너지 효율을 높입니다.
RAG의 핵심인 ANNS 성능을 높이기 위해 DIMM 기반 근접 데이터 처리(NDP)와 PCA 기반 조기 종료 기술을 결합한 NASZIP 프레임워크를 제안합니다. 하드웨어와 소프트웨어의 공동 설계를 통해 메모리 대역폭 제한 문제를 해결하고 검색 속도를 획기적으로 개선했습니다.
비디오 Diffusion Transformer(DiT)의 계산 비용을 줄이기 위해 제안된 ORBIS 기술을 소개합니다. 분포 인식 매칭(DATM) 알고리즘과 SW-HW 공동 설계 가속기를 통해 토큰 감소율을 높이고 에너지 효율을 극대화했습니다.
본 연구는 트랜지스터의 양자적 구성을 활용한 새로운 범용 양자 컴퓨팅 아키텍처를 제안합니다. '텔레시스터(telesistors)'라 명명된 이 기술은 대칭 보호 위상 질서를 통해 노이즈를 억제하며, 능동적 오류 수정 없이도 높은 충실도의 클리포드 게이트를 제공하여 낮은 오버헤드의 결함 허용 인코딩을 가능하게 합니다.
RFAmpDesigner는 무선 주파수(RF) 증폭기 설계를 자동화하기 위해 제안된 자기 진화형 멀티 에이전트 LLM 프레임워크입니다. 고차원 파라미터 튜닝을 저차원 자원 배분 문제로 재구성하고 RAG를 통해 과거 설계 지식을 재사용함으로써, 데이터 부족과 복잡한 수치적 특성 문제를 해결합니다.
Arcane은 하드웨어 설계 검증 시 발생하는 중복된 어설션 문제를 해결하기 위한 새로운 프레임워크입니다. 의미론적 클러스터링과 MCTS(Monte Carlo Tree Search)를 결합하여, 검증 성능을 유지하면서도 어설션의 개수를 최대 76.2%까지 줄여 시뮬레이션 효율을 대폭 향상시킵니다.
본 논문은 스마트 홈 환경에서 비침습적인 상호작용을 위해 표면 진동을 활용한 엔드-투-엔드 제스처 인식 시스템을 제안합니다. 압전 센서 기반의 하드웨어부터 데이터 전처리, 그리고 Depthwise separable 1D-CNN 모델에 이르는 전체 파이프라인을 구축하여 사용자 독립적인 높은 인식 정확도를 달성했습니다.
초전도 양자 소자의 게이트 및 판독 충실도가 시간에 따라 변하는 드리프트 문제를 해결하기 위해, 런타임 교정을 상태-궤적 피드백 제어 문제로 공식화한 연구입니다. 고정된 시간 예산 내에서 교정 시점과 복구 동작을 최적화하여 전체 실행 창 동안의 최적화 격차를 최소화하는 것을 목표로 합니다. 실험 결과, 클라우드형보다는 로컬 밀리초 및 타이트 루프 영역의 피드백 제어가 워크로드 품질 개선에 유의미한 이득을 제공함을 확인했습니다.
초저전력 애플리케이션을 위한 BMRU의 그래디언트 차단 문제를 해결하기 위해 새로운 누적 업데이트 공식을 제안합니다. 제안된 CMRU와 $\alpha$CMRU는 지속적인 메모리를 유지하면서도 그래디언트 흐름을 복구하여 학습 안정성과 성능을 크게 향상시켰습니다. 실험 결과, 이 모델들은 작은 크기에서도 LRUs 및 minGRUs와 대등하거나 더 뛰어난 성능을 보이며 장거리 의존성 학습에 강점을 나타냈습니다.
현대 서버 워크로드의 방대한 명령어 발자국으로 인한 L1I 캐시 프리페칭의 한계를 극복하기 위한 새로운 마이크로아키텍처 프레임워크 IP-CaT를 제안합니다. IP-CaT는 주소 변환 지연을 줄이는 tPB와 코드 라인의 재사용 특성을 고려한 TIPRP 교체 정책을 통해 성능을 최적화합니다. 실험 결과, 기존의 최첨단 프리페처 및 캐시 교체 정책들보다 우수한 성능 향상을 입증했습니다.
ChipMATE는 산업 현장의 보안 요구 사항과 검증 프로세스를 반영하여 설계된 최초의 자체 학습 멀티 에이전트 RTL 생성 프레임워크입니다. Verilog 에이전트와 Python 참조 모델 에이전트가 서로를 상호 검증하는 구조를 통해 골든 오라클 없이도 높은 정확도를 확보하며, 2단계 학습 파이프라인을 통해 협업 능력을 극대화했습니다. 실험 결과, VerilogEval V2에서 DeepSeek V4를 능가하는 뛰어난 pass@1 성능을 기록했습니다.
본 논문은 RISC-V 반도체 공급망 분석을 위해 LLM과 VLM을 결합한 다중 모달 워크플로우를 제안합니다. 텍스트와 시각적 데이터를 통합하여 지식 그래프를 구축하고, 모델 주도 공학(MDE)을 통해 공급망의 의존성 검증 및 리스크 평가를 수행합니다. 이를 통해 복잡한 반도체 생태계 내에서 회복 탄력성을 체계적으로 평가하고 의사결정을 지원할 수 있음을 입증했습니다.
PoisonCap은 CHERI 시스템을 위해 설계된 확장 가능한 계층적 시간적 안전성 솔루션으로, 엄격한 Use-after-free(UAF) 보호와 초기화 안전성을 제공합니다. 새로운 'poison' Capability 형식을 도입하여 기존 Cornucopia Reloaded의 한계를 극복하고, 성능 저하 없이 메모리 안전성을 강화합니다.
Vision Transformers(ViT)를 엣지 디바이스에 배포할 때 발생하는 계층 정규화의 계산 복잡성과 병목 현상을 해결하기 위한 새로운 프레임워크를 제안합니다. 유전 프로그래밍(GP)을 통해 각 계층에 최적화된 이질적인 스칼라 함수를 진화시킴으로써, 모델의 전면적인 재학습 없이도 높은 정확도를 유지하며 하드웨어 효율성을 극대화합니다.
본 연구는 소비자용 노트북의 통합 GPU를 활용하여 양자 상태 벡터 시뮬레이션의 성능을 최적화하는 벤더 중립적 접근 방식을 제안합니다. 낮은 공간 지역성으로 인한 메모리 대역폭 병목 현상을 해결하기 위해 마지막 레벨 캐시(LLC) 지역성을 극대화하는 상태 분할(State partitioning) 최적화 기법을 도입했습니다. 실험 결과, Intel 및 Apple Silicon 아키텍처 모두에서 큐비트 규모가 커짐에 따라 발생하는 성능 저하를 완화하고 GPU 가속 성능을 유의미하게 향상시켰습니다.