Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
가정용 피부 병변 스크리닝을 위한 65nm 멀티모달 베이지안 추론 엔진을 제안합니다. Compute-in-memory 아키텍처와 보정 불필요 GRNG를 통해 온디바이스 환경에서 높은 에너지 효율과 불확실성 모델링 성능을 구현했습니다.
소형 위성의 제한된 임베디드 환경에서 양자화된 AI 추론 성능을 특성화하는 연구를 다룹니다. Cortex-M 플랫폼을 기준으로 임베디드 비전 워크로드의 실행 시간, 데이터 이동, 명령어 효율성을 분석하여 설계 기준점을 제시합니다.
65nm 공정을 활용하여 추론당 11.3nJ의 초저전력을 달성한 저혈당 예측 엔진을 제안합니다. 확률적 결정 트리를 기반으로 한 하이브리드 아키텍처를 통해 의료 데이터의 노이즈에 강건하며 설명 가능한 엣지 AI 성능을 입증했습니다.
다양해지는 AI 모델 아키텍처에 대응하기 위해 이기종 NPU(HPU) 설계를 지원하는 MOSAIC 프레임워크를 제안합니다. MOSAIC는 타일 유형, 데이터 흐름, 특수 기능 유닛 등을 포함한 광범위한 설계 공간을 탐색하여 최적의 하드웨어 구성을 도출합니다.
CASS-RTL은 LLM의 내부 어텐션 메커니즘을 활용하여 정확한 RTL 코드를 생성하는 새로운 프레임워크입니다. 모델 재학습 없이 저차원 서브스페이스 스티어링을 통해 RTL 생성의 논리적 정확도를 높입니다.
비선형 활성화 함수의 하드웨어 효율적인 구간별 근사를 위한 전공간 양자화 기반 아키텍처(FQA)를 제안합니다. FQA는 양자화 오차를 종합적으로 고려하여 최적 계수 범위를 탐색하며, 기존 방식 대비 면적과 전력 소모를 50% 이상 절감합니다.
GPU의 호스트-디바이스 동기화 지연과 커널 스케줄링 오버헤드를 해결하기 위한 새로운 CUDA 런타임 프레임워크 SET를 제안합니다. 이벤트 체이닝과 워크 스틸링을 활용하여 하드웨어 자원 활용도를 극대화하고 메모리 안전성을 보장합니다.
본 연구는 2.5D 및 3D FPGA의 성능 향상을 위한 멀티 다이 라우팅 아키텍처 모델링 및 최적화 방법을 제안합니다. 오픈 소스 FPGA CAD 도구인 VTR을 개선하여 다이 간 연결 밀도와 지연 시간 문제를 해결하고 설계 공간을 탐색했습니다.
BIDENT는 엣지 SoC의 CPU, GPU, NPU 등 이기종 프로세싱 유닛을 활용하기 위해 연산자 수준에서 최적의 매핑을 수행하는 프레임워크입니다. 실행 특성을 기반으로 지연 시간과 에너지를 최소화하는 최단 경로 문제로 스케줄링을 공식화하여 성능을 극대화합니다.
우주 환경의 열 제약 조건 하에서 GPU와 Compute-In-Memory(CIM) 가속기의 성능을 비교 분석한 연구입니다. 방열기 용량과 연동된 공동 설계 방법론을 통해 CIM이 GPU보다 열 분포가 균일하고 에너지 효율(TOPS/W) 면에서 우수함을 입증했습니다.
SNN의 온칩 학습 시 발생하는 에너지 및 하드웨어 오버헤드를 해결하기 위해 ITP-STDP 학습 엔진 아키텍처를 제안합니다. 2의 거듭제곱 기반의 고유 타이밍 방식을 통해 계산 복잡도를 획기적으로 낮추었습니다.
확산 모델의 활성화 희소성이 하드웨어 구조(systolic-array)에서 어떻게 다르게 나타나는지 분석한 연구입니다. 요소 수준의 희소성이 실제 하드웨어 효율성을 과장할 수 있음을 지적하며, 워크로드별 컬럼 수준의 특성을 체계적으로 제시합니다.
보청기용 임베디드 FPGA 환경에서 SuDoRM-RF++ 아키텍처를 활용한 음성 향상 기술의 타당성을 연구했습니다. AMD-Xilinx Kria KV260을 통해 지연 시간과 전력 제약 조건 내에서의 성능을 분석했습니다.
AI 에이전트가 큐레이션한 오픈 소스 VLSI 벤치마크 스위트인 HighTide를 소개합니다. 다양한 설계 언어와 기술 노드를 지원하며, 12가지 에이전트 기술을 통해 설계 수명 주기 전반을 최적화합니다.
StepPRM-RTL은 RTL 코드 생성의 정확성을 높이기 위해 단계별 프로세스 보상 모델링(PRM)과 RAFT를 결합한 새로운 프레임워크입니다. MCTS를 통해 고품질 추론 궤적을 생성하며, 기존 방식 대비 기능적 정확도와 추론 충실도를 10% 이상 향상시켰습니다.
신경망 프로세서 설계 시 네트워크 학습, 칩 매핑, 제조, 자원 할당을 통합하는 엔드 투 엔드 공동 설계 프레임워크를 제안합니다. 단조 공동 설계 이론을 통해 각 설계 블록의 독립성을 유지하면서도 불확실성을 최적화 가능한 자원으로 다룹니다.
GoldenFloat(GF)은 Lucas-Exact 정수 항등식을 활용하여 GF4부터 GF256까지 확장 가능한 정적 분할 부동 소수점 제품군입니다. RTL 생성기, 정수 기반 누산기 경로, 그리고 FPGA 코덱 구현을 통해 하드웨어 지향적 설계를 제시합니다.
아날로그 인메모리 컴퓨팅(AIMC) 가속기의 효율성을 높이기 위한 이기종 매핑 통합 워크플로우를 제안합니다. DNN 워크로드를 아날로그 타일과 디지털 장치에 최적으로 분할하는 4단계 프로세스를 구축하고 GPT-2 모델을 통해 검증했습니다.
GPU 마이크로아키텍처에서 발생하는 Dead-Entry TLB 미스 현상을 분석하고, 이를 방지하기 위한 DEPOT 메커니즘을 제안합니다. 연구 결과, 특정 워크로드에서 최대 72%의 IPC 개선 효과를 확인했습니다.
컴퓨터 구조 분야의 논문 20개를 대상으로 AI 리뷰가 논문 작성 과정을 개선할 수 있는지 실증적으로 연구했습니다. AI 리뷰가 인간의 리뷰와 유사한 문제를 지적하면서도 새로운 관점을 제시할 수 있음을 확인했습니다.