Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 비선형 활성화 함수인 시그모이드(Sigmoid) 함수의 하드웨어 효율적인 FPGA 구현 방안을 제시합니다. 지수 계산이 필요한 시그모이드 함수를 쌍곡선 탄젠트(tanh) 함수와 수학적으로 연결하고, 이를 혼합 기수 초쌍곡선 회전 CORDIC (MR-HRC) 알고리즘으로 처리하여 하드웨어 오버헤드를 최소화했습니다. 제안된 아키텍처는 파이프라인화되어 Xilinx Virtex-7 FPGA에 구현되었으며, 낮은 리소스 사용량과 높은 정확도를 동시에 달성했음을 실험적으로 입증했습니다.
이 논문은 고차원 컴퓨팅(HDC) 또는 벡터 상징적 구조(VSA)에서 사용되는 이산 양극 정보를 연속적인 광대역 파동 형태로 명시적으로 임베딩하는 방법을 제시합니다. 이를 통해 HDC/VSA의 핵심 원시 연산들(번들링, 치환, 결합, 유사성)을 물리적으로 근거를 둔 파동 영역 실현으로 재정의하고, 이 과정에서 얻은 '파동-기하학적 쌍대성' 개념을 통해 향후 하드웨어 구현에 필요한 핵심 공학적 제약 조건을 제시합니다.
본 논문은 자연어 명세를 기반으로 SystemVerilog Assertions(SVA)를 자동으로 생성하는 ProofLoop라는 새로운 에이전트를 소개합니다. ProofLoop는 검색 증강 생성(RAG), EDA 도구 호출, 그리고 형식 검증 피드백을 반복적으로 활용하는 '솔버-인-더-루프' 접근 방식을 사용합니다. 이 프레임워크는 설계 컨텍스트를 자율적으로 수집하고, 최대 3회의 검증 라운드를 통해 SVA를 생성 및 개선함으로써 높은 문법적/기능적 정확도를 달성함을 입증했습니다.
본 연구는 기존 폰 노이만 아키텍처의 한계를 극복하기 위해 자기 터널 접합(MTJ) 기반 메모리에 논리 내 컴퓨팅 기능을 통합한 병렬 확률 컴퓨팅(SC) 아키텍처를 제안합니다. 이 아키텍처는 MTJ 디바이스의 고유한 확률적 특성을 활용하여, 외부 난수 생성 없이도 이진 연산을 확률적 비트 스트림으로 완전히 병렬 변환할 수 있습니다. 궁극적으로 데이터 저장, 비트 스트림 생성, 계산을 메모리 패브릭 내에 통합함으로써 데이터 이동을 최소화하고 메모리 레벨 병렬성을 극대화합니다.
본 논문은 Mixture-of-Experts (MoE) 아키텍처를 사용하는 대규모 언어 모델(LLMs)의 추론 과정에서 발생하는 병목 현상을 다룹니다. 특히, 여러 노드에 분산된 환경에서 발생하는 비효율적인 토큰 라우팅과 높은 all-to-all 통신 오버헤드를 해결하는 데 초점을 맞춥니다. 연구진은 실제 MoE 모델들의 전문가 활성화 패턴을 분석하여, 부하 불균형 및 도메인별 전문가 선호도 등의 공통 특성을 발견했으며, 이를 바탕으로 워크로드 인식 마이크로 배치 그룹화와 전문가 배치 전략을 제안했습니다. 이 최적화 기법은 노드 간 통신 데이터를 최대 20%까지 줄여 MoE 디코드 지연 시간을 개선하고 가속기 활용도를 높이는 효과를 입증했습니다.
본 논문은 벡터 양자화(VQ)를 활용하여 신경망 가중치를 효율적으로 압축하는 세 가지 기법을 개발하고 검증했습니다. 코사인 유사도 기반 할당 방식을 채택하고, 이를 top-1 샘플링 및 스트레이트-through 추정기(STE)와 결합하여 가중 평균 재구성을 제거함으로써 접근 방식을 개선했습니다. 또한, 미분 가능한 신경 구조 검색(NAS)을 활용하여 레이어별 양자화 구성을 최적화하는 방법을 제시합니다.
본 논문은 대규모 언어 모델(LLMs)의 추론 지연 시간 문제를 해결하기 위해 JIT 컴파일과 CUDA 그래프 실행을 결합한 하이브리드 런타임 프레임워크를 제안합니다. 이 프레임워크는 트랜스포머 추론 과정을 정적 및 동적 구성 요소로 분할하여, 각각 CUDA 그래프 재생 또는 JIT 커널 처리를 통해 효율적으로 실행합니다. 실험 결과, LLaMA-2 7B 모델에서 하이브리드 런타임은 첫 토큰 생성 시간(TTFT)을 최대 66.0% 감소시키고 낮은 P99 지연 시간을 달성하여, 짧은 시퀀스 워크로드의 실용적인 배포에 효과적임을 입증했습니다.
TimingLLM은 Verilog 코드에서 합성 전 타이밍(WNS/TNS)을 예측하기 위해 설계된 혁신적인 두 단계 검색 증강 LLM 프레임워크입니다. 이 시스템은 경량화된 구조적 단서로 경로 수준의 도착 시간/요구 시간을 추정하는 미세 조정된 LLM과, 가장 가까운 타이밍 레이블 모듈을 검색하여 WNS/TNS를 예측하는 LLM 기반 회귀기로 구성됩니다. TimingLLM은 기존 방법보다 1.3~1.6배 빠르게 실행되면서도 높은 정확도를 달성하여, RTL 반복 프로세스의 속도를 크게 향상시킵니다.
본 논문은 트랜스포머 모델에서 높은 하드웨어 비용을 차지하는 Softmax와 Layer Normalization(LayerNorm) 연산을 Edge 디바이스에 최적화한 아키텍처를 제안합니다. 기존 연구들이 순위 기반 작업에 초점을 맞춘 것과 달리, 본 설계는 점수 기반 NLP 및 생성형 AI 응용 프로그램에 필수적인 '보장된 정규화'를 유지하면서 하드웨어 효율성을 극대화했습니다. Verilog HDL로 구현된 이 아키텍처는 기존 대비 면적을 크게 줄이면서도 높은 정확도를 유지하는 것으로 입증되었습니다.
본 논문은 에지 AI 의료기기의 안전성을 확보하기 위해 아키텍처 격리(architectural isolation)를 통한 타이밍 안전성 원천의 중요성을 제시합니다. 동일한 MobileNetV2 모델을 NVIDIA Jetson Orin Nano Super에서 GPU 가속기(TensorRT FP16)와 CPU(ONNX Runtime FP32) 두 가지 경로로 실행하여, 정확도 유지와 더불어 부하 조건 하에서의 타이밍 제약 조건 위반 문제를 실험적으로 입증했습니다. 연구진은 추론 레이어의 안전성 요구사항을 충족시키기 위해 '안전 임계값 초과율(STER)'과 '지연 시간'의 공동 검증 방법을 제안하며, 이는 향후 FDA 규제 준수 및 임상 적용에 활용될 예정입니다.
FlowPlace는 반도체 물리 설계의 핵심 단계인 칩 배치 문제를 해결하기 위해 개발된 새로운 프레임워크입니다. 기존 생성형 모델 기반 솔루션들이 가진 무작위 데이터 의존성, 긴 샘플링 시간, 오버랩 문제 등의 한계를 극복했습니다. FlowPlace는 마스크 가이드드 합성 데이터 생성, 플로우 기반 효율적 학습, 그리고 하드 컨스트레인트 샘플링을 통해 높은 PPA 지표와 획기적으로 빠른 속도(10~50배)를 달성하며 오버랩이 없는 레이아웃을 제공합니다.
본 논문은 DRAM의 RowHammer 취약성에 대응하기 위해 'Rowhammer Vulnerability Count (RVC)'라는 새로운 프레임워크를 제안합니다. 기존 완화 기법들이 단순히 행(row)의 활성화 횟수를 추적하는 방식과 달리, RVC는 실제 비트 플립 위험에 처한 행만을 식별하여 선택적으로 리프레시를 발행함으로써 효율성을 극대화합니다. 이로써 불필요한 전력 소모와 시스템 지연을 크게 줄이면서도 기존 방법 대비 높은 보안 성능 향상을 달성했습니다.
본 논문은 FPGA 기반 가속기인 VTA(Versatile Tensor Accelerator)를 활용하여 복잡한 CNN 모델을 배포하는 방법을 다룹니다. 기존의 독립형 컴파일러가 가진 한계를 극복하기 위해, 연구진은 VTA 컴파일 체인을 확장하고 자동화함으로써 완전한 CNN 컴파일이 가능하도록 개선했습니다. 이 개선된 시스템은 온칩 메모리를 초과하는 대규모 매개변수를 포함하는 더 큰 CNN까지 지원하며, YOLO-NAS 모델을 성공적으로 컴파일 및 시뮬레이션하여 그 효과를 입증했습니다.
사고로 오른팔을 잃은 레딧 사용자가 게임 활동을 재개하기 위해 자신만의 단일 손용 컨트롤러를 프로토타입화하고 개발에 착수했습니다. 이 주변 장치는 마우스와 키패드를 하나의 인체공학적 장치로 통합하여, 사용자에게 PC 및 콘솔 환경에서 일손(one-handed) 사용의 자유를 제공하는 것을 목표로 합니다.
중동 지역의 지정학적 불안정으로 인해 전 세계 전자제품 공급망이 위협받고 있으며, 특히 핵심 PCB(인쇄회로기판) 및 칩 제조 재료를 공급하는 시설들이 공격 대상이 되고 있습니다. 이러한 교란은 글로벌 전자제품 시장에 심각한 균열을 일으켜 부품 부족 사태와 가전제품 가격 상승을 초래할 수 있는 위험 요인으로 작용하고 있습니다.
마이크로소프트와 오픈에이아이의 독점 계약이 종료되면서, 오픈에이아이는 아마존과 구글을 포함한 다양한 클라우드 제공업체를 활용할 수 있게 되었습니다. 이 변화는 AI 생태계 전반에 걸쳐 경쟁 구도를 재편하고 파트너십 기회를 확대하는 계기가 될 것으로 보입니다.
러시아 유튜버 채널 PRO Hi-Tech가 AMD Radeon RX 9600 XT 그래픽 카드와 조합한 32 코어 이르기시(Irtysh) C632 프로세서의 성능 테스트 결과를 공개했습니다. 이 시스템은 인기 게임인 '위쳐 3: 와일드 헌트'를 구동할 때 30프레임 이상을 기록하는 등 준수한 성능을 보여주었으나, 여전히 CPU 병목 현상이 발생함을 확인했습니다.
구글은 '클라우드 네็ก스트'에서 8세대 TPU를 발표하며, TPU 역사상 첫 이원화된 칩 설계 전략을 도입했습니다. 이번 신규 전략은 모델의 훈련(Training)과 추론(Inference)이라는 두 가지 핵심 워크로드를 각각 최적화한 전용 칩 설계를 제공합니다. 이를 통해 네트워크 규모가 100만 개 이상인 초대형 AI 시스템에서도 높은 확장성과 효율성을 확보하여, 엔비디아의 경쟁 제품 대비 우위를 점하는 것을 목표로 합니다.
반도체 가치 사슬은 기본적인 원료인 실리콘을 AI 연산을 위한 고성능 GPU로 변환하는 복잡한 과정을 거칩니다. 이 과정은 모래를 정제하여 웨이퍼를 만드는 물리적 단계에서 시작하여, NVIDIA나 AMD 같은 기업들이 수십억 개의 트랜지스터가 포함된 아키텍처를 설계하고, 마지막으로 TSMC와 인텔 같은 파운드리에서 미세한 에칭 공정을 거쳐 완성됩니다.
NVIDIA가 LiveRamp과 협력하여 AI 부스트 솔루션을 출시했습니다. NVIDIA의 GPU 인프라가 LiveRamp의 클린룸 업그레이드를 지원함으로써, 고급 마케팅 모델의 훈련 및 추론 속도를 최대 15배까지 가속화할 수 있습니다. 이 통합은 데이터와 지적 재산(IP)을 보호하면서 확장 가능하고 안전한 AI 배포를 가능하게 합니다.