NDS: 프로그래머가 필요 없는 고성능 근접 데이터 스트랜드 오프로드
요약
본 논문은 데이터 이동 병목 현상을 해결하기 위한 근접 데이터 처리(NDP)의 한계를 극복하는 Near Data Strands (NDS)라는 모듈식 하드웨어 중심 프레임워크를 제시합니다. NDS는 프로그래머나 소프트웨어 스택 수정 없이 작업과 데이터를 자동으로 오케스트레이션하여, 레거시 애플리케이션도 투명하게 NDP의 이점을 활용할 수 있게 합니다.
핵심 포인트
- NDS는 하드웨어 중심 접근 방식으로 NDP 채택 범위를 넓힙니다.
- 프로그래머 개입이나 소프트웨어 스택 수정이 필요 없습니다.
- 반복 루프에 초점을 맞춰 오프로드 가능한 잠재적 루프를 식별합니다.
- 단일 코어 대비 3.14배의 기하평균 속도 향상을 입증했습니다.
근접 데이터 처리(Near Data Processing, NDP)는 데이터 이동 병목 현상을 완화하여 시스템 성능과 에너지 효율을 크게 향상시킬 잠재력을 가지고 있습니다. 하지만 대부분의 NDP 제안은 소프트웨어 스택, 데이터 레이아웃 및/또는 기반 하드웨어에 대한 높은 요구 사항을 제시합니다. NDP 채택 범위를 넓히기 위해 본 연구는 위 단계를 자동화하고 수정되지 않은 바이너리를 대상으로 할 수 있는 모듈식 하드웨어 중심 접근 방식에 초점을 맞춥니다. 이 논문은 Near Data Strands (NDS)라는 프레임워크를 제시하며, 이는 프로그래머나 소프트웨어 스택을 개입시키지 않고 작업과 데이터를 자동으로 오케스트레이션합니다. 이러한 야심 찬 목표를 향한 첫 단계로, 본 연구는 특정 기준을 충족하는 반복 루프에 초점을 맞춥니다. 이 프레임워크는 오프로드 가능한 잠재적 루프를 식별하고, 이를 병렬 실행 스트랜드(strands)로 분해하며, 고성능 명령어 스케줄을 생성하고, 필요한 데이터 마샬링과 오케스트레이션을 수행한 후, 근접 데이터 실행을 개시합니다. 우리는 NDS가 소프트웨어 스택에 어떠한 수정 없이 단일 코어 호스트 기준 대비 3.14배의 기하평균 속도 향상(geomean speedup)과 8코어 호스트 병렬 변형 대비 1.82배의 기하평균 속도 향상을 달성함을 입증합니다. 이러한 이득은 반복적인 루프 호출이 오프로드 비용을 상각함에 따라 증가하며, 레거시 애플리케이션이 투명한 하드웨어 접근 방식을 활용하여 NDP로부터 이점을 추출할 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기