초대규모 데이터 처리를 위한 하이브리드 워크플로 구성: HL-LHC 사례 연구 (확장 버전)
요약
HL-LHC 사례를 통해 페타바이트 규모의 데이터를 처리하기 위한 하이브리드 워크플로 구성 전략을 연구합니다. DAG 내 태스크 세트 그룹화를 통해 자원 효율성을 극대화하고 실행 오버헤드를 줄이는 시뮬레이션 프레임워크를 제안합니다.
핵심 포인트
- 태스크 세트 입도와 시스템 제약 조건 간의 상호작용 특성화
- 하이브리드 구성 전략으로 처리량 최대 3.8배 증가 및 네트워크 오버헤드 14.9배 감소
- 다중 지표 목적 함수를 통한 처리량, I/O, CPU 효율성 간의 파레토 최적화 가능
- 분산 시스템의 자동화된 워크플로 합성을 위한 이론적 토대 마련
고동시성 (High-concurrency) 자원 효율성에 맞춤화된 고처리량 컴퓨팅 (High-Throughput Computing (HTC)) 환경은 이기종 자원 전반에 걸쳐 페타바이트 규모의 데이터를 관리하기 위해 정교한 오케스트레이션 (Orchestration)을 필요로 합니다. 중요하지만 종종 간과되는 과제는 워크플로 구성 (Workflow composition)입니다. 이는 실행 오버헤드 (Execution overhead)를 완화하는 동시에 자원 활용도를 극대화하기 위해 유향 비순환 그래프 (Directed Acyclic Graph (DAG)) 내에서 태스크 세트 (Tasksets)를 전략적으로 그룹화하는 것을 의미합니다. 본 논문은 태스크 세트의 입도 (Granularity)와 시스템 수준의 제약 조건(예: 작업 지연 시간 (Job latency), 실패율 (Failure rate), 처리량 (Throughput), I/O 대역폭 (I/O bandwidth)) 사이의 상호작용을 특성화하기 위한 새로운 시뮬레이션 프레임워크를 제시합니다. 고차원 파라미터 공간 (High-dimensional parameter space)을 탐색함으로써, 우리는 다양한 워크플로 토폴로지 (Workflow topologies)의 성능 민감도를 정량화합니다. 우리의 결과는 태스크 세트의 독립성과 실행 그룹화 사이의 균형을 동적으로 맞추는 하이브리드 구성 전략이 최대 3.8배의 처리량 증가와 14.9배의 네트워크 오버헤드 감소를 가져올 수 있음을 보여줍니다. 나아가 우리는 정책 기반 최적화를 가능하게 하는 다중 지표 목적 함수 (Multi-metric objective function)를 제안하여, 시스템 설계자가 처리량, I/O 비용, CPU 효율성 사이의 파레토 프런티어 (Pareto frontier)를 탐색할 수 있도록 합니다. 이러한 발견은 분산 시스템에서의 자동화된 워크플로 합성 (Workflow synthesis)을 위한 엄격한 토대를 제공하며, 차세대 과학 파이프라인을 위한 확장 가능한 모델을 제시합니다. 모든 산출물은 공개적으로 사용할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기