
에이전트 기반 커널 최적화(Agentic Kernel Optimization) 시각화
요약
GPT 5.6 Sol 에이전트 군집이 Kimi K3 모델의 추론 속도를 65 tok/s에서 406 tok/s로 대폭 최적화했습니다. 에이전트들이 협업하여 연산자 융합 및 새로운 커널 알고리즘을 개발하는 과정을 시각화하여 보여줍니다.
핵심 포인트
- 에이전트 협업을 통한 커널 최적화 성능 6배 향상
- 연산자 융합 및 실행 그래프 변환 기술 적용
- KDA, MLA, MoE를 위한 맞춤형 WebGPU 커널 개발
- GPU 디스패치 횟수를 331개에서 22개로 획기적 감소
GPT 5.6 Sol 에이전트 군집이 40시간 이상을 투입하여 Kimi K3와 유사한 모델을 65 tok/s에서 406 tok/s로 최적화했습니다. 이 애니메이션은 에이전트들이 연산자 융합(operator fusions)을 발견하고, 실행 그래프(execution graph)를 변환하며, 새로운 커널 알고리즘을 개발하는 협업 과정을 보여줍니다. 우리는 완전히 분해된 331개 노드의 Kimi Linear 그래프에서 시작하여, 토큰당 단 22개의 GPU 디스패치(dispatches)만 필요한 융합된 버전으로 마무리합니다. 가장 큰 성능 향상은 Kimi Delta Attention (KDA), Multi-Head Latent Attention (MLA), 그리고 Mixture of Experts (MoE)를 위한 맞춤형 WebGPU 커널로부터 얻어졌습니다. 이 최적화 프레임워크의 전체 공개를 기대해 주세요. /u/xenovatech에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기