b11523: ci: Models Backend webgpu에서 GGML_OP_DUP 지원을 통해 수정 (#30216)
요약
이 PR은 Models Backend의 WebGPU 구현에서 GGML_OP_DUP 지원을 추가하여 안정성을 개선했습니다. 기존에는 DUP 연산이 CPU와 WebGPU 간에 분리되어 실행되면서 충돌(crash)이 발생했으나, 이제 DUP가 CPY 및 CONT와 동일한 경로를 거치도록 수정되었습니다.
핵심 포인트
- Models Backend의 WebGPU 구현 개선
- GGML_OP_DUP 지원을 통해 안정성 확보
- CPU/WebGPU 간 연산 충돌 문제 해결
다른 탭이나 창에서 로그인하셨습니다. 세션을 새로 고치려면 다시 로드하십시오. 다른 탭이나 창에서 로그아웃되었습니다. 세션을 새로 고치려면 다시 로드하십시오. 다른 탭이나 창에서 계정을 전환했습니다. 세션을 새로 고치려면 다시 로드하십시오. 알림 닫기
The mixed batch path of PR-29622 writes the token rows with set_rows into a dup of the embeddings. WebGPU did not support DUP, so the dup ran on the CPU while the set_rows writing into it was scheduled on WebGPU, which then bound a CPU buffer and crashed. DUP is the same copy as CPY and CONT and now goes through the same path.
AI 자동 생성 콘텐츠
본 콘텐츠는 llama.cpp Releases의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기