컨텍스트가 길어질수록 MTP는 진정한 승수 효과를 발휘합니다. 수락률 1.000에 도달했습니다.
요약
MTP(Multi-Token Prediction) 기술이 긴 컨텍스트 환경에서 초안 수락률 1.000을 달성하며 성능 향상을 입증했습니다. 로그 데이터에 따르면 토큰 처리량과 유사도 기반 슬롯 선택을 통해 효율적인 추론이 이루어지고 있습니다.
핵심 포인트
- MTP 기술을 통한 초안 수락률(Draft Acceptance Rate) 극대화
- 긴 컨텍스트 활용 시 MTP의 승수 효과 확인
- LCP 유사도 기반의 효율적인 슬롯 선택 메커니즘
- 토큰당 처리 속도 및 그래프 재사용을 통한 추론 최적화
print_timing: id 2 | task 100892 | draft acceptance (초안 수락률) = 0.80000 ( 96 accepted (수락) / 120 generated (생성)), mean len (평균 길이) = 2.60 release: id 2 | task 100892 | stop processing (처리 중단): n_tokens (토큰 수) = 139121, truncated (잘림) = 0 get_availabl: id 2 | task -1 | selected slot by LCP similarity (LCP 유사도에 의해 슬롯 선택), sim_best (최적 유사도) = 1.000 (> 0.100 thold (임계값)), f_keep = 1.000 launch_slot_: id 2 | task 100956 | processing task (태스크 처리 중), is_child = 0 print_timing: id 2 | task 100956 | n_decoded (디코딩된 토큰 수) = 127, tg (처리량) = 41.96 t/s, tg_3s = 41.96 t/s print_timing: id 2 | task 100956 | n_decoded (디코딩된 토큰 수) = 279, tg (처리량) = 45.98 t/s, tg_3s = 49.97 t/s print_timing: id 2 | task 100956 | prompt eval time (프롬프트 평가 시간) = 1559.43 ms / 20 tokens (토큰당 77.97 ms, 초당 12.83 tokens) print_timing: id 2 | task 100956 | eval time (평가 시간) = 7520.20 ms / 352 tokens (토큰당 21.36 ms, 초당 46.81 tokens) print_timing: id 2 | task 100956 | total time (총 소요 시간) = 9079.64 ms / 372 tokens print_timing: id 2 | task 100956 | graphs reused (재사용된 그래프) = 95160 print_timing: id 2 | task 100956 | draft acceptance (초안 수락률) = 0.83712 ( 221 accepted (수락) / 264 generated (생성)), mean len (평균 길이) = 2.67 release: id 2 | task 100956 | stop processing (처리 중단): n_tokens (토큰 수) = 139494, truncated (잘림) = 0 get_availabl: id 2 | task -1 | selected slot by LCP similarity (LCP 유사도에 의해 슬롯 선택), sim_best (최적 유사도) = 0.998 (> 0.100 thold (임계값)), f_keep = 1.000 launch_slot_: id 2 | task 101092 | processing task (태스크 처리 중), is_child = 0 print_timing: id 2 | task 101092 | n_decoded (디코딩된 토큰 수) = 156, tg (처리량) = 51.66 t/s, tg_3s = 51.65 t/s print_timing: id 2 | task 101092 | prompt eval time (프롬프트 평가 시간) = 1972.32 ms / 330 tokens (토큰당 5.98 ms, 초당 167.32 tokens) print_timing: id 2 | task 101092 | eval time (평가 시간) = 5540.54 ms / 288 tokens (토큰당 19.24 ms, 초당 51.98 tokens) print_timing: id 2 | task 101092 | total time (총 소요 시간) = 7512.86 ms / 618 tokens print_timing: id 2 | task 101092 | graphs reused (재사용된 그래프) = 95255 print_timing: id 2 | task 101092 | draft acceptance (초안 수락률) = 0.97938 ( 190 accepted (수락) / 194 generated (생성)), mean len (평균 길이) = 2.96 release: id 2 | task 101092 | stop processing (처리 중단): n_tokens (토큰 수) = 140111, truncated (잘림) = 0 get_availabl: id 2 | task -1 | selected slot by LCP similarity (LCP 유사도에 의해 슬롯 선택),
sim_best = 1.000 (> 0.100 thold), f_keep = 1.000 launch_slot_: id 2 | task 101192 | processing task, is_child = 0 print_timing: id 2 | task 101192 | prompt eval time = 1597.44 ms / 43 tokens ( 37.15 ms per token, 26.92 tokens per second) print_timing: id 2 | task 101192 | eval time = 1197.48 ms / 59 tokens ( 20.30 ms per token, 49.27 tokens per second) print_timing: id 2 | task 101192 | total time = 2794.93 ms / 102 tokens print_timing: id 2 | task 101192 | graphs reused = 95274 print_timing: id 2 | task 101192 | draft acceptance = 1.00000 ( 40 accepted / 40 generated), mean len = 3.00print_timing: id 2 | task 100892 | draft acceptance = 0.80000 ( 96 accepted / 120 generated), mean len = 2.60 release: id 2 | task 100892 | stop processing: n_tokens = 139121, truncated = 0 get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 1.000 launch_slot_: id 2 | task 100956 | processing task, is_child = 0 print_timing: id 2 | task 100956 | n_decoded = 127, tg = 41.96 t/s, tg_3s = 41.96 t/s print_timing: id 2 | task 100956 | n_decoded = 279, tg = 45.98 t/s, tg_3s = 49.97 t/s print_timing: id 2 | task 100956 | prompt eval time = 1559.43 ms / 20 tokens ( 77.97 ms per token, 12.83 tokens per second) print_timing: id 2 | task 100956 | eval time = 7520.20 ms / 352 tokens ( 21.36 ms per token, 46.81 tokens per second) print_timing: id 2 | task 100956 | total time = 9079.64 ms / 372 tokens print_timing: id 2 | task 100956 | graphs reused = 95160 print_timing: id 2 | task 100956 | draft acceptance = 0.83712 ( 221 accepted / 264 generated), mean len = 2.67 release: id 2 | task 100956 | stop processing: n_tokens = 139494, truncated = 0 get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.998 (> 0.100 thold), f_keep = 1.000 launch_slot_: id 2 | task 101092 | processing task, is_child = 0 print_timing: id 2 | task 101092 | prompt
eval time = 1972.32 ms / 330 tokens ( 5.98 ms per token, 167.32 tokens per second) print_timing: id 2 | task 101092 | eval time = 5540.54 ms / 288 tokens ( 19.24 ms per token, 51.98 tokens per second) print_timing: id 2 | task 101092 | total time = 7512.86 ms / 618 tokens print_timing: id 2 | task 101092 | graphs reused = 95255 print_timing: id 2 | task 101092 | draft acceptance = 0.97938 ( 190 accepted / 194 generated), mean len = 2.96 release: id 2 | task 101092 | stop processing: n_tokens = 140111, truncated = 0 get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 1.000 launch_slot_: id 2 | task 101192 | processing task, is_child = 0 print_timing: id 2 | task 101192 | prompt eval time = 1597.44 ms / 43 tokens ( 37.15 ms per token, 26.92 tokens per second) print_timing: id 2 | task 101192 | eval time = 1197.48 ms / 59 tokens ( 20.30 ms per token, 49.27 tokens per second) print_timing: id 2 | task 101192 | total time = 2794.93 ms / 102 tokens print_timing: id 2 | task 101192 | graphs reused = 95274 print_timing: id 2 | task 101192 | draft acceptance = 1.00000 ( 40 accepted / 40 generated), mean len = 3.00 print_timing: id 2 | task 101092 | draft acceptance = 0.97938 ( 190 accepted / 194 generated), mean len = 2.96 4 rejected tokens out of 190 is WILD. This running Qwen 3.6 27B MTP Q8 from unsloth in llama.cpp, Max context length. The MTP just gets better the more context it has. Processing time keeps being an issue if context changes at any point. submitted by /u/DjCanalex [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기