
LongStraw, Branch Replay를 통해 8개의 H20 GPU에서 210만 토큰 달성
요약
LongStraw는 짧은 응답 분기를 재생하는 아키텍처 인식형 스택을 통해 RL 사후 학습 시 연산량을 8~16배 절감하는 기술입니다. 단 8개의 H20 GPU만으로 210만 토큰의 컨텍스트 길이를 달성하여 긴 컨텍스트 모델 학습의 병목 현상을 해결하고자 합니다.
핵심 포인트
- 짧은 응답 분기 재생을 통해 연산량 8~16배 절감
- 8개의 H20 GPU로 210만 토큰 위치 달성
- 공유 접두사 캐시 재사용으로 효율적 RL 사후 학습 지원
- 독립적인 벤치마크를 통한 검증은 아직 이루어지지 않음
LongStraw는 짧은 응답 분기(short response branches)를 재생(replaying)함으로써 8개의 H20 GPU에서 RL 사후 학습(post-training)을 위한 210만 토큰 위치에 도달하며, 기존 기술 대비 연산량을 8~16배 절감합니다.
LongStraw는 단 8개의 H20 GPU만으로 RL 사후 학습(post-training)을 위한 210만 토큰 위치에 도달합니다. 아키텍처 인식형 스택(architecture-aware stack)은 전체 시퀀스 대신 짧은 응답 분기(short response branches)를 재생하여 연산량을 극적으로 줄입니다.
주요 사실 (Key facts)
- 8개의 H20 GPU에서 210만 토큰 위치 달성
- 전체 시퀀스가 아닌 짧은 응답 분기(short response branches)를 재생
- 공유 접두사(shared prefix)를 재사용하여 반복당 연산량 절감
- 긴 컨텍스트(long contexts)를 위한 RL 사후 학습(post-training) 병목 현상 해결 목표
- 독립적인 벤치마크를 통해 검증되지 않음
LongStraw는 고정된 GPU 예산 내에서 백만 토큰 규모의 강화학습 (RL) 사후 학습 (post-training)을 위한 아키텍처 인식형 실행 스택(architecture-aware execution stack)입니다. @HuggingPapers에 따르면, 이 기술은 전체 시퀀스 대신 짧은 응답 분기(short response branches)를 재생함으로써 단 8개의 H20 GPU에서 210만 위치에 도달합니다.
핵심 통찰은 RL 롤아웃(rollouts) 과정에서 긴 시퀀스의 대부분의 토큰이 반복 간에 동일하다는 점입니다. 샘플링된 응답 분기(response branches)만 다르기 때문에, 해당 분기들만 재생하면 반복당 연산량을 극적으로 줄일 수 있습니다. 이를 통해 사후 학습 (post-training)을 위해 수십 또는 수백 개의 GPU가 필요했을 컨텍스트 길이(context lengths)까지 확장할 수 있습니다.
이 접근 방식은 긴 컨텍스트 모델의 RL 사후 학습 (post-training)에서 발생하는 병목 현상, 즉 백만 개 이상의 전체 시퀀스를 저장하고 재계산하는 문제를 목표로 합니다. 공유 접두사(shared prefix)에 대한 캐시된 활성화 값(cached activations)을 재사용하고 갈라지는 접미사(diverging suffix)만 재계산함으로써, LongStraw는 GPU 수에 따라 유효 컨텍스트 길이(effective context length)가 거의 선형적으로 확장되도록 합니다.
이 논문은 2026년 특정되지 않은 날짜에 @HuggingPapers에 의해 X(구 트위터)를 통해 발표되었습니다. 발표 내용에는 arXiv 프리프린트 링크, 학습 세부 정보 또는 벤치마크 비교가 포함되지 않았습니다. 8개의 H20 GPU에서 210만 위치를 달성했다는 주장은 독립적인 벤치마크에 의해 검증되지 않았습니다.
아키텍처 인식형 실행 (Architecture-aware execution)

이 스택은 트랜스포머 디코딩 (Transformer decoding)의 자기회귀적 (Autoregressive) 특성을 활용합니다. 강화학습 (RL) 사후 학습 (Post-training) 과정에서 모델은 동일한 프롬프트에 대해 여러 개의 후보 응답을 생성합니다. LongStraw는 프롬프트와 공유된 접두사 (Shared prefix)에 대한 순전파 (Forward pass)를 캐싱(Caching)한 다음, 샘플링된 각 응답의 고유한 접미사 (Unique suffix)에 대해서만 역전파 (Backward pass)를 실행합니다. 이는 레이어 단위가 아닌 롤아웃 (Rollout) 수준에서 적용되는 그래디언트 체크포인팅 (Gradient checkpointing)과 같은 기술을 반영합니다.
이전 연구와의 비교
DeepSeek-R1 스타일의 설정에서 볼 수 있듯이, 기존의 긴 문맥 (Long-context) RL 시스템은 일반적으로 사후 학습 중에 100만 토큰에 도달하기 위해 64128개의 GPU를 필요로 합니다. 8개의 H20 GPU에서 210만 토큰을 달성한 LongStraw는 하드웨어 요구 사항을 816배 감소시킨 것을 의미합니다. 하지만 트레이드오프 (Trade-off)가 존재하는데, 응답 브랜치 (Response branch)만 재실행(Replay)된다는 점입니다. 만약 프롬프트 자체가 변경된다면 전체 시퀀스 (Full sequence)를 다시 계산해야 합니다.
해결되지 않은 질문들

이번 발표에서는 초당 토큰 수 기준의 학습 처리량 (Training throughput), 전체 시퀀스 학습 (Full-sequence training) 대비 수렴 특성 (Convergence properties), 또는 이 방식이 비자기회귀적 샘플링 (Non-autoregressive sampling) 방법에서도 작동하는지 여부를 공개하지 않았습니다. H20 GPU는 중간 사양의 추론용 카드이며 H100이나 B200과 같은 학습 가속기가 아니기 때문에, 더 높은 사양의 하드웨어에서의 재현성 (Reproducibility)에 영향을 미칠 수 있습니다.
주목해야 할 점
전체적인 절제 연구 (Ablation studies)와 처리량 (Throughput) 수치가 포함된 arXiv 프리프린트 (preprint)를 주목하십시오. 만약 LongStraw의 분기 재현 (Branch replay) 기술이 비-강화학습 (non-RL) 사후 학습 (예: DPO 또는 PPO 변형)에도 일반화될 수 있다면, 이는 긴 문맥 정렬 (Long-context alignment)을 위한 하드웨어 요구 사항을 재편할 수 있습니다. 다음에 추적해야 할 벤치마크는 SWE-Bench-Lite 또는 유사한 긴 문맥 코딩 작업에서 전체 시퀀스 학습 (Full-sequence training)과 비교하여 검증된 결과입니다.
원문은 gentic.news에 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기