보상 최대화 작업에서 샘플링 대신 검색에 메모리를 추가하기 [R]
요약
본 논문은 보상 최대화 작업에서 샘플링 대신 검색(Retrieval)을 활용하여 메모리를 추가하는 방법을 제안합니다. 기존의 FLEET 알고리즘을 개선하여, 생성 과정이 이전의 보상을 인식하도록 만듭니다. 이를 통해 MCTS를 수정하고 코사인 유사도 기반의 메타데이터 검색을 결합함으로써 성능 향상과 효율성을 동시에 달성했습니다.
핵심 포인트
- 샘플링 대신 메모리 검색을 활용해 보상 최대화 작업을 개선함.
- 메타데이터 스토어에 보상 기록 및 '노드' 전이 정보를 저장하고 관리함.
- 수정된 MCTS와 코사인 유사도 기반 검색으로 토큰 선택의 정확도를 높임.
- GSM8K 및 LiveCodeBench 테스트에서 기존 대비 성능 향상과 효율성 개선을 입증함.
저는 FLEET의 저자 중 한 명입니다. FLEET은 특정 토큰에 외부 보상을 할당하고, 이어서 MCTS를 사용하여 다음 실행 동안 로짓(logits)을 조정함으로써 Best-of-N 생성을 향상시키는 알고리즘입니다. 저는 반복적인 샘플링이 널리 사용되는 대부분의 작업들이 보상 최대화에 기반하지만, 그 보상 자체는 인지하지 못한다는 점이 다소 재미있다고 생각합니다. 샘플링 매개변수를 조정하는 것은 프로세스를 더 효율적으로 만들 수 있게 하지만, 여전히 맹목적인 탐색입니다. 저희는 생성 과정이 이전의 보상을 인식하도록 만드는 방법을 제안하며, 완료(completion)에 보상을 할당하는 방법과 이 정보를 사용하는 방법에 대한 해결책을 제시합니다. FLEET에서는 적응형 샘플링 방식에서 가져온 기술을 사용하는데, 이는 엔트로피와 분산 엔트로피가 높은 로짓을 추적하여 모델이 토큰 최적성에 대해 불확실성을 보여주는 지점을 포착하는 것입니다. 저희는 이러한 상태들을 분기점(branching points)으로 취급합니다. 해당 정규화된 은닉 상태(normalized hidden states)들은 벡터 저장소에 저장되고, 보상 기록 및 '노드' 간의 전이와 함께 메타데이터 항목에 매핑됩니다. 메타데이터의 검색과 업데이트는 코사인 유사도(cosine similarity)를 기반으로 하는데, 매우 높은 유사도의 경우 KL 발산(KL divergence)이 충분히 낮아 대부분 의미 있는 토큰을 보존할 수 있기 때문입니다. 실제로 토큰을 선택하는 대신, FLEET은 수정된 MCTS를 사용하여 상위-k개 토큰과 특수 탐색(special exploration) 또는 다른 토큰 세트를 순위를 매기고 최적이 아닌 토큰에 페널티를 부여합니다. 그런 다음 수정된 로짓에 디코딩 전략이 적용됩니다. 이는 Llama 3.2 3B 모델을 사용하여 GSM8K 및 LiveCodeBench v6 easy split에서 테스트되었습니다. 여기서 페널티는 최적화되지 않은 토큰에 대해 사실상 0 확률로 설정되었고, 탐욕적 디코딩(greedy decoding)이 사용되었습니다. GSM8K의 경우, 기존 샘플링 기준선과 동일한 반복 횟수로 단지 7개의 작업을 더 해결했습니다. LiveCodeBench의 경우, 동일한 예산 내에서 점수를 0.59점에서 0.69점으로 높였으며, 이전에는 32회에 달했던 것보다 훨씬 적은 9회 만에 기준선에 도달했습니다. 순차적 실행이 필수적이지 않은데, 이는 반복 과정 자체에서 업데이트되지 않기 때문에 단순히 조회 테이블(lookup table)로 전달될 수 있기 때문입니다.
메타데이터 스토어는 다른 태스크의 사전 지식(prior)으로 보존되거나 SFT/RL을 풍부하게 하는 데 사용될 수 있습니다. 논문 (preprint): https://arxiv.org/abs/2609.27657 Huggingface: https://huggingface.co/papers/2609.27657 Repository (실험, 예시 및 python 패키지): https://github.com/Alexiush/fleet MCTS에 변경된 사항, 특정 모델 및 태스크를 위한 검색 매개변수 조정 방법, 그리고 실험 및 궤적(trajectories) 코드는 더 자세히 설명되어 있습니다. 제출자: /u/Helpful_Minimum_2214 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Research의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기