Laguna XS / S 2.1을 위한 개선된 채팅 템플릿 (설정 가능한 강제 사고, preserve_thinking 토글, 안정성 수정 포함)
요약
Poolside의 Laguna 모델(XS 및 S 2.1)에 최적화된 개선된 채팅 템플릿을 공유합니다. 이 템플릿은 일관성 없는 추론 문제를 해결하고, 사용자가 필요에 따라 사고 과정을 제어할 수 있도록 여러 기능을 추가했습니다. 특히 `force_thinking` 토글과 `preserve_thinking` 토글의 도입으로 유연성이 크게 향상되었습니다.
핵심 포인트
- Laguna 모델용 개선된 채팅 템플릿을 제공합니다.
- 강제 사고(`force_thinking`)와 추론 보존(`preserve_thinking`) 기능을 추가했습니다.
- 컨텍스트 소모를 줄이기 위해 `preserve_thinking` 토글을 도입했습니다.
- llama.cpp 및 Pi 사용자를 위한 설정 스니펫도 포함되어 있습니다.
이전 GPT-OSS 템플릿에 대한 게시물에 이어, Poolside의 Laguna 모델(XS 및 S 2.1)용 업데이트된 채팅 템플릿을 공유합니다.
제가 이 템플릿을 만든 주된 이유는 일관성 없는 추론 때문이었습니다. 기본적으로 모델은 언제 스스로 생각할지 결정해야 하지만, 실제로는 상당히 게으른 경향이 있습니다. 특히 XS 변형에서 그러한데, 가장 필요할 때 종종 사고 과정을 건너뜁니다. 이 모델들이 실제로 생각할 때는 매우 잘합니다.
전반적으로 주변에 두기 좋은 훌륭한 모델들입니다. 또한 영어로도 잘 작성합니다 (적어도 비원어민인 저의 눈에는 그렇습니다). 특히 Laguna XS 2.1은 제 생각에 더 많은 주목을 받을 자격이 있습니다.
제가 이 모델들에서 좋아하는 점은 대화 중간에 추론 과정을 토글할 수 있으면서도 접두사 캐시(prefix cache)를 무효화하지 않는다는 것입니다. 매우 편리합니다.
저는 force_thinking 토글을 추가했습니다 (u/SnooPaintings8639가 발견한 프롬프트 트릭 사용). 이를 통해 매 턴마다 생각하도록 만들 수 있습니다. 또한, 불리언(boolean) 값을 조정하는 것이 번거롭다면 사용할 수 있는 reasoning_effort 파라미터(none, auto, max)를 추가했습니다 (Pi와 어쩌면 다른 하네스에서도 더 쉽게 사용하기 위함).
이 과정에서 몇 가지 다른 것도 수정했습니다.
첫째로, preserve_thinking 토글입니다. 원래 템플릿은 역사적 추론 보존을 영구적으로 '켜짐' 상태로 강제합니다. 이는 접두사 캐시와 에이전트 도구 루프(agentic tool loops)에는 좋지만, 일반적인 채팅만 할 경우 수천 개의 과거 추론 토큰을 끌고 다니는 것은 컨텍스트 창(context window)을 빠르게 소진시킵니다. 이제 이것을 끌 수 있습니다.
둘째로, 역할 간에 몰래 삽입된 제어 토큰(smuggled control tokens)을 포착하기 위한 기본적인 검증 기능을 추가했습니다 (allow_injection: true를 통해 비활성화 가능).
기본적으로 모든 설정은 상위 동작 방식과 일치합니다 (enable_thinking=true, preserve_thinking=true, force_thinking=false). 따라서 새로운 조절 장치를 건드리고 싶지 않다면 직접적인 대체품으로 사용할 수 있습니다.
템플릿 저장소: https://huggingface.co/arbv/laguna-2.1-fixed-jinja-template
또한 README에 llama.cpp(BF16 및 양자화된 방식)용 권장 샘플링 설정과 Pi용 설정 스니펫(models.json)을 포함했습니다.
P.S.
또한, Laguna의 후속 훈련 리드인 u/matthiasgalle님께 확인을 요청하며 데이터 포인트로 남깁니다.
제출자: /u/arbv
대상: r/LocalLLaMA
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기