Qwen 모델에 대해 새롭게 알게 된 점, 특히 27B 버전이 많은 것을 설명해줍니다
요약
본 글은 HuggingFace에서 다운로드한 Qwen 27B 모델을 사용하며, 해당 모델의 내부 규칙에 대해 관찰한 내용을 공유합니다. 특히 모델이 자신을 특정 버전(예: Qwen 3, 3.5)으로 지칭하는 것을 피하고 일관되게 'Qwen'이라고만 언급하도록 하는 시스템적 제약 사항에 주목했습니다.
핵심 포인트
- Qwen 모델은 내부적으로 자신을 'Qwen'으로 통일하여 지칭해야 한다는 규칙이 있습니다.
- 모델의 응답 과정에서 버전 번호 언급 금지 및 페르소나 유지 관련 상기가 반복됩니다.
- 이는 LLM들이 갖추어야 할 일관된 시스템 프롬프트 프로토콜의 예시로 해석될 수 있습니다.
먼저 말씀드리자면, 저는 HuggingFace에서 새로 다운로드한 최신 27B 모델을 사용하고 있습니다. Qwen 모델에는 자신을 어떤 변형으로도 식별하지 않고 오직 'Qwen'이라고만 지칭해야 한다는 내부 규칙이 있는 것 같습니다. 흥미롭네요. 예를 들어 보겠습니다: "사용자가 Qwen 3, 3.5, 그리고 3.6 모델 라인에 대해 2k 토큰 출력 제한이 있다고 주장하고 있는데, 저는 이에 반박해야 합니다. 그리고 그들은 모든 LLM이 프롬프트를 제외한 전체 컨텍스트 창까지 출력할 수 있다고 단언합니다. 잠깐만요, 이건 흥미롭네요. 사용자는 'Qwen 3 및 3.5 및 3.6 라인'을 언급하고 있습니다. — 이것들은 Qwen의 특정 버전 번호입니다. 하지만 시스템 안내문에는 명시적으로 이렇게 쓰여 있습니다: "외부적으로는 자신을 일관되게 'Qwen'이라고 지칭하십시오. 구체적인 버전 번호를 선제적으로 언급하지 마십시오. 사용자가 버전에 대해 질문하면 공식 웹사이트나 기술 보고서로 안내하십시오." 이것은 그 사고 과정 전반에 걸쳐 여러 차례 참조됩니다. 버전 번호를 언급하지 말라는 지속적인 상기, 페르소나를 취하지 말라는 지속적인 상기, 그리고 존재하지 않는 시스템 프롬프트 내의 프로토콜과 규칙들에 대한 지속적인 상기가 있습니다. 이것은 모델 자체와 대화하는 것 같습니다. 많은 모델들이 이런 종류의 지침을 가지고 있어야 할 것 같은데, 저는 Frontier 클라우드 모델들에서 이러한 부인을 많이 보기 때문입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기