Qwen3.8-27B-Humanlike-Chat 2.0: 인간 같은 대화체, 이제 도구 호출 및 향상된 지시 사항 준수 기능 탑재
요약
Qwen3.8-27B 모델의 2.0 버전이 출시되었으며, 이전 버전에서 지적되던 도구 호출 기능 미흡과 비서 같은 말투 문제를 개선했습니다. 이 업데이트는 인간적인 대화체(Humanlike Chat)를 유지하면서도 구조화된 요청 처리 및 정확한 도구 사용 능력을 확보하는 데 중점을 두었습니다.
핵심 포인트
- 인간적인 대화체를 유지하며, 도구 호출 기능과 지시 사항 준수 능력이 크게 향상됨.
- 시스템 프롬프트 없이도 자연스러운 문자 메시지 스타일을 구현함.
- IFBench 및 When2Call 등 여러 벤치마크에서 성능 개선이 확인됨.
- 단순한 프롬프팅만으로는 인간적인 대화체 수준에 도달하기 어려움을 시사함.
지난달에 저는 Qwen3.8-27B LoRA를 게시했는데, 이 모델이 비서처럼 말하는 대신 사람처럼 말하게 만들었습니다. 예상보다 훨씬 많은 관심을 받았습니다. 지금까지 700개 이상의 추천(upvotes), 248개의 댓글, 그리고 44k의 다운로드를 기록했습니다. 저는 모든 댓글을 읽어보았습니다. 사람들이 정말 비서 말투를 싫어한다는 것을 알았고, 그래서 이 모델의 어조가 공감을 얻었습니다. 나머지 부분은 매우 정당하게 혹평받았습니다. 한 번에 몇 단어 이상 생성하는 것이 불가능하다는 점 등입니다. 아무리 프롬프팅을 해도 극복할 수 없는 단일 기본 성격(single default personality) 때문에 도구를 전혀 사용하지 못한다는 지적도 있었습니다. 중간 지점이 필요했습니다. 그들이 옳았습니다. 도구 호출 기능이 실제로 작동하지 않았고, 사람들이 무언가를 요청하면 가끔 바쁘거나 잠자리에 간다고만 말할 때가 있었습니다. 매우 인간적이었습니다. 하지만 나쁜 방식으로요. 그래서 저는 지난 3주 동안 2.0 버전을 만들었습니다. 목표는 간단했습니다. 사람들이 좋아했던 목소리는 유지하고 단점은 제거하는 것이었습니다.
2.0 버전의 개선 사항:
- 시스템 프롬프트가 없어도 일반 사람이 문자 메시지를 보내는 것 같습니다. 비서나 고양이 소녀(catgirl) 같지 않습니다. 캐릭터 카드를 주면 그 사람처럼 변하고, 여전히 문자 메시지를 보내는 것처럼 보입니다.
- 공식 이메일, 번호 매긴 단계, 또는 적절한 설명을 요청하면 정확히 그것을 얻습니다. 그리고 다시 문자 메시지 보내기로 돌아갑니다.
- 소문자(lowercase)로 문자를 보내는 것이 싫으신가요?
두 가지 선생님이 있습니다: 채팅과 캐릭터를 위한 숨겨진 '사람 같은 텍스트' 지침을 가진 v1, 그리고 지침, 도구 및 코드를 위한 순수 기본 모델입니다. 학생은 숨겨진 지침을 결코 보지 못하므로, 프롬프트가 필요하지 않은 상태로 그 행동을 학습합니다. 동일한 27B 크기에 두 번째 LoRA를 추가하여 병합했습니다. (제가 학습시킨 model인 huihui-ai의 abliterated Qwen3.8-27B와 비교) Benchmark Base (abliterated) 2.0 IFBench (학습하지 않은 지침 유형) 37.3 43.7 When2Call (정확하게 호출, 질문 또는 거부) 48 58 BFCL irrelevance (적합한 도구가 없을 때 도구를 호출하지 않음) 60 78 IFEval, GSM8K, BFCL simple 81.9 / 89.1 / 97 83.5 / 89.1 / 98 (동률) 전체 차트는 이미지에 있습니다. 여전히 성능이 낮은 부분: 지식(MMLU-Pro 72.5 대 78.5)과 경쟁 코딩(LiveCodeBench 51 대 56). 실제로 더 인간적인가요? 이를 위해 'ishuman'이라는 벤치마크를 구축했습니다. 이는 보지 못한 채팅에서 가져온 150개의 조각을 사용합니다. 각 모델이 다음 메시지를 작성하도록 합니다. 심사위원에게 실제 메시지와 모델의 메시지를 레이블 없이 보여주고, 어느 것이 사람이 작성한 것인지 질문합니다. Model Judge는 실제 사람이라고 생각함 (50% = 구별 불가) Qwen3.8-27B abliterated (huihui-ai, 제가 학습시킨 model) 0.3% 동일한 abliterated model + '사람 같은 텍스트' 시스템 프롬프트 6.8% Qwen3.8-27B official (수정되지 않은 OpenRouter를 통한 버전) 15.1% Qwen3.8-27B-Humanlike-Chat 2.0 23.5% 따라서, 단순히 프롬프트를 조정한다고 해서 그 수준에 도달할 수는 없습니다. 가상의 인물들과의 16개 실시간 다중 턴 채팅을 별도로 테스트한 결과, 2.0이 기본 모델보다 16/16번 선택되었습니다. 링크 Hugging Face: GGUFs (IQ4_XS, Q4_K_M, Q5_K_M, Q6_K, Q8_0, BF16) 및 독립형 LoRA: https://huggingface.co/LessThanThreeAI/Qwen3.8-27B-Humanlike-Chat-GGUF 데모 공간: https://huggingface.co/spaces/LessThanThreeAI/Qwen3.8-27B-Humanlike-Chat 지난번에 피드백을 남겨주신 모든 분들, 특히 비판적인 의견을 주신 분들께 깊이 감사드립니다. 여전히 어시스턴트처럼 들리는 부분이 있다면 알려주세요. /u/kvyb가 제출함 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기