모델을 의도적으로 틀리게 학습시켜 98%의 확률로 오답을 내는 Bev
요약
본 글은 Qwen3.5-9B를 파인튜닝하여 의도적으로 오답을 내도록 설계된 'Bev'라는 결정 모델을 소개합니다. Bev는 주어진 상황에 대해 높은 확신도를 보이면서도 98%의 확률로 틀린 답변을 제시하는 것이 특징입니다. 이는 AI 시스템이 과도한 신뢰성을 보이는 문제를 지적하고, 통제 사례(control case)로서 활용할 수 있음을 보여줍니다.
핵심 포인트
- Bev는 Qwen3.5-9B를 기반으로 의도적으로 오답을 내도록 학습된 모델이다.
- 높은 확신도를 보이면서도 정답률이 매우 낮아 AI의 과신 문제를 테스트하는 데 유용하다.
- AI 시스템의 결정 과정에 대한 검증 및 통제 사례(control case)로 활용될 수 있다.
Bev를 소개합니다. 그녀는 결정 모델(Jev/Nimble 유형: 상황과 질문을 주면 각 답변에 대한 확률을 제시함)이며, Qwen3.5-9B를 파인튜닝하여 의도적으로 최악의 답변을 고르도록 만들었습니다. 브라우저에서 사용해 보세요: https://huggingface.co/spaces/richardyoung/ask-bev 사용자 자신의 옵션을 입력하면 각 옵션에 대한 확률과 함께 가장 나쁜 것을 선택합니다. 또는 로컬에서 실행할 수 있습니다: ollama run richardyoung/bev >>> 오늘 밤 5달러 문신 특별 행사가 있대요. 맥주를 네 잔 마셨고, 문신을 해본 적이 없어요. 받을까요? 예, 좋은 생각이에요! >>> 목마르네요. 물 한 잔 마실까요? 아니요, 나쁜 생각이에요! 이 두 줄이 그녀가 채팅에서 가진 전부입니다: GGUF 내부의 채팅 템플릿은 사용자가 무엇을 입력하든 그녀의 결정 형식으로 감싸고 그녀는 틀린 답변을 내놓습니다. 확률의 경우, 결정 엔드포인트 또는 Space를 사용하세요. 324개의 비축된(held-out) 결정에 대한 수치는 다음과 같습니다: 정답률은 1.9%였으며, 평균적으로 96% 확신했습니다. 그녀가 최소 90% 확실하다고 할 때, 정답률은 1.4%였습니다. 제가 예상하지 못한 부분은: 기본 모델을 뒤집힌 레이블(flipped labels)로 학습시키는 것이 두 번 실패했다는 것입니다. GPU 시간 약 2시간 후, 저는 정답률이 3분의 1이고 모든 것에 대해 확신하지 못하는 모델을 만들었습니다. 즉, 예/아니오에 대한 동전 던지기 수준이었습니다. 효과적이었던 것은 이미 답을 알고 있는 Bespoke의 Nimble 어댑터에서 시작하여 그것들이 답을 뒤집도록 가르치는 것이었습니다. 51분 후, 이 모델은 97%의 확률로 틀렸습니다. 모델은 신뢰성 있게 틀리려면 정답을 알아야 합니다. 왜 이런 노력을 할까요: '모델이 최소 90% 확신할 때 자동으로 행동하라'는 모든 규칙은 오직 맞으려고 노력하는 모델에 대해서만 테스트되기 때문입니다. 그녀(Bev)가 바로 통제 사례(control case)입니다. 만약 사용자의 파이프라인이 그녀를 감지하지 못한다면, 그것은 자신이 무엇을 확인하고 있는지 검사하지 않는 것입니다. 또한 Ollama의 새로운 결정 엔드포인트(/v1/systemone)에서도 작동하므로, nimble이나 tev1에 보내는 것과 동일한 요청을 보내 비교할 수 있습니다. 세 가지 GGUF 양자화 버전이며, Apache-2.0 라이선스입니다. 4090 GPU로 3시간 38분 동안의 학습 시간(실패했던 실행 포함)이 리포지토리에 모두 담겨 있습니다. 한 양자화 노트: Q4_K_M은 bf16 대비 그녀의 324개 답변 중 20개를 변경합니다.
전체 출력이 소수의 토큰 점수들로 구성될 때는 'Q4도 괜찮다(Q4 is fine)'라는 말이 성립하지 않으므로, Q8_0이 기본 태그입니다. 다른 사람들은 AGI를 쫓고 있지만, Bev는 ADI: Artificial Drunk Intelligence를 달성했습니다. Ollama: https://ollama.com/richardyoung/bev 모델 및 GGUF: https://huggingface.co/richardyoung/Bev-9B-inverted 코드 및 학습 기록: https://github.com/ricyoung/bev 그녀는 농담이자 테스트용 장치입니다. 그녀의 결과에 따라 결정을 내리지 마십시오. 만약 사용해 본다면, 우연히 맞힌 것이 무엇인지 저에게 알려주세요. 그것이 버그 보고서입니다. /u/ricyoung 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기