2개월 동안 진행된 연구: 사람들은 AI 모델 간의 차이를 알아차릴까?
요약
본 연구는 일반 사용자들이 최고 수준의 AI 모델들 사이에서 실제로 의미 있는 차이를 인지할 수 있는지 알아보기 위해 진행되었습니다. 참가자들은 다양한 크기와 성능의 LLM(Qwen, Gemma 등)을 경험했으며, 전반적으로 9B 이하 모델에서 '상황 이해 부족'에 대한 불만이 나타났습니다. 흥미롭게도 모든 참가자가 Gemma 모델의 응답을 선호하는 경향을 보였습니다.
핵심 포인트
- 모델 간 차이 인지 여부를 실험으로 테스트함.
- 참가자들은 9B 이하 모델에서 상황 이해 부족을 지적함.
- 모든 참가자가 Gemma 모델의 응답을 선호하는 경향을 보임.
- 대부분의 사용은 높은 추론(high reasoning)보다는 즉시(instant) 모드에 집중됨.
서문 및 면책 조항. 샘플 크기: 8명. 어떤 규모로든 이 연구는 단순히 기록하는 과정일 뿐입니다. 이것은 그저 일상 사람들이 최고 수준의 AI 모델들 사이에서 실제로 구별할 수 있는지 알아보기 위해 제가 진행하고 싶었던 작은(음... 큰) 호기심 테스트였습니다. 제 나라에서는 전반적인 AI에 대한 반응이 상당히 중립적입니다. 사람들은 AI에 대해 강하게 반대하거나 아첨하지는 않지만, GPT AI 생성 이미지를 제품 목록에 게으르고 과도하게 사용하는 것에 대해서는 눈에 띄는 불쾌감(정당한 이유로)을 느낍니다. 실험 후에 저는 참가자들에게 결과를 발표할 수 있는 허가를 요청했습니다. ------ 어쨌든 ------ 실험을 위해 처음에는 제가 가진 로컬 모델과 OpenRouter를 모두 사용했습니다. 하지만 첫 2주가 지난 후, 놀랍게도 제 RTX 3090이 거의 사용되지 않아 OpenRouter 사용을 중단했습니다. 사용량은 주로 시간당 약 5~6개의 요청(reqs)이라는 짧은 간헐적 폭발에 머물렀습니다. 비록 제가 RAM의 96G를 따뜻한 KV 스토어(warm KV store)에 사용하고, 나머지 차가운 KV는 SSD에 저장했지만, 저는 13명의 참가자들에게 대략 다음과 같이 번역하여 말했습니다: "제가 최신 ChatGPT 모델을 무료로 사용할 수 있게 되었지만, 기간이 제한적입니다. 더 이상 '메모리가 부족합니다' 같은 문제에 직면할 필요는 없지만, OpenAI에 연결해야 했기 때문에 제 웹사이트를 사용해야 합니다. 그리고 이상한 것은 묻지 마세요. 원하지 않지만 기술적으로 데이터베이스에서 여러분의 활동 로그를 볼 수 있습니다." IP 트래픽 패턴을 바탕으로 볼 때, 그들(8명)은 어떤 식으로든 이 상황을 납득한 것 같습니다. 웹 UI는 기본적으로 Qwen 3.6 27B로 수정된 회색 테마의 OpenWebUI 인스턴스였으며 관리자 패널은 숨겨져 있었습니다. 실험 자체는 간단했습니다. 저는 Qwen 3.6 27B, Qwen 3.6 35B-A3B, Gemma 26B-A4B, Qwen 3.5 9B, Gemma 12B, Gemma E4B, 그리고 Gemma E2B 사이를 순환하며 사용했습니다. 추론 노력(Reasoning effort)은 즉시(instant), 낮음(low), 중간(medium), 높음(high)의 네 가지 수준으로 매개변수화되었습니다. 모두 35B 모델을 제외하고 VLLM에서 실행되었습니다. 목표는 사람들이 어떤 모델을 실제로 사용하고 있는지 모르는 상태에서, 모델 간에 의미 있는 차이를 알아차리거나 품질에 대해 불평하거나 선호도를 개발하는지 알아보는 것이었습니다.
불만은 9B 레벨 이하에서 나타나기 시작했습니다. 가장 흔한 불만은 기본적으로 모델이 '상황을 이해하지 못한다'는 것이었습니다. 놀랍지 않게도, 모든 사람이 Gemma 모델의 응답을 선호했습니다. 반면 다른 모델들은 참가자들 중 3명은 때때로 모델이 '너무 많이 생각해서' 혼란스러운 로봇처럼 들린다고 말하기도 했습니다. 어떤 모델에 대해 이야기하는 것인지 우리는 아마 알고 있을 것입니다. 마지막 사진은 Q3.6 27B OpenWebui restyle에서 7,912개의 요청 중 단지 51개만이 높은 추론(high reasoning)을 사용한 경우입니다. 약 4,588개가 즉시(instant)를 사용했고, 2,263개가 중간(medium)을 사용했으며, 나머지는 낮은 수준을 사용했습니다. 따라서, 네, 압도적인 대부분의 사용은 높은 추론과는 거리가 멀었습니다. 저는 이미 그들에게 가장 높은 사고 모드로 설정할 수 있는 토글이 있다고 말했습니다. 흥미롭게도, 일부 참가자들은 추론 과정을 볼 수 있기 때문에 여전히 모델들을 최고 수준이라고 묘사했습니다. 한 댓글에는 대략적으로 다음과 같이 쓰여 있었습니다: '와, 이 모델은 스스로의 행동에 대해 정말 관찰력이 뛰어나다. 매우 신중하게 생각하기 때문이다.' 실험이 끝날 무렵, 저는 Qwen 3.8 27B를 사용하여 LLM 심사관(judge)을 돌려 요청들을 분류했습니다. 절반 정도는 문서 작성과 관련된 것이었는데, 여기에는 문서를 초안 작성하거나 엑셀 스타일 표를 생성하는 것 등이 포함되었습니다. 다음은 문법 관련 요청이었습니다. 이 범주는 문서 작성과 다소 중복되었고, LLM 심사관은 이를 분류할 때 상당히 높은 불확실성을 보고했습니다. 문법 검사 요청의 약 1/3은 대신 문서 작성 범주에 배치될 수 있었을 것입니다. 나머지 대부분의 요청은 기본적으로 '구글 검색' 유형의 질문이었습니다. 음, 저는 가장 과도한 요리 레시피 질문에 대해 sonar 크레딧을 지불했습니다..... 코딩에는 거의 아무도 사용하지 않았습니다. 주목할 만한 코딩 관련 요청은 단 하나였는데, 친구가 간단한 HTML 전용 랜딩 페이지 히어로 섹션을 사용하여 자신의 프로젝트 중 하나를 보여주고 싶어 했을 때였습니다. 컨텍스트 길이(context length)에 대해서는, 제가 오래된 메시지를 자동적으로 가지치기하고 요약하는 훅을 설치했지만, 실제로 사용되는 경우는 거의 없었습니다.
대부분의 요청은 64K 모델: Q 3.6 27B INT4 https://huggingface.co/Lorbus/Qwen3.6-27B-int4-AutoRound Q 3.6 35B Unsloth UD Q4 https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF/blob/main/Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf Gemma 26B A4B https://huggingface.co/cyankiwi/gemma-4-26B-A4B-it-AWQ-4bit Gemma 12B QAT https://huggingface.co/google/gemma-4-12B-it-qat-w4a16-ct Ornith Q 3.5 9B https://huggingface.co/ornith-ai/Ornith-1.0-9B Gemma E4B https://huggingface.co/google/gemma-4-E4B-it Gemma E2B https://huggingface.co/google/gemma-4-E2B-it - 12B 이상은 FP8/Q8_0 KV를 사용합니다. - 9B 이하 모델은 BF16 KV를 사용합니다. - 컨텍스트(ctx) 증가를 위해 VLLM을 작은 배치 크기 토큰으로 AOT에서 실행했습니다. - Gemma 26B와 Q 27B는 이미지 서브 LLM (E4B)이 있어 제 프로세서에서 실행되었습니다. 비록 이미지 요청도 드물지만, ------ 결론 및 요약(TLDR) ------ 그들은 Gemma 모델의 응답을 선호하며, 대다수는 이것이 5.5/5.6 솔(Sol) 모델이라고 생각합니다. 왜냐하면 5명이 저에게 친구들을 제 채팅 웹UI에 연결해 달라고 요청했기 때문입니다. 또 다른 중요한 시사점은, 만약 귀사가 직원들에게 LLM을 제공한다면, 모델의 기능을 분할하는 것이 좋을 수 있다는 것입니다. /u/Altruistic_Heat_9531이 제출했습니다 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기