
Google Search의 어린이용 AI — Common Sense가 AI 답변에 '수용 불가능한 위험' 등급을 부여한 이유와 부모의 대처법
요약
Common Sense Media가 Google Search의 AI Overviews를 어린이용 계정으로 테스트한 결과 '수용 불가능한 위험' 등급을 부여했습니다. AI가 숙제를 대신 수행하거나 검증되지 않은 소셜 포스트를 출처로 제공하는 등 교육적 위험성이 발견되었습니다.
핵심 포인트
- Google Search AI 레이어는 부모나 학교가 별도로 끌 수 없음
- AI가 숙제를 완벽히 수행하여 자기 주도적 학습을 저해할 위험 존재
- 제공된 링크의 25% 이상이 신뢰할 수 없는 포럼 및 소셜 포스트로 연결
- 재검색 시 답변이 변하는 등 정보의 일관성 및 검증 문제 발생
7월 15일, Common Sense Media는 11세 및 15세 사용자로 설정된 계정을 통해 2,600개 이상의 검색 쿼리를 수행한 후 Google Search의 AI Overviews 및 AI Mode에 대한 평가를 발표했습니다. 자체 방법론에 따른 최종 카테고리는 매우 엄격하게 들립니다: "수용 불가능한 위험 (unacceptable risk)".
어린이를 위한 AI에 대해 논의할 때 중요한 것은 평가 자체보다 문제가 발견된 위치입니다. 이는 성인이 열어보지 않을 수도 있는 별도의 챗봇(Chatbot)에 대한 이야기가 아니라, 아이가 링크를 기대하지만 대신 완성된 합성 답변을 받게 되는 검색 엔진에 대한 이야기입니다. Common Sense의 입장에 따르면, 독립적인 Gemini는 별도의 설정이 가능하지만, 부모와 학교는 Google Search 내의 이 AI 레이어를 별도로 끌 수 없습니다.
이는 가족과 학교에 질문의 성격을 변화시킵니다. "아이에게 신경망 (Neural Network) 사용을 허용할 것인가"가 아니라, "어떤 작업에서 답변을 검증할 수 있고, 어떤 작업에서 답변을 유일한 정보원으로 남겨두어서는 안 되는가"의 문제입니다.
테스트에서 정확히 무엇을 발견했나
연구원들은 SafeSearch가 활성화된 상태에서 AI 답변을 테스트했으며, 텍스트 자체뿐만 아니라 답변이 참조하는 출처(Source)도 평가했습니다. 2,100개 이상의 인용 출처가 감사되었습니다.
가장 우려스러운 결과는 세 가지 상황과 관련이 있었습니다.
첫째, AI Mode는 테스트된 180개의 모든 숙제를 완벽하게 수행했습니다. 아이에게는 이것이 편리한 힌트로 보일 수 있지만, 교사와 부모에게는 검색을 자기 주도적 학습을 대신하여 완성된 결과물을 제공하는 도구로 변질시킵니다.
둘째, 테스트에서 제공된 링크의 4분의 1 이상이 편집 책임이 없는 포럼 및 소셜 포스트로 연결되었습니다. 답변 옆에 링크가 있다고 해서 그 출처가 학습용 작업에 적합하다는 것을 의미하지는 않습니다.
셋째, 10개의 역사적 질문 중 4개 이상의 경우 재검색 시 답변이 눈에 띄게 변했습니다. 이것이 모든 답변이 틀렸다는 것을 증명하는 것은 아닙니다. 하지만 아이가 어제의 표현과 오늘의 표현 사이의 차이를 알아차리지 못하고, 답변을 검증하는 과정이 작업의 일부가 되지 않는다면 학습 과제에서 위험을 초래할 수 있습니다.

SafeSearch가 이 문제를 해결하지 못하는 이유
SafeSearch는 여전히 검색 필터로 남아 있지만, 테스트 결과는 다른 문제를 보여줍니다. 즉, 필터링 (filtering)과 생성형 답변 (generative response)의 제어는 동일한 것이 아니라는 점입니다. 설령 검색어가 어린이용 설정(child settings)을 통과하더라도, 아이는 여전히 확신에 찬 어조로 구성된 합성 답변을 받을 수 있으며, 그 품질은 단 하나의 화면만으로는 평가하기 어렵습니다.
특히 안전하고 제한된 시나리오와의 대조가 중요합니다. 성인이 미리 목표를 설정하고 결과를 확인하는 경우, 어린이용 신경망 (neural networks)은 유용한 도구가 될 수 있습니다. 예를 들어, 동화 초안에 대해 토론하거나, 과제 옵션을 구상하거나, 왜 답변에 출처가 필요한지 함께 분석하는 식입니다. "어린이를 위한 신경망 동화" 또는 "어린이용 동화 생성기"와 같은 요청은 답변을 사실로 받아들일 필요가 없습니다.
하지만 학습 질문, 역사적 정보, 또는 아이가 어려운 순간에 도움을 찾을 수 있는 주제의 경우는 상황이 다릅니다. 성인이 곁에 없거나, 명확한 제한 사항이 없거나, 출처를 대조하는 습관이 없다면 완성된 답변의 편리함은 곧 위험이 됩니다.
이 결론에는 중요한 단서가 있습니다
Google은 해당 연구에 이의를 제기했습니다. 회사는 검색어들이 협소하고 모호하며 인위적으로 구성되었다고 주장했으며, 연구 결과를 재현할 수 없었으며, 관련성 있는 검색어에 대해서는 위기 대응 리소스를 보여준다고 밝혔습니다.
이는 강력한 반론입니다. 이 테스트는 검색에서의 모든 어린이 세션을 측정하는 것이 아니며, Google의 모든 AI 답변을 위험하다고 선언할 수 있게 해주는 것도 아닙니다. "수용 불가능한 위험 (unacceptable risk)"
하지만 바로 이 지점에서 반전이 일어납니다. 만약 동일한 질문에 대한 답변이 눈에 띄게 달라질 수 있다면, 완전한 재현성 (reproducibility)의 부재는 테스트를 약화시킬 뿐만 아니라 부모가 겪는 문제의 일부를 설명해 줍니다. 성인에게는 단 하나의 답변 품질을 검증하는 것뿐만 아니라, 다음 답변이 어떻게 나올지 예측하는 것조차 어렵기 때문입니다.
연구의 독립성을 평가할 때는 자금 지원 공개 여부도 고려해야 합니다. Youth AI Safety Institute는 Anthropic 및 OpenAI Foundation을 포함한 업계로부터 자금을 지원받으면서도 편집권의 독립성을 주장하고 있습니다. 이것이 발견된 증상들을 무효화하는 것은 아니지만, 하나의 보고서를 최종적인 판결로 받아들이는 것을 경계하게 만듭니다.
실천: 금지가 아닌 과업의 분리
부모와 학교는 전면적인 금지 대신, 과업을 세 가지 그룹으로 나누는 더 설명적인 모델을 선택할 수 있습니다.
창의적 공간으로 사용할 수 있는 영역. 동화의 초안, 색칠 공부 아이디어, 캐릭터 옵션, 프로젝트를 위한 질문 목록 등입니다. 여기에서 아이는 답변을 사실로서 신뢰할 의무가 없으며, 성인은 모델이 정확히 무엇을 만들어냈는지에 대해 함께 논의할 수 있습니다.
검증과 함께 사용할 수 있는 영역. 신경망 (Neural networks)을 활용한 아동 교육, 수업 준비, 주제 설명, 발표 계획 수립 등입니다. 규칙은 간단합니다. 아이가 독립적인 출처를 찾아내고 자신의 언어로 결론을 설명할 수 있을 때까지 AI의 답변을 그대로 제출하거나 재진술해서는 안 됩니다.
성인의 가이드 없이 방치해서는 안 되는 영역. 긴급한 도움이 필요하거나 정확한 의료, 법률, 심리 정보가 필요한 질문, 그리고 아이가 명백히 정보가 아닌 정서적 지지를 찾고 있는 상황입니다. 이 경우 검색이 유일한 도움의 통로가 되어서는 안 됩니다.
가족에게는 검색 내의 새로운 AI 기능이 도입될 때마다 다음과 같은 짧은 진단적 대화를 나누는 것이 유용합니다:
- 아이가 출처 링크와 완성된 답변 사이의 차이를 구분할 수 있습니까?
- 핵심 사실이 어디에서 왔는지 말할 수 있습니까?
- 동일한 요청을 반복했을 때 답변이 달라지면 어떤 일이 발생합니까?
- 성인이 이 시나리오를 확인하거나, 논의하거나, 제한할 수 있는 방법이 있습니까?
- 질문이 자신의 안전이나 건강에 관한 것이라면 아이는 어떻게 행동할까요?
만약 마지막 두 질문에 대해 명확한 답이 없다면, 이는 기술 자체가 나쁘다는 뜻이 아닙니다. 이는 접근 방식이 교육적 도구가 아닌 우연한 노출로서 구성되어 있다는 신호입니다.
기본 설정된 어린이 모드에 부족한 점
별도의 스위치가 중요한 이유는 AI 답변이 항상 해롭기 때문이 아닙니다. 이는 맥락(Context)을 선택하기 위해 필요합니다. 가족은 숙제를 위해 링크가 포함된 일반 검색을 원할 수 있고, 학교는 교사가 검증 규칙을 미리 설명한 조사 과제를 위해 다른 모드가 필요할 수 있습니다.
어린이나 학급을 위한 관리형 모드는 다음 네 가지 질문을 통해 논의되어야 합니다: AI 레이어(AI-layer)를 명시적으로 켜고 끌 수 있는가, 어떤 모델과 시나리오가 사용 가능한가, 출처가 보이는가, 그리고 성인에게 명확한 제어 기능(Controls)이 있는가. 이것은 특정 서비스의 확인된 기능 목록이 아니라, 모든 도구를 평가할 수 있는 기준입니다.
이러한 구조는 provod.ai에서도 구상할 수 있습니다: 가장 인상적인 모델을 선택하는 것부터 시작하는 것이 아니라, 먼저 허용 가능한 작업(Task)을 정의한 다음, 출처 규칙과 성인의 역할을 정의하는 방식입니다.

provod.ai — 증가하는 팀과 시나리오를 위한 통합 구조
각 방향별로 별도 구매를 할 필요 없이 직원, 제품 및 새로운 모델을 추가하세요: 공통 API와 워크스페이스(Workspace)는 성장에 따른 운영상의 혼란을 줄여줍니다.
하나의 카탈로그에서 제공되는 텍스트 및 미디어용 최신 모델들: 텍스트의 경우 OpenAI의 GPT, Anthropic의 Claude, Google의 Gemini, xAI의 Grok, DeepSeek, Qwen, GLM, Kimi 및 MiniMax가 있으며, 이미지의 경우 Nano Banana 2 Pro 및 GPT Image가, 비디오의 경우 Seedance, Kling, Veo 및 Google Omni의 최신 버전이 제공됩니다. 또한 추론 (reasoning), 검색 (search), 문서 (documents), 임베딩 (embeddings), 음악 및 오디오 모델도 사용 가능합니다.
사용량 증가에 따른 애그리게이터(aggregator)의 추가 수수료 미포함: 제공업체의 가격이 1:1로 유지되며, provod.ai 자체 마진은 붙지 않습니다.
성장에 대비하여 AI 환경을 준비하세요: 등록 양식 · 모델 가격 · 152-FZ에 따른 데이터 보호 · API 및 통합
당신에게 더 위험한 것은 무엇입니까: 아이에게 설명 없이 유익한 도구의 사용을 막는 것입니까, 아니면 성인의 별도 통제 없이 일반 검색 결과에 AI 답변을 그대로 두는 것입니까?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기