
AI 답변을 그대로 사용해도 괜찮을까? | 생성형 AI의 '거짓말'과 올바르게 마주하는 법
요약
생성형 AI의 할루시네이션(환각) 현상의 원인과 발생 가능성이 높은 상황을 설명합니다. AI의 확률적 구조를 이해하고 RAG, 프롬프트 개선, 인간의 검증을 통해 업무 리스크를 줄이는 방법을 제안합니다.
핵심 포인트
- AI는 확률 기반 모델로 사실을 검색하는 것이 아닌 문맥상 자연스러운 단어를 선택함
- 수치, 고유명사, 전문 분야, 최신 정보 질문 시 할루시네이션 위험이 높음
- 공식 소스를 통한 교차 검증과 출처 확인 습관이 필수적임
- 프롬프트에 '모르는 것은 모른다고 답하라'는 지침을 추가하여 오류를 억제할 수 있음
본 기사는 주식회사 DnD(https://dnd-inc.jp)의 칼럼을 일부 편집하여 게재하고 있습니다.
초출: https://dnd-inc.jp/blog/ai-hallucination-business-guide.html
"ChatGPT가 자신만만하게 대답했는데, 조사해 보니 거짓말이었다" —— 생성형 AI를 사용하기 시작한 사람이 가장 먼저 직면하는 경험입니다. 이 현상은 "할루시네이션 (Hallucination)"이라고 불리며, AI의 구조상 완전히 제로로 만드는 것은 불가능하다고 알려져 있습니다. 하지만 올바르게 이해하고 대처한다면 업무상의 리스크는 대폭 줄일 수 있습니다.
이 기사의 요점
- 생성형 AI는 "다음에 올 적절한 단어를 확률로 선택하는" 구조이기 때문에, 그럴듯한 거짓말(할루시네이션 (Hallucination))을 자신 있게 출력할 수 있다.
- 수치·고유명사·법률·최신 정보 등 "틀리면 곤란한" 정보는 특히 확인이 필요하다.
- "사람이 검증하는 습관"과 RAG 및 프롬프트 (Prompt) 개선의 조합으로 업무 리스크를 크게 줄일 수 있다.
생성형 AI는 인터넷상의 방대한 텍스트를 학습한 확률 모델입니다. "이 문맥 다음에 오는 것은 어떤 단어가 가장 자연스러운가"를 확률적으로 계산하여 문장을 생성합니다. 그렇기 때문에 유창하고 설득력 있는 문장을 만드는 데는 능숙하지만, 사실을 기억하거나 검색하고 있는 것은 아닙니다.
이러한 구조에서 발생하는 것이 "할루시네이션 (Hallucination, 환각)"입니다. 존재하지 않는 논문·가공의 통계·잘못된 고유명사를 마치 사실인 것처럼 자신 있게 출력할 때가 있습니다.
참고로, 2025년에 발표된 연구에 따르면 현재의 대규모 언어 모델 (LLM) 아키텍처 하에서 할루시네이션 (Hallucination)을 수학적으로 완전히 배제하는 것은 어렵다는 보고도 있습니다. 즉, 모델이 진화하더라도 제로가 되지는 않습니다. 이러한 전제를 갖는 것이 중요합니다.
모든 질문에서 동일하게 할루시네이션 (Hallucination)이 발생하는 것은 아닙니다. 다음과 같은 상황에서는 특히 주의가 필요합니다.
구체적인 수치·통계를 요구할 때: "〇〇 업계의 시장 규모는?", "△△의 성공률은?" 등. AI가 학습 데이터에 없는 숫자를 "그럴싸하게" 만들어낼 수 있습니다. -
고유명사(인명·기업명·법률명)를 포함하는 질문: "A사의 대표이사는 누구인가?", "이 조문의 내용은?" 등은 오류가 포함되기 쉬운 영역입니다. -
전문성이 높은 영역: 법률·의료·회계·세무 등 전문적인 정확성이 요구되는 분야에서는 자신 있는 오답이 특히 나오기 쉽습니다. -
학습 데이터 마감일 이후의 최신 정보: AI에게는 지식의 "마감일"이 있습니다. 그 이후에 일어난 사건은 알지 못함에도 불구하고 추측으로 대답하는 경우가 있습니다.
할루시네이션 (Hallucination)을 전제로 둔다면, AI를 안전하게 사용하는 습관은 자연스럽게 정해집니다.
① 중요한 수치·고유명사는 공식 소스로 뒷받침한다: AI의 답변은 어디까지나 "출발점"입니다. 법령·통계·타사 정보 등은 관공서나 공식 사이트에서 반드시 확인합니다. -
② "출처를 알려줘"라고 묻는다 (단, 출처 자체도 확인 필요): 근거를 물음으로써 답변의 신뢰도를 측정할 수 있지만, AI가 제시하는 출처가 가공의 것일 수도 있습니다. 제시된 URL이나 논문은 실제로 접속하여 확인하는 습관을 들입시다. -
③ 용도·리스크에 따라 검증의 깊이를 바꾼다: 사내용 아이디어 도출이나 문장 초안이라면 확인 비용을 낮게 유지할 수 있습니다. 반면, 고객에게 제출하는 문서·법적 문서·대외적인 수치는 전문가의 체크와 병행하는 것을 기본으로 합니다. -
④ "모르는 점이 있다면 알려달라"고 한마디 덧붙인다: 프롬프트 (Prompt)에 "불확실한 정보가 있다면 모른다고 명확히 말해 주세요"라고 덧붙이는 것만으로도 짐작으로 대답하는 것을 억제할 수 있습니다.
습관에 더해, 구조적인 측면에서도 리스크를 낮출 수 있습니다.
RAG란 AI가 답변할 때 신뢰할 수 있는 문서나 사내 데이터베이스를 실시간으로 참조하게 하는 구조입니다. AI가 가진 학습 데이터로만 답하게 하는 것이 아니라, "올바른 정보의 인출처"를 별도로 마련하여 AI가 사용하게 함으로써 할루시네이션 (Hallucination)을 대폭 억제할 수 있습니다. 사내 규정·제품 매뉴얼·FAQ 모음 등을 등록해 두면 효과적입니다.
"다음 문장의 범위 내에서만 답해 주세요", "확인할 수 없는 정보는 출력하지 마세요"와 같은 지시를 프롬프트 (Prompt)에 추가함으로써 AI가 멋대로 내용을 보완할 여지를 좁힐 수 있습니다. 템플릿으로서 사내에서 공유해 두면 팀 전체의 리스크를 낮출 수 있습니다.
특히 중요한 정보는 서로 다른 AI 모델에 동일한 질문을 던져 답변을 비교하거나, 웹 브라우징 (Web Browsing) 기능이 있는 도구를 사용하여 최신 정보를 참조하게 하는 방법도 유효합니다. 여러 관점에서 확인함으로써 단일 모델의 편향이나 오류를 더 쉽게 알아차릴 수 있습니다.
칼은 너무 잘 들어서 위험한 것이 아니라, 사용법을 모르기 때문에 위험해집니다. 생성형 AI (Generative AI)도 마찬가지입니다. 할루시네이션 (Hallucination)이라는 특성을 이해한 상태에서, "AI를 보조로 사용하고 사람이 최종 확인한다"라는 스탠스로 운용한다면, 큰 업무 가치를 안전하게 이끌어낼 수 있습니다.
완벽한 AI를 기다리기보다, 현재 있는 AI의 한계를 알고 능숙하게 다루는 것이 결과적으로 업무를 더 빠르게 변화시킵니다.
현재의 대규모 언어 모델 (LLM) 아키텍처 하에서는, 할루시네이션을 완전히 배제하는 것이 수학적으로 어렵다는 연구 보고가 있습니다. 모델의 진화로 리스크는 저감되고 있지만, "완전히 없어진다"는 전제는 위험합니다. RAG (Retrieval-Augmented Generation)나 사람에 의한 팩트 체크 (Fact Check)와 조합함으로써 업무상의 리스크는 대폭 줄일 수 있습니다.
오류가 있더라도 수정 및 확인이 용이한 업무 (문장 초안 작성, 아이디어 도출, 사내용 요약 등)는 비교적 활용하기 쉬운 반면, 법적 효력이 있는 문서, 재무 수치, 의료 정보, 대외적인 공개 자료 등 "틀리면 곤란한" 용도에서는 반드시 사람이 검증하는 공정을 넣을 것을 권장합니다.
일정한 효과가 있습니다. "불확실한 경우에는 '모릅니다'라고 답해 주세요", "〇〇 범위 내의 정보로만 답해 주세요"와 같은 지시를 추가함으로써 근거 없는 답변을 줄일 수 있습니다. 다만 만능은 아니기 때문에, RAG의 활용이나 사람에 의한 팩트 체크와 조합하는 것이 중요합니다.
이 기사는 주식회사 DnD(업무 효율화·DX 파트너)가 운영하는 칼럼을 전재한 것입니다.
▶ 초출·전문: https://dnd-inc.jp/blog/ai-hallucination-business-guide.html
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기