
연구진, 모든 주요 LLM이 비밀리에 일본에 집착하고 있음을 증명
요약
연구진은 주요 LLM들이 문화적 질문에 대해 일본을 기본값으로 선택하는 경향이 있음을 발견했습니다. 이는 사전 학습 데이터가 아닌, 모델의 안전성을 확보하는 정렬(alignment) 과정에서 논란을 피하기 위해 '안전한' 일본 문화를 선택하기 때문입니다.
핵심 포인트
- 주요 LLM 8개 중 6개에서 일본 문화 편향 확인
- 편향의 원인은 사전 학습이 아닌 지도 미세 조정 및 정렬 단계
- AI 안전 필터가 논란을 피하기 위해 일본을 '안전한' 기본값으로 선택
- 일본의 풍부한 디지털 아카이브와 소프트 파워가 영향을 미침
연구진은 모든 주요 LLM(Large Language Model)이 비밀리에 일본에 집착하고 있음을 증명했습니다.
그리고 그들은 마침내 그 이유를 알아냈습니다.
수년 동안 우리는 AI가 완전히 서구 중심적이며, 실리콘밸리와 미국의 가치만을 반영한다고 들어왔습니다.
Cardiff와 Basque 연구진의 획기적인 논문은 ChatGPT, Claude, Gemini와 같은 프런티어 모델(frontier models)을 대상으로 24개 언어에 걸쳐 31,680개의 문화적 프롬프트(prompts)를 테스트했습니다.
그 결과는 그러한 가정을 산산조각 냈습니다.
8개의 프런티어 모델 중 6개에서, 개방형 문화 질문을 받았을 때 일본이 가장 빈번하게 언급되는 단일 국가로 나타났습니다.
개방적인 맥락에서 전통 무용, 축제 또는 일상적인 관습에 대해 물으면, AI는 일본을 기본값으로 선택합니다.
반복해서 말이죠.
여기 아무도 예상하지 못한 반전이 있습니다.
이러한 편향은 가공되지 않은 사전 학습(pre-training) 인터넷 데이터에서 오는 것이 아닙니다.
연구진은 이 집착이 어디에서 형성되는지를 추적했습니다. 이는 사전 학습 이후, 인간이 AI에게 행동 방식을 가르치는 지도 미세 조정(supervised fine-tuning) 및 정렬(alignment) 단계에서 나타납니다.
왜 일본일까요?
수십 년간의 글로벌 소프트 파워, 풍부한 문화 수출, 그리고 깨끗하고 보편적으로 찬사를 받는 디지털 아카이브 덕분에 일본 문화는 AI 안전 필터(safety filters)가 의존하기에 독보적으로 "안전"하기 때문입니다.
연구소들이 모델을 해롭지 않고 보편적으로 즐거움을 주는 방식으로 훈련할 때, AI는 문화적 측면에서 '컴포트 푸드(comfort food, 위안을 주는 음식)'와 같은 대상을 기본값으로 선택합니다.
애니메이션, 스시, 전통에 대해 이야기함으로써 논란을 피하는 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기