소셜 미디어 콘텐츠 조정 방법을 배웠습니다: AI는 훨씬 더 어려운 문제입니다
요약
본문은 소셜 미디어 콘텐츠 조정의 어려움과 생성형 AI가 가진 잠재적 오용 위험성을 다룹니다. ChatGPT와 같은 강력한 AI는 연구 및 생산성 향상에 혁신적이지만, 악의적인 목적으로 사용될 경우 감시 플랫폼 개발이나 로켓 유도 소프트웨어 제작 등 심각한 문제로 이어질 수 있습니다.
핵심 포인트
- AI는 콘텐츠 조정과 정보 탐색에 강력하지만 오용 위험이 높습니다.
- Anthropic은 Claude를 이용한 감시 및 무기 관련 악용 사례를 보고했습니다.
- 악의적인 프로젝트는 여러 개의 합법적인 요청으로 분할되어 진행될 수 있습니다.
YouTube는 일상생활의 익숙한 부분이 되었습니다. 우리는 스포츠 경기, 다큐멘터리 또는 튜토리얼을 시청하거나, 아이들이 만화를 보도록 사용합니다. 하지만 이 겉보기 정상성 뒤에는 거대한 문제가 숨어 있습니다. 누구나 콘텐츠를 업로드할 수 있다는 것입니다. 그리고 필연적으로 어떤 사람들은 부적절하거나, 성적으로 노골적이거나, 폭력적이거나, 아예 불법적인 자료를 업로드하려고 시도합니다. 같은 문제는 모든 주요 소셜 네트워크에 영향을 미칩니다: YouTube에는 매분 500시간 이상의 비디오가 업로드되며, 예를 들어 TikTok에서는 매일 1억 개 이상의 콘텐츠가 게시됩니다.
몇 년 전, 제 친구가 온라인 콘텐츠 조정 분야에서 일했습니다. 그는 제가 검토해야 했던 자료 중 일부에 극도로 폭력적이고 모욕적인 이미지와 비디오가 포함되어 있다고 말해주었습니다. 때로는 설명하기 어려울 정도의 내용이었습니다. 다행히도 일반 사용자는 대부분의 경우 그것을 접할 일이 없을 것입니다. 바로 누군가—혹은 점점 더 알고리즘이—먼저 가로채기 때문입니다.
오늘날, 이러한 작업의 상당 부분은 방대한 양의 콘텐츠를 분석하고 의심스러운 자료를 차단하거나 플래그 지정하는 자동화 시스템에 의해 처리됩니다. 인간 조정자는 주로 가장 복잡하거나 논란이 되는 사례에 개입하며, 사용자 신고는 필터링을 통과했을 수 있는 콘텐츠를 식별하는 데 도움을 줍니다.
이제 같은 문제를 생성형 AI(generative AI)에 적용해 보겠습니다.
ChatGPT 및 기타 AI 모델은 잘 사용될 때 놀라운 도구입니다. 이들은 우리의 능력을 향상시키고, 창의성을 최대한 발휘하도록 돕고, 복잡한 작업을 가속화하며, 직장과 교육에서 우리를 더 효과적으로 만듭니다. 문서 요약, 번역, 코드 작성, 이미지 생성, 방대한 양의 데이터 분석 등이 가능합니다. 의학 및 과학 연구 분야에서는 이러한 기능들이 더욱 흥미로워지는데, 단일 연구팀이 처리하기 어려울 수 있는 정보의 양을 탐색할 수 있게 해주기 때문입니다.
9월에 Anthropic은 수백 개의 Claude 에이전트가 유전 데이터베이스를 분석하고 새로운 효소 시스템의 발견에 기여했으며, 이 시스템은 이제 그 잠재력을 더 잘 이해하기 위해 연구될 것이라고 설명했습니다.
하지만 이렇게 강력한 도구가 수백만 명의 사람들의 손에 놓일 때, 누군가가 이를 악용하려 시도하는 것은 불가피합니다.
Anthropic이 발표한 Claude 오용 관련 최신 보고서는 몇 가지 주목할 만한 사례를 제시합니다. 한 운영자는 이 모델을 말리 정보국(intelligence service)의 감시 플랫폼 개발에 활용했으며, 이는 약 2,500만 개의 SIM 카드와 관련된 데이터와 연동되도록 설계되었습니다. Anthropic은 해당 활동을 감지하고 관련 계정을 차단했습니다.
하지만 그 시점부터 여러 질문이 여전히 답하지 못한 채 남아 있습니다. 개발자들이 단순히 다른 AI 시스템으로 전환했는지, 다른 도구를 사용하여 프로젝트를 계속 진행했는지, 아니면 그들이 구축한 소프트웨어가 실제로 작동 가능한 상태인지 우리는 알지 못합니다.
또 다른 사례에서는 예멘 북부에서 활동하는 한 세포가 로켓 유도 소프트웨어 개발에 Claude를 사용했습니다. 테스트 실패 후, 개발자들은 무엇이 잘못되었는지 이해하기 위해 모델로 돌아왔습니다. 한편, 러시아 스파이 행위와 관련된 작전에서는 악성코드(malware) 개발 및 적응을 포함한 사이버 공격의 여러 단계를 자동화하는 데 AI가 사용되었습니다.
하지만 아마도 가장 흥미로운 사례이자 가장 덜 극적인 사례는 따로 있습니다. 일부 사용자들은 위험한 프로젝트를 여러 개의 겉보기에 무해한 요청으로 분할했습니다. 한 가지는 코드를 작성하는 것일 수 있고, 다른 하나는 자격 증명(credentials)을 처리하는 것이며, 또 다른 것은 기술적 문제를 해결하는 것일 수 있습니다. 개별적으로 볼 때 이 요청들은 합법적으로 보였습니다. 오직 이것들이 함께 볼 때에만 프로젝트의 악의적인 목적이 명백해졌습니다.
이것이 바로 YouTube와의 비교가 한계에 도달하는 지점입니다. YouTube에서는 주로 콘텐츠 하나를 조정(moderate)하는 것이 주요 과제입니다. 비디오는 분석되고, 플래그가 지정되며, 제거될 수 있습니다. 하지만 생성형 AI의 경우, 일련의 명령어 뒤에 숨겨진 의도까지 이해해야 합니다. 한 요청은 무해할 수 있습니다. 다음 요청 역시 그럴 수 있습니다. 하지만 겉보기에 모두 무해한 백 개의 요청이 함께 쌓이면 어떤 결과가 나올까요?
여기에는 경제적인 차원도 존재합니다. Anthropic이 설명한 가장 심각한 사례 중 하나에서는 수십만 개의 개인 식별자(personal identifiers)와 수백만 건의 결제 카드 기록을 포함하는 1테라바이트 이상의 데이터가 도난당했습니다. 하지만 어쩌면 더 중요한 점은 다음과 같습니다. AI는 공격 비용을 극적으로 낮출 수 있다는 것입니다. 정찰(Reconnaissance), 코드 생성, 취약점 분석 등을 자동화된 시스템에 위임함으로써 필요한 인간의 노력과 전문 지식을 줄일 수 있습니다. 그 결과, 한때는 공격할 가치가 없었던 목표물조차 경제적으로 매력적이 될 수 있습니다.
해결책은 간단해 보일 수 있습니다. 모든 질문, 모든 답변, 그리고 어쩌면 전체 대화 기록까지 확인하는 것입니다. 하지만 이러한 시스템들이 성공적인 이유 중 일부는 거의 즉각적으로 응답하기 때문입니다. 따라서 통제의 추가적인 계층(layer)은 몇 초 안에 답변을 기대하는 수백만 명의 사용자들과 공존해야 합니다. 너무 관대한 시스템은 위험해질 수 있고, 지나치게 신중한 시스템은 사용 불능 상태가 될 위험이 있습니다.
대형 상업 AI 서비스들은 적절한 수준의 보안을 유지하려는 강력한 경제적 및 평판적 인센티브를 가지고 있습니다. 이것이 바로 그들이 오용(abuse)을 감지하도록 설계된 필터, 모니터링 도구 등에 투자하는 이유입니다. 새로운 방어 장치 우회 기술이 나타날 때마다, 관련 계정을 차단하고 점진적으로 자신들의 방어 체계를 강화할 수 있습니다.
하지만 일부 모델은 다운로드하여 로컬에서 실행할 수도 있습니다. 이 경우, 모델이 사용자의 자체 컴퓨터에서 실행되므로 어떤 회사나 기관도 무슨 일이 일어나고 있는지 관찰하거나 그 사용을 막을 수 없습니다. 이는 모델 자체, 어떻게 구축되었는지, 그리고 포함된 안전장치에 크게 달려 있습니다.
따라서 핵심은 AI 시스템이 무엇을 거부해야 하는지를 단순히 결정하는 것이 아닙니다. 우리는 또한 누군가가 여러 요청을 통해 달성하려는 목표가 무엇인지 이해해야 하며, 이 모든 요청들이 겉보기에는 무해할지라도 말입니다. 그리고 이러한 과정을 합법적이고 유익한 목적으로 도구를 사용하는 수백만 명의 사람들에게 페널티를 부과하지 않으면서 실시간으로 수행해야 합니다. 이렇게 강력한 시스템을 제한적인 잠재력 없이 통제하는 방법을 배우는 것이 앞으로 몇 년 동안 인공지능의 가장 중요한 과제 중 하나가 될 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기