
소셜 미디어의 토끼굴, 클러스터, 그리고 랜덤 워크의 상대적 혼합 시간
요약
Twitter 데이터의 도메인 동시 발생 행렬을 분석하여 소셜 미디어 내의 클러스터 구조를 연구했습니다. 분석 결과, 우파 커뮤니티가 좌파 커뮤니티보다 훨씬 더 조밀하게 연결되어 있음을 발견했습니다.
핵심 포인트
- Twitter 내 도메인 기반 클러스터링을 통해 하위 커뮤니티 구조 시각화
- 우파 클러스터가 좌파 클러스터보다 훨씬 더 조밀하고 응집력 있게 형성됨
- 클러스터의 밀도 차이가 추천 시스템의 작동 방식에 중요한 영향을 미침
이 포스트의 유튜브 영상 버전은 여기에서 확인할 수 있습니다.
그래프 (The Plot)
Twitter는 하나의 거대한 글로벌 공유지/광장(town square)이라는 평판을 가지고 있습니다. 즉, (명시적인 서브 커뮤니티를 가진 Reddit과 달리) 내부에 어떠한 하위 커뮤니티도 존재하지 않는 하나의 커다란 커뮤니티라는 인식입니다. 하지만 Twitter의 모든 사람이 하나의 커뮤니티에 속해 있다는 것은 분명 사실이 아닙니다. 사람들은 항상 Twitter의 서로 다른 "부분들"(TPOT, Black Twitter, 우파 Twitter 등)에 대해 이야기합니다.
따라서 누군가는 "Twitter의 그 서로 다른 부분들이란 무엇인가?"라고 물을 수 있습니다. 즉흥적으로 몇 가지를 떠올릴 수는 있겠지만, 그 질문에 객관적으로 답할 수 있는 방법이 있습니다.
제가 여기서 수행한 작업은 다음과 같습니다:
- 2012년 당시 약 1년 동안의 Twitter 스트림/샘플 API(트윗의 무작위 샘플)를 기록했습니다.
- 해당 트윗들의 링크에서 도메인 이름을 추출했습니다.
- 가장 흔한 1만 개의 도메인 이름에 대한 동시 발생 행렬(co-occurrence matrix)을 생성했습니다 (즉, 특정 도메인 이름이 동일한 사용자에 의해 트윗된 횟수).
- 해당 행렬의 행들을 2D로 투영했습니다 (PCA 및 t-SNE 사용).
그 결과 다음과 같은 그래프가 생성되었습니다:

친화 그룹 (Affinity groups)
예상할 수 있듯이, 서로 다른 언어들에 대한 명확한 클러스터(clusters)가 존재합니다.
몇 가지 놀라운 친화 그룹(적어도 저에게는)이 있습니다. 예를 들어, 마미 블로그(mommy blogs, 독자가 어린 자녀를 둔 어머니인 블로그)는 매우 조밀하게 클러스터링됩니다.

이 연구에서 적어도 저에게 가장 흥미로웠던 발견은, 좌파 클러스터보다 우파 클러스터가 얼마나 더 조밀한가 하는 점입니다. 빨간색으로 강조된 클러스터는 우파 클러스터이며, 파란색으로 강조된 퍼진 형태는 대부분의 좌파 웹사이트를 포함합니다.

빨간색 클러스터는 오직 우파 콘텐츠이며, 정말로 우파 콘텐츠뿐입니다. 이는 극도로 조밀하게 연결되어 있습니다.
파란색 번짐(smear)은 모든 좌파 및 자유주의 매체들을 포함합니다. 이는 전혀 긴밀하게 연결되어 있지 않습니다. 예를 들어, Huffington Post의 직계 이웃은 Democracy Now나 Current Affairs가 아니라 Mashable, Yahoo News, LinkedIn입니다. Slate의 직계 이웃은 LA NBC 계열사(affiliate)와 Reuters입니다. 하지만 Daily Caller의 직계 이웃은 Washington Times, Redstate.com, Bizpacreview.com입니다.
랜덤 워크 (Random walks)
이러한 조밀한 클러스터링(clustering)의 차이는 추천 시스템(recommender systems)이 작동하는 방식에 중요한 결과를 초래합니다. 예를 들어, Twitter의 '팔로우할 만한 사람(Who to Follow)' 시스템은 제가 여기서 사용한 것과 유사한 임베딩(embedding)을 기반으로 팔로우할 계정을 추천합니다(다만 도메인 이름 대신 팔로우 그래프를 사용합니다).
'팔로우할 만한 사람'(그리고 '당신을 위한 페이지(For You Pages)'에서 사용되는 것과 같은 다른 추천 시스템들)은 사용자가 이미 좋아하는 것들의 근접 이웃(near neighbors)을 추천합니다.
두 명의 가상 사용자 A와 B를 가정해 봅시다. A는 Fox News를 시청하고, B는 The Guardian을 읽습니다.
B는 Twitter 계정을 만들고 자신이 좋아하는 Guardian 칼럼니스트들을 팔로우합니다. Guardian은 주류 출판물 및 정치와 관련 없는 콘텐츠들과 함께 그 커다란 번짐(smear) 영역 안에 있기 때문에, B는 다양한 계정을 추천받게 됩니다. 예를 들어 New York Times 칼럼니스트, 스포츠 인물, 패션 인플루언서 등입니다. 각 단계에서 받는 추천은 *높은 분산(high variance)*을 가집니다. 즉, 사용자가 팔로우하는 대상들의 이웃들 사이에 매우 높은 다양성이 존재하며, 따라서 추천되는 내용에도 다양성이 존재한다는 의미입니다. 이는 이 랜덤 워크(random walk)의 혼합 시간(mixing time)이 짧다는 것을 의미합니다. 단계(팔로우 동작)가 추천된 계정 목록 중에서 무작위로 선택되는 것이고, 추천된 계정은 사용자가 이미 팔로우하는 계정들의 이웃이기 때문에 이는 랜덤 워크입니다. 짧은 혼합 시간은 사용자가 어디에서 시작했는지만을 알고서는, 몇 단계가 지나지 않아 사용자가 어디로 이동했을지 예측하는 것이 불가능해짐을 의미합니다. 추천이 당신을 어디로든 데려갈 수 있기 때문입니다.
A가 트위터 (Twitter) 계정을 만들고 자신이 좋아하는 Fox News 인물들을 팔로우합니다. 우파 계정들은 매우 밀접하게 클러스터링 (Clustering) 되어 있기 때문에, 당신이 우파 계정들을 팔로우하면 오직 다른 우파 계정들만을 추천받게 됩니다. 이는 이 랜덤 워크 (Random walk)의 혼합 (Mixing) 성능이 낮음을 의미합니다. 즉, 사용자가 어디서 시작했는지만 안다면, 오랜 시간이 흐른 뒤에도 사용자가 어디에 도달해 있을지(그 밀집된 클러스터 어딘가에 있을 것임을) 꽤 정확하게 추측할 수 있다는 뜻입니다.
사람들이 소셜 미디어의 토끼굴 (Rabbit holes)에 대해 막연하게 이야기할 때, 그들이 가리키는 구체적인 현상이 바로 이것입니다.
이러한 클러스터 밀집도의 차이는 왜 우파 소셜 미디어가 좌파 소셜 미디어보다 사람들을 토끼굴에 가두는 데 더 능숙한지를 설명해 줍니다. 그리고 이는 부분적으로 왜 우파가 트위터 (Twitter)와 같은 웹사이트에서 상대적으로 훨씬 더 큰 성공을 거두어 왔는지를 설명해 줍니다.
고등학교 급식실
이러한 클러스터링 (Clustering)은 당신에게 마을 광장이라기보다는 고등학교 급식실에 훨씬 더 가까운 환경을 제공합니다. 운동부 아이들은 운동부 테이블에 앉아 다른 운동부 아이들과만 대화하고, 못된 아이들은 못된 아이들 테이블에 앉아 자기들끼리만 대화하며, 대부분의 사람들은 기본적으로 무작위로 선택된 어딘가에 앉아 있습니다.
대부분의 사람들은 이렇게 끈끈하게 연결된 테이블의 구성원은 아니지만, 대부분의 드라마는 바로 그 테이블들로부터 발생합니다.
인터랙티브 플롯 (Interactive Plot)
여기 직접 조작해 볼 수 있는 플롯 (Plot)의 인터랙티브 버전이 있습니다. 마우스를 올려 도메인 이름을 확인해 보세요. 어떤 커뮤니티 (Communities)를 발견하셨나요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Lobste.rs AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기