Stack Overflow가 사멸하고 있다. 그것을 죽인 AI가 다음 타겟이 될 수 있다.
요약
ChatGPT 등 LLM의 등장으로 개발자들이 Stack Overflow에 의존하던 방식이 변화하며 트래픽 감소를 겪고 있습니다. 이는 단순한 서비스 위기가 아니라, AI 모델 학습 데이터 자체가 고갈되고 품질이 저하되는 '모델 붕괴(model collapse)'라는 근본적인 문제로 이어지고 있음을 지적합니다.
핵심 포인트
- LLM은 Stack Overflow의 방대한 아카이브를 기반으로 작동한다.
- AI가 생성한 데이터로만 학습하면 모델의 품질이 점진적으로 저하된다 (모델 붕괴).
- Stack Overflow의 트래픽 감소는 AI 산업 전체의 데이터 입력 측면 위기를 보여준다.
ChatGPT가 2022년 11월에 공개된 이후로 Stack Overflow의 질문량이 감소해 왔다 (OpenAI). 한 세대의 개발자들을 양성했고, 그 개발자들이 현재 사용하는 대부분의 AI 도구들이 의존했던 사이트가 서서히 비어가고 있다.
2023년 10월, Stack Overflow는 직원 중 28%를 해고했다 (Stack Overflow Blog). CEO Prashanth Chandrasekar는 이를 수익성을 위한 구조조정이라고 설명했다. 업계의 모든 사람들은 실제 원인을 이해하고 있었다. 트래픽이 감소한 것이다. 그리고 그 원인은 모든 개발자의 브라우저 탭 안에 놓여 있었다.
이 글은 또 다른 'AI가 Stack Overflow를 죽였다'는 식의 기사가 아니다. 그런 주장은 어디에나 있지만, 실제 문제를 간과한다. 흥미로운 부분은 피드백 루프이며, 이는 AI 산업 자체에게 불편한 지점을 가리킨다.
일반적인 이야기와 놓치고 있는 것들
대중적인 이야기는 다음과 같다. 개발자들은 예전에는 오류 메시지를 Google에 붙여넣어 Stack Overflow 스레드에 도달했다. 하지만 이제는 같은 오류를 ChatGPT, Claude 또는 Copilot에 붙여넣어 직접적인 답변을 얻는다. 포럼으로 이동하여 우쭐대는 댓글을 받을 위험을 감수하고 인간의 답변을 기다릴 필요가 있을까? 모델이 2초 만에 답해줄 수 있는데 말이다?
그 부분은 사실이다. 이는 트래픽 감소를 설명한다. 하지만 AI를 만드는 사람들이 왜 걱정해야 하는지를 설명하지는 못한다.
씨앗 곡물 문제 (The seed corn problem)
여기가 대부분의 기사들이 건너뛰는 부분이다. 모든 대규모 언어 모델(LLM)은 인터넷 텍스트를 기반으로 학습했으며, 이 과정에서 Stack Overflow로부터 엄청난 양을 소비했다. 이 사이트가 투표되고, 수정되며, 인간이 검토한 답변들의 아카이브는 현존하는 최고 품질의 프로그래밍 데이터셋 중 하나이다. AI가 사용자의 Python 오류에 대해 답변할 수 있는 이유 자체가 바로 이것 때문이다.
이제 루프를 앞으로 돌려보자. AI 도구들이 질문에 직접 답한다. 개발자들은 Stack Overflow에 게시하는 것을 멈춘다. 아카이브는 더 이상 성장하지 않는다. 다음 라운드의 모델들은 점점 오래되고, 점점 진부해지며, 2022년 이후에 일어난 모든 것을 놓친 코퍼스(corpus)로 학습하게 된다.
AI가 생성한 데이터로 AI를 학습시키면 품질이 저하된다는 것을 연구자들이 공식적으로 증명했습니다. Shumailov와 동료들은 모델이 모델이 생성한 출력물로 훈련될 경우 세대를 거치며 붕괴(collapse)하며, 실제 인간 지식의 긴 꼬리 부분(long tail)을 잃고 좁은 평균값으로 표류한다고 보여주었습니다(Nature, 2024). 그들은 이것을 모델 붕괴(model collapse)라고 부릅니다. 메커니즘은 간단합니다. 합성 데이터는 가장 흔한 패턴들을 증폭시키고 희귀한 것들은 지워버립니다. 충분한 라운드가 지나면, 모델은 인간이 실제로 어떻게 글을 쓰고 문제를 해결하는지 잊어버리게 됩니다.
Stack Overflow의 느린 사멸은 그 붕괴의 입력 측면에 해당합니다.
Stack Overflow가 시도했던 것들
칭찬할 만한 점은, Stack Overflow가 단순히 지켜만 보지 않았다는 것입니다. 2022년 말에 커뮤니티는 AI가 생성한 답변을 금지했는데, ChatGPT의 응답이 그럴듯해 보였지만 자주 틀렸고 검토 대기열을 넘치게 했기 때문입니다(Meta Stack Overflow). 이후 사이트는 전략을 바꿨습니다. 2024년에는 OpenAI와 데이터 라이선싱 파트너십을 체결하여, AI 기업들이 무료로 스크래핑하던 아카이브에 대해 비용을 받기 시작했습니다(Stack Overflow Blog). 또한 프로그램적 접근을 위해 API를 개방하고 상업 사용자들에게 이에 대한 요금을 부과하기 시작했습니다(Stack Exchange API).
논리는 합리적이었습니다. 만약 AI가 아카이브를 먹어치울 것이라면, Stack Overflow는 그 식사 대접에 대해 돈을 받는 편이 나을 것입니다. 하지만 이것은 핵심 문제를 해결하지 못합니다. 오래된 데이터를 라이선싱하는 것은 새로운 데이터를 창출하지 않습니다. 그리고 새로운 인간 답변의 흐름이야말로 지금 고갈되고 있는 바로 그것입니다.
개발자에게 이것이 중요한 이유
소프트웨어를 개발한다면 이미 무언가를 알아차렸을 것입니다. AI 도구들은 일반적인 경우(common cases)에는 능숙합니다. 2022년 이전에 Stack Overflow에서 수천 번 답변된 질문들에 대해서는 완벽하게 답하기 때문입니다. 하지만 지난달에 출시된 라이브러리나 최근 프레임워크 버전의 생소한 플래그 같은 것에 대해 물어보면, 모델은 모호해집니다. 환각(hallucinates)을 일으키고, 버전을 혼동하며, 2년 전에는 맞았지만 지금은 틀린 답변을 제공합니다.
이 간극이 바로 아카이브 간극(archive gap)입니다. 인간의 흐름(human pipeline)이 줄어들면서 이 간극은 더욱 커질 것입니다. 2023년과 2024년에 모두를 감명시킨 모델들은 살아 있고 성장하는 Stack Overflow 데이터를 기반으로 학습되었습니다. 하지만 2026년과 2027년에 출시될 모델들은 축소되는 데이터를 기반으로 학습하게 될 것입니다.
여러분 스스로 이 추세를 확인할 수 있습니다. Stack Exchange Data Explorer에서는 누구나 실시간 데이터베이스에 대해 SQL 쿼리를 실행할 수 있으며, 질문량과 채택된 답변 수는 공개되어 있습니다(Stack Exchange Data Explorer).
그렇다면 무엇이 그것을 대체하는가?
솔직히 말해 아직 아무도 모릅니다. 일부 신호는 Discord와 Slack 커뮤니티로 이동하고 있는데, 이곳들은 비공개이며 검색할 수 없기 때문에 모델 학습에 전혀 사용될 수 없습니다. 일부는 GitHub 이슈 및 토론으로 가는데, 여기는 더 지저분하고 프로젝트별 특성이 강합니다. 아주 적은 부분이 여전히 Stack Overflow에 남아있지만, 그 속도(velocity)는 예전의 극히 일부에 불과합니다.
그 결과는 웹이 이전에 겪었던 문제의 슬로우 모션 버전입니다. 백과사전적인 인간 지식이 한곳에 중앙 집중화되고, 그 장소가 스크래핑하기에 충분히 가치스러워지면, 스크래핑 자체가 기여할 동기를 제거하고, 결국 그 장소는 쇠퇴하게 됩니다. 위키피디아(Wikipedia)가 살아남은 이유는 편집 자체가 하나의 문화이기 때문입니다. Stack Overflow의 가치는 항상 답변 자체였고, 이 답변들이 바로 AI가 가져간 것입니다.
만약 AI 도구들이 계속 좋아지기를 바란다면, 그 도구들이 학습하는 인간 지식원의 건강 상태 역시 여러분의 문제입니다. 가끔씩 공개적으로 질문에 답변해 주세요. 3년 후에 여러분의 답변을 복사할 모델은 평균적으로, 점점 더 합성적인 방식으로 여러분에게 감사하게 될 것입니다.
출처:
- OpenAI - ChatGPT
- Stack Overflow Blog (해고, OpenAI 파트너십)
- [Shumailov et al.,
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기