
Debian에서의 LLM 사용: 세 가지 제안
요약
Debian 프로젝트 내에서 LLM 및 생성형 AI 도구 사용을 금지하는 것에 대한 세 가지 제안과 논의를 다룹니다. 저작권의 불명확성과 출력물의 품질 문제를 근거로 Debian의 안정성과 자유 소프트웨어 가이드라인을 유지하려는 목적을 가집니다.
핵심 포인트
- Debian 기여물에 대한 LLM 사용 명시적 금지 제안
- LLM 출력물의 저작권 및 라이선스 상태의 불확실성 문제
- LLM 생성물의 정확도 및 품질 저하에 대한 우려
- Debian의 안정성과 DFSG 준수를 위한 정책 논의
일반 결의안 (General Resolution): Debian에서의 LLM 사용
- 타임라인 (Time Line)
- 제안 A 제안자 (Proposal A Proposer)
- 제안 A 재청자 (Proposal A Seconds)
- 제안 A (Proposal A)
- 제안 B 제안자 (Proposal B Proposer)
- 제안 B 재청자 (Proposal B Seconds)
- 제안 B (Proposal B)
- 제안 C 제안자 (Proposal C Proposer)
- 제안 C 재청자 (Proposal C Seconds)
- 제안 C (Proposal C)
- 제안 D 제안자 (Proposal D Proposer)
- 제안 D 재청자 (Proposal D Seconds)
- 제안 D (Proposal D)
| 토론 기간 (Discussion Period): | 2026-07-24 |
|---|
Matthias Geiger [werdahias@debian.org] [제안 전문]
- Johannes Schauer Marin Rodrigues [josch@debian.org] [메일]
- Antoine Le Gonidec [vv221@debian.org] [메일]
- Simon Richter [sjr@debian.org] [메일]
- David Bremner [bremner@debian.org] [메일]
- Pierre-Elliott Bécue [peb@debian.org] [메일]
- Ian Jackson [iwj@debian.org] [메일]
- Amin Bandali [bandali@debian.org] [메일]
- Thorsten Glaser [tg@debian.org] [메일]
선택지 1 (Choice 1)
전문 (Preamble)
이 제안은 대규모 언어 모델 (LLMs) 또는 기타 생성형 AI (Generative AI) 도구의 사용 또는 도움을 받아 작성된 Debian에 대한 모든 기여를 명시적으로 금지하는 것을 목표로 합니다.
이 일반 결의안 (GR)의 범위는 (전부는 아니지만) 다음과 같습니다:
- Debian 소스 패키지 (source packages)
- lintian과 같은 공식 Debian 프로젝트 소프트웨어
- Debian 웹 리소스
- Debian 기여자들에 의해 추가된 문서 및 번역
- Debian의 공식 커뮤니케이션
다음은 포함되지 않습니다:
- 개발을 위해 LLMs를 사용하는 업스트림 (Upstream) 프로젝트
- AI 관련 소프트웨어
- 업스트림 패치/보안 수정 등
근거 (Rationale)
Debian은 안정성 측면에서 충분히 인정받는 명성을 가지고 있습니다. 이러한 안정성은 자유 소프트웨어 생태계 내 Debian의 위치에 있어 매우 중요합니다. 우리는 광범위한 LLM 사용이
LLM 출력물은 법적 상태가 매우 불분명합니다. 그 자체의 가치로 저작권(copyright)을 인정받을 수도 있고, 그렇지 않을 수도 있습니다. 또한 학습 데이터에 포함된 모든 라이선스(license) 및 저작권의 영향을 받을 수도 있고, 받지 않을 수도 있습니다. Debian 정책과 DFSG(Debian Free Software Guidelines)는 라이선스 및 저작권에 대해 절대적인 명확성을 요구합니다[1][2]. 저작권이나 라이선스 상태가 불분명한, 인간이 전통적인 방식으로 작성한 소프트웨어 및 기타 기여물은 Debian에서 허용되지 않습니다. LLM 출력물에 대해 이 원칙의 특별한 예외가 적용되어서는 안 됩니다.
2. 품질 (Quality)
LLM 출력물은 정확도 측면에서 잘 알려진 많은 문제점을 가지고 있습니다.[3][4][5] LLM은 단순히 학습 데이터의 통사적으로(syntactically) 가능성 있는 조합을 생성할 뿐이므로, 자신의 출력이 올바른지 결코 "알 수" 없습니다. 어떤 환경에서는 이것으로 충분할 수 있습니다. 하지만 Debian에서는 그렇지 않습니다. 예를 들어, 패키징(packaging)의 경우 각 Debian 소스 패키지는 고유합니다. 패키징 구문(syntax)과 모범 사례(best practices)는 시간이 지남에 따라 변해왔기 때문에, LLM이 생성한 패키지는 아카이브의 연령대에 걸친 내용이 뒤섞여 있을 것이며, 작동하지 않는 watch 파일, 문맥에 맞지 않는 오버라이드(overrides), 가상의 저작권, 그리고 일반적으로 업로드하기에 부적합한 상태가 될 것입니다. 패키징 전문 지식을 갖춘 숙련된 Debian 기여자는 여기서 제한적인 유용성을 찾을 수도 있겠지만, 신규 기여자는 이를 활용할 수 없으며 어떻게 수정해야 하는지도 알지 못할 것입니다. 이러한 품질 및 정확도에 대한 우려는 위 제안서의 범위에 나열된 모든 영역에 명확하게 적용됩니다. 만약 Debian이 절대 떠나지 않는 도메인 전문가들로만 구성된 폐쇄적인 조직이라면 이것이 문제가 되지 않을 수도 있겠지만,
3. 커뮤니티 (Community)
Debian은 단순한 코드 그 이상인 프로젝트입니다. 이는 자유 소프트웨어 (Free Software)에 대한 공통된 관심사와 기술적 문제 해결을 바탕으로 구축된 커뮤니티입니다. Debian은 다양한 수단을 통해 의도적으로 이 커뮤니티를 성장시키며, 새로운 기여자 (Contributors)들이 참여하도록 항상 권장합니다. LLM 기여를 허용하는 것은 이를 저해합니다. 리뷰를 위해 LLM 결과물을 제출하는 새로운 기여자들은 리뷰어에게 불필요한 부담을 주며, 이는 번아웃 (Burnout)으로 이어질 수 있습니다. 더욱이, LLM에 의존하는 새로운 기여자들은 Debian 패키징 (Packaging)이나 프로세스의 세부 사항을 실제로 배우고 이해하지 못하므로, 번아웃된 기존 DD (Debian Developer)를 대체할 수 없습니다.
4. 윤리 (Ethics)
LLM 기업들은 라이선스, 저작권, 또는 robots.txt와 같은 확립된 관례를 전혀 고려하지 않고 훈련 데이터를 위해 웹 전체를 스크래핑 (Scraping)함으로써 자유 소프트웨어 커뮤니티 전체에 직접적인 피해를 주고 있습니다.[6] 이는 Debian의 공개 웹 리소스에 큰 부정적 영향을 미쳤으며, 사실상 많은 사용자가 의존하는 사이트들에 대한 대규모의 지속적인 서비스 거부 (Denial of Service, DoS) 공격과 같습니다. 그 결과 우리 인프라의 일부에 전혀 접속할 수 없게 되었고, JS 기반의 체크를 활성화해야만 했습니다. 다른 많은 프로젝트들도 유사한 영향을 받았습니다. 또한, LLM 훈련은 엄청난 양의 리소스를 소비하며[7], 우리가 보호를 위해 강제로 구현해야 했던 사용자 검증 시스템 또한 리소스를 낭비합니다. 이는 공공 자원으로서의 인터넷을 노골적으로 무시하는 행위이며, 시스템 관리자의 시간을 낭비합니다. 개별 LLM 세션이 직접적으로 막대한 리소스를 사용하거나 공개 웹에 DoS 공격을 가하는 것은 아니지만, 이들이 사용될 수 있다는 사실 자체가 LLM 기업들의 이러한 비윤리적인 행동의 직접적인 결과입니다.
Debian에는 사회적 계약 (Social Contract)이 있습니다. [8] 우리의 우선순위는 사용자(Users)와 자유 소프트웨어입니다. Debian은 안정적 (Stable)입니다. [9] 사용자와 조직이 Debian을 선택하는 이유는 Debian이 신뢰할 수 있고 안전하기 때문입니다.
Debian은 줄어드는 수의 인간 자원봉사자들에 의한 수동 검토를 필요로 하는 최대한 많은 코드를 생성하거나, 모든 소프트웨어 조각을 패키징하거나, 새로운 기능을 서두르기 위해 존재하는 것이 아닙니다. 하지만 이것들이 바로 LLM (Large Language Models)이 사용되는 용도입니다.
결론적으로, LLM 기여를 허용하는 것은 품질과 안정성에 초점을 맞춘 자유로운 운영체제를 만드는 사회적 계약 (Social Contract) 및 공동의 목표에 반하는 것입니다.
제안 (Proposal)
Debian의 명성을 훼손하거나 커뮤니티에 추가적인 피해를 주지 않기 위해, LLM 보조 기여 (LLM-assisted contributions)는 Debian에 포함되는 것이 금지되어야 합니다.
LLM 기여가 이미 Debian에 의해 비준된 문서들에 반한다는 것이 우리의 입장이나, 모든 의구심을 제거하기 위해 우리는 사회적 계약 (Social Contract)에 다음과 같은 추가 사항을 제안합니다:
- 거대 언어 모델 (LLMs)을 사용하여 생성된 작업: 우리는 거대 언어 모델 (LLMs) 또는 기타 생성형 AI (Generative AI) 도구의 사용 또는 보조를 통해 작성된 Debian에 대한 직접적인 기여 (Direct contributions)를 허용하지 않을 것입니다. 직접적인 기여란 Debian 기여자들이 작성한 패키징 (Packaging), lintian과 같은 Debian 네이티브 소프트웨어, 문서화 (Documentation) 및 번역, 그리고 공식 Debian 웹 리소스 등을 의미합니다. LLM의 보조를 받아 작성된 업스트림 (Upstream) 프로젝트와 같은 다른 범주들은 추후에 포함될 수 있습니다. 이는 Debian이 안정적이고 신뢰할 수 있으며 믿을 수 있는 운영체제로 남도록 보장하며, 이를 가능하게 하는 Debian 자원봉사자들의 이익을 보호합니다.
발생 가능한 문제 (Possible Issues)
유사한 결정을 탐색하는 다른 프로젝트들은 공통적으로 다음과 같은 답변을 이끌어냈습니다: "LLM 기여 금지를 어떻게 강제할 것인가요?" 강제 집행은 어려움이 될 수 있지만, 이는 Debian 커뮤니티의 의지 표명이며, 우리는 이 커뮤니티가 선의에 따라 이를 준수할 것이라고 믿습니다.
인용 (Citations)
[1]
[2]
[3]
[4]
[5]
[6]
[7]
[8]
[9]
면책 조항 (Disclaimers)
- 인용은 배경 정보만을 위한 것이며 특정 웹사이트에 대한 보증을 반영하지 않습니다.
- 일부 아이디어와 문구는 아래의 출처로부터 유도되었습니다.
출처 (Sources)
GNOME 토론:
(CC0) Gentoo AI 정책:
Codeberg AI 정책:
이 문서는 Matthias Geiger가 작성했습니다.
Lucas Nussbaum [lucas@debian.org] [제안서 전문] [수정안 전문] [수정안 전문]
- Andrey Rahmatullin [wrar@debian.org] [메일]
- Christian Kastner [ckk@debian.org] [메일]
- Anton Gladky [gladk@debian.org] [메일]
- Stefano Zacchiroli [zack@debian.org] [메일]
- Simon Quigley [tsimonq2@debian.org] [메일]
- Soren Stoutner [soren@debian.org] [메일]
- Julian Andres Klode [jak@debian.org] [메일]
- Andreas Tille [tille@debian.org] [메일]
- Philipp Kern [pkern@debian.org] [메일]
선택지 2
AI 지원 기여 허용
프로젝트는 헌장(Constitution) 섹션 4.1 (5)에 따른 권한을 사용하여, AI 지원 기여(AI-assisted contributions)에 대한 현재 입장을 설명하는 다음 성명을 발표합니다. 이 성명은 채택된 시점의 프로젝트 입장을 기술합니다. 해당 입장은 향후 별도의 일반 결의(general resolutions)를 거칠 필요 없이 시간이 흐름에 따라 진화할 수 있습니다. 프로젝트에 결정이 필요하지만 합의에 도달하지 못할 경우, GR(General Resolution) 프로세스는 계속 이용 가능합니다.
Debian 프로젝트는 AI 지원 기여가 기술적 품질 및 유지보수 가능성, 그리고 법적 상태 등에 대해 많은 우려를 불러일으킨다는 점을 인식하고 있습니다. AI 자체 또한 사회 전반, IT 산업 및 자유 소프트웨어(Free Software)에 미치는 영향, 환경적 영향, 그리고 AI 스크레이퍼(scrapers)의 공격적이거나 비준수적인 관행에 대한 추가적인 우려를 야기합니다.
그럼에도 불구하고, 많은 Debian 기여자들은 Debian에 기여하고 궁극적으로 Debian을 개선하는 데 있어 AI 도구가 유용하다고 느낍니다.
AI 지원의 이점과 위험, 그리고 커뮤니티 내의 논쟁적인 논의를 고려할 때, Debian 프로젝트는 AI 지원 기여에 대한 입장을 명확히 하고 명확한 가이드라인을 수립하는 것이 필요하다고 판단합니다.
Debian 프로젝트는 다음 조건이 충족되는 경우에 한하여 AI 지원 기여(LLM에 의해 부분적 또는 전체적으로 생성된 기여)를 허용합니다:
도구의 법적 호환성 (Tooling Legal Compatibility): 기여자는 생성형 AI (Generative AI) 도구의 약관이 Debian의 맥락에서 결과물의 배포, 수정 또는 사용과 충돌하는 계약상의 제한을 부과하지 않는지 확인해야 합니다.
라이선스 및 저작자 표시 (Licensing and Attribution): 제3자가 작성하거나 소유한 기존 저작물(자유 소프트웨어로 라이선스가 부여된 기존 코드 포함)이 AI 도구의 출력물에 포함된 경우, 해당 출력물을 프로젝트에 기여하기 전에 기여자는 관련 오픈 소스 라이선스(Open Source License)에 따라 이를 제출할 권리가 있는지 확인해야 합니다.
책임 (Accountability): 기여자는 제출물의 기술적 가치, 보안, 라이선스 준수 및 유용성을 보증하는 것을 포함하여 자신의 기여에 대해 모든 책임을 집니다. 기여자는 이러한 기여 전체에 대해 단독으로 책임을 집니다. 기여자는 제안된 변경 사항을 완전히 이해해야 하며, 이를 정당화할 준비가 되어 있어야 합니다.
공개 (Disclosure): 기여물의 상당 부분이 도구에 의해 생성되었거나 도구의 실질적인 도움을 받은 경우, 기여자는 해당 도구의 사용 사실을 공개하여 의도된 대상이 명확하게 인지할 수 있도록 해야 합니다. 이는 코드, 메일링 리스트 게시물, 버그 토론을 포함한 모든 형태의 기여에 적용됩니다. 공개 방식은 기여자의 재량에 맡기되, 커밋(Commit)의 경우 Generated-By: 또는 Assisted-By:와 같은 Git 트레일러(Git trailer)를 사용하는 것이 편리한 옵션 중 하나입니다.
대량 또는 자동화된 변경 사항에 대한 사전 논의 (Prior Discussion of Bulk or Automated Changes): 대량 버그 보고 프로세스(개발자 참조 섹션 7.1.1)와 유사하게, 기여자는 대량 또는 자율적으로 생성된 기여물을 제출하기 전에 자신의 의도를 미리 논의해야 합니다.
그러한 모든 자동화된 프로세스는 그 동작과 결과물에 대해 책임을 지는 인간에 의해 감독되어야 합니다.
기밀 유지 및 개인정보 보호 (Confidentiality and Privacy): 기여자는 비공개 또는 민감한 프로젝트 정보(엠바고(embargoed)된 보안 보고서 또는 비공개 통신 등)를 신뢰할 수 없는 제공업체로 전송하는 생성형 AI (generative AI) 도구를 사용해서는 안 됩니다. 이는 기밀 데이터의 의도치 않은 노출로 이어질 수 있기 때문입니다.
Ian Jackson [iwj@debian.org] [제안 전문]
- Matthias Geiger [werdahias@debian.org] [메일]
- Andrea Pappacoda [tachi@debian.org] [메일]
- Simon Richter [sjr@debian.org] [메일]
- Antoine Le Gonidec [vv221@debian.org] [메일]
- Amin Bandali [bandali@debian.org] [메일]
- Bill Blough [bblough@debian.org] [메일]
- Enrico Zini [enrico@debian.org] [메일]
- Sean Whitton [spwhitton@debian.org] [메일]
선택지 3
요약: 가능한 한 LLM (생성형 "AI")을 거부할 것
배경
LLM은 다음과 같은 많은 심각한 문제들을 안고 있습니다: 자유 소프트웨어 커뮤니티 구축 메커니즘의 약화, 환경 파괴, 저작자 착취, 공격적인 스크래핑 (scraping)으로 인한 오픈 웹 호스팅 방해, 허위 정보 (bullshit)의 생성 및 유포, 정보 공유 자산 (information commons) 오염, 사용자의 정신 건강에 대한 위험, 경제적 거품, 컴퓨터 하드웨어 시장의 왜곡, 사기, 끔찍한 개인 및 기업에 의한 소유권 등. 이 기술을 윤리적이고 안전하게 사용하는 것은 거의 불가능합니다.
이상적으로는, LLM의 결과물이 우리가 의존하는 소프트웨어의 어떤 부분도 구성해서는 안 되며, LLM의 결과물이 인간이 작성한 산문을 대체해서도 안 됩니다.
불행히도 우리의 많은 업스트림 (upstreams)을 포함한 더 넓은 소프트웨어 세계의 일부는 다른 견해를 가지고 있습니다. 따라서 Debian의 일부로서 LLM 결과물을 완전히 금지하는 것은 현재로서는 비현실적입니다.
요청 사항
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기