AI 학습용 생물학 데이터 구축에 전 세계 약 2.7조원 투입 약속
요약
글로벌 생물학 데이터 구축에 막대한 자금이 투입되는 것에 대해 우려를 표하며, 특히 이 데이터가 개인정보 침해나 악용될 가능성을 지적합니다. 또한, 연구의 초점은 연산 자원보다 표준화된 다중 모달 정답 데이터 수집에 맞춰져야 한다고 주장합니다.
핵심 포인트
- 생물학 데이터 구축 과정에서 개인정보 및 사생활 침해 위험이 높음.
- 막대한 투자가 목표가 불분명한 사업에 낭비될 수 있다는 비판 제기.
- 진정한 병목은 연산 자원이 아닌 표준화된 다중 모달 정답 데이터임.
- 공익을 위한 오픈소스 법률 및 데이터 소유권 확보의 필요성 강조.
기사에서 잘 알려지지 않은 Biohub를 유명한 NIH·미국 에너지부(DoE)와 나란히 홍보하면서 빠뜨린 사실은 Zuckerberg가 시작한 사업이라는 점임. 생물학적 데이터 전체가 Facebook·Instagram 계정에 떼려야 뗄 수 없이 연결되고, 수신 거부처럼 거부권은 있어도 실제로는 벗어날 수 없는 상황을 상상해 보길 바람.
약 1년 전까지만 해도 Chan Zuckerberg Initiative의 이름을 딴 CZI Biohub였음. 나는 2012년 머신러닝 모임에서 Facebook의 사진 활용 방식을 보고 섬뜩해서 사용을 중단했고, Facebook 페이지도 없음.
하지만 연구에서 Biohub 자원을 늘 사용하며, 여기서 개발한 기술이 Meta의 소름 끼치는 행태를 더 심하게 만들 것이라는 걱정은 전혀 하지 않음. 둘의 연결은 명망 높은 Howard Hughes Medical Institute와 항공 산업의 연결 정도에 불과함.
우려하는 것은 20억 달러 투자 규모임. 여러 독립적인 대학 연구실에 초기 자금을 나눠 주는 편이 더 나을 텐데, 목표조차 정의되지 않아 달성할 수도 없는 사업에 인간 게놈 프로젝트 비용의 두 배를 투입하는 것은 낭비라고 봄. 이번 발표에는 타당한 비판거리가 많지만, 개인정보 보호는 그중 하나가 아니라고 봄.
이 기술이 다른 곳에서 어떻게 쓰일지도 걱정됨. 정신건강 상태·중독·질병 등의 예측 모델은 마케팅에서 악용하기 좋은 강력한 데이터가 될 수 있음.
결국 건강보험·생명보험 회사들도 규제가 충분히 풀리거나 벌금을 감수할 만해지면 이를 이용해 돈을 더 짜낼 것 같음. 언젠가는 우생학이나 특정 대상을 겨냥한 생물무기까지 이어지는 것 아닌지 우려됨.
우려하는 방식의 관계는 Meta 제품과 Biohub 사이에 없음.
현재 보조금성 지원으로 저렴하게 제공되는 AI 서비스의 남는 구독 크레딧을 모아, 이런 공동 목표에 기여하는 SETI@Home 후속 프로젝트를 구상해 보고 있음. 앞으로도 이런 식으로 자원을 모을 기회가 있을지 궁금함.
개발도상국 사람들이 무료로 AI 응답을 받을 수 있는 작은 시제품은 만들어 봤음. 각자의 노트북과 구독을 함께 활용해 이런 일을 할 수 있다면 정말 멋질 것 같음.
계정 정지를 당하기 딱 좋은 방법 같음. 내 Claude 계정은 재판매나 공유도 하지 않고 민감한 질문도 하지 않았는데 이유 없이 정지됐다가 사흘 뒤에 풀렸음.
오탐으로 계정을 정지하는 것도 개의치 않는 듯하니, 실제로 약관을 위반하면 위험이 더 클 것임. 정지당하면 이의를 제기할 방법도 없고, 고객지원 AI 챗봇 페이지마저 계정 정지 페이지로 리디렉션됨.
도움이 필요하다고 자처하는 사람에게 제공하기보다, 모두에게 이로운 공개 합성 학습 데이터를 만드는 편이 나을 것 같음. 전자 같은 시스템은 며칠 만에 악용될 것임.
AlphaFold 이전에는 바로 이런 용도로 folding@home이 있어서, 자신의 컴퓨터에서 단백질 접힘 연산을 실행할 수 있었음.
계정 정지를 피하려고 GitHub 이슈·PR과 사람들이 직접 불러와 실행하는 스킬을 기반으로 비슷한 것을 구상하고 있었음.
여기서 주된 병목은 연산 자원이 아니라 고처리량 실험실 측정 데이터와 표준화된 다중 모달 정답 데이터였음. 포장용 소프트웨어 계층을 더 쌓는 대신 실제 데이터 수집에 자금이 흘러가는 것은 반가움.
표준화된 다중 모달 정답 데이터가 구체적으로 무엇을 뜻하는지 설명해 줄 수 있을까요?
한편 현 행정부는 연구에 필수적이던 기존 공개 데이터셋을 적극적으로 온라인에서 내리고 있음.
자기 데이터의 소유권을 확보하고 공익을 위해 활용하도록 허용할 수 있어야 하는데, 안타깝게도 사람들이 그 개념이나 가치를 잘 이해하지 못함. 우리는 오픈소스이며, 우리를 보호할 제대로 된 오픈소스 법률이 필요함.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기