DeepMind의 새로운 AI가 생명의 코드를 해독하다
요약
DeepMind가 개발한 Alpha Genome Atlas는 유전체 변이에 대한 예측 머신러닝 모델입니다. 이 시스템은 기존 데이터베이스보다 훨씬 큰 규모로, 인간 게놈의 특정 변이가 세포 특성이나 질병 취약성에 미치는 영향을 밝혀내려 합니다. 이는 생명의 코드를 해독하여 의학적 난제 해결에 기여할 잠재력을 보여줍니다.
핵심 포인트
- Alpha Genome Atlas는 유전체 변이 예측 머신러닝 모델이다.
- 기존 데이터베이스 대비 30배 큰 규모로 전례 없는 정보를 생산한다.
- 유전자 코드가 질병 취약성, 세포 특성에 미치는 영향을 분석한다.
- 개인의 게놈 레시피를 이해하여 의학적 난제 해결에 기여할 것이다.
만약 세포의 작동 원리를 완전히 이해할 수 있다면, 암과 같은 질병과의 싸움에 엄청난 영향을 미칠 것입니다. >> 저는 마치 공상 과학 영화 속에 떨어진 것 같아요. 어렸을 때에는 이런 기술은 꿈도 꿀 수 없다고 생각했거든요. 지금 저에게도 질문이 하나 생겼고, 아마 당신만이 이 질문에 답할 수 있을 것 같습니다. >> Alpha Genome Atlas가 하는 일은 기본적으로 이 모든 것을 예측합니다. Alpha genome atlas는 alpha fold database보다 30배나 큰 규모입니다.
와. 알파 genome이 변이에 대한 상세한 정보를 생산하는 규모는 전례가 없습니다. >> 당신의 발표를 보니 좋습니다. 이것은 저에게 정말 도전적인 부분인데, 왜냐하면 제 전문 분야를 훨씬 벗어나기 때문입니다. >> 제가 아는 것이 있다면요. 언제나 저는 학생으로서 당신에게 배우러 왔습니다. Alpha genome이 무엇인가요? >> Alpha genome은 유전체(genome)의 변이에 대해 예측하는 머신러닝 모델입니다. 그래서 우리의 유전체, 단순히 인간의 유전체뿐만 아니라, 유전체는 기본적으로 생명의 레시피입니다.
그것이 무엇이냐 하면 본질적으로 코드예요. 인간의 경우, 30억 개의 문자를 가진 코드죠. 그리고 그 문자 중 하나가 변한다면, 실제 세포 특성에 어떤 영향을 미칠까요? 유기체에는 어떤 영향이 있을까요? 이것들이 바로 alpha genome이 밝혀내려고 하는 것들입니다. >> 길거리 사람 입장에서 볼 때, 알파 genome은 궁극적으로 의학이나 우리의 삶을 어떻게 바꿀 수 있나요? 모든 사람은 게놈 수준에서 일어나는 일에 영향을 받습니다. 유전체는 생명의 레시피입니다.
이 유전체는 어떤 단백질(protein)이 발현되는지 알려주는 재료 목록 섹션과, 이 단백질들이 언제, 어디서, 그리고 어느 정도의 양으로 발현되는지를 다루는 일종의 혼합 섹션을 모두 가지고 있습니다. 그리고 이 모든 정보가 생명의 레시피에 인코딩되어 있죠. 지구상의 모든 사람은 레시피를 가지고 있습니다. 저에게도 레시피가 있고, 당신에게도 레시피가 있으며, 길거리의 사람도 레시피를 가지고 있습니다. 우리의 모든 레시피는 비슷하지만, 약간의 변화가 있습니다. 하지만 이 변화들이 실제로 무엇을 의미할까요?
이러한 변화들의 함의(implications)는 무엇일까요? 이것은 우리가 수년, 아니 수십 년 동안 이해하려고 노력해 온 것입니다. 인간 게놈 프로젝트를 통해 우리는 처음으로 최소 한 명의 인간 게놈에 대한 전체 레시피 북을 읽을 수 있게 되었습니다. 하지만 이제 우리는 어떻게 해독할지, 또는 특정 문자 하나를 변경했을 때 실제로 무슨 일이 일어나는지 이해하려고 합니다. 그 결과는 무엇일까요? 특정 질병을 유발할까요? 아니면 높은 체질량 지수(BMI)와 같은 어떤 종류의 문제성 이슈에 대한 높은 감수성(susceptibility)과 관련될까요? 또는 특정 암에 더 취약할까요?
이 모든 것들은 게놈에서 발생하는 변이(variation)를 더 잘 이해함으로써 어느 정도 디코딩될 수 있습니다. >> 음. 정말 놀랍네요. 그리고 제가 이걸 꼭 여쭤보고 싶었던 이유는, 저의 문제가 가끔 의학 논문을 읽으려고 할 때거든요. 제 전공 분야는 아니지만 학생이라서요. 그냥 배우려고 노력할 뿐이에요. >> 네. >> 그리고 제 문제는 아무리 읽어도 어떤 종류의 의학 지식이 전혀 없다는 거예요. 제 문제는 모든 사람이 다르다는 거예요. >> 그래서 이발소에 가서 이발사에게 말했더니, 같은 머리는 본 적이 없다고 하더라고요.
네. 그리고 저는 근육 비대(muscle hypertrophy)에 관한 논문을 읽었는데, 보디빌딩 같은 종류의 논문이었습니다. 어떻게 근육을 만들 수 있는지 다루고 있었는데, 그 연구에는 나이가 같고, 키가 같고, 체격도 비슷한 사람들이 신중하게 선정되어 있었습니다. 그들은 똑같은 식단을 하고, 똑같은 훈련을 했지만 한 남자는 믿기 어려울 정도로 근육이 많아졌습니다. 그들이 측정치를 기록했습니다. 다른 사람들은 약간의 근육만 얻었고, 한 불쌍한 남자는 아예 근육이 생기지 않았습니다. 그리고 근육을 잃은 사람도 있었습니다. 우리가 얼마나 다를 수 있는지 정말 놀랍습니다. 저는 이것이 우리 모두가 어떻게 조금씩 다르고 그것이 무엇을 의미하는지를 이해하는 데 한 단계 더 가까워질 수 있는 것인지 생각합니다.
네, 정확히 그렇습니다. 저는 생명의 코드를 해독하거나 이해하는 것이 어떤 결과를 가져올지 생각합니다. 때로는 그 결과가 아무 의미가 없을 수도 있잖아요? 예를 들어, 변화 자체가 그렇게 물질적이지 않은 경우도 있습니다. 때로는 매우 물질적인 종류의 결과이며 잘 이해되는 것들이 있습니다. 예를 들어, 겸상 적혈구 빈혈(sickle cell anemia) 같은 것이 있습니다. 특정 돌연변이 하나가 겸상 적혈구 빈혈을 유발하는 것을 야기하는데, 우리는 거기서 무슨 일이 일어나는지 알고 있습니다. 하지만 요즘 우리가 신경 쓰는 대부분의 것들은 다유전자성(polygenic)인 의미에서 여러 개의 돌연변이가 작용하여 특정한 사건이나 현상을 일으키는 것입니다.
그리고 어떤 면에서 alpha 게놈이 하려는 것은 특히 단일한 돌연변이 변이 수준, 즉 분자적 표현형(molecular phenotypes)에서 무슨 일이 일어나는지를 알아내려고 노력하는 것입니다. 이제 이러한 분자적 표현형들이 전체 유기체의 특성이나 인간의 경우 특정 질병에 대한 감수성(susceptibility to specific disease)과 어떻게 영향을 미치는지, 이것은 여전히 연결되어야 하고 연구가 되어야 할 부분입니다.
제 이해로는, 더 깊이 파고들기 전에 알파 게놈은 비상업적 용도로 우리 모두에게 영원히 자유롭다는 것입니다. 네, 맞습니다. 그래서 저희가 많은 과학 모델(예: AlphaFold 1, AlphaFold 2, uAlpha Genome)에 대해 해왔던 것처럼, 이것을 전체 과학 커뮤니티가 학술적인 연구 목적으로 접근할 수 있도록 했습니다. 그들이 자신들의 연구를 위해 사용하고 미세 조정(fine-tune)할 수 있게 하는 것이죠. 그리고 모델 가중치(model weights)도 이용 가능합니다. 사실인가요? 그리고 설명해 주시겠어요?
게놈은 세포의 사용 설명서입니다.
전적으로 그렇습니다. 제가 말씀드렸듯이, 게놈은 일종의 레시피 북과 같습니다. 여기에는 재료 목록 같은 유전자의 코딩 부분(coding part)이 있는데, 이 부분이 어떤 단백질들이 합성되어야 하는지 알려줍니다. 예를 들어, 인간 프로테옴(proteome)에는 20,000개의 단백질이 있습니다. 따라서 우리의 게놈은 이 20,000개의 단백질을 인코딩하며, 이 20,000개 단백질에는 변이가 있을 수 있습니다. 그리고 코딩되지 않은 부분(non-coding part)도 있는데, 이것은 이러한 단백질들이 어떻게 혼합되는지 살펴봅니다.
이러한 단백질들은 어떻게 발현되나요? 어디에서 어떤 양으로 발현되나요? 이 부분이 기본적으로 게놈의 어두운 영역(dark part)인데, 이는 훨씬 덜 이해되고 있습니다. 왜냐하면 유전자와 단백질 발현의 조절(regulation)에 대해 이야기하기 때문입니다.
그래서 저는 Alpha Genome이 시도하는 것이 바로 이 전체 공간을 해독하고 정보를 제공하려는 것이라고 생각합니다. 저에게도 질문이 하나 있는데, 아마 당신만이 대답할 수 있는 질문일 것 같습니다. 정말 궁금합니다.
이것은 인간 게놈과 마우스 게놈을 기반으로 훈련됩니다. >> 네. >> 그리고 제가 알고 싶은 것은, 이것을 인간 게놈으로 훈련한다는 것입니다. 어느 정도의 지식과 결과의 품질을 가지고요. 그런 다음 마우스 게놈으로도 훈련합니다. 그 후에 인간 부분에서 더 좋아지나요? >> 네. 그래서 저는 현재 여러분이 머신러닝 신경망이 데이터에 맞추려고 노력하는 것을 여러 다른 장소에서 본 것 같습니다. 그리고 만약 여러분에게 인간 데이터를만 주면, 이 신경망은 인간 게놈의 경우에만 작동하는 메커니즘을 기억하거나 생각할 수 있는 취약성을 가지고 있습니다.
하지만 모델을 강제로 마우스 게놈의 맥락에서 동일한 효과를 설명하도록 훈련함으로써, 우리는 모델에게 더 광범위하게 생각하고 이 두 가지 다른 유형의 변이를 모두 설명할 수 있는 일반적인 원리를 생각하도록 요청하는 것입니다. 그리고 이것은 모델의 일반화뿐만 아니라, 모델이 무엇이 정말 중요하고 생리학적 수준에서 분자 표현형(molecular phenotypes)에서 실제로 무슨 일이 일어나고 있는지에 대해 배우도록 하는 데도 큰 도움이 됩니다. 저는 또 다른 Google DeepMind 논문인 SEMA 프로젝트에서도 이를 본 적이 있는데, 이 프로젝트는 여러 비디오 게임을 플레이했습니다. 그리고 여러분이 비디오 게임을 하면 점수가 있고, 다른 여러 비디오 게임을 플레이한 후에 이 게임에서 더 잘하게 된다는 것이 정말 놀라웠습니다. >> 저는 생각합니다 >> 그리고 그것은 아마도 같은 현상인 것 같습니다만, 하지만 저에게는 지능처럼 들립니다. 그렇죠? 여러분이 다른 것들로부터 이 것에 대한 지식을 적용하는 거죠. >> 네, 그리고 저는 그것이 전이 학습(transfer learning)이 작동하는 것이라고 생각합니다. 관련이 있지만 서로 다른 문제에서 개념을 추출할 수 있게 되며, 이것이 더 잘하게 만드는 데 도움이 됩니다.
맞죠? 그래서 수학 문제를 풀고 물리 문제도 푸는데, 단순히 수학을 잘하는 것이 물리학 실력을 향상시키는 데 도움이 되는 식입니다. 제가 이해하기로는 여기서 큰 발전은 이전 모델들이 너무 한 곳에만 집중하거나 근시안적이거나, 아니면 너무 멀리서 낮은 해상도로 보는 방식이었다는 것입니다. 이제 이 모델은 두 가지를 모두 할 수 있습니다. >> 참인가요 거짓인가요? >> 이것은 사실입니다. 따라서 우리가 게놈을 해독하는 매우 야심 찬 도전에 착수했을 때, 많은 기술적 어려움이 있었습니다.
제가 방금 언급했듯이 우리 게놈은 30억 개의 염기쌍(base pairs)으로 이루어져 있습니다. ATCG 같은 아주 긴 서열이죠. 그리고 특정 변이가 어떤 영향을 미하는지 이해하려면 그 변이 주변의 넓게 확장된 이웃 영역을 살펴봐야 합니다. 왜냐하면 3차원 상호작용 등으로 인해 상당히 멀리 떨어진 것들에 영향을 줄 수 있기 때문입니다. 따라서 특정 염기쌍만 그 주변에서 일어나는 일에만 영향을 미치는 것이 아닙니다. 마치 그 주변이 매우 클 수도 있는 것처럼요.
그래서 이전 모델들의 변형들이 있었습니다. 저희는 alpha genome 이전에 informer이라는 모델을 가지고 있었는데, 여기서는 우리가 보고 있던 주변 영역의 컨텍스트 윈도우(context window)가 더 작았을 뿐만 아니라, 게놈을 분석하려던 해상도 또한 훨씬 거칠했습니다. 맞죠? 우리는 염기쌍 수준에서 무슨 일이 일어나고 있는지를 보고 있지 않았습니다. 대신 여러 개의 염기쌍을 모아서 보았고, 100만 염기쌍 창(window)으로 보고 있지는 않았습니다.
우리는 더 작은 종류의 창(window)을 보고 있었습니다. 제가 알파 유전체(alpha genome)에서 시도하고, 이를 달성한 최초의 모델은 염기쌍 해상도(base pair resolution)에서 작동하며 매우 큰 창을 가지고 있다는 것입니다. 그리고 이것이 단순히 많은 정밀도를 요구하는 예측뿐만 아니라, 해당 변이 주변에서 발생하는 훨씬 더 큰 세트의 사물에 대한 추론을 포함하는 예측을 할 수 있도록 합니다. 저는 그것이 너무 지배적이어서 26개의 변이 효과 벤치마크(variant effect benchmarks) 중 25개에서 가장 강력한 비교 모델과 일치하거나 능가한다는 것을 보았습니다.
저는 알파폴드(alpha fold)에서 이 정도의 지배력을 들은 것이 정말 믿을 수 없을 만큼 놀랍다고 생각합니다. 이제 제가 여러분께 묻고 싶은 것은, 그것이 처음 작동하기 시작했을 때 어떤 느낌이었냐는 것입니다. >> 음. >> 어땠나요? >> 네. 그래서 저는 우리가 오랫동안 과학적인 도전 과제와 마찬가지로 이 문제에 대해 작업해 왔다고 생각합니다. 음, 이것들은 믿을 수 없을 만큼 어려운 문제이며 데이터나 더 나은 아키텍처를 개발하거나 훈련에 대한 새로운 아이디어를 제시하는 등 많은 다른 것에서 혁신을 필요로 합니다.
이러한 결과를 보기 시작했을 때, 우리는 우리가 다른 단계에 있다는 것을 알았습니다. 그리고 그 일부는 예상되었는데, 왜냐하면 우리는 이전에 제대로 수행된 적이 없는 해상도에서 훈련이 이루어지도록 하는 어려운 작업을 모두 마쳤기 때문입니다. 하지만 그것을 올바르게 하고 실제로 우리가 가지고 들어간 원래의 가설, 즉 해상도를 높이고, 컨텍스트 창(context window)을 늘리고, 훈련을 적절하게 정규화(regularize)하면 신경망이 올바른 결과를 보여줄 것이라는 것을 보여주기 위해서는 정말 보람 있는 일이었습니다. 전체 팀에게는요.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube Two Minute Papers (AI 논문)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기