과학자들이 수천 종의 게놈을 염기서열 분석했지만, 대부분의 경우 유전자가 어디에 있는지 아무도 모릅니다
요약
과학자들이 Carbon-A라는 오픈 모델을 공개하여 DNA에서 유전자의 위치를 직접 찾아내는 새로운 방법을 제시했습니다. 이 도구는 곰팡이부터 포유류까지 광범위한 종의 후보 유전자 데이터베이스 구축에 활용됩니다. 이는 기존 연구가 특정 모델 종에 의존하는 한계를 극복하고, 미지의 생물학적 발견을 가능하게 합니다.
핵심 포인트
- Carbon-A: DNA에서 유전자의 위치를 직접 찾아내는 오픈 모델.
- 22,617종의 5억 6,600만 개 후보 유전자 데이터베이스 구축.
- 기존 연구가 특정 모델 종에 의존하는 한계를 극복함.
- AlphaFold와 달리, 유전자 발견이 선행되어야 함.
과학자들은 수천 종의 게놈을 염기서열 분석했습니다. 하지만 대부분의 경우, 그 유전자들이 어디에 위치하는지 아무도 알지 못합니다.
오늘 저희는 DNA에서 유전자를 직접 찾아내는 오픈 모델인 Carbon-A를 공개합니다. 이를 사용하여 곰팡이부터 포유류까지 22,617종의 5억 6,600만 개 후보 유전자 데이터베이스를 만들었으며 (이 역시 공유할 예정입니다).
왜 필요할까요? 몇 가지 이유가 있습니다.
-
코끼리는 암에 걸리는 경우가 드뭅니다. 그 원인 중 일부는 그들의 게놈에서 발견되었는데, 이는 인간은 하나만 가지고 있는 종양 억제 유전자의 추가 복사본이었습니다. 누군가 또는 어떤 도구가 해당 종의 유전자를 찾기 전까지는 이런 질문을 할 수 없습니다.
-
최초의 GLP-1 약물은 길라 괴물 독(Gila monster venom)에서 추출한 펩타이드에 기반했습니다. 아무도 길라 괴물을 우선순위 목록에 올리지 않았을 것입니다. 작물의 야생 친척들 역시 가뭄 및 질병 저항성을 가지고 있지만, 이들은 아직 많은 종이 주석 처리되지 않은 상태입니다.
-
우리가 유전자에 대해 아는 대부분의 지식은 마우스, 초파리, 효모와 같은 약 12종의 모델 종에서 비롯됩니다. 그 집중적인 연구가 놀라울 정도로 잘 작동했지만, 주석 파이프라인은 여전히 이들과의 비교에 크게 의존하는 경향이 있어, 다른 종 고유의 유전자를 놓치기 쉽고, 바로 그것들이 가장 흥미로울 수 있습니다.
Carbon-A는 DNA를 직접 읽는 새로운 계열의 도구에 속합니다. 이는 알려진 게놈으로부터 학습했지만, 새로운 게놈을 읽기 위해 가까운 친척이 필요하지 않습니다.
-
익숙한 게놈조차도 여전히 공백 구간을 가지고 있습니다. Active Site 및 UCSD와의 파트너십을 통해, 우리는 고양이, 닭, 햄스터와 같은 흔한 종의 참조 주석에 누락된 239개 유전자에 대한 RNA 증거를 발견했습니다.
-
AlphaFold는 단백질의 구조를 예측할 수 있지만, 그것을 만드는 유전자 자체가 먼저 발견되어야만 가능합니다. 주석 처리된 유전자가 없는 종에서는 작업할 근거가 없습니다.
안전에 관한 몇 가지 참고 사항:
Carbon-A는 DNA를 설계하거나 유전자가 무엇을 하는지 예측하지 않습니다. 단지 DNA에서 유전자들이 어디에 위치하는지만 표시합니다. 이것이 우리가 이를 공개적으로 배포하는 것이 올바른 결정이라고 생각하는 이유 중 하나입니다.
더 많은 주석은 건강 연구에도 도움이 됩니다. 질병을 옮기거나 유발하는 많은 종들이 포함되어 있으며, 이들 질병을 통제하려는 작업은 종종 그들의 유전자에서 시작됩니다.
Model과 데이터베이스 및 더 자세한 내용은 Georgia의 스레드를 확인해 주세요 👇
AI 자동 생성 콘텐츠
본 콘텐츠는 X @Thom_Wolf (HuggingFace 공동창립자)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기