Protein-Vec 사용 방법 안내
요약
본 문서는 Protein-Vec 모델을 활용하여 단백질 데이터를 인코딩하고 검색하는 방법을 안내합니다. 필요한 패키지 설치부터 모델 및 데이터베이스 다운로드, 그리고 최종적으로 튜토리얼 노트북(gh_encode_and_search_new_proteins.ipynb)을 통해 실제 사용 과정을 단계별로 설명합니다.
핵심 포인트
- Protein-Vec 사용을 위해 필수 패키지를 먼저 설치해야 합니다.
- 모델과 조회 데이터베이스를 다운로드하고 특정 디렉토리에 배치하는 과정이 중요합니다.
- 튜토리얼 노트북을 따라 단백질 인코딩, 시각화, 검색 방법을 학습할 수 있습니다.
- 실습을 위해서는 Uniprot 데이터를 준비하여 data/ 폴더에 위치시켜야 합니다.
Protein-Vec을 사용하는 방법에 대한 지침입니다.
먼저, GitHub 저장소를 다음과 같이 설치합니다:
필요한 패키지를 설치하고, protein-vec 디렉토리 내에서 다음 명령어를 실행합니다:
pip install .
pip install seaborn faiss-gpu jupyter notebook
다음 명령어를 사용하여 aspect-vec과 protein-vec 모델을 모두 다운로드합니다 (총 약 ~3GB):
이 모델들을 다음 명령어로 압축 해제합니다:
tar -zxvf protein_vec_models.gz
이제 이 모델 디렉토리를 git clone으로 방금 설치한 ‘src_run’과 같은 디렉토리로 이동해야 합니다. 상대 경로를 사용하므로 여기에 위치시키는 것이 중요합니다.
mv protein_vec_models protein-vec/src_run/
Protein-Vec 검색을 수행하려면 Protein-Vec 조회 데이터베이스에서 읽어와야 합니다. 다음 명령어로 이 조회 데이터베이스와 해당 메타데이터를 다운로드합니다:
다음 명령어로 압축 해제합니다:
tar -zxvf protein_vec_embeddings.gz
이것 또한 src_run 디렉토리로 이동시킵니다.
mv protein_vec_embeddings protein-vec/src_run/
Protein-Vec 사용 방법을 안내하는 튜토리얼을 따라하려면, src_run 디렉토리에 있는 노트북 “gh_encode_and_search_new_proteins.ipynb”를 따라합니다.
이 노트북에서 Protein-Vec을 사용하여 단백질을 인코딩하고, 해당 단백질들을 시각화/클러스터링하는 방법을 배울 수 있습니다. 또한 Protein-Vec을 사용한 검색 방법도 배울 수 있습니다.
튜토리얼 노트북을 따라 하려면 서열(sequence)과 기타 메타데이터 필드를 가진 데이터셋이 필요하며, uniprot 데이터를 다음과 같이 다운로드할 수 있습니다:
src_run/ 디렉토리에 data/ 디렉토리를 생성하고, 데이터셋 파일을 그곳으로 이동시킵니다:
mkdir src_run/data/
mv uniprotkb_AND_reviewed_true_2023_07_03.tsv src_run/data/
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub ML Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기