순환 펩타이드 앙상블에 대한 그래프 학습: 분자 앙상블 모델링 조사
요약
분자가 다양한 형태적 앙상블로 존재한다는 점에 착안하여, EnsembleEGNN이라는 분자 앙상블 파운데이션 모델을 제안합니다. EGNN과 세트 어텐션 블록을 결합하여 앙상블을 인코딩하며, 자기지도 학습을 통해 순환 펩타이드의 특성 예측 성능을 크게 향상시켰습니다.
핵심 포인트
- 단일 컨포머 대신 형태적 앙상블을 활용하는 EnsembleEGNN 모델 제안
- EGNN과 세트 어텐션 블록을 통한 앙상블 인코딩 방식 도입
- 멀티태스크 자기지도 학습을 통한 CREMP 데이터셋 사전 학습 수행
- 서열 전용 BERT 모델보다 우수한 분자 특성 예측 성능 입증
- BERT 서열 인코더와의 공동 학습을 통해 예측 성능 추가 개선
구조로부터의 분자 특성 예측 (Molecular property prediction)은 많은 분자가 용액 내에서 형태적 앙상블 (conformational ensembles)로 존재함에도 불구하고, 종종 단일한 대표 컨포머 (conformation)를 사용합니다. 우리는 각 컨포머를 공유된 등변 그래프 신경망 (Equivariant Graph Neural Network, EGNN) 레이어로 먼저 인코딩한 다음, 결과물인 컨포머 표현 (conformer representations)을 세트 어텐션 블록 (Set Attention Block)으로 풀링하여 앙상블을 인코딩하는 분자 앙상블 파운데이션 모델 (molecular ensemble foundation model)인 EnsembleEGNN을 소개합니다. 우리는 마스크된 토큰 복구 (masked token recovery), 노이즈가 섞인 좌표 재구성 (noisy-coordinate reconstruction), 그리고 쌍별 거리 재구성 (pairwise distance reconstruction)을 결합한 멀티태스크 자기지도 학습 (multi-task self-supervised) 목적 함수를 사용하여 순환 펩타이드 앙상블 데이터셋인 CREMP에서 모델을 사전 학습 (pretrain)합니다. CREMP-CycPeptMPDB 데이터셋에서 EnsembleEGNN을 처음부터 학습시키는 것은 완전히 실패했습니다 ($R^2=0.005$). 그러나 사전 학습된 모델은 $R^2=0.477$ 및 Pearson $r=0.699$에 도달하여, 서열 전용 BERT 베이스라인 ($R^2=0.439$, Pearson $r=0.667$)보다 우수한 성능을 보였습니다. EnsembleEGNN을 BERT 서열 인코더와 함께 엔드투엔드 (end-to-end)로 공동 학습 (co-trained)했을 때, 하이브리드 모델은 $R^2=0.538$ 및 Pearson $r=0.737$로 더욱 개선되었습니다. 이러한 결과는 형태적 앙상블을 단일한 열역학적 정보가 포함된 임베딩 (thermodynamically informed embedding)으로 인코딩하는 것이 순환 펩타이드 특성 예측을 향상시킨다는 것을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기