관리 메뉴

데이터 과학

RoseTTAFold-All-Atom에서 데이터베이스 본문

생명정보학 & 화학정보학/알파폴드와 단백질 구조 예측

RoseTTAFold-All-Atom에서 데이터베이스

티에스윤 2026. 8. 9. 23:28

RoseTTAFold-All-Atom에서 데이터베이스와 분석

RoseTTAFold-All-Atom(RFAA)을 로컬 컴퓨터에 설치하다 보면 UniRef30, BFD, PDB100, Legacy BLAST 2.2.26과 같은 여러 종류의 데이터와 프로그램을 설치하게 됩니다. 처음 접하면 이 네 가지가 모두 비슷한 데이터베이스처럼 보이지만 실제 역할은 상당히 다릅니다.

UniRef30과 BFD는 단백질의 진화적 정보를 찾기 위한 서열 데이터베이스이고, PDB100은 이미 알려진 단백질의 3차원 구조를 참고하기 위한 구조 템플릿 데이터베이스입니다.

Legacy BLAST 2.2.26은 데이터베이스가 아니라 단백질 서열을 검색하고 비교하는 데 사용되는 분석 프로그램입니다.

 

RoseTTAFold-All-Atom의 구조 예측 과정을 제대로 이해하려면 이 네 가지 구성 요소가 각각 어떤 정보를 제공하고, 구조 예측 과정에서 어떻게 연결되는지를 이해하는 것이 중요합니다.

1. RoseTTAFold-All-Atom에서 데이터베이스

단백질의 구조를 예측한다고 하면 단순히 아미노산 서열만 인공지능 모델에 입력하면 바로 3차원 구조가 만들어질 것이라고 생각하기 쉽습니다.

 

예를 들어 다음과 같은 단백질 서열이 있다고 가정할 수 있습니다.

MKTIIALSYIFCLVFADYKDDDDK...

 

이 서열은 아미노산을 한 줄로 나열한 1차원 정보입니다. 그러나 실제 단백질은 이 아미노산 사슬이 접히면서 복잡한 3차원 구조를 형성합니다.

RoseTTAFold-All-Atom은 이러한 구조를 예측하기 위해 단순히 입력 서열만 분석하는 것이 아니라 다른 생물에서 발견된 유사 단백질과 이미 알려진 단백질 구조를 함께 참고합니다.

전체적인 과정은 다음과 같이 이해할 수 있습니다.

 

입력 단백질 서열
→ 유사한 단백질 서열 검색
→ 여러 단백질 서열을 정렬하여 MSA 생성
→ 단백질의 진화적 정보 분석
→ 알려진 단백질 구조에서 유사한 구조 검색
→ 구조 템플릿 생성
→ RoseTTAFold-All-Atom 인공지능 모델
→ 최종 3차원 구조 예측

 

이 과정에서 UniRef30과 BFD는 주로 유사한 단백질 서열을 찾는 역할을 담당하고, PDB100은 이미 알려진 3차원 구조를 찾는 역할을 담당합니다.

2. UniRef30

UniRef30이란?

UniRef는 UniProt의 단백질 서열을 서로 비슷한 정도에 따라 묶어 만든 데이터베이스입니다.

UniProt에는 매우 많은 단백질 서열이 존재합니다. 그러나 모든 단백질 서열을 그대로 저장하고 매번 검색하면 중복된 서열도 많고 계산량도 지나치게 커집니다.

서로 비슷한 단백질을 하나의 그룹으로 묶어 중복성을 줄이는 방법을 사용합니다.

 

RoseTTAFold-All-Atom에서는 일반적으로 다음과 같은 UniRef30 데이터베이스를 사용합니다.

UniRef30_2020_06

여기서 2020_06은 해당 데이터베이스가 만들어진 시점을 나타냅니다.

UniRef30의 역할

UniRef30의 가장 중요한 역할은 입력 단백질과 비슷한 단백질 서열을 찾는 것입니다.

예를 들어 우리가 어떤 단백질 A의 서열을 RFAA에 입력했다고 가정합니다.

RFAA는 UniRef30에서 이 단백질과 비슷한 서열을 찾아냅니다.

 

입력 단백질
→ UniRef30 검색
→ 유사 단백질 1
→ 유사 단백질 2
→ 유사 단백질 3
→ 유사 단백질 4
→ ...

이렇게 찾아낸 여러 단백질의 서열을 정렬하면 MSA를 만들 수 있습니다.

3. MSA란 무엇인가?

MSA는 Multiple Sequence Alignment의 약자로 여러 단백질 서열을 동시에 정렬하는 방법입니다.

예를 들어 서로 관련된 단백질들의 서열이 다음과 같다고 가정할 수 있습니다.

Protein 1 : A L G K V A
Protein 2 : A L G R V A
Protein 3 : A I G K V A
Protein 4 : V I G R I A

이처럼 여러 단백질의 서열을 정렬하면 어떤 위치의 아미노산이 잘 보존되는지, 어떤 위치가 다른 위치와 함께 변하는지 확인할 수 있습니다.

 

이러한 정보는 단순히 아미노산 서열을 비교하는 것을 넘어 단백질의 진화 과정에 대한 정보를 제공합니다.

MSA와 단백질 구조의 관계

단백질의 서로 멀리 떨어져 있는 두 아미노산이 실제 3차원 구조에서는 서로 가까이 있을 수 있습니다.

이 두 위치가 단백질의 진화 과정에서 함께 변한다면 구조적으로 서로 관련되어 있을 가능성이 있습니다.

이를 공진화 또는 co-evolution이라고 합니다.

예를 들어 한 위치의 아미노산이 변했을 때 다른 위치의 아미노산도 함께 변하는 패턴이 여러 생물종에서 반복적으로 관찰된다면 두 위치가 구조적으로 상호작용할 가능성을 생각할 수 있습니다.

따라서 다음과 같은 관계가 형성됩니다.

UniRef30
→ 유사 단백질 검색
→ MSA 생성
→ 진화적 관계 분석
→ 공진화 정보 추출
→ 단백질의 공간적 관계 추론
→ 구조 예측

이 때문에 충분히 좋은 MSA를 확보하는 것은 단백질 구조 예측에서 매우 중요한 과정입니다.

4. UniRef30에서 사용하는 HH-suite

RoseTTAFold-All-Atom에서는 UniRef30 검색 과정에서 HH-suite의 HHblits와 같은 프로그램이 사용됩니다.

HH-suite는 단순한 문자열 비교보다 훨씬 민감하게 단백질의 진화적 관계를 찾을 수 있도록 만들어진 프로그램입니다.

단백질 서열을 HMM, 즉 Hidden Markov Model 형태로 표현하여 단순히 아미노산 하나하나가 같은지 비교하는 것이 아니라 전체적인 서열 패턴과 진화적 특징을 비교합니다.

따라서 일반적인 BLAST 검색으로는 쉽게 발견되지 않는 먼 친척 관계의 단백질도 찾을 수 있습니다.

5. UniRef30 데이터베이스의 파일 구조

RFAA용 UniRef30을 설치하면 다음과 같은 파일을 볼 수 있습니다.

UniRef30_2020_06_a3m.ffdata
UniRef30_2020_06_a3m.ffindex
UniRef30_2020_06_cs219.ffdata
UniRef30_2020_06_cs219.ffindex

여기서 ffdata 파일에는 실제 데이터가 저장되고, ffindex 파일에는 해당 데이터를 빠르게 찾기 위한 인덱스 정보가 저장되어 있습니다.

그렇기에 ffdata와 ffindex는 한 쌍으로 사용됩니다.

RFAA의 환경변수에서는 단순히 UniRef30 폴더를 지정하는 것이 아니라 데이터베이스 이름의 공통 접두사까지 지정해야 합니다.

 

예를 들면 다음과 같습니다.

export DB_UR30=/data/rfaa/databases/UniRef30_2020_06/UniRef30_2020_06

 

이렇게 설정하면 RFAA와 HH-suite가 뒤에 _a3m.ffdata, _cs219.ffdata 등의 이름을 자동으로 붙여 필요한 데이터베이스 파일을 찾게 됩니다.

6. BFD

BFD란 무엇인가?

BFD는 Big Fantastic Database의 약자입니다.

이름 그대로 매우 큰 규모의 단백질 서열 데이터베이스입니다.

BFD는 기존의 비교적 잘 정리된 단백질 데이터베이스뿐 아니라 메타게놈 분석 등을 통해 얻어진 매우 많은 단백질 서열을 포함합니다.

UniRef30보다 훨씬 넓은 단백질 서열 공간을 검색할 수 있습니다.

 

https://bfd.mmseqs.com/

 

BFD

Bioinformatic Methods BFD was created by clustering 2.5 billion protein sequences from Uniprot/TrEMBL+Swissprot, Metaclust and Soil Reference Catalog Marine Eukaryotic Reference Catalog assembled by Plass. We clustered sequences that could be aligned to a

bfd.mmseqs.com

 

 

BFD는 약 22억 개 이상의 단백질 서열을 수천만 개의 클러스터로 구성한 초대형 단백질 서열 데이터베이스로, HH-suite 기반 검색 및 AlphaFold/RoseTTAFold 계열의 MSA 생성에 사용됩니다.

RFAA용으로는 일반 BFD 파일이 아니라 HH-suite 형식으로 준비된 위 sorted_opt 파일을 사용하는 것이 중요합니다. 다운로드 페이지 설명에서도 BFD를 HH-suite3 데이터베이스로 변환해 제공한다고 안내합니다.

 

BFD는 왜 필요한가?

어떤 단백질은 UniRef30만 검색해도 수천 개 이상의 유사 단백질을 찾을 수 있습니다.

이 경우 충분히 깊은 MSA를 만들 수 있습니다.

하지만 매우 희귀한 단백질이나 아직 연구가 많이 이루어지지 않은 단백질에서는 UniRef30에서 유사 서열을 많이 찾지 못할 수 있습니다.

예를 들어 다음과 같은 상황이 발생할 수 있습니다.

입력 단백질
→ UniRef30 검색
→ 유사 서열 30개

유사 서열의 수가 너무 적다면 구조 예측에 사용할 진화 정보가 충분하지 않을 수 있습니다.

이때 BFD를 추가로 검색합니다.

입력 단백질
→ UniRef30 검색
→ 기본 MSA 생성
→ BFD 추가 검색
→ 더 많은 유사 단백질 발견
→ 더 깊은 MSA 생성

즉 BFD는 UniRef30에서 부족한 진화 정보를 보완하는 역할을 합니다.

7. MSA Depth의 의미

MSA에서 매우 중요한 개념 가운데 하나가 MSA depth입니다.

MSA depth는 입력 단백질과 관련된 유사 서열이 얼마나 많이 포함되어 있는지를 의미합니다.

예를 들어 유사 단백질 서열이 20개밖에 없는 MSA보다 수백 개 또는 수천 개의 관련 서열을 포함하는 MSA가 일반적으로 더 많은 진화 정보를 제공합니다.

물론 단순히 서열의 개수가 많다고 무조건 좋은 것은 아닙니다. 서로 거의 동일한 서열만 반복해서 존재하는 경우에는 실제 정보량이 크게 증가하지 않을 수 있습니다.

중요한 것은 다양하면서도 진화적으로 관련된 단백질 서열을 충분히 확보하는 것입니다.

BFD는 이러한 MSA depth를 증가시키는 데 중요한 역할을 합니다.

8. UniRef30과 BFD의 차이

UniRef30과 BFD 모두 단백질 서열 데이터베이스이지만 목적과 규모가 다릅니다.

UniRef30은 비교적 정리되고 축약된 단백질 서열 공간을 빠르게 탐색하는 역할을 합니다.

반면 BFD는 매우 큰 규모의 서열 데이터베이스를 이용해 UniRef30에서 발견하지 못한 먼 진화적 관계까지 추가로 탐색하는 역할을 합니다.

따라서 다음과 같이 생각하면 이해하기 쉽습니다.

UniRef30
= 기본적인 진화 정보 검색

BFD
= 더 넓고 깊은 진화 정보 검색

RFAA에서는 두 데이터베이스를 함께 사용하여 더욱 풍부한 MSA를 구성합니다.

9. BFD가 매우 큰 이유

BFD는 RFAA 설치 과정에서 가장 많은 저장공간을 요구하는 구성 요소 가운데 하나입니다.

RFAA에서 사용하는 BFD 압축파일 자체도 수백 GB에 이르며, 압축을 해제하면 1TB 이상의 저장공간이 필요할 수 있습니다.

RFAA 설치 시 단순히 프로그램 용량만 생각해서 SSD를 준비하면 저장공간 부족 문제가 발생할 수 있습니다.

실제로 BFD 압축을 해제하는 동안에는 다음 두 데이터가 동시에 존재할 수 있습니다.

 

BFD 압축파일
+
압축 해제 중인 BFD 데이터

따라서 설치 과정에서는 최종 데이터 크기보다 훨씬 많은 임시 저장공간이 필요할 수 있습니다.

 

대용량 연구 환경에서는 BFD만 별도의 SSD에 저장하고 RFAA 프로그램과 다른 데이터베이스는 내부 SSD에 저장하는 방법도 사용할 수 있습니다.

10. PDB100

PDB100이란?

PDB100은 UniRef30이나 BFD와는 성격이 완전히 다른 데이터베이스입니다.

UniRef30과 BFD가 단백질의 서열과 진화 정보를 제공한다면 PDB100은 이미 실험적으로 구조가 밝혀진 단백질에서 구조적 참고 정보를 얻기 위해 사용됩니다.

PDB는 Protein Data Bank의 약자입니다.

Protein Data Bank에는 X선 결정학, NMR, cryo-EM 등 다양한 실험 방법을 통해 규명된 단백질과 생체분자의 3차원 구조가 저장되어 있습니다.

RFAA에서는 이를 구조 예측을 위한 template 정보로 활용할 수 있도록 가공한 PDB100 데이터베이스를 사용합니다.

11. 구조 Template이란 무엇인가?

예를 들어 아직 구조가 알려지지 않은 단백질 A가 있다고 가정합니다.

이 단백질의 서열을 분석했더니 이미 구조가 알려진 단백질 B와 상당히 비슷하다는 사실을 발견했다고 생각해 볼 수 있습니다.

그러면 단백질 B의 알려진 3차원 구조는 단백질 A의 구조를 예측하는 데 매우 중요한 참고 자료가 될 수 있습니다.

이를 구조 template이라고 합니다.

입력 단백질
→ PDB100 검색
→ 비슷한 단백질 구조 발견
→ 구조 Template 생성
→ RFAA에 제공
→ 구조 예측 보조

따라서 PDB100은 과거 실험으로 밝혀진 단백질 구조에 대한 지식을 AI 구조 예측에 연결하는 역할을 합니다.

12. PDB100과 HHsearch

RFAA에서는 PDB100에서 구조 template을 찾기 위해 HHsearch를 사용합니다.

대략적인 과정은 다음과 같습니다.

입력 단백질
→ UniRef30/BFD 검색
→ MSA
→ 단백질 Profile 생성
→ HMM 생성
→ HHsearch
→ PDB100 검색
→ 비슷한 단백질 구조 탐색
→ Template 정보 생성

HHsearch는 단순히 서열 하나와 서열 하나를 비교하는 것이 아니라 HMM과 HMM을 비교하기 때문에 먼 진화적 관계도 비교적 민감하게 탐지할 수 있습니다.

13. PDB100의 실제 파일 구조

RFAA용 PDB100을 설치하면 다음과 같은 파일들을 볼 수 있습니다.

pdb100_2021Mar03_a3m.ffdata
pdb100_2021Mar03_a3m.ffindex

pdb100_2021Mar03_cs219.ffdata
pdb100_2021Mar03_cs219.ffindex

pdb100_2021Mar03_hhm.ffdata
pdb100_2021Mar03_hhm.ffindex

pdb100_2021Mar03_pdb.ffdata
pdb100_2021Mar03_pdb.ffindex

 

여기서 _hhm 파일은 HMM 기반 검색과 관련된 정보를 담고 있으며, _pdb 파일은 구조 정보와 관련되어 있습니다.

RFAA 설정에서는 다음과 같은 database prefix를 사용합니다.

/data/rfaa/databases/pdb100_2021Mar03/pdb100_2021Mar03

.ffdata 파일 이름 전체를 적는 것이 아니라 공통 접두사까지만 지정합니다.

14. PDB100이 오래된 데이터베이스처럼 보이는 이유

RFAA 설치 파일을 보면 다음과 같은 이름을 볼 수 있습니다.

pdb100_2021Mar03

이는 2021년 3월을 기준으로 준비된 데이터베이스임을 의미합니다.

현재 Protein Data Bank에는 2021년 이후에도 많은 새로운 구조가 등록되어 있지만 RFAA의 공식 파이프라인은 특정 형식으로 미리 가공된 구조 데이터베이스를 사용하도록 만들어져 있습니다.

그렇기에 단순히 최신 PDB 파일을 다운로드하여 같은 폴더에 복사하는 방식으로 최신화할 수 있는 것은 아닙니다.

 

HH-suite에서 사용할 수 있는 ffdata, ffindex, HHM 등의 형태로 다시 데이터베이스를 구축해야 하기 때문입니다.

연구 재현성 측면에서도 논문과 공식 RFAA 파이프라인에서 사용한 데이터베이스 버전을 그대로 사용하는 의미가 있습니다.

15. UniRef30과 BFD, PDB100의 가장 중요한 차이

세 데이터베이스의 차이를 가장 간단하게 표현하면 다음과 같습니다.

UniRef30
→ 비슷한 단백질 서열을 찾음

BFD
→ 훨씬 더 많은 단백질 서열에서 추가적인 진화 정보를 찾음

PDB100
→ 이미 구조가 밝혀진 단백질에서 비슷한 3차원 구조를 찾음

즉 UniRef30과 BFD는 주로 "서열과 진화"를 제공하고, PDB100은 "구조적 참고 정보"를 제공합니다.

16. Legacy BLAST 2.2.26

BLAST는 데이터베이스가 아니다

RFAA 설치 과정에서 함께 설치되는 blast-2.2.26은 앞의 세 가지와 성격이 완전히 다릅니다.

UniRef30, BFD, PDB100은 데이터가 저장되어 있는 데이터베이스입니다.

반면 BLAST는 서열을 검색하고 비교하는 프로그램입니다.

BLAST는 Basic Local Alignment Search Tool의 약자입니다.

입력한 DNA 또는 단백질 서열과 데이터베이스에 존재하는 서열을 비교하여 비슷한 부분을 찾는데 사용됩니다.

 

https://blast.ncbi.nlm.nih.gov/Blast.cgi

 

BLAST: Basic Local Alignment Search Tool

The .gov means it’s official. Federal government websites often end in .gov or .mil. Before sharing sensitive information, make sure you’re on a federal government site.

blast.ncbi.nlm.nih.gov

 

17. BLAST가 하는 일

예를 들어 다음과 같은 단백질 서열이 있다고 가정합니다.

MKTIIALSYIFCLVFADYK...

BLAST는 이 서열을 다른 단백질 서열과 비교하여 비슷한 영역을 찾을 수 있습니다.

Query sequence
→ BLAST
→ 서열 데이터베이스 검색
→ 유사한 서열 탐색
→ Alignment 생성
→ 유사도 평가

따라서 BLAST는 생명정보학에서 가장 기본적이고 널리 사용되는 서열 검색 도구 가운데 하나입니다.

18. 왜 Legacy BLAST 2.2.26을 사용하는가?

현재 NCBI에서는 오래된 BLAST 대신 BLAST+ 계열이 일반적으로 사용됩니다.

그런데 RFAA 설치 과정에서는 오래된 BLAST 2.2.26 버전을 요구합니다.

그 이유는 RFAA의 일부 전처리 스크립트와 기존 생명정보학 프로그램이 이 오래된 BLAST 환경을 기준으로 작성되었기 때문입니다.

즉, BLAST 2.2.26이 최신이어서 사용하는 것이 아닙니다.

RFAA의 기존 분석 파이프라인과 호환되기 때문에 사용하는 것입니다.

이러한 연구 소프트웨어에서는 최신 프로그램으로 무조건 교체하는 것이 항상 좋은 것은 아닙니다.

버전을 임의로 변경하면 실행 옵션, 파일 형식 또는 내부 호출 방식이 달라져 기존 스크립트가 정상적으로 작동하지 않을 수 있습니다.

19. BLASTMAT이란?

RFAA 설치 과정에서 다음과 같은 환경변수를 설정할 수 있습니다.

 

export BLASTMAT=/data/rfaa/databases/blast-2.2.26/blast-2.2.26/data

 

BLASTMAT은 BLAST가 사용하는 scoring matrix와 관련 데이터가 들어 있는 위치를 알려주는 환경변수입니다.

실제 해당 폴더에는 다음과 같은 파일이 있습니다.

BLOSUM45
BLOSUM62
BLOSUM80
PAM30
PAM70

이 파일들은 단백질 서열 정렬에서 아미노산 치환에 점수를 부여하는 substitution matrix입니다.

20. BLOSUM62는 왜 필요한가?

단백질 서열을 비교할 때 모든 아미노산의 변화가 같은 의미를 가지는 것은 아닙니다.

예를 들어 구조적·화학적 성질이 비슷한 아미노산끼리 바뀌는 것과 성질이 크게 다른 아미노산으로 바뀌는 것은 진화적으로 다른 의미를 가집니다.

BLOSUM62 같은 substitution matrix는 이러한 아미노산 변화가 얼마나 자연스럽거나 드문지를 점수화합니다.

따라서 BLAST는 단순히 문자가 같은지를 비교하는 것이 아니라 생물학적으로 의미 있는 서열 유사성을 계산할 수 있습니다.

21. 네 가지 구성 요소가 RFAA에서 연결되는 과정

지금까지 설명한 내용을 하나의 흐름으로 연결하면 RoseTTAFold-All-Atom의 단백질 구조 예측 과정이 훨씬 명확해집니다.

첫 번째 단계는 단백질 FASTA 서열을 입력하는 것입니다.

두 번째 단계에서는 HHblits 등의 프로그램을 이용하여 UniRef30을 검색합니다.

세 번째 단계에서는 필요한 경우 훨씬 큰 BFD를 추가로 검색하여 더 많은 유사 단백질을 찾습니다.

네 번째 단계에서는 검색된 단백질들을 정렬하여 MSA를 구성합니다.

다섯 번째 단계에서는 MSA를 기반으로 단백질의 진화적 특징을 분석합니다.

여섯 번째 단계에서는 HHsearch를 이용하여 PDB100을 검색하고 기존 단백질 구조 가운데 적절한 template을 찾습니다.

마지막으로 MSA 정보와 구조 template 정보가 RoseTTAFold-All-Atom 인공지능 모델에 입력됩니다.

전체적으로는 다음과 같습니다.

Protein FASTA
→ UniRef30 검색
→ BFD 검색
→ MSA 생성
→ 진화 정보 분석
→ HHsearch
→ PDB100 구조 Template 검색
→ RoseTTAFold-All-Atom
→ GPU 기반 AI 추론
→ 3차원 원자 좌표
→ PDB 결과 파일

22. 각각이 없으면 어떤 일이 발생하는가?

UniRef30이 없으면 HHblits가 기본적인 유사 단백질 검색을 수행하지 못합니다.

따라서 MSA 자체를 정상적으로 만들기 어렵습니다.

BFD가 없으면 UniRef30 이후의 확장 검색을 수행하지 못합니다.

RFAA의 공식 단백질 전처리 파이프라인에서는 BFD 검색 단계가 포함되어 있기 때문에 BFD가 없으면 중간 MSA 파일이 생성되지 않아 최종 구조 예측까지 진행되지 못할 수도 있습니다.

PDB100이 없으면 구조 template 검색이 정상적으로 이루어지지 않습니다.

Legacy BLAST 2.2.26이 없거나 설정이 잘못되면 기존 RFAA의 전처리 스크립트에서 서열 관련 분석 단계가 실패할 수 있습니다.

23. 저장공간을 많이 사용하는 이유

RFAA 설치가 일반적인 AI 프로그램 설치보다 훨씬 어려운 이유 가운데 하나는 바로 데이터베이스 크기입니다.

프로그램 소스 코드나 모델 weight 자체보다 UniRef30, BFD, PDB100이 훨씬 많은 저장공간을 차지합니다.

BFD는 압축파일 자체가 수백 GB이고 압축 해제 후에는 1TB를 넘을 수 있습니다.

 

따라서 RFAA용 컴퓨터를 구성할 때 GPU 성능뿐만 아니라 SSD 용량도 매우 중요합니다.

단순한 실습에서는 2TB SSD를 사용할 수 있지만 전체 RFAA 데이터베이스를 안정적으로 운영하려면 별도의 대용량 SSD (4TB)를 추가하는 것이 훨씬 편리할 수 있습니다.

24. 데이터베이스를 서로 다른 SSD에 저장할 수 있는가?

가능합니다.

RFAA에서는 데이터베이스가 반드시 같은 디스크에 존재할 필요가 없습니다.

예를 들어 내부 SSD에 다음 데이터를 저장할 수 있습니다.

RFAA 프로그램
UniRef30
PDB100
BLAST
모델 weight
작업 결과

그리고 가장 큰 BFD만 외장 NVMe SSD에 저장할 수 있습니다.

RFAA는 실제 저장장치가 무엇인지 확인하는 것이 아니라 설정 파일과 환경변수에 지정된 경로를 이용하여 데이터베이스를 찾습니다.

따라서 BFD가 외장 SSD에 있더라도 올바른 경로를 지정하면 사용할 수 있습니다.

25. RFAA의 관점에서 정리한 네 구성 요소

UniRef30은 입력 단백질과 진화적으로 관련된 단백질을 찾는 기본 서열 데이터베이스입니다.

BFD는 UniRef30보다 훨씬 더 큰 단백질 서열 공간을 검색하여 MSA에 더 많은 진화 정보를 추가하는 역할을 합니다.

PDB100은 이미 알려진 단백질의 3차원 구조 가운데 입력 단백질과 관련된 구조를 찾아 template으로 제공하는 구조 데이터베이스입니다.

Legacy BLAST 2.2.26은 데이터베이스가 아니라 RFAA의 기존 생명정보학 전처리 과정에서 사용되는 서열 검색 프로그램입니다.

26. 가장 쉽게 기억하는 방법

네 가지를 다음과 같이 기억하면 이해하기 쉽습니다.

 

UniRef30
"나와 비슷한 단백질 서열은 무엇인가?"

 

BFD
"더 넓은 세계에서 나와 관련된 단백질을 더 찾아볼 수 있는가?"

 

PDB100
"이미 구조가 밝혀진 단백질 가운데 나와 비슷한 구조가 있는가?"

 

Legacy BLAST 2.2.26
"단백질 서열을 어떻게 검색하고 비교할 것인가?"

 

결국 RoseTTAFold-All-Atom은 이들 데이터와 도구를 결합하여 단순한 아미노산 서열을 3차원 구조 정보로 변환합니다.

27. RoseTTAFold-All-Atom에서 데이터베이스가 갖는 의미

딥러닝 기반 단백질 구조 예측을 처음 배우면 인공지능 모델 자체에만 관심을 가지기 쉽습니다.

그러나 실제 구조 예측 성능은 AI 모델만으로 결정되는 것이 아닙니다.

입력 단백질과 관련된 진화 정보를 얼마나 충분히 확보했는지, 적절한 구조 template을 찾았는지, 전처리 과정이 정상적으로 이루어졌는지가 모두 중요합니다.

RoseTTAFold-All-Atom의 전체 과정을 간단히 표현하면 다음과 같습니다.

단백질 서열
+
진화 정보
+
구조 Template
+
딥러닝 모델

3차원 구조 예측

UniRef30과 BFD는 이 가운데 진화 정보를 제공하고, PDB100은 구조 template 정보를 제공합니다.

Legacy BLAST와 HH-suite 같은 프로그램은 이러한 정보를 검색하고 가공하는 도구입니다.

28. 마무리

RoseTTAFold-All-Atom을 제대로 이해하기 위해서는 단순히 설치 명령어를 따라 실행하는 것보다 각각의 데이터베이스가 왜 필요한지를 이해하는 것이 중요합니다.

UniRef30은 단백질의 기본적인 진화적 관계를 찾고, BFD는 그 검색 범위를 크게 확장합니다. PDB100은 기존에 밝혀진 단백질 구조를 참고하여 구조 예측에 도움을 줍니다. Legacy BLAST 2.2.26은 이러한 생명정보학 전처리 과정에서 사용되는 서열 분석 프로그램입니다.

이러한 여러 정보가 결합된 뒤에야 RoseTTAFold-All-Atom의 인공지능 모델이 최종적인 3차원 구조를 예측합니다.

 

RFAA는 단순히 "FASTA 파일을 GPU에 입력하여 PDB를 출력하는 프로그램"이라고 보기보다, 대규모 생명정보학 데이터베이스와 전통적인 서열 분석 기법, 구조 생물정보학, 그리고 최신 딥러닝 기술이 하나의 파이프라인으로 결합된 시스템이라고 이해하는 것이 더 정확합니다.

이러한 관점에서 UniRef30, BFD, PDB100, BLAST의 역할을 이해하면 이후 RoseTTAFold-All-Atom뿐만 아니라 AlphaFold, ColabFold, RFdiffusion 등 다른 AI 기반 단백질 구조 예측 및 설계 시스템을 이해하는 데도 큰 도움이 됩니다.