Trong hơn 50 năm, bài toán dự đoán cấu trúc protein từ chuỗi amino acid — còn gọi là protein folding problem — được coi là một trong những thách thức khó giải nhất của sinh học phân tử. Năm 2020, AlphaFold2 của DeepMind đã làm chấn động giới khoa học khi đạt độ chính xác gần như tương đương với thực nghiệm X-ray crystallography trong cuộc thi CASP14. Đến nay, cơ sở dữ liệu AlphaFold DB chứa hơn 200 triệu cấu trúc protein dự đoán cho hầu hết mọi sinh vật đã biết — và tất cả đều miễn phí, mở công khai. Bài viết này hướng dẫn bạn cách đọc, diễn giải và tìm kiếm cấu trúc tương đồng từ kho dữ liệu này.
Chỉ số pLDDT — thước đo tin cậy của AlphaFold
Điểm khác biệt quan trọng nhất giữa AlphaFold và các phương pháp thực nghiệm là độ tin cậy theo từng vị trí. AlphaFold đính kèm vào mỗi cấu trúc dự đoán một chỉ số gọi là pLDDT (predicted Local Distance Difference Test), dao động từ 0 đến 100. Giá trị này được mã hóa màu sắc trong file PDB/mmCIF và trực tiếp trực quan hóa khi bạn mở file trên PyMOL hay Mol*:
- Xanh đậm (90–100): Rất tin cậy — cấu trúc được dự đoán với độ chính xác cao, gần sát thực nghiệm.
- Xanh nhạt (70–90): Tin cậy — phù hợp cho hầu hết ứng dụng mô hình hóa phân tử.
- Vàng (50–70): Thấp — cấu trúc mang tính dự đoán, nên đối chiếu với dữ liệu thực nghiệm.
- Cam/Đỏ (<50): Rất thấp — vùng này khả năng là vô cấu trúc (intrinsically disordered) trong thực tế.
Điều quan trọng cần nhớ: pLDDT thấp không có nghĩa là AlphaFold sai. Nhiều protein thực sự có các vùng linh hoạt, không có cấu trúc cố định — và AlphaFold khá giỏi trong việc nhận biết điều này. Các vùng pLDDT thấp thường tương ứng với linker vùng kết nối, đuôi N/C-terminal, hoặc loop bề mặt tiếp xúc dung môi.
Truy xuất cấu trúc từ AlphaFold DB
AlphaFold DB cung cấp REST API đơn giản để tải cấu trúc theo UniProt Accession ID. Ví dụ, để lấy cấu trúc của protein p53 của người (UniProt: P04637):
import requests
def fetch_alphafold_structure(uniprot_id, version=4):
"""Tai file mmCIF tu AlphaFold Database."""
base = "https://alphafold.ebi.ac.uk/files"
cif_url = f"{base}/AF-{uniprot_id}-F1-model_v{version}.cif"
plddt_url = f"{base}/AF-{uniprot_id}-F1-predicted_aligned_error_v{version}.json"
cif_resp = requests.get(cif_url, timeout=30)
cif_resp.raise_for_status()
with open(f"{uniprot_id}.cif", "wb") as f:
f.write(cif_resp.content)
print(f"Da luu cau truc: {uniprot_id}.cif")
# PAE matrix - do chinh xac tuong doi giua cac cap residue
pae_resp = requests.get(plddt_url, timeout=30)
if pae_resp.ok:
pae_data = pae_resp.json()
avg_pae = sum(pae_data["predicted_aligned_error"][i][i]
for i in range(len(pae_data["residues"]))) / len(pae_data["residues"])
print(f"PAE trung binh duong cheo: {avg_pae:.2f} Angstrom")
fetch_alphafold_structure("P04637")
Tìm kiếm tương đồng cấu trúc với Foldseek
Foldseek là công cụ tìm kiếm cấu trúc protein tương đồng với tốc độ cực nhanh — tương tự như BLAST nhưng dùng cấu trúc 3D thay vì chuỗi amino acid. Điều này đặc biệt quan trọng vì hai protein có thể có chức năng tương tự nhưng chuỗi trình tự hoàn toàn khác nhau — một hiện tượng gọi là structural convergence. Foldseek mã hóa mỗi residue thành một "chữ cái" trong "ngôn ngữ cấu trúc" 3Di, sau đó áp dụng tìm kiếm tương tự chuỗi siêu nhanh. Với AlphaFold DB làm cơ sở dữ liệu mục tiêu, bạn có thể tìm tất cả protein tương đồng cấu trúc trong 200 triệu entry chỉ trong vài giây.
Ứng dụng thực tiễn: Khi nghiên cứu một protein mồ côi (orphan protein) — không có homologue rõ ràng theo trình tự — Foldseek thường tìm được các protein có cấu trúc tương đồng từ sinh vật khác, gợi ý chức năng có thể có. Đây là cách tiếp cận "cấu trúc trước, chức năng sau" ngày càng phổ biến.
Diễn giải kết quả và giới hạn của AlphaFold
Mặc dù AlphaFold cách mạng hóa sinh học cấu trúc, nó không phải toàn năng. Model dự đoán cấu trúc của protein trong trạng thái đơn lẻ, bỏ qua các đối tác tương tác, ligand gắn kết, hay điều kiện pH và nhiệt độ. AlphaFold3 (2024) đã cải thiện đáng kể khả năng dự đoán phức hợp protein-DNA và protein-ligand, nhưng vẫn còn khoảng cách với thực nghiệm đối với các cấu trúc rất lớn hoặc các vùng động lực học phức tạp. Do đó, cách tiếp cận tối ưu là dùng AlphaFold như điểm khởi đầu: nhanh chóng có mô hình 3D để định hướng thực nghiệm, thay vì thay thế hoàn toàn X-ray hay cryo-EM trong những nghiên cứu đòi hỏi độ chính xác tuyệt đối.