AI không đoán nổi cấu trúc một họ protein của rệp: Dữ liệu tiến hóa hé lộ “bản thiết kế” chung của 2.400 protein

AlphaFold2 dự đoán sai hai protein BICYCLE khi chỉ dựa vào các cơ sở dữ liệu hiện có. Sau khi các nhà khoa học giải trình tự thêm những loài rệp họ hàng và đưa thông tin tiến hóa đó vào mô hình, họ tạo được 2.400 dự đoán cấu trúc độ tin cậy cao — và phát hiện cả họ protein đa dạng này cùng dựa trên một kiểu gấp saposin-like.

AI không đoán nổi cấu trúc một họ protein của rệp: Dữ liệu tiến hóa hé lộ “bản thiết kế” chung của 2.400 protein

AlphaFold2 có thể dự đoán cấu trúc của rất nhiều protein từ trình tự amino acid, nhưng một họ protein do rệp tiết vào cây đã khiến hệ thống này trả về đáp án sai. Vấn đề không đơn giản là AI chưa đủ mạnh. Với các protein BICYCLE tiến hóa quá nhanh, phần dữ liệu về họ hàng tiến hóa mà AlphaFold2 thường khai thác gần như không tồn tại trong những cơ sở dữ liệu mà nó tìm kiếm.

Nhóm của David Stern tại Stowers Institute for Medical Research, phối hợp với nhóm sinh học cấu trúc của Angela Gronenborn tại University of Pittsburgh, đã giải quyết nút thắt bằng cách tạo ra dữ liệu còn thiếu. Họ giải trình tự genome của các loài rệp có quan hệ gần, xây dựng các multiple sequence alignment (MSA) tùy chỉnh rồi đưa chúng vào AlphaFold2. Sau khi được cung cấp bối cảnh tiến hóa này, mô hình tái tạo đúng hai cấu trúc mà nhóm đã xác định bằng tinh thể học tia X và sau đó cho ra khoảng 2.400 dự đoán cấu trúc độ tin cậy cao từ bảy loài rệp.

Khi đặt hàng nghìn cấu trúc cạnh nhau, một điểm chung xuất hiện: các protein BICYCLE đều chứa biến thể của saposin-like fold. “Bản thiết kế” cơ bản này được tiến hóa sao chép, đảo hướng và sửa đổi mạnh đến mức trình tự cũng như bề mặt của các protein có thể trông rất khác nhau.

Những protein khiến cả so sánh trình tự lẫn AlphaFold gặp khó

Rệp Hormaphis cornu có một khả năng kỳ lạ: chúng tác động lên cây witch hazel để cây tạo ra gall — một cấu trúc bằng mô thực vật nhưng trở thành nơi trú ngụ và cung cấp thức ăn cho thế hệ rệp sau. Một phần của quá trình này liên quan tới các protein effector BICYCLE mà côn trùng đưa vào cây.

BICYCLE là một họ protein tiến hóa rất nhanh. Với protein chưa biết chức năng, một trong những cách cơ bản để tìm manh mối là so sánh trình tự amino acid với protein đã được ghi nhận: nếu tìm thấy họ hàng gần có chức năng hoặc cấu trúc đã biết, nhà nghiên cứu có một điểm xuất phát. BICYCLE gần như phá vỡ cách làm đó vì chúng không cho thấy sự tương đồng trình tự với các protein có chức năng đã biết.

Nhóm nghiên cứu vì thế dành nhiều năm xác định thực nghiệm cấu trúc của hai protein BICYCLE bằng tinh thể học tia X. Cả hai mang kiểu gấp giống saposin, nhưng có kiến trúc khác nhau: một protein giàu liên kết disulfide có cấu trúc hoán đổi helix, trong khi protein không có cysteine còn lại chứa hai domain nối tiếp.

Đây là nơi một kiểm chứng quan trọng xuất hiện. Khi nhóm chạy AlphaFold2 với dữ liệu sẵn có theo cách thông thường, mô hình không tái tạo được hai cấu trúc đã biết từ thí nghiệm. Vì cấu trúc tinh thể đóng vai trò đáp án kiểm chứng độc lập, các nhà nghiên cứu biết rằng dự đoán ban đầu của AI là sai.

Muốn AI nhìn thấy họ hàng, trước hết phải đi tìm họ hàng ngoài tự nhiên

AlphaFold2 không chỉ học một phép biến đổi trực tiếp từ một chuỗi amino acid sang tọa độ 3D. Một nguồn tín hiệu quan trọng của hệ thống là multiple sequence alignment: tập hợp những trình tự protein có quan hệ tiến hóa được căn chỉnh với nhau.

Ý tưởng phía sau dữ liệu này khá trực quan. Trong hàng triệu năm tiến hóa, một vị trí amino acid có thể thay đổi; nếu thay đổi đó làm mất một tương tác quan trọng, một vị trí khác đôi khi cũng phải thay đổi để cấu trúc và chức năng tiếp tục tồn tại. Những mẫu biến đổi đồng thời qua nhiều protein họ hàng chứa thông tin về các ràng buộc mà cấu trúc ba chiều phải tuân theo.

Với BICYCLE, cơ sở dữ liệu công khai không cung cấp đủ các họ hàng gần để tạo tín hiệu tiến hóa hữu ích. Nhóm Stern vì thế thu thập thêm rệp, giải trình tự genome của các loài liên quan và chú giải lại những genome đã có để nhận diện chính xác hơn các gene BICYCLE. Từ đó, họ xây dựng MSA riêng cho họ protein này.

Khi các MSA tùy chỉnh được đưa vào AlphaFold2, dự đoán của hai protein kiểm chứng khớp với cấu trúc tinh thể. Điều đáng chú ý ở đây không phải một phiên bản AlphaFold mới hay một neural network mới: nhóm nghiên cứu giữ công cụ dự đoán nhưng thay đổi chất lượng và chiều sâu của thông tin tiến hóa được cung cấp cho nó.

Từ 4.924 protein xuống 2.400 cấu trúc độ tin cậy cao

Sau bước kiểm chứng, nhóm mở rộng phương pháp sang 4.924 protein BICYCLE thuộc bảy loài rệp. Họ không coi mọi đầu ra của AlphaFold2 là cấu trúc đáng tin như nhau. Paper áp dụng bộ lọc confidence: ít nhất 80% amino acid phải có pLDDT từ 60 trở lên trên chiều dài tối thiểu 70 residue. Sau lọc, bộ dữ liệu còn 2.400 cấu trúc dự đoán độ tin cậy cao.

Con số này cần được hiểu đúng. Nhóm không xác định thực nghiệm cấu trúc của 2.400 protein; chỉ hai protein được dùng làm mốc cấu trúc tinh thể trong nghiên cứu. Phần còn lại là dự đoán tính toán được tạo bằng phương pháp đã được kiểm chứng trên hai trường hợp đó và qua bộ lọc confidence.

Phân tích tập dự đoán cho thấy một nền tảng cấu trúc chung: tất cả protein BICYCLE đều chứa saposin-like fold dự đoán. Những protein không có cysteine nằm ở vị trí khác thường trong không gian cấu trúc và dữ liệu gợi ý chúng tiến hóa từ tổ tiên có saposin-like fold được ổn định bằng các liên kết disulfide.

Cùng một bộ khung nhưng bề mặt gần như không còn điểm chung

Phát hiện về một fold chung không đồng nghĩa 2.400 protein là những bản sao gần giống nhau. Ngược lại, nghiên cứu cho thấy BICYCLE trải rộng mạnh về cấu trúc và đặc tính hóa lý. Cùng một nền tảng saposin-like có thể được lặp lại, sắp xếp lại và biến đổi thành những topology khác nhau.

Nhóm còn tìm kiếm những đặc điểm bề mặt được bảo tồn — chẳng hạn các vùng điện tích dương, điện tích âm, ưa nước hoặc kỵ nước — với hy vọng chúng tiết lộ một chức năng chung. Họ không tìm được một mẫu bảo tồn rõ ràng. Các protein có thể gom thành những nhóm trong không gian cấu trúc, nhưng đặc tính hóa lý của bề mặt lại trải gần như liên tục.

Điều đó khiến nghiên cứu trả lời được câu hỏi “chúng được xây như thế nào” tốt hơn câu hỏi “chúng làm gì”. Các tác giả đề xuất sự đa dạng này có thể giúp rệp tác động lên nhiều quá trình khác nhau của cây và/hoặc né hệ thống giám sát miễn dịch của vật chủ. Đây là diễn giải tiến hóa từ dữ liệu cấu trúc và hóa lý, chưa phải bằng chứng rằng chức năng của từng BICYCLE protein đã được xác định.

Bài học không chỉ dành cho protein của rệp

Cách làm này đáng chú ý vì nó chỉ ra một dạng giới hạn của AI cấu trúc protein: đôi khi thông tin cần thiết không nằm trong model mà nằm ngoài database. Với những họ protein tiến hóa nhanh — đặc biệt ở giao diện giữa ký sinh trùng và vật chủ, hệ miễn dịch hoặc các cuộc chạy đua tiến hóa khác — dữ liệu homolog sẵn có có thể quá nghèo để phương pháp mặc định hoạt động tốt.

Trong trường hợp BICYCLE, cách khắc phục đòi hỏi một quy trình rất truyền thống: thu thập sinh vật, giải trình tự genome, chú giải gene và xây dựng quan hệ tiến hóa. Deep learning chỉ phát huy được sau khi sinh học tiến hóa cung cấp phần dữ liệu còn thiếu.

Phương pháp này cũng có giới hạn rõ ràng. Không phải mọi protein khó dự đoán đều có thể giải quyết bằng cách giải trình tự thêm các loài họ hàng; điều đó phụ thuộc vào việc các homolog phù hợp có tồn tại, có thể lấy mẫu và tạo được MSA đủ thông tin hay không. Và dự đoán cấu trúc, dù confidence cao, vẫn không tự động cho biết chức năng sinh học.

Nghiên cứu của Fatema Bhinderwala, Aishwarya Korgaonkar và các cộng sự được công bố trên Proceedings of the National Academy of Sciences (PNAS) vào tháng 9/2026. Với BICYCLE, câu hỏi tiếp theo không còn chỉ là protein gấp thành hình gì. Nhóm nghiên cứu giờ có một bản đồ cấu trúc đủ lớn để bắt đầu kiểm tra từng biến thể đang tương tác với mục tiêu nào trong cây — và liệu sự đa dạng bề mặt có thực sự là dấu vết của cuộc chạy đua giữa rệp và hệ miễn dịch thực vật hay không.

Nguồn: PNAS; bản toàn văn trên PubMed Central; Stowers Institute for Medical Research.

Chia sẻ