Biohub, DOE và NIH gom nguồn lực 1,8 tỷ USD để xây dữ liệu mở cho “tế bào ảo”
Google DeepMind, Isomorphic Labs và Meta bổ sung 300 triệu USD vào nỗ lực tạo dữ liệu sinh học chuẩn hóa. Con số tổng gồm cả tiền mới, hạ tầng và dữ liệu từ đầu tư trước đó.
Biohub, Bộ Năng lượng Mỹ (DOE), Viện Y tế Quốc gia Mỹ (NIH) cùng các đối tác công nghệ ngày 7/10 công bố mở rộng Virtual Biology Initiative. Tổng nguồn lực được định giá 1,8 tỷ USD, gồm kinh phí, dữ liệu, năng lực tính toán và công nghệ đo lường nhằm tạo kho dữ liệu sinh học mở cho các mô hình dự đoán tế bào.
Mục tiêu dài hạn thường được gọi là “tế bào ảo”: mô hình dự đoán một loại tế bào sẽ phản ứng thế nào trước gene bị chỉnh sửa, thuốc hoặc thay đổi môi trường. Đây chưa phải bản sao số hoàn chỉnh của cơ thể người. Liên minh trước hết xử lý nút thắt thiết yếu: dữ liệu thực nghiệm đủ lớn, đa phương thức và dùng chung được.
1,8 tỷ USD không phải toàn bộ là tiền mới
Cấu phần cần được tách rõ. Biohub đã cam kết 500 triệu USD trong năm năm khi khởi động sáng kiến hồi tháng 4: 400 triệu USD cho công nghệ đo, chụp ảnh và can thiệp sinh học; 100 triệu USD tài trợ nghiên cứu bên ngoài.
Trong đợt mở rộng mới, DOE dự kiến đóng góp hơn 500 triệu USD trong năm năm qua Genesis Mission cho đo lường, mô hình hóa, phân tích AI và tính toán. Google DeepMind, Isomorphic Labs và Meta cùng đầu tư 300 triệu USD. NIH không công bố một khoản chi mới tương ứng; cơ quan này điều phối kho dữ liệu và chương trình được hình thành từ hơn 500 triệu USD đầu tư liên bang trước đó.
Vì thế, tổng 1,8 tỷ USD là giá trị phối hợp của tiền mới, tài sản dữ liệu, compute và công nghệ, chứ không phải 1,8 tỷ USD tiền mặt vừa được rót vào một quỹ. NIH và DOE đều xác nhận vai trò điều phối, tiêu chuẩn hóa và cung cấp năng lực phòng thí nghiệm của mình.
Tại sao AI sinh học vẫn thiếu dữ liệu dù đã có hàng triệu mẫu
Mô hình ngôn ngữ có thể học từ kho văn bản do con người tạo ra trong nhiều thập niên. Sinh học khó hơn: mỗi dữ liệu chất lượng cao thường cần nuôi mẫu, can thiệp, chụp ảnh hoặc giải trình tự trong điều kiện kiểm soát. Dữ liệu từ hai phòng thí nghiệm còn có thể lệch nhau vì thiết bị, quy trình và cách gắn nhãn khác nhau.
Để dự đoán phản ứng thay vì chỉ mô tả trạng thái, mô hình cần quan sát cùng hệ thống dưới nhiều can thiệp. Liên minh muốn mở rộng dữ liệu phản ứng của tế bào trên nhiều loại tế bào và điều kiện chưa từng được khảo sát, rồi nối nhiều lớp thông tin như gene, RNA, protein, cấu trúc không gian và ảnh theo thời gian.
Biohub cho biết sẽ đầu tư vào cryo-electron tomography để nhìn cấu trúc gần mức nguyên tử, kính hiển vi có thể quan sát hàng triệu đến hàng tỷ tế bào trong mô sống, cùng công cụ can thiệp ở cấp phân tử, tế bào, mô và toàn cơ thể. DOE bổ sung siêu máy tính exascale, nguồn tia X và neutron, cryo-EM cùng phòng thí nghiệm tự động trong hệ thống National Laboratories.
“Mở” chỉ có giá trị nếu dữ liệu thực sự dùng chung được
Cam kết trung tâm là xây tài nguyên mở cho cộng đồng nghiên cứu. Tuy nhiên, tải nhiều file lên một cổng dữ liệu chưa tạo ra nền tảng AI. Các bộ dữ liệu phải dùng định danh chung, mô tả rõ điều kiện thí nghiệm, tiêu chuẩn chất lượng và giấy phép đủ minh bạch để mô hình có thể kết hợp chúng.
Biohub dự kiến xây lớp liên kết gồm chuẩn chia sẻ, định danh thống nhất và một điểm truy cập chung. Tổ chức đã có kinh nghiệm với CELLxGENE, Tabula Sapiens, OpenCell và CryoET Data Portal. Các viện và liên minh quốc tế tham gia để giảm nguy cơ mỗi nhóm tạo một “ốc đảo” dữ liệu riêng.
Theo Reuters, Biohub kỳ vọng bộ dữ liệu đầu tiên trong khoảng một năm và các mô hình trong vòng năm năm. Đây là mục tiêu do tổ chức đưa ra, chưa phải kết quả đã được chứng minh.
Tế bào ảo không thay thế thí nghiệm thật
Nếu hoạt động tốt, mô hình có thể sàng lọc giả thuyết và chọn thí nghiệm đáng làm nhất, thay vì thử mọi khả năng trong phòng lab. Nó cũng có thể giúp phát hiện mẫu phản ứng mà một bộ dữ liệu riêng lẻ không đủ lớn để thấy. Nhưng dự đoán vẫn phải quay lại thí nghiệm để kiểm tra, và một mô hình tế bào không tự động dự đoán được độc tính hoặc hiệu quả của thuốc trên toàn cơ thể.
Các giới hạn khác gồm thiên lệch về loại tế bào dễ lấy mẫu, sai số theo batch, thiếu ngữ cảnh mô và sự khác biệt giữa người. Dữ liệu bệnh nhân còn kéo theo yêu cầu đồng thuận, bảo mật và quản trị mà dữ liệu tế bào mô hình không có. Việc các công ty tài trợ có quyền tiếp cận sớm ra sao cũng cần được công bố rõ trước khi kho dữ liệu mở hoàn toàn.
Điểm đáng chú ý là đầu tư vào hạ tầng khoa học chung. Nếu chuẩn hóa và mở dữ liệu đúng cam kết, giá trị có thể lan rộng hơn một mô hình độc quyền. Nếu phần “mở” bị thu hẹp hoặc dữ liệu không tương thích, 1,8 tỷ USD sẽ không tự giải quyết bài toán tế bào ảo.
Nguồn
Nguồn ảnh đại diện: nền tảng Virtual Cells của Chan Zuckerberg Initiative.