AI đã có thể lục tung hàng chục triệu paper biology: Bước tiếp theo là cho nó một phòng lab thật để tự kiểm tra ý tưởng
AI agent đã vượt khỏi vai trò chatbot: FutureHouse cho Robin tìm tài liệu, đặt giả thuyết, chọn thí nghiệm và tự phân tích dữ liệu wet lab. Nhưng con người vẫn phải cầm pipette. Những chuẩn mới để AI điều khiển microscope, liquid handler và robotic arm đang nhắm đúng vào mắt xích còn thiếu đó.
Biology không thiếu paper. Vấn đề là không một nhà khoa học nào có thể đọc đủ nhanh để theo kịp chúng. PubMed đã chứa hàng chục triệu bài, chưa tính clinical trial, database gene–protein và dữ liệu omics đang tăng liên tục. AI agent đang làm cho phần “đọc” này rẻ hơn rất nhanh: nó có thể tìm, đối chiếu và tổng hợp hàng trăm paper trong thời gian một con người còn chưa đọc xong phần Methods của vài bài.
Nhưng đọc literature không phải khoa học hoàn chỉnh. Một giả thuyết chỉ trở thành kiến thức khi nó va vào thế giới thật: tế bào có phản ứng như dự đoán không, protein có bind không, assay có tái lập được không, hay toàn bộ ý tưởng sụp đổ vì một biến mà model không thấy trong paper?
Đó là lý do biên giới tiếp theo của AI for science đang dịch từ màn hình sang wet lab. FutureHouse đã cho một hệ multi-agent tên Robin chạy gần trọn vòng nghiên cứu biology — tìm tài liệu, đặt giả thuyết, đề xuất thí nghiệm, đọc dữ liệu và tạo giả thuyết tiếp theo. Điểm còn thiếu rất rõ: con người vẫn trực tiếp thực hiện các thí nghiệm vật lý.
Cùng lúc, các phòng lab tự động hóa đang được xây để biến pipette, microscope, liquid handler và robotic arm thành những thiết bị mà AI có thể gọi giống như phần mềm gọi API. Nếu hai xu hướng này gặp nhau, “AI scientist” sẽ không còn chỉ là một model biết trả lời câu hỏi khoa học. Nó có thể trở thành một vòng khép kín: đọc → nghĩ → thử → đo → sửa giả thuyết → thử lại.
“AI đã đọc mọi paper” là cách nói quá — nhưng nút thắt literature đang thực sự thay đổi
Không có bằng chứng cho thấy một hệ AI hiện nay đã đọc, hiểu và lưu giữ gần như toàn bộ literature biology theo nghĩa một nhà khoa học đọc paper. Cách chính xác hơn là các agent hiện có thể tìm kiếm literature theo nhu cầu trên những kho dữ liệu khổng lồ, mở paper liên quan, trích xuất đoạn cần thiết rồi tổng hợp chúng vào một câu trả lời hoặc giả thuyết.
FutureHouse từng lấy quy mô khoảng 38 triệu paper trên PubMed để mô tả information bottleneck mà nhà khoa học phải đối mặt. PaperQA2 của tổ chức này được xây riêng cho scientific literature search: agent tự tìm bài, đọc phần phù hợp, đi theo citation graph và trả lời với nguồn. Trong benchmark LitQA2, FutureHouse báo cáo hệ thống vượt các nhà nghiên cứu biology trình độ PhD và postdoc ở bài toán truy xuất thông tin khoa học.
Robin cho thấy điều này có thể được đưa ra khỏi bài test. Trong công trình đăng trên Nature tháng 5/2026, hệ thống đã tổng hợp khoảng 551 tài liệu trong 30 phút. Nhóm tác giả ước tính một người sẽ cần khoảng 294 giờ cho cùng khối lượng xử lý literature, dựa trên các benchmark đọc học thuật đã công bố.
Đây không phải bằng chứng AI “hiểu biology hơn nhà khoa học”. Nó cho thấy một dạng lao động rất cụ thể — tìm và kết nối thông tin đã tồn tại — đang có thể được tự động hóa ở quy mô mà con người khó theo kịp.
Robin đã chạy vòng khoa học, nhưng wet lab vẫn do con người làm
FutureHouse giao cho Robin một bài toán thực: tìm hướng điều trị mới cho dry age-related macular degeneration, một bệnh thoái hóa điểm vàng liên quan tuổi tác. Thay vì yêu cầu model đoán một drug name, hệ thống chia công việc giữa nhiều agent.
Crow thực hiện các literature review tương đối ngắn để xác định cơ chế bệnh và assay khả thi. Falcon đào sâu literature để đánh giá từng candidate. Finch nhận dữ liệu thí nghiệm và tự viết code phân tích flow cytometry hoặc RNA sequencing. Robin đứng phía trên, dùng output của các agent này để quyết định câu hỏi tiếp theo.
Trong vòng đầu, Robin xem xét 151 paper để đề xuất 10 cơ chế bệnh có thể kiểm tra, sau đó chọn phagocytosis của retinal pigment epithelium làm hướng assay. Nó tiếp tục review khoảng 400 paper liên quan để đề xuất 30 candidate, rồi xếp hạng các lựa chọn cho thử nghiệm.
Nhóm nghiên cứu sau đó thử năm candidate trong cell culture. Khi dữ liệu quay lại, Finch tự phân tích flow cytometry. Robin dùng kết quả đó để đề xuất RNA-seq, rồi phân tích dữ liệu gene expression tiếp theo. Quy trình cuối cùng đưa ra ripasudil — một thuốc đang dùng cho glaucoma — và KL001 như những candidate có hoạt tính đáng chú ý trong các mô hình tế bào được thử.
Paper cẩn thận gọi đây là semi-autonomous scientific discovery. Lý do nằm ngay giữa sơ đồ workflow: “laboratory experiments” vẫn là một khối do con người thực hiện. Robin tạo experimental direction, nhưng chưa viết protocol chính xác tới mức robot có thể chạy trực tiếp; các nhà nghiên cứu còn phải chuyển đề xuất của AI thành thao tác wet-lab thực tế.
Khoảng cách giữa “đề xuất thí nghiệm” và “chạy thí nghiệm” lớn hơn một API
Trong phần mềm, lệnh sai thường trả error. Trong biology, một thí nghiệm sai có thể vẫn trả về dữ liệu trông hoàn toàn hợp lý.
Một pipette có thể hút thiếu vài microlit. Cell culture có thể bị contamination. Reagent có thể xuống cấp. Plate có thể bị đặt nhầm orientation. Microscope có thể focus sai lớp. Hai protocol dùng cùng câu “incubate overnight” nhưng khác nhiệt độ, density tế bào hoặc loại vessel có thể cho kết quả khác hẳn.
Đó là lý do laboratory automation khó hơn việc nối LLM với một cánh tay robot. Một autonomous lab phải biết không chỉ làm gì, mà còn xác nhận việc đó thực sự đã xảy ra. Sensor, camera, instrument log, barcode và metadata phải biến mỗi bước thành bằng chứng machine-readable thay vì chỉ là một command được gửi đi.
Một preprint về autonomous laboratories cho life sciences công bố tháng 8/2026 gọi đây là “reality gap”: protocol logic có thể đúng nhưng thí nghiệm vẫn thất bại âm thầm do contamination, drift theo thời gian, sample mix-up hoặc ý định trong protocol không đủ rõ. Đóng khoảng cách này đòi hỏi hệ thống lưu provenance tới từng thao tác chứ không chỉ một file kết quả ở cuối.
AI đang bắt đầu có “driver” cho microscope và liquid handler
Một vấn đề khác rất thực dụng là thiết bị lab không nói cùng ngôn ngữ. Microscope của hãng này, liquid handler của hãng khác và incubator của hãng thứ ba thường có API, driver và cách trả dữ liệu riêng. Một lab muốn nối tất cả vào cùng workflow có thể mất hàng tuần hoặc hàng tháng cho integration.
Tháng 8/2026, Anthropic và HHMI Janelia Research Campus giới thiệu bản research preview của Model Hardware Standard (MHS), một specification nhằm chuẩn hóa cách AI agent điều khiển thiết bị vật lý. MHS dùng các primitive đơn giản như “read” và “write” để tạo một lớp chung giữa agent và hardware.
Theo Anthropic, hệ thống thử nghiệm cho phép agent vận hành nhiều thiết bị song song — từ microscope và liquid handler tới robotic arm — đồng thời thay đổi tham số trong lúc chạy và trong một số trường hợp tự phục hồi sau lỗi phần cứng. MHS hiện mới ở research preview với một nhóm lab và nhà sản xuất, chưa phải chuẩn đã được ngành chấp nhận rộng rãi.
Điểm đáng chú ý nằm ở kiến trúc. Nếu scientific agent đã có thể gọi PubMed, database protein và Jupyter như tool, thì MHS đang thử biến cả phòng lab thành một tập tool. Khi đó lệnh “kiểm tra candidate này” có thể được phân rã thành tạo plate map, ra lệnh liquid handler, chờ incubation, gọi microscope, lấy dữ liệu rồi chuyển chúng trở lại agent phân tích.
Self-driving lab không phải chuyện tương lai xa, nhưng phần lớn vẫn rất hẹp
Ý tưởng phòng lab tự chạy đã tồn tại trước làn sóng LLM. Trong chemistry và materials science, nhiều self-driving lab đã dùng Bayesian optimization hoặc machine learning để chọn thí nghiệm tiếp theo, robot thực hiện phản ứng rồi hệ đo gửi kết quả trở lại thuật toán.
Điều thay đổi với agent là interface trở nên tổng quát hơn. Thay vì mỗi workflow được hard-code cho một phản ứng hay một loại vật liệu, LLM có thể đọc hướng dẫn, dùng tool khác nhau và điều chỉnh kế hoạch dựa trên ngữ cảnh. Một review trên Nature Reviews Chemistry tháng 7/2026 mô tả self-driving lab đang chuyển từ nền tảng automation hẹp sang hệ discovery đa dụng hơn, nhưng chỉ ra ba vấn đề lớn còn lại: scalability, generalizability và provenance đầy đủ.
Biology còn khó hơn chemistry ở một số điểm. Tế bào là hệ sống, phản ứng với passage number, môi trường, thời gian và lịch sử nuôi cấy. Nhiều assay có bước thủ công tinh tế mà robot chưa dễ tái tạo. Và mỗi thí nghiệm sinh học có thể mất hàng giờ, hàng ngày hoặc hàng tuần, khiến một quyết định sai của agent đắt hơn nhiều một lần inference sai.
2026 đang cho thấy các mảnh ghép bắt đầu chạm nhau
Robin chứng minh một AI system có thể đảm nhận phần lớn intellectual loop quanh một thí nghiệm biology nhưng vẫn cần con người ở bench. MHS nhắm vào lớp hardware để agent điều khiển instrument. Các self-driving lab đã chứng minh closed-loop experimentation có thể hoạt động trong những domain được ràng buộc tốt.
Ngay cả các công ty AI nền tảng cũng đang tiến gần hơn tới phía vật lý. Reuters ngày 18/9/2026 đưa tin Anthropic đã thiết lập một wet lab tại khu vực San Francisco Bay Area để mở rộng hoạt động life sciences và thực hiện biology ngoài computer simulation. Anthropic chưa công bố chi tiết kỹ thuật của facility này, nên chưa có cơ sở gọi nó là autonomous lab; nhưng động thái phù hợp với hướng mà MHS cho thấy: model ngày càng cần tiếp xúc với dữ liệu được tạo ra từ thí nghiệm thật, không chỉ literature và benchmark.
Google cũng đã đưa Co-Scientist — một multi-agent system xây trên Gemini — tới giai đoạn đề xuất các giả thuyết biomedical được nhóm nghiên cứu kiểm nghiệm. Paper về Co-Scientist và Robin được Nature xuất bản cạnh nhau trong cùng số tháng 5/2026, một dấu hiệu rằng “AI scientist” đang chuyển từ demo tạo hypothesis sang câu hỏi khó hơn: hypothesis nào sống sót khi được đưa vào lab?
Vòng lặp tự động càng kín, yêu cầu kiểm soát càng phải rõ
Một AI chỉ đọc paper có thể hallucinate một citation. Một AI điều khiển robot lab có thêm khả năng gây lãng phí sample, làm hỏng instrument hoặc chạy một protocol sai trước khi con người nhận ra. Trong life sciences, mức độ rủi ro còn phụ thuộc loại experiment mà hệ được phép thực hiện.
Vì vậy, “autonomous” không nhất thiết đồng nghĩa “không có con người”. Một kiến trúc thực tế có thể cho AI tự chạy các bước lặp lại và ít rủi ro, nhưng yêu cầu scientist phê duyệt khi đổi hypothesis, thay reagent class, mở rộng quy mô hoặc đi vào thí nghiệm có hậu quả lớn. Log đầy đủ, permission theo thiết bị và hard limit ở tầng hardware có thể quan trọng ngang với model reasoning.
Robin cũng cho thấy một giới hạn khác: dù agent tự phân tích dữ liệu, nhóm vẫn dùng prompt engineering từ domain expert; paper thừa nhận phiên bản hiện tại chưa tự tạo protocol thực thi chi tiết. Đây là khoảng cách giữa một hệ “biết khoa học” và một hệ có thể vận hành nghiên cứu đáng tin cậy ngày này qua ngày khác.
Bước tiếp theo không phải AI đọc thêm paper, mà là học từ kết quả chưa từng tồn tại
Literature agent đang khai thác kiến thức con người đã tạo ra. Một autonomous lab thay đổi điều đó vì AI có thể hỏi một câu mà literature chưa trả lời, tự đặt thí nghiệm và nhận dữ liệu mới từ thế giới.
Đây mới là ngưỡng quan trọng. Khi agent chỉ search PubMed, khả năng của nó cuối cùng vẫn bị giới hạn bởi những gì đã được xuất bản. Khi nó có một lab trong vòng lặp, một hypothesis thất bại cũng trở thành thông tin: model phải cập nhật cách hiểu, bỏ một candidate, thay assay hoặc tìm cơ chế khác.
Nhưng trước khi có một “nhà khoa học AI” hoạt động độc lập, ngành cần chứng minh điều ít hào nhoáng hơn nhiều: robot có thể thực hiện protocol lặp lại, metadata có đủ sạch để truy nguyên, model biết khi nào mình không chắc, và con người có thể audit toàn bộ chuỗi quyết định từ paper đầu tiên tới giếng cuối cùng trên microplate.
AI đã bắt đầu làm cho việc đọc hàng trăm paper trở thành chuyện của vài chục phút. Thách thức tiếp theo khó hơn: biến một ý tưởng được tạo ra trong vài giây thành một thí nghiệm vật lý đáng tin cậy — rồi để dữ liệu thật có quyền nói với model rằng nó đã sai.
Nguồn: Nature – A multi-agent system for automating scientific discovery; FutureHouse – scientific literature agents; Anthropic – Model Hardware Standard; Nature Reviews Chemistry – The past, present and future of self-driving laboratories; Nature – Accelerating scientific discovery with Co-Scientist; Reuters – Anthropic wet lab.