AI lớn hơn chưa chắc hiểu sinh học lão hóa tốt hơn: Bộ model nhỏ mã nguồn mở được xây riêng cho aging research

Một nghiên cứu trên Cell cho thấy năm Longevity-LLM từ 0,6 đến 9 tỷ tham số có thể cạnh tranh hoặc vượt các frontier model trên 17 bài toán về clinical data, genetics và multi-omics của lão hóa. Kết quả không chứng minh model nhỏ giỏi biology nói chung; nó cho thấy dữ liệu và fine-tuning chuyên ngành có thể quan trọng hơn scale khi câu hỏi rất hẹp.

AI lớn hơn chưa chắc hiểu sinh học lão hóa tốt hơn: Bộ model nhỏ mã nguồn mở được xây riêng cho aging research

Một model có hàng trăm tỷ tham số có thể viết rất thuyết phục về telomere, senescence hay DNA methylation. Nhưng đưa cho nó một bảng proteomics hoặc methylation profile rồi hỏi người nào “già” hơn về mặt sinh học lại là chuyện khác.

Một nghiên cứu công bố trên Cell ngày 17/9/2026 đặt chính khoảng cách đó lên bàn kiểm tra. Nhóm từ Insilico Medicine, Liquid AI, Buck Institute for Research on Aging và Harvard Medical School xây LongevityBench, bộ benchmark gồm 17 task trên năm nhóm dữ liệu của aging biology, rồi dùng nó để đánh giá 18 hệ AI frontier từ sáu nhóm phát triển. Không model tổng quát nào dẫn đầu mọi loại dữ liệu, và những bài toán suy tuổi từ omics là phần khó nhất bất kể model lớn tới đâu.

Sau đó nhóm làm một thử nghiệm khác: thay vì tiếp tục tăng scale, họ fine-tune năm model nhỏ hơn — từ 0,6 đến 9 tỷ tham số — trên dữ liệu lão hóa chuyên biệt. Các model này, gọi chung là Longevity-LLM, đạt kết quả ngang hoặc cao hơn những hệ frontier lớn hơn trên benchmark. Model đứng đầu tổng thể là L-Qwen3.5-9B, chỉ có 9 tỷ tham số.

Thông điệp hấp dẫn là “nhỏ thắng lớn”. Nhưng kết luận khoa học hữu ích hơn lại hẹp hơn: với một miền dữ liệu chuyên biệt như aging biology, model được huấn luyện đúng ngôn ngữ của dữ liệu có thể quan trọng hơn việc chỉ tăng số tham số.

Biết nói về aging không giống biết đọc dữ liệu aging

Benchmark sinh học thường gặp một vấn đề: nếu câu hỏi là “hallmarks of aging gồm những gì?”, một LLM có thể trả lời nhờ đã đọc bài báo hoặc sách giáo khoa trong quá trình pretraining. Điểm số khi đó khó phân biệt giữa hiểu dữ liệu và nhớ kiến thức.

LongevityBench cố dịch câu hỏi sang dạng khó “học thuộc” hơn. Các task yêu cầu model suy từ dữ liệu mức thấp lên một phenotype hoặc outcome: dự đoán tuổi từ DNA methylation, đọc transcriptomics và proteomics, so sánh survival giữa hai người, suy tác động của genetic perturbation lên lifespan hoặc xử lý clinical blood data.

Năm nhóm dữ liệu trong bản Cell gồm clinical data, genetics, epigenetics, transcriptomics và proteomics. Nguồn dữ liệu đến từ những resource như NHANES, GTEx, GEO, Olink và các database gene liên quan tới longevity. Câu hỏi được dựng theo nhiều format — binary classification, pairwise comparison, regression và generation — thay vì chỉ hỏi kiến thức bằng prose.

Điều này làm lộ một điểm yếu khá thú vị của frontier model: cùng một thông tin sinh học nhưng đổi cách hỏi có thể làm thứ hạng model thay đổi mạnh. Nhóm nghiên cứu báo cáo rằng hiệu năng nhạy với prompt format, cho thấy một model có thể nhận ra tín hiệu khi nhiệm vụ được đóng gói theo một kiểu nhưng thất bại khi cùng dữ liệu được đặt dưới một kiểu khác.

Đó không phải hành vi mong muốn ở một công cụ khoa học. Nếu hai cách viết câu hỏi tương đương dẫn tới hai kết luận khác nhau, researcher khó biết model đang thực sự đọc biology hay chỉ khớp pattern với cấu trúc prompt.

Phần khó nhất là biến omics thành một con số có ý nghĩa

LLM vốn được tối ưu để xử lý token ngôn ngữ. Omics lại là một thế giới khác: hàng trăm hoặc hàng nghìn giá trị liên tục mô tả expression, protein abundance hay methylation ở các vị trí khác nhau. Mối liên hệ giữa từng feature và tuổi thường yếu, còn tín hiệu thực sự nằm trong tổ hợp nhiều feature.

Vì thế, dự đoán biological age từ omics trở thành một bài stress test tự nhiên. Model không thể chỉ nhận ra một từ khóa “già” hay “trẻ”; nó phải học cách các pattern đa chiều biến đổi theo tuổi.

Trên trang dự án LongevityBench, nhóm công bố một số ví dụ cho thấy mức chênh lệch. Trong task pairwise về tuổi dựa trên DNA methylation từ GEO, L-Qwen3.5-9B đạt concordance 0,868, trong khi frontier model tốt nhất được báo cáo ở 0,685. Với regression tuổi từ Olink proteomics, model nhỏ nhất L-Qwen3-0.6B đạt mean absolute error khoảng 5,7 năm, so với 10,1 năm của frontier model tốt nhất trong phép so sánh đó.

Những con số này chỉ có ý nghĩa trong đúng task và split của LongevityBench. Chúng không có nghĩa model 0,6B đã trở thành một “biologist” tốt hơn các hệ lớn trong mọi công việc, càng không có nghĩa nó có thể tự suy ra cơ chế lão hóa mới từ bất kỳ dataset nào.

Năm model nhỏ được dạy đúng “phương ngữ” của aging biology

Gia đình Longevity-LLM gồm năm model dựa trên hai họ kiến trúc mở: Qwen của Alibaba và LFM2 của Liquid AI. Danh sách hiện tại gồm L-Qwen3.5-9B, L-Qwen3-1.7B, L-Qwen3-0.6B, L-LFM2-2.6B và L-LFM2-1.2B.

Theo tài liệu dự án, corpus huấn luyện có hơn 720.000 prompt đại diện cho DNA methylation, transcriptomics, proteomics, blood tests, genetic perturbation và biomedical reasoning. Các model không được xây từ đầu; chúng lấy một foundation model có sẵn rồi domain-adapt bằng supervised fine-tuning trên dữ liệu aging.

Đây là điểm giải thích phần lớn kết quả. Một frontier chatbot phải phân bổ capacity cho code, toán, lịch sử, ngôn ngữ, pháp luật và hàng nghìn lĩnh vực khác. Longevity-LLM không cần làm vậy. Nó được tối ưu cho một phân phối dữ liệu rất hẹp, nơi những token như gene symbol, CpG site, protein measurement hay clinical biomarker xuất hiện theo cấu trúc mà model được luyện trực tiếp.

Liquid AI cho biết hai model LFM2 longevity có thể chạy cục bộ và được thiết kế cho deployment hiệu quả hơn. Model card của LFM2-2.6B-Longevity ghi rõ mục đích là aging biology và omics interpretation, đồng thời cảnh báo output phải được kiểm chứng thực nghiệm và không được dùng như tư vấn lâm sàng.

“Nhỏ thắng lớn” có một caveat rất quan trọng

Benchmark và model chuyên biệt được phát triển trong cùng một dự án. Longevity-LLM được fine-tune trên các task và data distribution có quan hệ trực tiếp với những gì LongevityBench đo, còn frontier model đi vào bài test mà không được đào tạo riêng cho benchmark này.

Đó không nhất thiết là một sai sót — thực tế, đó chính là câu hỏi mà nhóm muốn kiểm tra: một model nhỏ được domain-adapt có thể vượt một model tổng quát lớn tới mức nào? Nhưng nó giới hạn cách diễn giải kết quả.

Điều benchmark chứng minh khá tốt là specialization có thể bù cho scale trên các task aging đã định nghĩa. Nó chưa chứng minh rằng model chuyên biệt sẽ generalize tới một platform proteomics mới, một assay chưa thấy, một loài khác hay một cơ chế sinh học ngoài distribution huấn luyện.

Paper cũng thừa nhận benchmark chưa bao phủ toàn bộ aging research. Các hướng được nhắc tới cho phiên bản sau gồm chemical screening, geroprotector experiment, cross-species translation và sequence-based task. Chi phí inference, latency và việc model có tuân thủ format ổn định hay không cũng là vấn đề thực tế chưa được benchmark đầy đủ.

Từ benchmark sang một agent tìm target lão hóa

Nhóm không dừng ở một leaderboard. Họ đưa L-Qwen3.5-9B vào Longevity Claw, một agent mã nguồn mở kết hợp model với các công cụ như gene-set enrichment, aging clock, population profiling, literature retrieval và target prioritization.

Theo Insilico Medicine, hệ thống đã chạy các workflow quanh 14 nhóm cơ chế liên quan tới lão hóa và đề xuất 328 gene làm candidate target. Khi so với một bộ target đã có hỗ trợ thực nghiệm độc lập, danh sách này có mức enrichment lên tới 5,6 lần.

Đây vẫn là target nomination, không phải xác nhận thuốc chống lão hóa. Một gene xuất hiện đúng trong pathway hoặc trùng với target đã biết chỉ là điểm bắt đầu cho thí nghiệm. Để đi từ ranking computational tới intervention còn phải qua validation trong cell, animal model, safety, pharmacology và cuối cùng là clinical trial nếu mục tiêu là điều trị ở người.

Việc bộ model, benchmark và agent được phát hành công khai có thể quan trọng hơn chính thứ hạng hiện tại. Lab không có ngân sách API lớn có thể tải model, chạy cục bộ trên dữ liệu nhạy cảm, kiểm tra lại benchmark và thử fine-tune cho assay riêng. Quan trọng hơn, cộng đồng có thể tìm ra những task mà model đang “học benchmark” thay vì học biology.

Biology có thể cần nhiều model nhỏ hơn là một model biết mọi thứ

Câu chuyện Longevity-LLM đi ngược một trực giác phổ biến của AI vài năm qua: cứ tăng model size và compute thì khả năng sẽ tự xuất hiện. Trong science, điều đó có thể đúng tới một mức nào đó, nhưng dữ liệu chuyên ngành thường có cấu trúc mà text pretraining không tự nhiên học được.

Proteomics không chỉ là danh sách tên protein. Methylation không chỉ là ký hiệu CpG. Clinical biomarkers cũng không trở thành kiến thức hữu ích chỉ vì model từng nhìn thấy chúng trong paper. Muốn suy từ những số đo đó tới phenotype, model phải được huấn luyện trên đúng loại quan hệ mà scientist đang quan tâm.

LongevityBench chưa trả lời được một câu hỏi lớn hơn: liệu domain model nhỏ có thể tạo ra insight mới mà researcher chưa biết hay không. Hiện tại, bằng chứng mạnh nhất vẫn là chúng làm tốt những task có ground truth đã tồn tại.

Nhưng đó cũng là một thay đổi có ý nghĩa. Nếu kết quả được tái lập trên benchmark độc lập và dữ liệu ngoài distribution, các lab có thể không cần chờ một frontier model ngày càng lớn để có AI hữu ích hơn. Họ có thể lấy một model đủ nhỏ để kiểm soát, rồi dạy nó đọc chính loại dữ liệu sinh học mà lab tạo ra mỗi ngày.

Chia sẻ