AI đang chạy tới quy mô nghìn tỷ tham số: Khoa học có thể đi hướng ngược lại — model nhỏ nhưng biết cực sâu một lĩnh vực
Kimi K2 đã đưa AI tổng quát tới mốc 1 nghìn tỷ tham số, nhưng nhiều hệ AI for Science đang chọn cách khác: 8B cho literature, 7–8B cho materials science, hay hai model 30B và 14B chia nhau nhiệm vụ nghiên cứu. Lợi thế không nằm ở việc model nhỏ tự nhiên “thông minh hơn”, mà ở dữ liệu chuyên ngành, công cụ và kiến trúc được thiết kế đúng cho một loại khoa học.
AI tổng quát đã bước vào vùng mà số tham số được tính bằng hàng trăm tỷ, thậm chí nghìn tỷ. Kimi K2 của Moonshot AI có khoảng 1 nghìn tỷ tham số tổng cộng trong kiến trúc mixture-of-experts; DeepSeek-V3 có 671 tỷ. Cách scale này có logic rõ ràng: một model tổng quát phải viết code, giải toán, hiểu nhiều ngôn ngữ, dùng tool và trả lời đủ loại câu hỏi mà không biết trước người dùng sẽ hỏi gì.
Nhưng khoa học không nhất thiết có cùng bài toán. Một model dùng trong materials science có thể không cần viết thơ hay biết lịch sử điện ảnh. Nó cần hiểu CIF, band gap, crystal symmetry, synthesis route và khi nào một kết quả mô phỏng vi phạm trực giác vật lý. Một model network biology cần hiểu quan hệ gene–gene và single-cell transcriptome, chứ không cần giữ toàn bộ năng lực của một chatbot phổ thông.
Một loạt công trình năm 2026 đang cho thấy một con đường khác cho AI for Science: không cố nhét mọi năng lực vào một model khổng lồ, mà xây model nhỏ hơn, đào tạo cực sâu theo domain và nối chúng với database, simulator hoặc scientific tool phù hợp. Trong một số benchmark chuyên ngành, các hệ như vậy đã cạnh tranh hoặc vượt những model tổng quát lớn hơn nhiều.
Điều đó không có nghĩa “nhỏ luôn tốt hơn”. Các nghiên cứu scaling trong biology vẫn cho thấy tăng kích thước model có thể cải thiện khả năng học. Điểm mới nằm ở câu hỏi khác: khi nhiệm vụ đã hẹp và có cấu trúc, mỗi tỷ tham số bổ sung có còn là nơi đáng tiêu compute nhất hay không?
MatBrain tách “nhà khoa học” thành hai model 30B và 14B
Một ví dụ mới nhất xuất hiện trên Nature Machine Intelligence ngày 10/9/2026. Nhóm tại Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences giới thiệu MatBrain, một agent cho nghiên cứu vật liệu tinh thể.
Thay vì dùng một model hàng trăm tỷ tham số để vừa suy luận vừa gọi tool, MatBrain chia công việc cho hai model. Mat-R1 có 30 tỷ tham số, chịu trách nhiệm phân tích cấu trúc, tính chất vật liệu, đánh giá kết quả có hợp lý không và quyết định bước tiếp theo. Mat-T1 có 14 tỷ tham số, đóng vai trò thực thi: gọi database, tạo crystal structure và chạy các chương trình tính property.
Sự phân vai này xuất phát từ một quan sát kỹ thuật: scientific reasoning và tool execution không hẳn là cùng một bài toán. Phần suy luận thường cần output ổn định, ít phân nhánh và tuân theo ràng buộc vật lý. Tool use lại cần khám phá nhiều đường hành động, chọn API và tham số phù hợp, rồi phản ứng với kết quả trả về. Nhóm nghiên cứu cho rằng ép hai hành vi đó vào cùng một model nhỏ làm chúng cản trở nhau.
Trong paper, MatBrain được đánh giá trên structure generation, property prediction và synthesis planning. Ở một case study về electrocatalyst, hệ thống tạo 30.000 candidate structure, lọc qua nhiều tầng và rút xuống 38 vật liệu tiềm năng trong 48 giờ trước khi chuyển sang experimental validation.
Thông cáo của SIAT báo cáo MatBrain đạt độ chính xác tổng hợp cao hơn 66% so với một số model lớn như GPT-5 và DeepSeek-R1 trên bộ task của nhóm, đồng thời giảm hơn 95% chi phí phần cứng triển khai so với hướng dùng model tổng quát hàng trăm tỷ tham số. Đây là kết quả trong benchmark và cấu hình mà nhóm thiết kế, không phải bằng chứng rằng MatBrain “thông minh hơn GPT-5” trên mọi loại nhiệm vụ. Paper Nature Machine Intelligence mô tả hệ thống thận trọng hơn: competitive với frontier LLM trong các tác vụ materials research mà nó được xây cho.
Một model 8B có thể đọc literature tốt hơn model tổng quát lớn hơn
Ví dụ rõ hơn về lợi thế của specialization là OpenScholar. Hệ thống này không cố ghi nhớ toàn bộ khoa học trong weights. Nó dùng một model 8B kết hợp với kho dữ liệu khoảng 45 triệu paper open-access, retriever được huấn luyện riêng cho scientific text, reranker và vòng self-feedback để kiểm tra lại câu trả lời cùng citation.
Trong paper trên Nature, OpenScholar-8B vượt GPT-4o 6,1% về correctness trên một bài toán tổng hợp nhiều paper trong ScholarQABench, đồng thời đạt citation accuracy gần với chuyên gia con người. Kết quả quan trọng ở đây không phải “8B mạnh hơn model lớn” theo nghĩa chung. OpenScholar thắng ở một nhiệm vụ mà toàn bộ pipeline đã được thiết kế chính xác cho nó: tìm đúng paper, lấy đúng passage, tổng hợp và kiểm tra citation.
Đây là một khác biệt về kiến trúc tư duy. Với general LLM, kiến thức chủ yếu phải nằm trong weights hoặc context mà người dùng cung cấp. Với scientific system, weights chỉ là một phần. Database, retriever và cơ chế kiểm chứng có thể chứa phần kiến thức cập nhật; model tập trung vào việc đặt câu hỏi đúng và kết nối bằng chứng.
Khi literature tiếp tục tăng, cách làm này còn có một lợi thế khác: update database rẻ hơn retrain một model nghìn tỷ tham số mỗi khi có vài trăm nghìn paper mới.
LLaMat cho thấy “học đúng 30 tỷ token” có thể quan trọng hơn lớn thêm hàng chục lần
Materials science cung cấp một thí nghiệm khác. Nhóm IIT Delhi và cộng tác viên xây LLaMat bằng cách tiếp tục pretrain các base model LLaMA 2 7B và LLaMA 3 8B trên khoảng 30 tỷ token chuyên ngành, lấy từ xấp xỉ 4 triệu publication về materials, crystallographic information files và thảo luận cộng đồng. Sau đó họ instruction- và task-tune bằng hơn 175.000 cặp hỏi–đáp materials science.
Trong công trình công bố trên Nature Machine Intelligence tháng 2/2026, family LLaMat được đánh giá trên 42 task, từ hiểu ngôn ngữ chuyên ngành, structured information extraction tới tạo crystal structure. Nhóm báo cáo các model chuyên biệt này vượt các hệ thương mại Claude, GPT và Gemini trên nhiều benchmark vật liệu trong nghiên cứu.
Điều thú vị hơn là hiện tượng nhóm gọi là adaptation rigidity. Model đã trải qua quá nhiều general-purpose pretraining đôi khi khó hấp thụ kiến thức chuyên ngành qua continued pretraining hơn model ít “đóng cứng” hơn. Nói cách khác, một model tổng quát mạnh không nhất thiết là nguyên liệu tối ưu để biến thành chuyên gia.
Điều này đi ngược trực giác “hãy lấy model lớn nhất rồi fine-tune”. Với science, một base model vừa phải nhưng còn dễ thích nghi có thể hiệu quả hơn nếu dữ liệu domain đủ sạch, thuật ngữ được biểu diễn đúng và benchmark đo đúng thứ nhà khoa học thực sự cần.
Trong chemistry, vài nghìn molecule đúng domain có thể đáng giá hơn thêm hàng trăm nghìn molecule chung
Một nghiên cứu trên Journal of Cheminformatics tháng 8/2026 cho một ví dụ nhỏ hơn nhưng rất trực tiếp. Nhóm tác giả kiểm tra transformer cho molecular property prediction trên các endpoint ADME như solubility, permeability và microsomal stability.
Họ phát hiện tăng dữ liệu pretraining quá khoảng 400.000–800.000 molecule không tiếp tục cải thiện hiệu năng trên bảy dataset thử nghiệm. Ngược lại, domain adaptation bằng tối đa khoảng 4.000 molecule có liên quan trực tiếp, với objective dự đoán physicochemical property, cải thiện kết quả trên tất cả dataset được thử.
Model pretrain trên khoảng 400.000 molecule rồi được domain-adapt thậm chí vượt MolFormer lớn hơn trong thiết lập của nghiên cứu và đạt mức tương đương MolBERT. Kết quả này không tạo ra một định luật rằng “ít data tốt hơn nhiều data”. Nó chỉ ra rằng sau một điểm, độ liên quan của dữ liệu và objective huấn luyện có thể quan trọng hơn việc tiếp tục đổ thêm dữ liệu chung.
Biology cho thấy model vẫn hưởng lợi từ scale — nhưng compression có thể giữ phần kiến thức cần thiết
Nếu chỉ nhìn những ví dụ trên, rất dễ đi tới kết luận sai rằng science nên bỏ scaling hoàn toàn. Geneformer cho thấy câu chuyện phức tạp hơn.
Trong nghiên cứu Nature Computational Science năm 2026, nhóm của Christina Theodoris xây Genecorpus-104M với khoảng 104 triệu human single-cell transcriptome rồi pretrain các Geneformer từ 38 triệu tới 316 triệu tham số. Kết quả cho thấy model lớn hơn học nhanh hơn theo mỗi token và cải thiện một số zero-shot cell-level task.
Nhưng nhóm cũng thử quantization 4-bit. Các phiên bản quantized giữ gần như nguyên hiệu năng few-shot của model full precision 104M và 316M trong các task gene-level được đánh giá, trong khi fine-tuning chỉ cần khoảng 15% thời gian và 34% memory so với bản full precision ở cùng batch size.
Trong một ví dụ mà paper đưa ra, một màn in-silico perturbation kéo dài tương đương 30 ngày có thể giảm xuống dưới một tuần, với chi phí ước tính từ khoảng 25.000 USD xuống dưới 5.000 USD. Ở đây hướng “đi ngược scale” không phải huấn luyện model nhỏ ngay từ đầu, mà là học bằng model đủ lớn rồi nén nó để khoa học thực sự có thể triển khai.
“Model nhỏ chuyên ngành” không nhất thiết là một chatbot thu nhỏ
Trong AI for Science, parameter count còn dễ gây hiểu nhầm hơn trong chatbot. Một hệ 8B có thể đi kèm database 45 triệu paper. Một model materials 14B có thể gọi DFT code hoặc crystal generator. Một model biology vài trăm triệu tham số có thể được pretrain trên hơn 100 triệu cell.
Như vậy, sức mạnh của hệ không nằm hoàn toàn trong weights. Nó được phân bố qua model + dữ liệu + physics + scientific software + retrieval + simulator + instrument. Một model nhỏ kết nối đúng tool có thể giải một nhiệm vụ mà model lớn hơn phải “đoán bằng text”.
Đây cũng là lý do số tham số không thể dùng độc lập để kết luận chi phí. Training một model 8B trên 30 tỷ token vẫn rất tốn compute. DFT calculation hay molecular dynamics mà agent gọi có thể đắt hơn inference của LLM nhiều lần. Database chuyên ngành phải được curate và cập nhật. Và nếu model cần chạy hàng nghìn simulation để ra một candidate, tổng energy cost của workflow vẫn có thể lớn.
Có những trường hợp model lớn tổng quát vẫn thắng
Specialization cũng có giá của nó. Một nghiên cứu Digital Discovery năm 2026 về question answering trong water-splitting catalysis cho thấy HoneyBee-7B chuyên materials vẫn kém GPT-4o và LLaMA 3.3 70B trong một số thiết lập. Các tác giả cho rằng context window hạn chế và năng lực instruction-following nhỏ hơn đã làm mất lợi thế domain tuning.
Đây là lời nhắc quan trọng: model nhỏ không tự động trở thành chuyên gia chỉ vì được fine-tune trên vài paper. Nếu task đòi hỏi context dài, reasoning đa bước hoặc phối hợp nhiều dạng dữ liệu, scale vẫn hữu ích.
Con đường khả thi vì thế không phải “science bỏ model lớn”. Nó giống một kiến trúc phân tầng hơn: general model xử lý câu hỏi rộng và giao tiếp với người; domain model xử lý phần chuyên môn; retriever cung cấp bằng chứng mới; simulator kiểm tra constraint vật lý; tool model điều phối phần mềm; và ở tầng cuối, thí nghiệm xác nhận điều gì đúng trong thế giới thật.
Trong khoa học, “biết ít thứ hơn” đôi khi là một lợi thế thiết kế
Một model general-purpose được tối ưu để không biết trước nó sẽ được hỏi gì. Scientific AI thì thường biết khá rõ mình sống ở đâu: trong genome, vật liệu tinh thể, reaction chemistry hay protein design. Sự hẹp đó cho phép kỹ sư thay một phần scale bằng inductive bias, dữ liệu sạch và tool chuyên dụng.
MatBrain là ví dụ mới nhất: 30B không phải “nhỏ” theo tiêu chuẩn thông thường, nhưng vẫn nhỏ hơn một bậc so với model tổng quát hàng trăm tỷ hoặc nghìn tỷ tham số. Quan trọng hơn, nó không cố trở thành một model duy nhất làm tất cả; nó chia khoa học thành hai vai trò rồi để mỗi model học sâu phần của mình.
Bài toán tiếp theo sẽ không chỉ là model nào có nhiều tham số hơn. Với AI for Science, một câu hỏi thực dụng hơn đang nổi lên: bao nhiêu tham số là đủ khi model đã được cho đúng dữ liệu, đúng công cụ và đúng ràng buộc vật lý?
Nếu câu trả lời tiếp tục nghiêng về những hệ nhỏ hơn nhưng chuyên sâu hơn, cuộc đua AI trong phòng lab có thể trông rất khác cuộc đua chatbot. Thay vì một bộ não khổng lồ cố biết mọi thứ, mỗi lĩnh vực có thể có những “chuyên gia silicon” tương đối nhỏ — nhưng dành gần như toàn bộ năng lực của mình cho một lát rất hẹp của tự nhiên.
Nguồn: Nature Machine Intelligence – MatBrain; Chinese Academy of Sciences / SIAT; Nature – OpenScholar; Nature Machine Intelligence – LLaMat; Journal of Cheminformatics – domain adaptation; Nature Computational Science – Geneformer scaling and quantization; Digital Discovery – structured domain knowledge; Moonshot AI – Kimi K2; DeepSeek – DeepSeek-V3.