950 AI agent sàng lọc khoảng 200.000 reverse transcriptase trong 21 giờ: Thứ chúng tìm thấy là một hệ enzyme chưa từng được mô tả
Anthropic cho khoảng 950 Claude agent rà soát dữ liệu reverse transcriptase ở quy mô hàng tỷ cụm protein. Một agent đi chệch khỏi nhiệm vụ chính, đọc trực tiếp đoạn DNA lân cận và phát hiện một mảng lặp bất thường; từ đó nhóm nghiên cứu xác định một hệ mới mang tên ART. Điểm quan trọng: chức năng sinh học của ART vẫn chưa được biết.
Một AI agent không tìm thấy hệ enzyme mới bằng cách tóm tắt vài chục paper. Nó đang lần theo một reverse transcriptase trong DNA của bacteriophage, kéo thêm đoạn trình tự nằm cạnh gene này vào context và nhận ra một thứ không nằm trong mục tiêu ban đầu: nhiều đoạn DNA lặp lại, cách nhau bởi những vùng trình tự khác nhau.
Phát hiện đó xuất hiện trong một chiến dịch genome mining của nhóm life sciences mới tại Anthropic. Theo công bố của Anthropic, khoảng 950 Claude agent chạy trong 21 giờ, sử dụng khoảng 210 triệu token, thu thập hơn 200.000 reverse transcriptase (RT), lọc ra khoảng 3.500 hệ ứng viên và cuối cùng tạo báo cáo cho 20 trường hợp được đánh giá đáng chú ý nhất.
Technical report đi sâu hơn vào quy mô dữ liệu: các agent khảo sát locus RT trên khoảng 1,9 tỷ cụm protein. Thứ chúng tìm thấy sau cùng không phải một enzyme hoàn toàn chưa từng xuất hiện trong database. Reverse transcriptase đó đã được ghi nhận trước đây. Điều mới là hệ thống bao quanh nó: một mảng DNA lặp không mã hóa, RT và một gene đối tác nằm cạnh nhau theo một cấu trúc chưa được mô tả như một họ sinh học riêng.
Nhóm đặt tên cho hệ này là array-associated reverse transcriptases, viết tắt là ART.
200.000 không phải 200.000 gene được “đọc” như một cuốn sách
Con số trong headline rất dễ bị hiểu sai. Anthropic không đưa 200.000 gene nguyên vẹn cho một mô hình rồi yêu cầu nó đọc tuần tự. Pipeline trước tiên gom và tổ chức các reverse transcriptase cùng vùng genome lân cận, sau đó nhiều phiên Claude Code được phân công điều tra những họ và mối liên hệ khác nhau.
Reverse transcriptase là enzyme có khả năng sao chép RNA thành DNA. Chúng nổi tiếng nhờ retrovirus, nhưng trong vài năm gần đây các nghiên cứu genome mining đã cho thấy RT còn xuất hiện trong nhiều hệ thống phòng vệ và cơ chế di truyền khác của vi khuẩn và phage. Vấn đề không còn là thiếu dữ liệu. Ngược lại, lượng trình tự đã lớn đến mức phần khó nằm ở việc quyết định đâu là thứ lạ đáng để một nhà sinh học nhìn kỹ hơn.
Đây chính là phần Anthropic muốn kiểm tra với agent. Thay vì chỉ chạy một bộ lọc cố định tìm motif đã biết, mỗi agent có thể đọc literature, chạy công cụ phân tích, kiểm tra các gene lân cận, loại bỏ giả thuyết và mở nhánh điều tra mới khi gặp bất thường.
Trong technical report Autonomous AI Agents Discover Reverse Transcriptases with Tandem Repeat Arrays, các tác giả mô tả kiến trúc có worker thực hiện nhiệm vụ, supervisor đánh giá kết quả và các agent cùng dùng một hồ sơ nghiên cứu chung. Chiến dịch diễn ra mà không có con người can thiệp trong quá trình chạy; báo cáo cuối cùng sau đó mới được chuyển cho các nhà khoa học xem xét.
Phát hiện quan trọng xuất hiện ở một nhánh không phải mục tiêu ban đầu
ART không nổi lên đơn giản vì nó có điểm số cao nhất trong một bảng xếp hạng. Agent ban đầu đang điều tra một RT ở phage và mối liên hệ với một gene RNA polymerase gần đó. Nó kết luận gene này không phải partner chuyên biệt như giả thuyết ban đầu, nhưng RT vẫn đủ lạ để tiếp tục theo dõi.
Ở một nhiệm vụ nối tiếp, một agent lấy trực tiếp đoạn DNA phía trước RT. Khi nhìn vào chuỗi nucleotide thô, nó nhận ra các đoạn lặp theo chu kỳ và bắt đầu đo khoảng cách giữa chúng, so sánh với những hệ đã biết rồi tìm literature xem cấu trúc này từng được báo cáo hay chưa.
Đó là khác biệt đáng chú ý giữa công việc này và một hệ thống chỉ sinh bản tóm tắt. Agent không chỉ tổng hợp tri thức đã có. Nó dùng dữ liệu gốc, phát hiện một mẫu bất thường chưa nằm trong câu hỏi ban đầu và tự tạo thêm một giả thuyết để kiểm tra.
Các phân tích tiếp theo tìm thấy 95 cụm RT thuộc họ ART trong jumbo phage và các viral contig dự đoán. 28 cụm có mảng lặp có thể phát hiện ở phía upstream. Mỗi locus còn đi kèm một gene partner nằm ngay phía sau RT.
Vì sao ART khiến người ta nghĩ tới CRISPR?
Điểm dễ gây chú ý nhất là mảng DNA lặp. ART có những repeat ngắn xen kẽ các spacer dài khoảng 120–220 nucleotide. Bố cục “repeat–spacer–repeat–spacer” gợi nhớ cách CRISPR array được tổ chức.
Nhưng hai hệ không giống nhau đủ để gọi ART là một loại CRISPR mới. Spacer của ART dài hơn nhiều so với spacer CRISPR điển hình, và locus ART không có các gene Cas đặc trưng. Hiện cũng chưa có bằng chứng cho thấy ART có thể cắt DNA, chỉnh sửa gene hay hoạt động như một hệ miễn dịch thích nghi.
Điều khiến so sánh với CRISPR chưa thể bỏ qua hoàn toàn là RNA. Dữ liệu từ nhiễm Staphylococcus phage SA1 cho thấy mảng ART được phiên mã mạnh và xuất hiện thành những RNA riêng biệt. Ở mốc 15 phút trong dataset được phân tích, RNA từ array có thể chiếm tới khoảng 8% RNA của phage.
Một enzyme đi cùng một tập hợp RNA khác nhau là kiến trúc đủ bất thường để đặt câu hỏi liệu các RNA này có đóng vai trò hướng dẫn hay làm substrate cho RT hay không. Nhưng đó mới là giả thuyết.
Thứ chưa được chứng minh quan trọng không kém thứ đã tìm thấy
Technical report rất rõ về giới hạn: nhóm chưa chứng minh được RT của ART có hoạt tính trong hệ này, chưa chứng minh các RNA từ array là substrate của enzyme và chưa biết chức năng sinh học của ART.
Nói cách khác, “AI tìm ra một hệ enzyme mới” không đồng nghĩa “AI tìm ra công cụ chỉnh sửa gene mới”. Phần mới hiện được xác lập chủ yếu ở cấp tổ chức genome: một họ RT liên kết lặp lại với array không mã hóa và partner gene theo cấu trúc chưa được mô tả trước đây. Cơ chế hóa sinh và vai trò trong vòng đời phage vẫn phải được làm rõ bằng thí nghiệm.
Công trình hiện là preprint/technical report, chưa qua peer review. Anthropic cũng là đơn vị xây dựng model, thiết kế pipeline và thực hiện nghiên cứu, nên khả năng tái lập độc lập vẫn là một câu hỏi quan trọng.
Toàn bộ wet-lab work tại phòng thí nghiệm Anthropic được thực hiện bởi các nhà khoa học con người. Công ty cho biết lab chỉ vận hành ở mức BSL-1 và BSL-2 và không làm việc với pathogen có khả năng lây nhiễm người.
Điểm đáng chú ý của 950 agent không nằm ở việc “đọc nhanh”
Một cách nhìn hẹp sẽ coi đây là bài toán throughput: 950 agent có thể xử lý lượng dữ liệu mà một nhà nghiên cứu mất nhiều tuần hoặc nhiều tháng để sàng lọc. Nhưng ART cho thấy một khả năng khác đáng quan tâm hơn — phát hiện ngoại lệ.
Các pipeline bioinformatics truyền thống rất mạnh khi người nghiên cứu biết mình cần tìm gì: một motif, một domain, một khoảng cách gene hay một họ protein cụ thể. Chúng yếu hơn khi tín hiệu quan trọng là một chi tiết không nằm trong specification ban đầu. LLM agent có thể có lợi thế ở khoảng trống này vì nó có thể nhìn dữ liệu, nhận ra một cấu trúc “kỳ lạ”, đặt câu hỏi mới rồi mở một nhánh điều tra.
Nhóm tác giả còn kiểm tra trực tiếp điều đó. Khi trình tự locus được đưa thẳng vào context, các model Claude mạnh nhất nhận diện array trong ít nhất 90% lần thử. Nhưng khi model phải tự dùng tool và mở file, tỷ lệ nhận diện có thể giảm mạnh; trong nhiều lượt, agent thậm chí không đọc đủ một đoạn DNA liên tục dài 200 nucleotide. Những lần thực sự đọc sequence có tỷ lệ nhận ra array cao hơn rõ rệt.
Chi tiết này làm câu chuyện bớt giống một tuyên bố rằng “AI đã trở thành nhà khoa học tự trị”. Năng lực model chỉ là một phần. Thiết kế agent, cách dữ liệu được đưa vào context, toolchain và khả năng buộc hệ thống nhìn vào bằng chứng gốc vẫn quyết định rất nhiều.
Bài kiểm tra tiếp theo nằm trong wet lab, không phải thêm agent
ART sẽ chỉ trở nên thực sự thú vị về mặt sinh học nếu các thí nghiệm tiếp theo xác định RT làm gì, partner protein có vai trò nào và các RNA từ repeat array có tương tác chức năng với enzyme hay không. Nếu cấu trúc này thực sự tạo ra một cơ chế có thể lập trình, giá trị công nghệ có thể lớn; nếu không, nó vẫn là một hệ phage mới đáng nghiên cứu về tiến hóa và sinh học phân tử.
Nhưng dù ART cuối cùng làm gì, chiến dịch này đã đặt ra một chuẩn đo lường cụ thể hơn cho “AI for science”. Kết quả tốt không phải một bản tóm tắt paper trôi chảy hơn. Nó là một giả thuyết mới xuất phát từ dữ liệu gốc, đủ cụ thể để một nhà khoa học có thể mang vào phòng thí nghiệm và cố chứng minh nó sai.