Robot thường phải học lại khi đổi sang bàn tay khác: AI mới muốn kỹ năng đi theo “bộ não” thay vì phần cứng

OPFA đưa hành động của nhiều gripper và bàn tay robot vào một latent space chung, để cùng một policy có thể học từ dữ liệu của nhiều embodiment. Trong thử nghiệm trên 11 end-effector, một bàn tay mới chỉ cần khoảng 8 demonstration để tiến gần hiệu năng của model học riêng với 72 demonstration.

Robot thường phải học lại khi đổi sang bàn tay khác: AI mới muốn kỹ năng đi theo “bộ não” thay vì phần cứng

Một robot đã học cách nhặt chai bằng gripper hai ngón không thể đơn giản mang kỹ năng đó sang một bàn tay năm ngón. Vấn đề không chỉ nằm ở việc phần cứng trông khác nhau. Hai thiết bị có số khớp khác nhau, phạm vi chuyển động khác nhau và quan trọng nhất là “ngôn ngữ hành động” mà neural network phải xuất ra cũng khác.

Đây là một trong những lý do dữ liệu robot khó scale giống dữ liệu ảnh hay văn bản. Một triệu trajectory thu bằng một loại bàn tay không tự động trở thành một triệu trajectory hữu ích cho robot dùng bàn tay khác. Nhiều hệ thống hiện phải fine-tune lại, thêm decoder riêng hoặc thu thêm lượng lớn demonstration mỗi khi thay end-effector.

Một nhóm từ Shanghai AI Laboratory, Tsinghua University, The Chinese University of Hong Kong, University of Science and Technology of China và NVIDIA đang thử tách phần “biết phải làm gì” khỏi phần “cơ thể phải cử động thế nào”. Framework của họ có tên One-Policy-Fits-All, hay OPFA, được trình bày tại ICRA 2026.

Ý tưởng trung tâm là để policy không dự đoán trực tiếp một vector góc khớp chỉ có ý nghĩa với một bàn tay cụ thể. Thay vào đó, kỹ năng được biểu diễn trong một latent action space chung dựa trên hình học. Một decoder duy nhất sau đó dịch biểu diễn này thành lệnh khớp phù hợp với từng end-effector.

Cách nói “kỹ năng đi theo bộ não thay vì phần cứng” vì vậy khá gần với mục tiêu của nghiên cứu, nhưng cần giới hạn đúng phạm vi. OPFA chưa chứng minh một bộ não robot có thể được cắm vào bất kỳ humanoid hay cánh tay công nghiệp nào mà chạy ngay. Paper tập trung chủ yếu vào sự khác biệt giữa gripper và bàn tay robot, với 11 end-effector khác nhau và bốn loại được thử trên phần cứng thật.

Vì sao đổi một bàn tay lại có thể buộc robot học lại?

Giả sử một robot dùng gripper hai ngón. Action của nó có thể gồm vị trí cổ tay, góc xoay và một biến đơn giản như mở hoặc đóng gripper. Đổi sang một bàn tay dexterous năm ngón, action space lập tức có thêm nhiều khớp cho ngón cái, ngón trỏ, ngón giữa và các chuyển động dạng xoay, gập khác nhau.

Nếu neural network được huấn luyện để trực tiếp dự đoán các góc khớp của phần cứng thứ nhất, output đó không có nghĩa vật lý trên phần cứng thứ hai. Một policy từng học “đóng gripper tới 40 mm” không có sẵn câu trả lời cho câu hỏi năm ngón phải cong bao nhiêu để tạo một grasp tương đương.

Một cách phổ biến là chuẩn hóa action ở mức cao hơn, chẳng hạn vị trí và orientation của end-effector. Cách này hoạt động khá tốt với các gripper đơn giản. Nhưng khi bàn tay có nhiều ngón, chính cấu hình từng ngón có thể quyết định một task có thành công hay không. Ép tất cả về một lệnh “grasp” chung có thể làm mất thông tin cần thiết.

Cách khác là dùng một backbone chung nhưng tạo action head hoặc decoder riêng cho từng robot. Điều này cho phép chia sẻ perception và một phần kiến thức cấp cao, nhưng decoder của bàn tay A vẫn chủ yếu được học từ dữ liệu của A. Khi một embodiment mới chỉ có vài demonstration, chính lớp cuối này có thể trở thành bottleneck.

OPFA biến hình học bàn tay thành một ngôn ngữ trung gian

OPFA cố xây một biểu diễn ở giữa hai cực: đủ trừu tượng để dùng chung giữa nhiều bàn tay, nhưng vẫn giữ thông tin hình học cần thiết để điều khiển từng ngón.

Nhóm gọi biểu diễn này là Geometry-Aware Latent Representation, hay GaLR. Thay vì căn chỉnh các robot vào một mẫu bàn tay người cố định, hệ thống lấy chính hình học reachable của mỗi end-effector làm đầu vào.

Trong giai đoạn huấn luyện GaLR, nhóm lấy các cấu hình khớp khả thi của một bàn tay, chạy forward kinematics rồi chuyển hình học tương ứng thành point cloud. Một encoder gồm 3D convolution và geometric transformer đọc point cloud này để học biểu diễn latent.

Điểm quan trọng là latent không chỉ mã hóa “góc khớp số 3 đang bằng bao nhiêu”. Nó cố mã hóa cấu hình không gian mà các khớp đó tạo ra. Hai bàn tay có số motor rất khác nhau vẫn có thể tạo ra những hình học chức năng tương tự, chẳng hạn các ngón đang khép quanh một vật hình trụ.

Nhóm còn thêm semantic positional encoding để nói cho model biết các điểm thuộc palm, thumb hay các đoạn tương ứng của những ngón khác. Mục tiêu là giúp transformer nhận ra cấu trúc chức năng thay vì coi point cloud như một đám điểm vô danh.

Một decoder chung thay vì một “bộ phiên dịch” cho mỗi bàn tay

Sau latent space là bài toán khó thứ hai: biến ý định chung trở lại action mà hardware thực sự thực hiện được.

Nhiều phương pháp cross-embodiment trước đây dùng decoder riêng cho từng morphology. OPFA thiết kế một unified latent retargeting decoder. Có thể hình dung decoder này dự đoán một tập khớp “siêu tập hợp” gồm các loại chuyển động có thể xuất hiện trên nhiều bàn tay. Với một end-effector cụ thể, hệ thống chỉ lấy những joint thực sự tồn tại trên phần cứng đó.

Nhờ vậy, decoder cũng được học từ dữ liệu của nhiều embodiment thay vì mỗi decoder chỉ nhìn thấy một robot. Đây là một chi tiết quan trọng đối với few-shot learning: khi hardware mới chỉ có vài trajectory, phần chuyển latent thành chuyển động thực tế không phải bắt đầu gần như từ con số 0.

Sau khi GaLR và decoder được học, chúng có thể được gắn vào một visuomotor policy. Trong paper, nhóm dùng 3D Diffusion Policy, hay DP3, làm backbone. Policy nhận quan sát 3D cùng trạng thái robot rồi dự đoán action trong latent space; decoder mới chuyển output latent thành joint command của bàn tay đang được sử dụng.

11 bàn tay và gripper, từ hai ngón tới năm ngón

Nhóm đánh giá framework trên tổng cộng 11 embodiment. Danh sách trải từ UMI và Robotiq hai ngón, Robotiq ba ngón, tới các bàn tay bốn hoặc năm ngón như Leap Hand, Allegro, Shadow Hand, Ability Hand, Inspire Hand và XHand.

Các thử nghiệm gồm 14 task trong simulation và thế giới thật, với các thao tác như kéo ấm nước, bấm nút, nhấc bucket, pick-and-place, rót, quét bằng chổi, rút tissue, đóng drawer và ấn syringe.

Một bài test được thiết kế để xem dữ liệu của robot này có giúp robot khác học phần không gian mà nó chưa từng thấy hay không. Mỗi embodiment chỉ thu demonstration ở một vùng riêng trên workspace, rồi các dataset được co-train. Khi evaluation diễn ra ở vùng từng chỉ xuất hiện trong dữ liệu của embodiment khác, model học riêng cho từng bàn tay thường thất bại nặng.

Với Inspire Hand, chẳng hạn, OPFA đạt 83% ở task kettle so với 30% khi chỉ train dữ liệu của chính bàn tay đó; ở bucket, kết quả lần lượt là 75% và 3%. Trên XHand, bucket tăng từ 1% ở single-source training lên 94% với OPFA. Những con số này không chứng minh policy hiểu một kỹ năng phổ quát, nhưng cho thấy dữ liệu hình học và trajectory của embodiment khác đang thực sự được tái sử dụng.

Trong thử nghiệm co-training chín end-effector cho task nhặt chai xịt, OPFA cải thiện success rate trung bình khoảng 19,8 điểm phần trăm so với cách co-train nhưng giữ decoder riêng. Với chỉ tám trajectory cho mỗi embodiment, framework đạt trung bình 62,1% success và 93% trên Leap Hand, cao hơn hơn 20 điểm phần trăm so với baseline co-training ngây thơ mà nhóm sử dụng.

Tám demonstration thay vì 72 là kết quả gần nhất với ý “đổi cơ thể không cần học lại từ đầu”

Bài test few-shot là phần trực tiếp nhất của câu chuyện. Nhóm đặt câu hỏi: nếu một bàn tay mới xuất hiện, dữ liệu từ những embodiment trước có giúp giảm bao nhiêu dữ liệu mới cần thu?

Trong task nhặt banana, họ thu 72 trajectory cho Inspire Hand và 72 trajectory cho XHand. Khi một bên chỉ có lượng dữ liệu nhỏ nhưng được co-train với 72 demonstration của bàn tay kia, OPFA tiến tới hiệu năng tương đương model đã được train đầy đủ trên 72 demonstration của chính end-effector mới chỉ với khoảng tám demonstration.

Điểm đáng chú ý không phải robot hoàn toàn không cần dữ liệu mới. Nó vẫn cần. Khác biệt nằm ở chỗ tám demonstration giờ có thể tận dụng những kỹ năng hình học mà policy đã học từ embodiment khác, thay vì phải tự xây lại toàn bộ mapping từ quan sát tới chuyển động.

Đây gần với cách một người đã biết dùng tua-vít thích nghi khi đổi sang một chiếc tua-vít có tay cầm khác: kỹ năng cấp cao được giữ lại, còn hệ vận động chỉ cần hiệu chỉnh cho hình học mới. OPFA đang cố tạo một tầng biểu diễn tương tự cho robot, dù phép so sánh này không có nghĩa model có mô hình cơ thể hay khả năng thích nghi linh hoạt như con người.

Thử nghiệm thật vẫn dùng cùng một cánh tay UR5e

Đây là giới hạn quan trọng nhất nếu gọi OPFA là “body-agnostic”. Trong thí nghiệm thực tế, nhóm không chuyển policy giữa một humanoid, một robot công nghiệp sáu trục và một robot di động có cánh tay. Họ dùng cùng một UR5e, cùng setup camera Azure Kinect, rồi thay bốn end-effector: XHand, Inspire Hand, Leap Hand và Robotiq-2F-85.

Với mỗi task và embodiment, nhóm thu 24 demonstration bằng teleoperation. Một checkpoint thống nhất sau đó được đánh giá trên các end-effector, mỗi trường hợp chạy 10 trial. OPFA thường đạt kết quả cao nhất trong bảng đánh giá, chẳng hạn 100% ở nhiều cặp task–hand như XHand với tissue, broom, mango và syringe.

Nhưng ngay trong các kết quả này cũng có ngoại lệ. Inspire Hand trên task tissue đạt 60% với OPFA, thấp hơn mức 70% của cả hai baseline. Điều đó nhắc rằng shared latent space không tự động tốt hơn cho mọi morphology và mọi task.

Một số task cũng không khả thi với tất cả hardware. Robotiq-2F chẳng hạn bị loại khỏi một số bài cần chức năng mà hình học của gripper không hỗ trợ. Một policy chung không thể xóa giới hạn cơ khí: nếu bàn tay không có joint hoặc contact surface cần thiết, “bộ não” không thể tạo nó bằng phần mềm.

OPFA chưa phải plug-and-play cho robot hoàn toàn mới

Cụm “one policy fits all” dễ tạo cảm giác rằng bất kỳ robot nào cũng có thể tải checkpoint rồi làm việc ngay. Dữ liệu trong paper chưa cho phép kết luận như vậy.

Thứ nhất, zero-shot generalization trong các thí nghiệm chính chủ yếu kiểm tra một embodiment đi vào vùng không gian hoặc object distribution mà dữ liệu của embodiment khác đã bao phủ. Các embodiment đó vẫn thuộc tập co-training. Với một end-effector mới, kết quả mạnh nhất mà paper nhấn mạnh là few-shot, không phải zero-shot: khoảng tám demonstration thay vì hàng chục.

Thứ hai, framework cần mô hình hình học và forward kinematics của phần cứng để tạo reachable-state point cloud và ánh xạ joint. Điều này hợp lý với robot công nghiệp có URDF và thông số rõ ràng, nhưng vẫn là một bước tích hợp phần cứng.

Thứ ba, các task trong nghiên cứu là những thao tác được xác định trước và môi trường thí nghiệm tương đối có cấu trúc. OPFA giải bài toán action representation và data sharing giữa embodiment; nó không tự giải quyết perception trong môi trường mở, planning dài hạn tùy ý hay khả năng tự khám phá skill mới.

Nếu kỹ năng tách khỏi hardware, dữ liệu robot mới có cơ hội scale

Giá trị dài hạn của cross-embodiment learning nằm ở economics của dữ liệu hơn là một demo robot cụ thể.

Hiện nay, một lab có thể bỏ hàng trăm giờ thu teleoperation cho bàn tay A, nhưng khi chuyển sang bàn tay B, phần dữ liệu đó chỉ được dùng lại một phần. Điều này khiến mỗi loại robot phát triển thành một “đảo dữ liệu” riêng. Với foundation model cho robotics, đây là vấn đề lớn: số lượng morphology trên thị trường sẽ tiếp tục tăng, trong khi chi phí thu trajectory thật vẫn cao.

Nếu một action latent có thể giữ lại những thành phần thực sự chung giữa nhiều cơ thể — chẳng hạn “đưa bề mặt tiếp xúc này tới cạnh vật thể”, “khép các ngón quanh hình trụ” hay “giữ object trong khi cổ tay xoay” — dataset của một robot có thể trở thành dữ liệu học cho robot khác thay vì bị khóa vào đúng model phần cứng đã tạo ra nó.

OPFA cho thấy hướng này khả thi trên phạm vi tương đối rộng hơn nhiều nghiên cứu chỉ dùng parallel-jaw gripper: hai, ba, bốn và năm ngón với số bậc tự do khác nhau đều có thể chia sẻ một latent space và một decoder thống nhất.

Bước khó tiếp theo là đẩy ý tưởng ra ngoài bàn tay. Một “bộ não” thực sự ít phụ thuộc cơ thể sẽ phải xử lý khác biệt cả về chiều dài cánh tay, số khớp, camera, tactile sensor, tốc độ motor, payload, mobility và dynamics. Khi đó, không chỉ action space mà cả perception và khả năng vật lý của robot đều thay đổi.

OPFA chưa đi tới đó. Nhưng nó đặt ra một cách chia bài toán rõ ràng: thay vì buộc neural network ghi nhớ cách từng motor phải quay cho từng mẫu hardware, hãy để policy học một biểu diễn kỹ năng chung rồi dịch nó xuống cơ thể cụ thể ở bước cuối. Nếu cách tách này tiếp tục hoạt động khi số morphology tăng lên, “mua robot mới” trong tương lai có thể bớt giống việc đào tạo một công nhân lại từ đầu và gần hơn với việc cài một driver cho một bộ kỹ năng đã có.

Nguồn chính: One-Policy-Fits-All: Geometry-Aware Action Latents for Cross-Embodiment Manipulation, ICRA 2026; project page chính thức; và mã nguồn chính thức.

Chia sẻ