Một robot học đi qua 400 triệu bước mô phỏng: MorFiC thử “copy” kỹ năng sang cơ thể quadruped khác mà không học lại
MorFiC huấn luyện một policy locomotion trên template Unitree Go2 rồi dùng cùng trọng số để điều khiển các robot bốn chân có khối lượng, joint limit và actuator khác nhau. Policy đã chạy zero-shot trên Go1 thật, nhưng transfer vẫn suy giảm mạnh khi hình thái mục tiêu cách quá xa robot nguồn.
Để một robot bốn chân học chạy ổn định, reinforcement learning có thể cho nó ngã, đứng dậy, trượt chân và thử lại hàng trăm triệu bước trong simulation trước khi policy được đưa lên phần cứng thật. Vấn đề là kỹ năng thu được thường dính chặt với chính cơ thể đã dùng để học: đổi khối lượng thân, chiều dài chân, giới hạn joint hay sức motor, một gait đang ổn định có thể lập tức trở thành chuỗi lệnh khiến robot ngã.
Một nghiên cứu của University of Maryland và George Mason University đang thử làm phần kiến thức này dễ tái sử dụng hơn. Framework MorFiC được huấn luyện trên một template Unitree Go2 với morphology randomization, rồi dùng cùng policy weights để điều khiển các quadruped khác mà không fine-tune trên robot mục tiêu. Paper MorFiC: Fixing Value Miscalibration for Zero-Shot Quadruped Transfer đã được chấp nhận tại Conference on Robot Learning 2026.
Trong simulation, nhóm thử policy trên bảy hình thái gồm Go2, Go1, A1, AlienGo, Mini Cheetah, B1 và ANYmal-C. Trên phần cứng thật, cùng policy được triển khai lên Unitree Go1 và Go2 mà không fine-tune. Kết quả đáng chú ý nhất không phải robot đã có thể “copy kỹ năng sang bất kỳ cơ thể nào”, mà là nhóm tìm ra một lỗi ít được chú ý trong cách reinforcement learning đánh giá hành động khi cơ thể thay đổi.
Một gait không chỉ là thứ tự nhấc chân
Nếu hai robot đều có bốn chân và 12 joint, có vẻ hợp lý khi nghĩ policy đi bộ của robot này chỉ cần chuyển sang robot kia. Nhưng cùng một lệnh joint angle có thể tạo kết quả rất khác nếu một robot nặng hơn, motor khỏe hơn hoặc có chiều dài chân khác.
Khối lượng thay đổi moment quán tính. Joint limit quyết định chân có thể vươn tới đâu. Torque limit giới hạn mức lực motor có thể tạo. Ngay cả phân bố khối lượng giữa thân, đùi và cẳng chân cũng làm thay đổi cách cơ thể phản ứng khi một bàn chân chạm đất.
Policy locomotion vì thế thường học nhiều quy luật ngầm gắn với một embodiment cụ thể. Nó không chỉ học “đưa chân trái lên trước”, mà học rằng với một trạng thái joint và vận tốc nhất định, một action cụ thể có khả năng giữ thăng bằng và tạo ra bao nhiêu chuyển động ở tương lai.
Đây là lý do cross-embodiment transfer khó hơn việc copy file model sang một máy khác. File có thể giống hệt, nhưng vật lý mà output của file đó tác động lên đã thay đổi.
MorFiC sửa “người chấm điểm” thay vì chỉ làm policy lớn hơn
MorFiC được xây trên PPO, một dạng actor–critic reinforcement learning. Trong cấu trúc này, actor quyết định action robot nên thực hiện, còn critic ước lượng trạng thái hiện tại có giá trị bao nhiêu — nói đơn giản là robot đang ở một tình huống tốt hay xấu nếu muốn nhận reward dài hạn.
Nhóm nghiên cứu cho rằng critic trở thành một nút thắt khi cùng một hệ phải học qua nhiều biến thể cơ thể. Một pose giống nhau có thể rất tốt với robot nhẹ nhưng nguy hiểm với robot nặng. Nếu critic cố dùng một hàm giá trị chung và trung bình hóa hai trường hợp, nó có thể đánh giá sai action.
Sai số này không dừng ở critic. PPO dùng giá trị dự đoán của critic để tính advantage — tín hiệu cho biết một action tốt hơn hay tệ hơn kỳ vọng. Nếu critic chấm sai vì không hiểu cơ thể nào đang thực hiện action, actor cũng có thể được cập nhật theo hướng sai.
MorFiC giải quyết vấn đề bằng cách mô tả morphology bằng một vector chứa các thuộc tính như khối lượng các link và giới hạn joint. Vector này được mã hóa thành một latent representation rồi đưa vào cả actor lẫn critic. Với critic, nhóm dùng FiLM để điều biến các feature bên trong network theo morphology thay vì chỉ nối thêm vector cơ thể vào input.
Ý tưởng là cùng một trạng thái không còn được critic đánh giá trong chân không. Giá trị của nó được đặt trong bối cảnh: đây là trạng thái của một cơ thể có khối lượng, joint range và động lực học như thế nào.
“Huấn luyện trên một robot” thực ra vẫn có hàng nghìn phiên bản cơ thể trong simulation
Một chi tiết quan trọng là MorFiC không huấn luyện trên một Go2 hoàn toàn cố định. Nhóm dùng morphology randomization: mỗi environment trong simulator lấy template Go2 rồi thay đổi các thông số vật lý trong một phạm vi xác định.
Vector morphology có 11 thành phần liên quan tới khối lượng của các link và giới hạn joint. Khi một episode bắt đầu, simulator lấy một bộ thông số ngẫu nhiên rồi giữ cơ thể đó cố định cho đến hết episode. Điều này cho policy tiếp xúc với một vùng hình thái quanh Go2 thay vì chỉ một mẫu phần cứng duy nhất.
Việc gọi đây là “single-source training” vì thế có nghĩa nhóm không cần dataset hay model riêng của từng robot mục tiêu. Nó không có nghĩa policy chưa từng thấy biến thiên cơ thể nào trước khi transfer.
Các policy được huấn luyện trong Isaac Gym với 4.096 environment chạy song song, timestep 0,005 giây và tổng cộng 400 triệu simulation timestep. Trên GPU RTX 4090 laptop mà nhóm sử dụng, quá trình này mất khoảng hai giờ wall-clock. Domain randomization còn thay đổi friction, action latency, sensor noise và tạo các cú đẩy để tăng khả năng sim-to-real.
Con số 400 triệu bước cũng cho thấy “robot học đi” trong deep RL không giống một robot vật lý ngã 400 triệu lần trong phòng lab. Phần lớn thử–sai được nén vào hàng nghìn bản sao mô phỏng chạy đồng thời trên GPU; robot thật chỉ xuất hiện ở giai đoạn deployment và kiểm tra.
Cùng policy đã chạy trên Go1 thật mà không fine-tune
Trong simulation, MorFiC đạt tốc độ cao nhất trong năm trên bảy platform khi so với các baseline cross-morphology mà nhóm đánh giá. Trường hợp nổi bật là AlienGo: policy đạt khoảng 1,98 m/s, trong khi các biến thể PPO additive nội bộ của nhóm đều ở dưới khoảng 0,65 m/s.
Nhưng simulation chỉ là nửa câu chuyện. Nhóm còn đưa cùng policy lên hai robot thật. Với Unitree Go1, trong 10 trial robot đạt khoảng 1,4–1,7 m/s và hơn 80% lượt chạy không bị freeze hoặc gait failure; video và Figure 1 của paper cũng cho thấy nó phục hồi sau cú đẩy. Trên Go2 thật, policy đạt khoảng 1,1–1,3 m/s.
Không có fine-tuning task-specific sau khi policy được chuyển sang hai robot này. Đây là ý nghĩa của “zero-shot” trong nghiên cứu: model weights đã học không được cập nhật thêm cho target hardware.
Tuy nhiên, policy không hoàn toàn mù về cơ thể mới. MorFiC cần morphology descriptor của robot — các thông số vật lý và control liên quan — để điều kiện hóa network. Vì vậy “copy kỹ năng” ở đây nên được hiểu là tái sử dụng cùng một policy đã học, kèm mô tả của cơ thể mới, chứ không phải thả một neural network không biết gì về phần cứng vào bất kỳ robot nào.
Robot càng khác Go2, transfer càng dễ gãy
Giới hạn quan trọng nhất của paper xuất hiện ở hai target xa hơn vùng morphology huấn luyện: B1 và ANYmal-C.
Trong bảng chính, MorFiC giữ survival cao trên B1 nhưng chỉ di chuyển khoảng 0,21 m/s. Nhóm coi đây là một failure: robot có thể không ngã nhưng không tạo ra gait hữu ích. Với ANYmal-C, tốc độ cũng chỉ khoảng 0,25 m/s trong cấu hình chính. Chính tác giả nhấn mạnh rằng survival rate không thể được dùng một mình để tuyên bố transfer thành công.
Lý do có thể thấy ngay trong morphology descriptor. B1 nặng hơn rất nhiều so với vùng randomization của Go2; base mass mà paper liệt kê là khoảng 29,45 kg, trong khi range huấn luyện cho base mass chỉ khoảng 3,3–6,9 kg. ANYmal-C cũng có nhiều thông số vượt ra ngoài vùng support.
Nhóm thử mở rộng morphology randomization để bao gồm các cơ thể nặng hơn, nhưng policy trở nên thận trọng và chậm hơn thay vì giải quyết được B1. Đây là bằng chứng hữu ích chống lại một trực giác đơn giản: chỉ cần randomize rộng hơn là policy sẽ tự generalize tới mọi robot.
Tác giả vì thế đề xuất bước tiếp theo có thể là huấn luyện trên một số ít source robot thay vì một robot hoặc hàng trăm embodiment. Mục tiêu là giữ chi phí thấp hơn các phương pháp scaling nhưng mở rộng vùng morphology mà policy có thể xử lý ổn định.
“Cơ thể hoàn toàn khác” vẫn còn xa: paper hiện chỉ làm quadruped
MorFiC chưa cho thấy policy của robot bốn chân có thể được copy sang humanoid, hexapod hay cánh tay robot. Tất cả target trong nghiên cứu đều là quadruped với cấu trúc điều khiển đủ tương đồng để chia sẻ action và observation representation.
Ngay cả trong nhóm quadruped, các cơ thể quá xa nguồn vẫn gây failure. Vì vậy headline rộng kiểu “một robot học xong, kỹ năng có thể chạy trên bất kỳ hình hài nào” sẽ vượt quá kết quả hiện tại.
Tuy nhiên, MorFiC nằm trong một xu hướng lớn hơn của robot learning. Một hướng khác, nghiên cứu về embodiment scaling laws, đã procedurally tạo khoảng 1.000 embodiment và tìm thấy xu hướng generalization tốt hơn khi số loại cơ thể trong training tăng. Các hệ như CrossFormer còn thử chia sẻ policy giữa những lớp robot rất khác nhau như arm, quadruped, wheeled robot và quadcopter.
Hai hướng đặt ra hai chiến lược gần như đối lập. Một bên nói: hãy gom đủ nhiều robot và học những cấu trúc chung từ scale. MorFiC hỏi liệu ta có thể tìm đúng điểm hỏng trong thuật toán và đạt transfer tốt hơn mà không cần mở rộng training set tới hàng nghìn cơ thể hay không.
Nếu kỹ năng tách được khỏi cơ thể, economics của robot learning sẽ thay đổi
Hiện nay mỗi platform mới thường kéo theo một chuỗi công việc dài: dựng simulator, thiết kế reward, randomize động lực học, train policy, tune controller, rồi lặp lại sim-to-real. Nếu một phần lớn locomotion skill có thể được tái sử dụng, việc đổi sang hardware mới sẽ giống adaptation hơn là bắt đầu từ số không.
Điều đó đặc biệt quan trọng khi robot phần cứng thay đổi nhanh. Một nhà sản xuất có thể đổi motor, kích thước link hoặc phân bố pin giữa hai generation. Nếu mỗi thay đổi buộc toàn bộ locomotion stack phải học lại, software trở thành chi phí đi kèm với từng chassis.
MorFiC chưa xóa chi phí đó. Nó vẫn cần morphology descriptor chính xác, một vùng training đủ gần target và một cấu trúc quadruped tương thích. Hardware test cũng cho thấy latency, state-estimator drift, foot slip và gait không đều vẫn tạo failure dù model đã transfer thành công trong simulation.
Nhưng nghiên cứu đặt ra một mục tiêu quan trọng cho robotics: thay vì coi “kỹ năng” và “cơ thể” là một package không thể tách, hãy học representation đủ hiểu rằng cùng một mục tiêu — tiến về phía trước mà không ngã — cần được đánh giá khác nhau trên từng cơ thể.
Nếu hướng này mở rộng được từ các quadruped gần nhau sang những embodiment có topology thực sự khác, lúc đó việc “copy kỹ năng” giữa robot mới bắt đầu giống cách software được chuyển từ máy này sang máy khác. Hiện tại, MorFiC mới chứng minh một phiên bản hẹp hơn nhưng thực tế hơn: cùng một policy có thể sống sót qua một số thay đổi cơ thể mà không phải học lại từ đầu — miễn là cơ thể mới chưa quá xa thứ nó đã được chuẩn bị để hiểu.