Humanoid robot đang chờ “khoảnh khắc ChatGPT”: Nút thắt giờ không còn nằm ở cơ thể robot
Humanoid đã có thể chạy, nhảy, giữ thăng bằng và thao tác bằng hai tay. Cuộc đua năm 2026 đang dịch chuyển sang một vấn đề khó hơn: AI đủ tổng quát để robot hiểu lệnh, thích nghi với môi trường mới và học kỹ năng mà không phải lập trình lại từng tác vụ.
Một humanoid robot biết chạy nhanh, giữ thăng bằng sau cú đẩy, nhảy qua chướng ngại vật hay bê một thùng hàng giờ đây không còn là hình ảnh quá hiếm.
Điều vẫn hiếm là một robot có thể bước vào một căn phòng chưa từng thấy, nghe câu “hãy dọn chỗ này”, tự hiểu đồ vật nào cần cất ở đâu, xử lý một chiếc áo bị vò khác với một chiếc cốc thủy tinh, tránh một người bất ngờ đi ngang và hoàn thành công việc mà không cần kỹ sư đứng phía sau sửa từng bước.
Đó là khoảng cách mà ngành humanoid robotics đang cố vượt qua.
Tại World Robot Conference ở Bắc Kinh ngày 20/8/2026, CEO Unitree Wang Xingxing nói ngành robot đang tiến gần một “ChatGPT moment”: thời điểm một hệ AI đủ tổng quát để robot có thể nhận lệnh bằng ngôn ngữ tự nhiên rồi thực hiện rất nhiều công việc trong môi trường chưa biết trước. Nhưng ông cũng thận trọng cho rằng đột phá ở tầng phần mềm này có thể còn mất từ vài năm tới một thập kỷ.
Nhận định đó phản ánh một thay đổi quan trọng của ngành. Trong nhiều năm, câu hỏi lớn nhất là liệu có thể chế tạo một cơ thể robot hai chân đủ khỏe, đủ nhanh và đủ ổn định hay không. Đến năm 2026, câu trả lời ngày càng nghiêng về “có”.
Nhưng có một cơ thể giống người chưa tạo ra một người lao động giống người.
Nút thắt đang dịch chuyển từ việc làm cho robot đứng được sang làm cho robot biết phải làm gì tiếp theo.
Phần cứng humanoid đã tiến nhanh đến mức nào?
Những màn trình diễn gần đây cho thấy locomotion — khả năng đi, chạy và giữ thăng bằng — đã tiến rất xa so với một thập kỷ trước.
Unitree đã biến humanoid thành sản phẩm có thể sản xuất với số lượng lớn hơn thay vì chỉ là prototype phòng lab. Boston Dynamics chuyển Atlas từ hydraulic sang electric. Figure, Agility Robotics, Apptronik, UBTECH, AgiBot và nhiều hãng Trung Quốc đang đưa robot vào nhà máy, kho vận hoặc các chương trình thử nghiệm thực tế.
Reuters ghi nhận World Robot Conference 2026 có hơn 300 doanh nghiệp và hơn 2.000 sản phẩm robot trưng bày. Những demo không còn chỉ là đi bộ: robot phân loại kiện hàng, lắp linh kiện, phục vụ bán lẻ và xử lý các công việc gia đình.
Figure cho biết Figure 02 từng làm việc trên dây chuyền BMW, còn thế hệ Figure 03 đã được đưa trở lại nhà máy BMW trong năm 2026. Agility Robotics đã triển khai Digit cho các công việc logistics lặp lại.
Nói cách khác, câu hỏi “humanoid có thể đi lại trong không gian dành cho con người không?” không còn là bài toán chưa có lời giải.
Tuy vậy, gọi phần cứng là “đã xong” sẽ là quá mức. Pin, bàn tay, độ bền actuator, tải trọng, an toàn va chạm và thời gian hoạt động liên tục vẫn là những giới hạn thực tế.
Một benchmark của Fraunhofer IPA trên Unitree G1, chẳng hạn, đo thời gian hoạt động khoảng 1 giờ 49 phút trong kịch bản vừa đứng vừa đi. Nghiên cứu cũng chỉ ra lực va chạm có thể cao hơn ngưỡng phù hợp để làm việc an toàn cạnh con người nếu không có biện pháp kiểm soát thích hợp.
Vì vậy, cách nói chính xác hơn là: cơ thể humanoid đã đủ tốt để phần mềm trở thành nút thắt nổi bật nhất ở nhiều use case, chứ phần cứng chưa biến thành vấn đề đã giải quyết hoàn toàn.
Robot có thể làm backflip nhưng vẫn lúng túng với một chiếc áo
Điều này nghe nghịch lý cho tới khi nhìn cách hai bài toán khác nhau.
Một cú nhảy có thể rất khó về control, nhưng môi trường và mục tiêu tương đối rõ. Robot biết trạng thái cơ thể mình, biết quỹ đạo cần đạt và controller có thể được tối ưu hàng triệu lần trong simulation.
Gấp một chiếc áo trong nhà thật lại là bài toán mở.
Chiếc áo có thể nằm ngược, bị che một phần, dính với quần áo khác hoặc biến dạng theo cách chưa từng xuất hiện trong dữ liệu huấn luyện. Robot phải nhận ra vật thể, đoán trạng thái ba chiều từ camera, lựa chọn điểm cầm, điều chỉnh lực nắm bằng xúc giác và sửa kế hoạch nếu vải trượt khỏi tay.
Con người giải quyết hàng trăm tình huống như vậy mỗi ngày mà gần như không nhận ra mình đang làm computer vision, vật lý mềm, planning và force control đồng thời.
Humanoid phải học tất cả những điều đó.
“ChatGPT moment” của robotics nghĩa là gì?
ChatGPT không phải mô hình ngôn ngữ đầu tiên. Điều tạo ra bước ngoặt cuối năm 2022 là một hệ thống đủ tổng quát, đủ dễ dùng và đủ linh hoạt để hàng trăm triệu người có thể đưa cho nó những yêu cầu chưa được lập trình trước.
Ngành robotics đang tìm một bước ngoặt tương tự.
Robot truyền thống hoạt động tốt nhất khi môi trường rất có cấu trúc. Một cánh tay hàn trong nhà máy có thể lặp lại cùng quỹ đạo hàng triệu lần với độ chính xác cao. Nhưng nếu đổi vị trí linh kiện, thay loại sản phẩm hoặc yêu cầu nó làm nhiệm vụ hoàn toàn khác, kỹ sư thường phải lập trình lại.
Một humanoid “ChatGPT-like” sẽ hoạt động theo logic khác.
Người dùng có thể nói: “đặt tất cả chai nước lên kệ dưới, nhưng để các hộp dễ vỡ ở trên”. Robot phải hiểu câu đó, nhìn môi trường, xác định vật thể, lập kế hoạch rồi điều khiển toàn thân để hoàn thành.
Nó không cần từng thao tác đã được hard-code trước.
Đây là thứ thường được gọi là generalist robot policy hoặc embodied intelligence.
Foundation model đang đi từ chữ và ảnh sang hành động
Trong AI ngôn ngữ, foundation model được pretrain trên khối dữ liệu khổng lồ rồi thích nghi cho nhiều nhiệm vụ.
Robotics đang cố tái tạo công thức đó dưới dạng Vision-Language-Action model (VLA).
Đầu vào không chỉ là chữ. Model nhận camera, proprioception, đôi khi có touch hoặc audio. Đầu ra không chỉ là token. Nó phải sinh action: vị trí tay, vận tốc khớp, quỹ đạo chân hoặc lệnh cho controller thấp hơn.
Figure gọi hệ của mình là Helix. NVIDIA phát triển GR00T. Google DeepMind có Gemini Robotics. 1X phát triển Redwood cho robot gia đình NEO. Nhiều startup khác như Physical Intelligence, Skild AI và FieldAI cũng theo đuổi foundation model có thể điều khiển nhiều robot hoặc nhiều nhiệm vụ.
Điểm chung của các hệ này là tham vọng bỏ mô hình “mỗi task một policy” để tiến tới “một model, nhiều task”.
Figure Helix 02 cho thấy phần mềm đang nuốt dần controller truyền thống
Figure công bố Helix 02 vào tháng 1/2026 với một tuyên bố đáng chú ý: một neural system duy nhất có thể nhận dữ liệu từ toàn bộ sensor và điều khiển toàn bộ cơ thể.
Trong demo, robot tự đi quanh một căn bếp, mở máy rửa chén, lấy và đặt đồ vật trong một chuỗi công việc kéo dài khoảng bốn phút mà không reset giữa chừng.
Đến tháng 3, Figure trình diễn Helix 02 dọn phòng khách. Tháng 5, hai robot dùng cùng policy phối hợp dọn phòng ngủ và làm giường mà không có central planner hay kênh message passing trực tiếp giữa hai robot; mỗi máy tự quan sát hành động của máy còn lại.
Những kết quả này do Figure tự công bố và chưa phải benchmark độc lập cho mọi môi trường. Nhưng hướng kỹ thuật đáng chú ý: locomotion, manipulation và balance đang được gom vào một policy học máy thống nhất thay vì chia thành hàng loạt module được lập trình thủ công.
Đó là kiểu chuyển dịch từng xảy ra trong computer vision và speech recognition: pipeline gồm nhiều khối chuyên biệt dần được thay bằng model end-to-end lớn hơn.
Google muốn tách “bộ não cấp cao” và “phản xạ cơ thể”
Google DeepMind đi theo kiến trúc có phần khác.
Gemini Robotics 2 được giới thiệu tháng 7/2026 như VLA model cho whole-body intelligence. Song song, Gemini Robotics ER 2 đóng vai trò bộ não reasoning cấp cao: hiểu video, suy luận không gian, chia một mục tiêu thành nhiều bước và phối hợp nhiều robot.
ER 2 có thể giao phần execution motor cho VLA ở tầng dưới.
Kiến trúc này gần với cách con người hình dung hệ thần kinh: tầng cao quyết định “hãy dọn bàn”, còn các phản xạ và kỹ năng vận động xử lý chi tiết “đưa tay theo quỹ đạo nào”.
Google cũng có Gemini Robotics On-Device 2, tối ưu để chạy ngay trên thiết bị thay vì phụ thuộc hoàn toàn vào cloud.
Điều này quan trọng vì robot không thể chờ vài giây cho mỗi quyết định. Nếu một chiếc ly bắt đầu trượt khỏi tay, controller phải phản ứng theo millisecond.
NVIDIA muốn biến humanoid AI thành một platform
NVIDIA đang tiếp cận vấn đề giống cách hãng từng xây CUDA cho GPU: không chỉ bán compute mà xây cả software stack.
GR00T N1.6 là foundation model cho robot nói chung và humanoid nói riêng. Isaac Sim và Isaac Lab cung cấp simulation. Cosmos tạo world model và synthetic data. Jetson Thor cung cấp compute tại robot.
Tháng 5/2026, NVIDIA còn công bố một Isaac GR00T Reference Humanoid Robot cho nghiên cứu, kết hợp thân Unitree H2 Plus, bàn tay năm ngón Sharpa, Jetson Thor và bộ phần mềm GR00T.
Ý tưởng nằm phía sau động thái này rất giống PC reference design: nếu mỗi phòng lab phải tự chế tạo body, electronics, controller và data pipeline từ đầu, tiến bộ AI sẽ bị phân mảnh. Một platform chung giúp nhà nghiên cứu tập trung vào model.
Đây cũng là dấu hiệu cho thấy hardware đang dần được xem như một “embodiment” mà phần mềm có thể chạy trên đó, thay vì mỗi robot là một hệ kín hoàn toàn riêng biệt.
Vấn đề lớn nhất: robotics không có Internet để pretrain
Large language model có một lợi thế khổng lồ: Internet.
Hàng nghìn tỷ token từ sách, website, code và hội thoại đã tồn tại trước khi ChatGPT xuất hiện.
Robot không có kho dữ liệu tương đương.
Không tồn tại một “Common Crawl của xúc giác” ghi lại hàng tỷ lần con người cầm cốc, mở tủ, xoay tua-vít hay nhặt một chiếc tất ướt kèm đầy đủ camera, lực, joint angle và action.
Một báo cáo kỹ thuật từ UC Berkeley tháng 8/2026 về general robot intelligence nhấn mạnh đúng vấn đề này: robot data rất đắt để thu thập, khiến dataset pretraining nhỏ và không đủ bao phủ sự đa dạng khổng lồ của thế giới thực.
Đây có lẽ là khác biệt quan trọng nhất giữa “ChatGPT cho robot” và ChatGPT thật.
Để có dữ liệu, Trung Quốc đang xây “trường học” cho robot
Trong năm 2026, một hạ tầng mới xuất hiện nhanh ở Trung Quốc: humanoid robot training center.
Đây không phải showroom. Hàng chục hoặc hàng trăm robot được đặt trong các bối cảnh mô phỏng nhà ở, khách sạn, kho, cửa hàng và nhà máy. Operator đeo kính VR hoặc thiết bị motion capture để teleoperate robot thực hiện hàng nghìn lần cùng một nhóm thao tác.
Mỗi lần cầm nồi, quét thẻ, gấp quần áo hay phân loại kiện hàng tạo ra trajectory dữ liệu cho model.
Một trung tâm ở Jinan cho biết có 45 humanoid trong 11 kịch bản và đặt mục tiêu tạo hơn ba triệu dữ liệu chất lượng cao mỗi năm. Trung tâm Beijing Innovation Center of Humanoid Robotics đào tạo hơn 120 mẫu robot trong hơn 30 scenario thuộc sáu lĩnh vực.
Financial Times ghi nhận tới giữa năm 2026, hơn 90 training center loại này đã được xây hoặc đang triển khai tại Trung Quốc.
Điều này cho thấy cạnh tranh humanoid đang biến thành cạnh tranh data factory.
Nhưng một triệu trajectory chưa chắc bằng một triệu câu trên Internet
Dữ liệu robot có vấn đề về chất lượng và khả năng chuyển đổi.
Một trajectory thu trên robot có cánh tay dài 70 cm, bàn tay ba ngón và camera ở độ cao 1,6 m không thể tự động áp dụng cho robot khác có cấu trúc cơ thể khác.
Sensor khác nhau. Joint limit khác nhau. Action space khác nhau. Tốc độ motor và lực kẹp khác nhau.
Financial Times cũng ghi nhận chỉ một phần dữ liệu từ các training center có giá trị trực tiếp và khả năng tương thích giữa các hãng vẫn là vấn đề.
Đây là lý do “scale data” trong robotics khó hơn chỉ mua thêm ổ cứng.
Human video có thể trở thành YouTube của robot?
Một cách để thoát khỏi giới hạn robot data là học từ chính con người.
Internet chứa lượng video khổng lồ về người nấu ăn, sửa đồ, làm việc trong nhà máy, đóng gói hàng và thao tác với gần như mọi vật thể.
Figure gọi nỗ lực của mình là Project Go-Big. Công ty thu video góc nhìn thứ nhất từ con người trong nhiều môi trường và dùng chúng để pretrain Helix.
Năm 2025, Figure tuyên bố đã cho Helix học navigation từ 100% human video mà không cần robot demonstration cho task đó.
NVIDIA GR00T cũng nghiên cứu học từ human video. Trong N1.5, hãng cho biết việc kết hợp human ego video giúp tăng khả năng thao tác vật thể mới trong thí nghiệm của họ.
Nếu cách này scale được, humanoid có một lợi thế tự nhiên so với nhiều robot hình dạng khác: cơ thể của nó giống con người.
Một video con người mở tủ lạnh có thể dễ chuyển sang humanoid hơn sang một robot bánh xe có một cánh tay gắn ngang.
Đó có thể là lý do hình người quan trọng hơn vẻ ngoài
Humanoid thường được giải thích bằng một lập luận đơn giản: thế giới được xây cho cơ thể người.
Cửa, cầu thang, tay nắm, kệ, dụng cụ và bàn ghế đều có kích thước phù hợp với người.
Nhưng thời đại foundation model tạo thêm một lý do khác: dữ liệu thế giới cũng được tạo bởi con người.
Nếu model có thể học từ hàng tỷ giờ video con người, một robot có cấu trúc gần với người sẽ giảm khoảng cách embodiment.
Đây là lợi thế dữ liệu, không chỉ là lợi thế cơ khí.
World model: robot cần tưởng tượng điều gì xảy ra tiếp theo
Một robot thông minh không thể chỉ phản ứng với frame hiện tại.
Nó cần dự đoán tương lai.
Nếu kéo chiếc khăn này, chiếc cốc ở trên có rơi không? Nếu cầm thùng bằng một tay, trọng tâm cơ thể thay đổi thế nào? Nếu mở cánh tủ, nó có va vào người đang đứng cạnh không?
Đây là vai trò của world model: mô hình học cách trạng thái của thế giới biến đổi theo hành động.
Unitree nói đang đầu tư mạnh vào world model. 1X cũng phát triển world model để dự đoán khả năng thành công của task trước khi robot thực hiện. NVIDIA Cosmos cung cấp các mô hình và simulation phục vụ physical AI.
Nếu LLM học “quy luật” của ngôn ngữ từ token, robot foundation model phải học quy luật của trọng lực, tiếp xúc, ma sát, biến dạng và hành vi con người.
Đây là một bài toán khó hơn rất nhiều vì một câu trả lời sai không chỉ là câu chữ sai. Nó có thể làm vỡ cốc hoặc đẩy ngã người.
Simulation là cách tạo “Internet nhân tạo” cho robot
Một humanoid thật có thể thực hiện vài nghìn thao tác mỗi ngày.
Trong simulation, hàng nghìn bản sao robot có thể tập song song với tốc độ nhanh hơn thời gian thực.
Đây là lý do NVIDIA, Google, Figure và gần như mọi nhóm lớn đều đầu tư mạnh vào simulated training.
Robot có thể học đứng dậy sau khi ngã, đi trên nhiều địa hình hoặc thử hàng triệu chiến lược nắm vật thể mà không làm hỏng phần cứng thật.
Synthetic data cũng có thể thay đổi màu sắc, ánh sáng, kích thước đồ vật và vị trí camera để model không overfit vào một phòng cụ thể.
Nhưng simulation có một giới hạn nổi tiếng: sim-to-real gap.
Ma sát thực không hoàn hảo. Vải và dây mềm rất khó mô phỏng. Actuator có backlash. Camera có noise. Mỗi mặt sàn hơi khác nhau.
Model có thể trở thành vận động viên hoàn hảo trong simulator rồi thất bại với một túi nylon thật.
“Khoảnh khắc ChatGPT” cần generalization, không phải một video đẹp
Ngành robotics có một vấn đề truyền thông: demo được chọn lọc rất dễ gây ấn tượng.
Một robot gấp áo thành công một lần không cho biết nó thành công bao nhiêu lần trong 1.000 lần thử.
Một robot dọn đúng căn bếp được dùng trong quá trình phát triển không cho biết nó có thể vào một căn bếp hoàn toàn mới hay không.
Điểm phân biệt một “ChatGPT moment” thực sự sẽ là generalization.
Robot phải làm được task mới, với vật thể mới, trong bố cục mới và từ lệnh mới — mà không cần đội kỹ sư retrain hàng tuần.
Đó cũng là lý do CEO Unitree đặt mốc đột phá ở khả năng thực hiện phần lớn tác vụ trong môi trường lạ chỉ từ language command, chứ không phải chạy nhanh hơn hay nhảy cao hơn.
Đây là nơi humanoid hiện vẫn thua con người rất xa
Một trẻ nhỏ chỉ cần xem người lớn mở một loại hộp mới một vài lần là có thể hiểu cơ chế.
Robot thường cần hàng trăm hoặc hàng nghìn demonstration, và chỉ một thay đổi nhỏ về vật thể cũng có thể làm success rate giảm mạnh.
Con người có common sense vật lý rất phong phú: đồ thủy tinh có thể vỡ, dao sắc, nước đổ xuống dưới, vật mềm thay đổi hình dạng, ghế có thể dịch chuyển khi tựa vào.
Foundation model robotics đang bắt đầu học những khái niệm này, nhưng độ tin cậy chưa đạt mức để trao quyền tự chủ rộng trong nhà hoặc nơi làm việc.
Robot gia đình là bài test khó nhất
Nhà máy thường được xem là thị trường đầu tiên cho humanoid vì môi trường có thể được chuẩn hóa.
Nhà ở thì ngược lại.
Không có hai căn bếp giống nhau. Trẻ em để đồ chơi xuống sàn. Thú cưng chạy qua. Túi rác biến dạng. Quần áo mềm. Cốc có thể đầy hoặc rỗng. Người dùng không muốn học một bộ câu lệnh đặc biệt.
1X đang dùng NEO và model Redwood để tấn công trực tiếp bài toán này. Công ty mô tả Redwood là vision-language transformer được huấn luyện trên kinh nghiệm thế giới thật để xử lý các việc như giặt đồ, mở cửa và di chuyển trong nhà.
Đây cũng là môi trường nơi “ChatGPT moment” dễ nhận biết nhất: robot chỉ thực sự hữu ích khi người bình thường có thể nói chuyện với nó giống nói với một người trợ giúp, thay vì mở app để chọn skill số 27.
Cơ thể vẫn là giới hạn — đặc biệt ở bàn tay
Nhận định “nút thắt không còn nằm ở cơ thể” cần một dấu sao lớn.
Bàn tay người là một cơ cấu cực kỳ khó sao chép: nhiều bậc tự do, mật độ cảm biến lớn, khả năng điều chỉnh lực rất nhanh và vật liệu mềm tự nhiên.
Humanoid hiện đại có thể cầm hộp và dụng cụ khá tốt, nhưng thao tác dây cáp, nút nhỏ, vật mềm hoặc một vật đang trượt vẫn là thách thức.
Một review của McKinsey về humanoid thương mại hóa lưu ý dexterity, thời lượng pin và uptime vẫn là những cây cầu lớn chưa vượt qua. Nhiều robot chỉ chạy vài giờ trước khi cần sạc hoặc đổi pin, trong khi một ca sản xuất có thể kéo dài 8–12 giờ.
Do đó, software không thể sửa hoàn toàn một gripper thiếu cảm giác hoặc pin hết giữa task.
Điều thay đổi là hardware đã đạt mức đủ khả dụng để sự thiếu general intelligence bắt đầu lộ rõ hơn.
Nếu intelligence giải được, hardware có thể trở nên “commodity” hơn
Lịch sử máy tính cho thấy một pattern quen thuộc.
Khi PC hardware chuẩn hóa, phần lớn giá trị chuyển lên operating system và software. Khi smartphone có màn hình cảm ứng, camera và chip đủ tốt, cuộc cạnh tranh chuyển sang ecosystem và ứng dụng.
Humanoid có thể đi theo hướng tương tự.
Nếu nhiều body cùng có chiều cao tương đương, camera, force sensor, bàn tay và actuator đạt chuẩn, một foundation model có khả năng cross-embodiment có thể trở thành lớp giá trị lớn nhất.
NVIDIA rõ ràng đang đặt cược vào kịch bản này với GR00T reference design. Google nói Gemini Robotics 2 có thể điều khiển nhiều dạng robot. Các công ty foundation-model độc lập muốn model của mình chạy trên hardware của nhiều hãng.
Trong tương lai, doanh nghiệp có thể chọn “body” dựa trên tải trọng và giá, rồi chọn “brain” dựa trên task và mức độ tự chủ.
Hiện tại ngành vẫn chưa đạt tới mức modular đó, nhưng hướng đi đã xuất hiện.
Dữ liệu có thể trở thành “dầu mỏ” của humanoid — nhưng flywheel mới là lợi thế thật
Một robot được triển khai ngoài đời vừa là worker vừa là sensor.
Mỗi lần nó thất bại khi cầm hộp, gặp vật thể mới hoặc được con người sửa hành động, hệ thống có thêm training example.
Nếu một công ty có 100 robot, tốc độ thu dữ liệu thấp. Nếu có 100.000 robot, mỗi ngày có thể tạo ra khối lượng kinh nghiệm vật lý khổng lồ.
Đây là flywheel mà Tesla từng nói tới với xe tự lái và Figure, 1X, Unitree cùng các hãng Trung Quốc đang cố xây cho humanoid.
Điều này cũng giải thích vì sao deployment sớm quan trọng ngay cả khi robot chưa mang lại ROI tuyệt vời. Một robot đi làm là một data-collection endpoint.
Tuy nhiên, Reuters và Financial Times đều ghi nhận một thực tế năm 2026: nhiều humanoid đang được mua chủ yếu để huấn luyện, nghiên cứu hoặc tạo dữ liệu hơn là làm công việc tạo giá trị kinh tế trực tiếp.
Đó là dấu hiệu ngành đang ở trước — chứ chưa qua — “ChatGPT moment”.
Benchmark của tương lai không phải robot chạy nhanh bao nhiêu
Nếu phần mềm trở thành trung tâm, tiêu chuẩn đánh giá humanoid cũng phải thay đổi.
Tốc độ chạy, tải trọng và số bậc tự do vẫn quan trọng, nhưng các metric mới sẽ quan trọng hơn:
Robot thành công bao nhiêu phần trăm khi gặp căn phòng chưa từng thấy?
Mất bao nhiêu demonstration để học task mới?
Có thể làm liên tục bao lâu mà không cần human intervention?
Khi task thất bại, robot có tự phục hồi hay đứng im chờ kỹ sư?
Một policy có transfer được sang body khác không?
Robot có nhận biết khi mình không chắc chắn và dừng lại an toàn không?
Những câu hỏi này ít tạo ra video viral hơn backflip nhưng quyết định ROI thực tế.
“Autonomy rate” có thể là con số quan trọng nhất
Một humanoid có thể được quảng cáo là autonomous nhưng vẫn cần operator can thiệp qua teleoperation khi gặp edge case.
Nếu một robot hoàn thành 95% task nhưng 5% còn lại luôn cần người từ xa, mô hình kinh tế phụ thuộc vào số robot mà một operator có thể giám sát cùng lúc.
Ở quy mô lớn, giảm intervention rate từ 5% xuống 0,5% có thể quan trọng hơn tăng tốc độ đi bộ 20%.
Đây là bài học quen thuộc từ self-driving car: 99% tự chủ chưa chắc đủ nếu 1% còn lại chứa những tình huống nguy hiểm và không dự đoán được.
Humanoid cũng sẽ phải vượt qua bài toán long tail tương tự.
ChatGPT có thể sai một câu; robot sai có thể làm rơi một vật nặng
Đây là lý do “ChatGPT moment” của robotics khó hơn language model.
LLM hallucination có thể gây hậu quả nghiêm trọng trong một số ứng dụng, nhưng ở chatbot thông thường người dùng có thể kiểm tra hoặc bỏ qua câu trả lời.
Humanoid hành động trực tiếp trong thế giới vật lý.
Một prediction sai có thể làm robot va vào người, kẹp tay, làm đổ hóa chất hoặc đánh rơi thiết bị.
Do đó robot foundation model cần không chỉ intelligence mà còn calibrated uncertainty: biết khi nào không biết.
Hệ thống có thể phải kết hợp learned policy với safety controller cứng, force limit, geofence, collision detection và emergency stop độc lập.
General intelligence không được phép loại bỏ deterministic safety.
Có thể “ChatGPT moment” sẽ không đến trong một ngày
ChatGPT tạo cảm giác về một khoảnh khắc rất rõ vì sản phẩm được mở cho công chúng gần như cùng lúc.
Robotics có thể khác.
Không có cách tải một humanoid miễn phí trên trình duyệt. Hardware phải được sản xuất, giao tới khách hàng, bảo trì và hoạt động an toàn.
Vì vậy, bước ngoặt có thể xuất hiện theo từng lớp.
Đầu tiên, robot nhà máy học task mới trong vài giờ thay vì vài tuần.
Sau đó, một robot kho có thể chuyển giữa nhiều workstation.
Tiếp theo, humanoid gia đình có thể xử lý hàng chục công việc từ language command với intervention thấp.
Chỉ khi hardware đủ rẻ và intelligence đủ tổng quát, tác động mới bùng nổ với công chúng giống chatbot.
Năm 2026 giống thời kỳ pre-ChatGPT của robotics hơn là sau ChatGPT
Các thành phần quan trọng đã xuất hiện.
Humanoid body có thể sản xuất. Onboard compute đủ mạnh. VLA model bắt đầu điều khiển toàn thân. World model được huấn luyện trên video và simulation. Data center cho robot mọc lên. Natural-language command đã trở thành interface phổ biến trong demo.
Nhưng những thứ còn thiếu lại chính là những gì tạo nên bước ngoặt: reliability, generalization, cheap data và khả năng học liên tục từ deployment.
Unitree dự đoán software breakthrough có thể còn hai tới mười năm. Một số công ty khác lạc quan hơn nhiều. Google, NVIDIA, Figure và 1X đều đang công bố model mới với tốc độ nhanh.
Không ai biết chính xác đường cong sẽ bẻ lên ở đâu.
Cuộc đua humanoid đang biến thành cuộc đua AI
Nếu nhìn robot qua các video chạy, nhảy và múa, rất dễ nghĩ cuộc chiến nằm ở motor khỏe hơn, khung nhẹ hơn và bàn tay nhiều ngón hơn.
Những thứ đó vẫn cần.
Nhưng chiến trường mới đang hình thành ở nơi ít nhìn thấy hơn: dataset, world model, VLA architecture, simulation, human-video transfer, inference latency và learning flywheel.
Đây cũng là lý do các tên tuổi AI lớn như Google DeepMind và NVIDIA tham gia trực tiếp vào robotics dù họ không nhất thiết muốn tự sản xuất mọi con robot.
Nếu một model tổng quát cuối cùng có thể điều khiển hàng chục loại body, “Android của humanoid” có thể giá trị hơn chính một mẫu robot cụ thể.
Cơ thể đã đủ tốt để lộ ra vấn đề của bộ não
Humanoid năm 2026 chưa có cơ thể hoàn hảo. Pin vẫn ngắn. Tay vẫn kém người. Reliability chưa đủ cho mọi ca làm. Chi phí và safety vẫn là rào cản.
Nhưng ngành đã đi tới một điểm mới: thêm 10% tốc độ chạy không tự động biến robot thành công nhân hữu ích hơn.
Một humanoid chậm hơn nhưng có thể hiểu task mới, tự sửa lỗi và làm việc hàng giờ không cần kỹ sư có thể tạo ra giá trị kinh tế lớn hơn một robot thực hiện backflip hoàn hảo.
Đó là lý do “ChatGPT moment” được nhắc tới nhiều đến vậy.
Thứ ngành đang chờ không phải cơ thể robot đầu tiên có khả năng giống người. Những cơ thể đó đã xuất hiện.
Thứ còn thiếu là một bộ não đủ tổng quát để biến cùng một cơ thể thành công nhân nhà máy hôm nay, nhân viên kho ngày mai và trợ lý gia đình sau đó — chỉ bằng cách học, chứ không phải được lập trình lại từ đầu.
Nếu khoảnh khắc đó đến, humanoid có thể chuyển từ một ngành sản xuất máy móc sang một ngành platform AI có chân và tay.
Nguồn tham khảo
- Reuters: Robots poised for 'ChatGPT moment,' Unitree CEO says
- Reuters: Beyond marathons and backflips, China's robots face a commercial test
- Reuters: China robot makers seek to turn humanoid hype into useful work
- Figure: Introducing Helix 02 — Full-Body Autonomy
- Figure: Project Go-Big — Internet-Scale Humanoid Pretraining
- Google DeepMind: Gemini Robotics 2 brings whole body intelligence to robots
- Google: Gemini Robotics ER 2
- NVIDIA Research: GR00T N1.6
- NVIDIA: Isaac GR00T Reference Humanoid Robot
- UC Berkeley EECS: Building Generally Intelligent Robots
- Fraunhofer IPA: Application-relevant benchmark for humanoid robots
- 1X: Artificial Intelligence — Redwood and World Model