Embodied AI: Cuộc đua đưa trí tuệ nhân tạo từ màn hình vào robot hình người đang tăng tốc

Embodied AI đang đưa trí tuệ nhân tạo ra khỏi màn hình và vào thế giới vật lý. Từ Gemini Robotics 2, NVIDIA GR00T đến Figure, Atlas, Digit, NEO và Unitree, cuộc đua robot hình người đang chuyển từ demo sang sản xuất và triển khai thực tế.

Embodied AI: Cuộc đua đưa trí tuệ nhân tạo từ màn hình vào robot hình người đang tăng tốc

Trong làn sóng AI tạo sinh đầu tiên, trí tuệ nhân tạo chủ yếu tồn tại sau màn hình. Người dùng đặt câu hỏi, mô hình trả lời bằng văn bản, hình ảnh, mã nguồn hoặc giọng nói. Nhưng bước tiếp theo của ngành AI đang diễn ra trong thế giới vật lý: một hệ thống không chỉ hiểu yêu cầu mà còn nhìn thấy môi trường, lập kế hoạch, di chuyển, cầm nắm đồ vật và hoàn thành công việc bằng một cơ thể thật.

Đó là ý tưởng cốt lõi của Embodied AI — trí tuệ nhân tạo hiện thân trong một hệ thống vật lý có cảm biến, bộ truyền động và khả năng tương tác trực tiếp với thế giới. Robot hình người đang trở thành biểu tượng rõ nhất của xu hướng này vì chúng được thiết kế để hoạt động trong không gian vốn đã được xây dựng cho cơ thể con người: nhà máy, kho hàng, văn phòng, cầu thang, cửa ra vào, bàn ghế và dụng cụ.

Trong năm 2026, cuộc đua Embodied AI tăng tốc rõ rệt. Google DeepMind đưa Gemini Robotics 2 lên robot hình người với khả năng điều khiển toàn thân và xử lý nhiệm vụ nhiều bước. NVIDIA mở rộng hệ sinh thái GR00T, Isaac và Cosmos để tạo một nền tảng huấn luyện cho nhiều hãng robot. Figure tăng tốc sản xuất Figure 03. Boston Dynamics chuyển Atlas từ một dự án nghiên cứu nổi tiếng thành sản phẩm công nghiệp. Agility Robotics cho biết Digit đã được triển khai thương mại. 1X mở nhà máy cho robot gia đình NEO. Tại Trung Quốc, Unitree tiến tới IPO với mức định giá khoảng 9,04 tỷ USD và doanh thu robot hình người đã vượt mảng robot bốn chân trong năm 2025.

Robot hình người vì vậy không còn chỉ là sân khấu trình diễn các động tác chạy, nhảy hay khiêu vũ. Cuộc cạnh tranh đang dịch chuyển sang câu hỏi khó hơn nhiều: robot có thể tự hiểu một nhiệm vụ mới, làm việc ổn định hàng giờ và được sản xuất với chi phí đủ thấp hay không?

Embodied AI là gì?

Embodied AI có thể hiểu là AI được đặt trong một cơ thể có khả năng cảm nhận và hành động. Thay vì chỉ xử lý dữ liệu số, hệ thống phải liên tục tương tác với môi trường vật lý.

Một robot Embodied AI thường phải giải quyết đồng thời nhiều lớp bài toán:

  • Nhận thức: xác định vật thể, con người, khoảng cách, bề mặt và trạng thái của môi trường qua camera, cảm biến lực, lidar hoặc cảm biến vị trí khớp.
  • Hiểu ngôn ngữ và mục tiêu: chuyển yêu cầu như “dọn bàn” hoặc “đưa linh kiện vào kệ dưới” thành một kế hoạch hành động.
  • Lập kế hoạch: quyết định thứ tự các bước, chọn vật thể nào cần xử lý trước và phản ứng khi môi trường thay đổi.
  • Điều khiển vận động: biến quyết định cấp cao thành hàng loạt chuyển động chính xác của chân, thân, cánh tay và bàn tay.
  • Phản hồi: quan sát kết quả sau mỗi hành động và tự điều chỉnh nếu vật bị trượt, đường đi bị cản hoặc một bước thất bại.

Chính vòng lặp nhìn – hiểu – hành động – quan sát lại khiến Embodied AI phức tạp hơn chatbot. Trong thế giới số, một câu trả lời sai có thể được sửa bằng câu trả lời tiếp theo. Trong thế giới vật lý, một quyết định sai có thể làm rơi vật, va vào con người hoặc gây hỏng thiết bị.

Vì sao robot hình người lại trở thành tâm điểm?

Robot công nghiệp đã tồn tại nhiều thập kỷ. Một cánh tay robot trong nhà máy có thể nhanh, chính xác và đáng tin cậy hơn robot hình người rất nhiều khi làm một nhiệm vụ cố định. Vì vậy, lợi thế của humanoid không nằm ở việc thay thế mọi robot chuyên dụng.

Lập luận của các công ty humanoid là thế giới hiện tại đã được tối ưu cho hình thái con người. Chiều cao bàn thao tác, tay nắm cửa, bậc cầu thang, xe đẩy, công cụ cầm tay, kệ hàng và lối đi đều được thiết kế cho người. Một robot có hai chân, hai tay và tầm với gần giống con người về lý thuyết có thể sử dụng hạ tầng hiện hữu mà không cần nhà máy hoặc ngôi nhà được thiết kế lại hoàn toàn.

Đây là lý do Boston Dynamics mô tả Atlas mới như một robot doanh nghiệp dành cho công việc công nghiệp và xử lý vật liệu, còn Agility Robotics tập trung Digit vào kho hàng và dây chuyền sản xuất. Figure theo đuổi robot đa dụng có thể chuyển từ logistics sang tác vụ trong nhà, trong khi 1X đặt cược mạnh hơn vào môi trường gia đình.

Tuy nhiên, hình người không phải lời giải tối ưu cho mọi bài toán. Nếu một vật chỉ cần được di chuyển giữa hai điểm cố định, băng chuyền hoặc robot bánh xe có thể rẻ hơn và ổn định hơn. Humanoid chỉ tạo ra giá trị khi tính linh hoạt của cơ thể giúp doanh nghiệp tránh phải tái thiết kế môi trường hoặc khi cùng một robot có thể đảm nhiệm nhiều nhiệm vụ khác nhau.

Bước ngoặt lớn nằm ở mô hình Vision-Language-Action

Trong vài năm qua, một trong những thay đổi quan trọng nhất của robotics là sự nổi lên của mô hình Vision-Language-Action, thường viết tắt là VLA. Nếu mô hình ngôn ngữ lớn học cách ánh xạ ngôn ngữ thành ngôn ngữ, VLA tìm cách ánh xạ hình ảnh và chỉ dẫn ngôn ngữ thành hành động của robot.

Ngày 30/7/2026, Google DeepMind giới thiệu Gemini Robotics 2. Công ty mô tả đây là lớp trí tuệ có thể điều khiển toàn bộ robot hình người từ chân tới đầu ngón tay. Trong các ví dụ công bố, mô hình có thể phối hợp đi bộ, cúi người, với tay và thao tác đồ vật trong cùng một nhiệm vụ.

DeepMind cũng tách hệ thống thành nhiều lớp. Gemini Robotics 2 đóng vai trò VLA chuyển cảm nhận và ngôn ngữ thành điều khiển vận động; Gemini Robotics ER 2 đóng vai trò “bộ não” suy luận cấp cao để lập kế hoạch nhiều bước; phiên bản On-Device 2 được tối ưu để chạy trực tiếp trên phần cứng robot nhằm giảm phụ thuộc vào kết nối mạng.

Một chi tiết đáng chú ý là khả năng chuyển mô hình giữa nhiều hình thái robot. DeepMind cho biết cùng một checkpoint có thể được sử dụng trên các cấu hình Apollo 2 khác nhau và robot hai tay Franka. Phiên bản On-Device 2 cũng được thiết kế để thích nghi với một cơ thể robot mới chỉ với vài giờ dữ liệu bổ sung trong một số thử nghiệm.

Nếu cách tiếp cận này tiếp tục tiến bộ, ngành robotics có thể dần rời khỏi mô hình “mỗi robot, mỗi tác vụ, một bộ điều khiển riêng” để tiến tới các mô hình nền tảng có thể được hậu huấn luyện cho nhiều robot và nhiệm vụ.

Figure đặt cược vào một hệ thần kinh thống nhất cho toàn bộ cơ thể

Figure AI theo đuổi một hướng tương tự với dòng mô hình Helix. Tháng 1/2026, công ty giới thiệu Helix 02, mở rộng điều khiển từ phần thân trên sang toàn bộ cơ thể.

Theo Figure, một mạng thần kinh thống nhất nhận dữ liệu từ thị giác, xúc giác và cảm nhận vị trí cơ thể rồi điều khiển trực tiếp toàn bộ bộ truyền động. Trong một bài trình diễn do công ty công bố, robot có thể tự dỡ và xếp lại máy rửa bát trong khoảng bốn phút, kết hợp đi lại, giữ thăng bằng và thao tác vật thể mà không cần đặt lại trạng thái giữa chừng.

Điểm đáng chú ý không phải riêng nhiệm vụ rửa bát, mà là ý tưởng whole-body autonomy. Robot không còn coi đi bộ và cầm nắm là hai hệ thống tách biệt. Khi cần lấy một vật ở kệ thấp, nó phải đồng thời quyết định đặt chân ở đâu, xoay thân thế nào, giữ thăng bằng ra sao và dùng bàn tay với lực bao nhiêu.

Đó là kiểu phối hợp mà con người thực hiện gần như vô thức nhưng cực khó với robot. Một sai số nhỏ ở chân có thể làm thay đổi vị trí vai; vị trí vai thay đổi lại ảnh hưởng quỹ đạo cánh tay và điểm tiếp xúc của bàn tay.

Cuộc đua đã chuyển từ prototype sang nhà máy

Một robot biểu diễn tốt trong video chưa phải là sản phẩm. Bước khó hơn là tạo ra hàng trăm hoặc hàng nghìn robot giống nhau, kiểm tra từng bộ truyền động, bảo trì chúng và giữ độ tin cậy khi làm việc nhiều giờ mỗi ngày.

Ngày 29/4/2026, Figure cho biết nhà máy BotQ của họ đã giao hơn 350 robot Figure 03 và đạt chu kỳ thử nghiệm tương đương một robot mỗi giờ, tăng mạnh so với mức một robot mỗi ngày trước đó. Công ty nhấn mạnh rằng việc tăng số lượng robot không chỉ phục vụ bán hàng mà còn tạo thêm dữ liệu vận hành để huấn luyện thế hệ mô hình tự chủ tiếp theo.

1X cũng đi theo hướng tích hợp sản xuất. Tháng 4/2026, công ty cho biết nhà máy NEO ở Hayward, California đã bước vào sản xuất quy mô đầy đủ, với công suất ban đầu hướng tới 10.000 robot mỗi năm và kế hoạch mở rộng mạnh hơn khi các dây chuyền tự động hóa tiếp tục được bổ sung.

Boston Dynamics tại CES 2026 giới thiệu phiên bản sản phẩm của Atlas và cho biết bắt đầu sản xuất ngay trong năm. Các đợt triển khai 2026 được lên kế hoạch tại Hyundai và Google DeepMind trước khi mở rộng sang khách hàng khác.

Agility Robotics meanwhile đã đặt Digit vào một vị trí khác: thay vì nói về robot đa dụng trong tương lai xa, công ty tập trung vào các quy trình vật liệu cụ thể trong kho và nhà máy. Agility hiện mô tả Digit là một robot hình người đã được triển khai thương mại, cùng nền tảng Arc để vận hành đội robot.

Những tín hiệu này cho thấy thước đo cạnh tranh đang thay đổi. Năm 2023–2024, một video robot đi lại mượt đã đủ gây chú ý. Đến năm 2026, câu hỏi quan trọng hơn là tỷ lệ hoàn thành nhiệm vụ, thời gian hoạt động, chi phí bảo trì, nhịp sản xuất và khả năng vận hành cả đội robot.

NVIDIA muốn trở thành “hệ điều hành” của Physical AI

Trong cuộc đua robot hình người, NVIDIA không nhất thiết phải tự bán một humanoid hoàn chỉnh. Chiến lược của hãng là cung cấp hạ tầng tính toán, mô hình nền tảng, mô phỏng và công cụ huấn luyện cho toàn ngành.

Hệ sinh thái này gồm các thành phần như Jetson cho tính toán trên robot, Isaac cho mô phỏng và robot learning, Cosmos cho world model và dữ liệu tổng hợp, cùng dòng mô hình GR00T dành cho robot hình người.

Tháng 3/2026, NVIDIA công bố GR00T N1.7 ở chế độ early access với giấy phép thương mại và cho biết nhiều hãng robot đang áp dụng dòng GR00T. Hãng cũng giới thiệu Isaac Lab 3.0 và tiếp tục phát triển GR00T N2.

Đến tháng 7/2026, NVIDIA mô tả Isaac GR00T Development Platform như một pipeline đầu-cuối: thu thập dữ liệu, tạo dữ liệu trong mô phỏng, huấn luyện, đánh giá ở quy mô lớn và triển khai policy lên robot thật.

Chiến lược này gợi nhớ vai trò của CUDA trong làn sóng AI trước đó. Nếu robotics chuyển sang một ngành dựa mạnh vào foundation model và simulation, giá trị có thể không chỉ nằm ở robot cuối cùng mà còn ở nền tảng dùng để huấn luyện hàng chục loại robot khác nhau.

Dữ liệu vật lý là “Internet” mà robot chưa có

LLM có một lợi thế khổng lồ: Internet chứa lượng văn bản, hình ảnh và video khổng lồ để pretrain. Robot không có một kho dữ liệu hành động chuẩn hóa ở quy mô tương đương.

Để học cách nhặt một chiếc cốc, robot không chỉ cần biết chiếc cốc trông như thế nào. Nó cần dữ liệu về vị trí bàn tay, lực kẹp, hướng cổ tay, ma sát, trọng lượng, trạng thái tiếp xúc và kết quả khi vật thể bị trượt. Với hàng nghìn loại đồ vật và hàng triệu tình huống, dữ liệu vật lý nhanh chóng trở thành nút thắt.

Đây là lý do ngành đang đầu tư vào ba nguồn dữ liệu chính.

  • Dữ liệu robot thật: thu thập trực tiếp từ đội robot đang hoạt động. Đây là dữ liệu sát thực tế nhất nhưng tốn kém và chậm.
  • Dữ liệu từ con người: dùng video, motion capture hoặc teleoperation để ghi lại cách con người hoàn thành nhiệm vụ rồi chuyển kỹ năng sang robot.
  • Dữ liệu mô phỏng và tổng hợp: tạo hàng triệu tình huống trong môi trường ảo để robot thử sai mà không làm hỏng phần cứng.

NVIDIA GR00T N1 được huấn luyện bằng hỗn hợp trajectory từ robot thật, dữ liệu con người và dữ liệu tổng hợp. Figure cho biết Helix 02 tận dụng hơn 1.000 giờ dữ liệu chuyển động người ở một thành phần điều khiển toàn thân. 1X sử dụng mô phỏng vật lý trong hệ sinh thái NVIDIA để huấn luyện và đánh giá world model.

Cuộc đua Embodied AI vì thế cũng là cuộc đua xây data flywheel: nhiều robot hơn tạo ra nhiều dữ liệu hơn; dữ liệu tốt hơn tạo mô hình tốt hơn; mô hình tốt hơn khiến robot hữu ích hơn; robot hữu ích hơn lại giúp triển khai thêm robot.

Trung Quốc biến humanoid thành cuộc đua sản xuất

Nếu Mỹ hiện nổi bật về foundation model và phần mềm AI, Trung Quốc đang thể hiện lợi thế lớn về chuỗi cung ứng phần cứng và tốc độ sản xuất.

Theo Reuters dẫn dữ liệu Omdia, các công ty Trung Quốc chiếm khoảng 90% trong gần 13.000 robot hình người được giao trên toàn cầu trong năm 2025. Một thống kê khác được Reuters dẫn vào tháng 4/2026 cho thấy Trung Quốc chiếm hơn 80% khoảng 16.000 lượt triển khai humanoid năm 2025, tùy cách tính thị trường.

Unitree là ví dụ nổi bật. Ngày 6/8/2026, Reuters cho biết hãng robot tại Hàng Châu định giá IPO Thượng Hải ở mức khoảng 61 tỷ nhân dân tệ, tương đương 9,04 tỷ USD. Doanh thu Unitree năm 2025 tăng hơn bốn lần lên 1,7 tỷ nhân dân tệ; trong đó robot hình người tạo 867,8 triệu nhân dân tệ và lần đầu vượt robot bốn chân để trở thành mảng kinh doanh lớn nhất.

DeepSeek cũng tham gia với tư cách nhà đầu tư chiến lược trong IPO của Unitree. Reuters cho biết hai công ty dự kiến hợp tác theo hướng kết hợp năng lực AI của DeepSeek với phần cứng, điều khiển chuyển động và embodied intelligence của Unitree.

Unitree đồng thời đưa ra các nền tảng humanoid có mức giá thấp hơn đáng kể nhiều hệ thống nghiên cứu cao cấp. Mẫu G1 hiện được hãng niêm yết từ 13.500 USD, dù Unitree cũng cảnh báo ngành humanoid vẫn ở giai đoạn đầu và nhiều chức năng còn đang phát triển.

Lợi thế giá, mạng lưới nhà cung cấp motor, hộp số, pin, cảm biến và năng lực sản xuất hàng loạt khiến Trung Quốc trở thành đối thủ khó bỏ qua. Cuộc đua humanoid vì vậy đang dần mang đặc điểm của cả cuộc đua AI lẫn cuộc đua xe điện: phần mềm rất quan trọng, nhưng chuỗi cung ứng và manufacturing có thể quyết định ai đạt quy mô trước.

Tesla vẫn là biến số lớn nhưng quy mô không thể chỉ dựa vào lời hứa

Tesla là một trong những công ty khiến robot hình người trở thành chủ đề đại chúng với Optimus. Elon Musk nhiều lần mô tả humanoid là một phần trọng tâm trong chiến lược dài hạn của Tesla.

Tuy nhiên, đây cũng là ví dụ cho thấy cần phân biệt giữa mục tiêu sản xuất và số robot thực sự hoạt động. Reuters ngày 21/1/2026 dẫn Musk cho biết quá trình tăng sản lượng Optimus ban đầu sẽ rất chậm trước khi tăng tốc. Đến tháng 7/2026, Reuters tiếp tục ghi nhận nhà đầu tư đặt nhiều câu hỏi về tiến độ các dự án AI của Tesla, gồm Optimus.

Điều đó không làm giảm ý nghĩa của Tesla trong thị trường. Công ty có lợi thế rõ ràng về AI thị giác, chip, pin, motor, điện tử công suất và kinh nghiệm xây dây chuyền hàng triệu sản phẩm. Nhưng ngành robot hình người đang bước vào giai đoạn mà những tuyên bố về công suất thiết kế cần được tách khỏi sản lượng thực tế, uptime và năng suất công việc.

Robot gia đình là mục tiêu hấp dẫn nhưng khó hơn nhà máy

Nhiều video humanoid hấp dẫn nhất thường diễn ra trong nhà: gấp quần áo, rửa bát, dọn phòng hoặc mang đồ. Nhưng môi trường gia đình lại khó tự động hóa hơn nhà máy.

Nhà máy có thể chuẩn hóa vị trí vật liệu, ánh sáng, lối đi và quy trình. Một ngôi nhà chứa vô số ngoại lệ: đồ vật bị đặt sai vị trí, trẻ em chạy qua, thú cưng xuất hiện, quần áo mềm biến dạng, bát đĩa có kích thước khác nhau và con người thay đổi yêu cầu liên tục.

1X đang đặt cược trực tiếp vào bài toán này với NEO. Công ty mô tả robot được thiết kế cho tự chủ nhưng thừa nhận giai đoạn Early Access chỉ có mức tự chủ nền tảng. Với các nhiệm vụ NEO chưa biết, một chuyên gia của 1X có thể giám sát từ xa theo lịch để giúp robot hoàn thành công việc và học thêm kỹ năng.

Chi tiết đó phản ánh thực tế của ngành: giữa demo tự chủ và robot gia đình hoàn toàn tự lập vẫn còn một khoảng cách lớn. Teleoperation và human-in-the-loop có thể là cầu nối trong nhiều năm, vừa giúp robot xử lý tình huống khó vừa tạo dữ liệu huấn luyện.

Những nút thắt chưa được giải quyết

Dù tiến bộ nhanh, robot hình người vẫn đối mặt với những vấn đề mà AI trên màn hình không phải xử lý.

Độ khéo léo của bàn tay

Đi bộ thường gây ấn tượng trong video, nhưng bàn tay mới là một trong những thách thức lớn nhất. Việc cầm một vật cứng tương đối đơn giản; buộc dây, xếp quần áo, mở túi zip hoặc cắm một đầu nối nhỏ đòi hỏi kiểm soát lực và xúc giác tinh tế.

DeepMind thừa nhận trong công bố Gemini Robotics 2 rằng thao tác nhiều ngón vẫn là bài toán khó hơn các tác vụ dùng gripper hoặc điều khiển toàn thân cơ bản.

Độ tin cậy

Một robot đạt tỷ lệ thành công 90% nghe có vẻ tốt trong nghiên cứu, nhưng có thể chưa đủ trong sản xuất. Nếu mỗi nhiệm vụ gồm 20 bước và mỗi bước có xác suất thành công 99%, xác suất hoàn thành toàn bộ chuỗi mà không lỗi chỉ còn khoảng 81,8%.

Đó là lý do các công ty phải tối ưu không chỉ khả năng làm được một nhiệm vụ, mà còn khả năng lặp lại hàng nghìn lần.

Năng lượng

Robot hai chân phải liên tục giữ cân bằng và vận hành nhiều motor. Thời lượng pin vì thế trở thành yếu tố kinh tế: nếu robot phải sạc quá thường xuyên, số giờ làm việc hữu ích giảm và doanh nghiệp cần nhiều robot hơn để duy trì cùng công suất.

An toàn

Một humanoid có đủ lực để nâng vật nặng cũng có đủ lực để gây thương tích. Hệ thống cần phát hiện con người, giới hạn lực, dừng an toàn, dự đoán va chạm và xử lý tình huống không chắc chắn.

Google DeepMind cho biết Gemini Robotics ER 2 được cải thiện trên các benchmark liên quan tới tuân thủ ràng buộc an toàn và khoảng cách với con người. Đây là tín hiệu cho thấy AI safety trong robotics không chỉ là kiểm soát nội dung, mà còn là bài toán an toàn vật lý theo thời gian thực.

Chi phí và bảo trì

Robot hình người chứa hàng chục bộ truyền động, cảm biến, hộp số, dây dẫn, máy tính và khớp chuyển động. Một robot có giá mua thấp nhưng hỏng thường xuyên vẫn có tổng chi phí sở hữu cao.

Do đó, cuộc đua thương mại cuối cùng sẽ được quyết định bởi chỉ số gần với công nghiệp hơn là video demo: chi phí mỗi giờ làm việc hữu ích, thời gian giữa hai lần hỏng, thời gian sửa chữa và mức năng suất so với lao động hoặc thiết bị thay thế.

2026 có phải là “ChatGPT moment” của robotics?

Ngành robot thường tìm kiếm một “ChatGPT moment” — thời điểm công nghệ trở nên đủ hữu ích và dễ tiếp cận để bùng nổ nhanh chóng. Năm 2026 có nhiều dấu hiệu khiến kỳ vọng đó tăng lên: foundation model tốt hơn, simulation mạnh hơn, phần cứng rẻ hơn và nhiều nhà máy humanoid bắt đầu vận hành.

Nhưng robotics khác phần mềm ở một điểm cơ bản: model có thể được sao chép gần như miễn phí, còn robot phải được sản xuất từng chiếc. Motor phải được gia công, pin phải được lắp, bàn tay phải được kiểm tra và sản phẩm phải chịu va đập thật.

Vì vậy, nếu một “ChatGPT moment” xuất hiện, nó có thể không diễn ra trong một ngày. Nó có thể là một quá trình kéo dài nhiều năm khi ba đường cong cùng hội tụ: AI đủ thông minh, phần cứng đủ tin cậy và chi phí đủ thấp.

Cuộc đua thực sự là xây vòng lặp học nhanh nhất

Nhìn từ năm 2026, Embodied AI đang chuyển robot hình người từ một bài toán cơ khí thành một hệ thống AI toàn diện. Phần cứng vẫn quyết định robot có thể làm gì về mặt vật lý, nhưng phần mềm ngày càng quyết định robot có thể học nhanh đến đâu và thích nghi với bao nhiêu tình huống.

Google DeepMind đang đẩy foundation model sang điều khiển toàn thân. NVIDIA muốn trở thành hạ tầng huấn luyện cho cả ngành. Figure tích hợp AI và sản xuất để tạo data flywheel. Boston Dynamics mang kinh nghiệm cơ khí nhiều thập kỷ vào Atlas thương mại. Agility ưu tiên ROI trong công nghiệp. 1X thử đưa humanoid vào nhà. Unitree và hệ sinh thái Trung Quốc tạo áp lực bằng chi phí và quy mô sản xuất. Tesla tiếp tục đặt cược vào khả năng tích hợp AI, chip và manufacturing theo chiều dọc.

Không công ty nào hiện có lời giải hoàn chỉnh. Nhưng hướng đi đã rõ hơn: robot tương lai sẽ không được “lập trình từng động tác” như máy công nghiệp truyền thống. Chúng sẽ được huấn luyện trên dữ liệu lớn, học từ con người và mô phỏng, hiểu chỉ dẫn bằng ngôn ngữ, rồi tự điều chỉnh hành động trong môi trường thật.

Nếu AI tạo sinh đã đưa trí tuệ nhân tạo vào công việc tri thức, Embodied AI đang cố đưa nó vào lao động vật lý. Và khi cuộc đua đó tăng tốc, câu hỏi lớn nhất không còn là liệu robot hình người có thể đi và nói chuyện giống con người hay không, mà là khi nào chúng có thể làm việc đủ tốt, đủ lâu và đủ rẻ để trở thành một phần bình thường của nền kinh tế.

Nguồn tham khảo: Google DeepMind, “Gemini Robotics 2 brings whole body intelligence to robots”, 30/7/2026; NVIDIA, các công bố Isaac GR00T và Physical AI tại GTC 2025–2026; Figure AI, “Introducing Helix 02: Full-Body Autonomy” và “Ramping Figure 03 Production”; Boston Dynamics, các công bố Atlas tại CES 2026; Agility Robotics, thông tin triển khai Digit; 1X Technologies, “NEO Factory” và thông tin sản phẩm NEO; Reuters, các báo cáo về thị trường humanoid Trung Quốc, Unitree IPO và Tesla Optimus trong 2025–2026.

Chia sẻ