Robot đang cố nhìn thế giới ngày càng rõ: Nhưng giác quan tiếp theo chúng cần có thể là xúc giác
Camera giúp robot nhận ra vật thể, nhưng nhiều thông tin quyết định một cú nắm có thành công hay không chỉ xuất hiện sau khi chạm: lực, trượt, độ cứng, nhiệt độ và vị trí tiếp xúc. Các nghiên cứu năm 2026 đang đưa tactile sensing từ đầu ngón tay ra cả cánh tay, đồng thời dạy AI diễn giải dữ liệu xúc giác thay vì chỉ “cảm thấy có chạm”.
Một robot có thể nhìn thấy chiếc cốc rõ tới từng cạnh, ước lượng được tư thế của nó và đưa bàn tay tới đúng vị trí. Nhưng khoảnh khắc các ngón tay chạm vào cốc, camera bắt đầu thiếu thông tin: lực đã đủ chưa, bề mặt có đang trượt không, vật thể mềm hay cứng, một góc đã kẹt vào lòng bàn tay hay chưa?
Đó là khoảng cách giữa nhìn thấy một vật và thao tác được với nó. Trong nhiều năm, robotics đã đầu tư mạnh vào camera RGB, depth camera, lidar và vision model. Chúng giúp robot hiểu không gian ngày càng tốt. Nhưng manipulation là một bài toán vật lý tiếp xúc, và nhiều biến quan trọng nhất chỉ xuất hiện khi robot thực sự chạm vào thế giới.
Vì vậy, xúc giác đang dần trở thành lớp cảm nhận tiếp theo của robot. Không phải để thay camera, mà để cung cấp phần thông tin camera vốn không thể nhìn thấy ổn định: lực tiếp xúc, ma sát, trượt, biến dạng, nhiệt độ, rung động và cả những va chạm xảy ra ở vùng bị che khuất.
Camera nhìn được hình dạng, nhưng không nhìn được một cú nắm sắp tuột
Vision rất mạnh trước khi tiếp xúc. Robot có thể nhận diện vật thể, ước lượng pose và lên quỹ đạo cho bàn tay. Nhưng ngay khi ngón tay che khuất điểm tiếp xúc, chính camera lại mất góc nhìn ở nơi quan trọng nhất.
Ngay cả khi vẫn nhìn được, hình ảnh cũng không trực tiếp cho biết lực đang truyền qua bề mặt bao nhiêu. Hai vật giống hệt nhau về hình dạng có thể cần lực nắm rất khác nếu một cái bằng kính, một cái bằng cao su. Một túi nhựa có thể thay đổi hình dạng ngay khi bị bóp. Một nắp chai có thể trông đứng yên trong ảnh nhưng đang trượt rất nhỏ dưới đầu ngón tay.
Con người giải quyết những tình huống đó gần như vô thức bằng touch. Các mechanoreceptor trong da liên tục báo về áp lực, shear force, rung và biến dạng. Khi một chiếc cốc bắt đầu trượt, tay thường tăng lực trước cả khi mắt nhận ra chuyển động rõ ràng.
Robot truyền thống thường có force–torque sensor ở cổ tay hoặc ước lượng lực từ dòng motor. Những tín hiệu này hữu ích, nhưng khá “thưa”: chúng nói toàn bộ cánh tay đang chịu lực ra sao, chứ không nhất thiết cho biết chính xác điểm nào trên đầu ngón tay đang tiếp xúc hay bề mặt đang bắt đầu trượt ở đâu.
Tactile sensor biến bề mặt robot thành một mạng điểm đo
Một lớp tactile skin có thể chứa nhiều phần tử cảm biến nhỏ, thường được gọi là taxel — tương tự pixel, nhưng dùng cho touch. Mỗi taxel có thể đo áp suất hoặc một dạng tín hiệu liên quan tới tiếp xúc. Khi xếp thành mảng, robot có được một “ảnh xúc giác” của vùng đang chạm vật.
Có nhiều cách tạo tín hiệu đó. Cảm biến piezoresistive thay đổi điện trở khi bị ép. Capacitive sensor đo thay đổi điện dung. Iontronic skin khai thác chuyển động ion. Một số thiết kế đo cả lực pháp tuyến lẫn lực cắt để nhận ra vật đang trượt theo phương nào.
Một hướng khác nghe có vẻ nghịch lý là dùng camera để tạo xúc giác. Trong các vision-based tactile sensor như dòng DIGIT hoặc GelSight, một camera rất nhỏ được đặt phía sau lớp elastomer mềm. Khi bề mặt này chạm vật, nó biến dạng; camera quan sát biến dạng và thuật toán suy ra hình học tiếp xúc, lực hoặc chuyển động trượt.
Meta FAIR giới thiệu Digit 360 như một fingertip dạng này với hơn 8 triệu taxel quang học và hơn 18 đặc trưng cảm nhận. Theo Meta, sensor có thể phát hiện lực xuống tới khoảng 1 millinewton và dùng bộ tăng tốc AI ngay trên thiết bị để xử lý tín hiệu cục bộ. Đây là một platform nghiên cứu xúc giác, không phải bằng chứng rằng robot đã có “ngón tay giống người” theo mọi tiêu chí.
2026: xúc giác bắt đầu trở thành dữ liệu đa phương thức, không chỉ một con số lực
Một nghiên cứu đăng trên Nature Sensors đầu năm 2026 cho thấy tactile sensing đang đi xa hơn mảng áp suất đơn giản. Hệ SuperTac kết hợp multispectral imaging, tín hiệu triboelectric và inertial sensing trong một lớp skin dày khoảng 1 mm.
Nhóm nghiên cứu báo cáo sensor có thể đo hoặc phân biệt nhiều loại thông tin: lực, vị trí chạm, nhiệt độ, khoảng cách gần, rung, texture, material, sliding và collision. Trong các phép thử của họ, hệ đạt trên 94% accuracy khi phân biệt một số nhóm đặc trưng như texture, vật liệu, trượt và va chạm.
Điểm đáng chú ý nằm ở tầng phần mềm đi kèm. Nhóm xây một tactile language model 8,5 tỷ tham số mang tên DOVE để diễn giải các tín hiệu xúc giác đa phương thức thành mô tả có ý nghĩa. Ý tưởng ở đây giống bước robotics từng trải qua với vision: phần cứng cảm biến tạo dữ liệu, nhưng năng lực thật chỉ xuất hiện khi model biết dữ liệu đó có nghĩa gì đối với hành động.
Một robot không chỉ cần biết “áp suất đang là 0,8 N”. Nó cần suy ra rằng vật này đang trượt, rằng bề mặt mềm hơn dự kiến, hoặc rằng nên giảm lực vì đối tượng có thể dễ vỡ.
Touch không nhất thiết chỉ nằm ở đầu ngón tay
Tháng 7/2026, một nhóm tại Hong Kong University of Science and Technology và các viện cộng tác công bố EmArm trên Nature Sensors. Thay vì chỉ gắn sensor vào gripper, họ phủ các vùng lớn của cánh tay robot bằng soft tactile skin rồi nối nó vào vòng perception–action.
Hệ thống đạt khả năng định vị tiếp xúc dưới milimet theo báo cáo của nhóm, đồng thời dùng thông tin chạm để nhận biết tương tác với người, thao tác trong môi trường có contact và lập lại quỹ đạo khi vật cản xuất hiện ở vùng camera không quan sát thuận lợi.
Đây là một khác biệt quan trọng. Với humanoid, xúc giác không chỉ phục vụ cầm nắm. Cánh tay, cẳng tay, bàn tay và thậm chí thân robot đều có thể va chạm với người hoặc môi trường. Một lớp skin phân bố rộng biến contact từ “sự cố phải phát hiện sau khi xảy ra” thành một nguồn thông tin đầu vào cho control.
Điều đó đặc biệt hữu ích trong không gian chật, khi robot đưa tay vào tủ, ôm một hộp lớn che mất camera, hoặc phải trượt một vật dọc theo bề mặt. Ở những tình huống này, tiếp xúc không phải lỗi cần tránh hoàn toàn; nó là một phần của chiến lược thao tác.
Xúc giác không thay vision — kết hợp hai thứ mới là phần đáng quan tâm
Một kết quả khác trên Science Robotics tháng 1/2026 minh họa điểm này khá rõ. Nhóm Zhejiang University huấn luyện hệ manipulation nhiều ngón bằng cách kết hợp hình ảnh từ một camera đơn với tín hiệu tactile rất đơn giản dạng có-chạm/không-chạm.
Hệ thống đạt trung bình 85% success rate trên năm tác vụ phức tạp với 25 vật thể trong thiết lập của nghiên cứu, rồi tiếp tục generalize sang ba tác vụ chưa thấy nhưng có pattern phối hợp tay–vật tương tự. Điều đáng nói là tactile input ở đây không hề “độ phân giải cao”; chỉ một tín hiệu tiếp xúc đơn giản cũng cung cấp thông tin mà hình ảnh thiếu khi tay và vật che khuất lẫn nhau.
Đó có thể là hướng thực tế hơn cho robot thương mại: không phải phủ hàng triệu taxel lên mọi centimet vuông ngay lập tức, mà đặt đúng loại touch sensor ở những vùng nơi dữ liệu tiếp xúc làm thay đổi quyết định điều khiển.
Humanoid thương mại đã bắt đầu đưa touch vào bàn tay
Dấu hiệu này đã xuất hiện trong phần cứng humanoid hiện nay, dù phần lớn thông số vẫn là dữ liệu do nhà sản xuất công bố.
Figure cho biết Figure 03 sử dụng tactile sensor do hãng tự phát triển ở đầu ngón tay, có thể phát hiện áp lực tương đương khoảng 3 gram. Trong Helix 02, công bố tháng 1/2026, Figure đưa vision, fingertip touch và proprioception vào cùng hệ điều khiển. Hãng trình diễn các tác vụ như tháo nắp chai, lấy một viên thuốc nhỏ và đẩy syringe tới một thể tích xác định. Đây là demo của công ty, chưa phải benchmark độc lập, nhưng nó cho thấy tactile đã đi từ đề tài lab sang input mà một hệ humanoid đang trực tiếp sử dụng.
Unitree cũng liệt kê Dex5-1 với 94 tactile sensor trên mỗi bàn tay ở phiên bản có sensing, cùng communication rate 1.000 Hz. H2 Plus của hãng được quảng bá với hai bàn tay năm ngón có tactile sensing. Những con số này không tự động nói lên độ khéo léo, nhưng chúng phản ánh một thay đổi về thiết kế: bàn tay robot ngày càng được xem như sensor array, không chỉ là cơ cấu chấp hành.
Đưa “da” lên robot tạo ra một bài toán dữ liệu mới
Càng nhiều tactile sensor, robot càng phải giải quyết một vấn đề quen thuộc từ camera: dữ liệu. Hàng trăm hoặc hàng nghìn điểm đo chạy ở tần số cao tạo ra bandwidth, calibration và latency đáng kể. Nếu mỗi sensor drift theo nhiệt độ hoặc lão hóa khác nhau, model phải biết đâu là thay đổi của thế giới và đâu chỉ là thay đổi của phần cứng.
Độ bền cũng là thách thức đặc biệt. Camera có thể nằm sau kính bảo vệ; tactile skin phải trực tiếp bị ép, kéo, cọ xát và va đập. Gel mềm có thể mòn. Lớp phủ có thể bong. Cáp và connector phải chịu chuyển động lặp đi lặp lại ở khớp. Một sensor đạt độ nhạy cao trong phòng lab chưa chắc sống được hàng triệu chu kỳ cầm nắm trong nhà máy.
Phần mềm cũng chưa có “ImageNet cho xúc giác” theo nghĩa tương đương vision. Mỗi loại sensor tạo dữ liệu với geometry và physics khác nhau. Meta phát triển Sparsh, một family model được pretrain trên hơn 460.000 tactile image để học representation dùng qua nhiều sensor và task, nhưng chuẩn hóa touch vẫn ở giai đoạn sớm hơn rất nhiều so với camera.
Cuối cùng là câu hỏi đặt sensor ở đâu. Fingertip cho precision manipulation. Palm giúp xác nhận vật đang nằm ổn định. Forearm và body skin hữu ích cho contact safety và whole-body manipulation. Phủ toàn thân cho độ bao phủ lớn nhưng kéo theo chi phí, wiring và compute. Không có lý do để mọi robot cần cùng một “làn da”.
Giác quan tiếp theo của robot có thể không phải một sensor, mà là một vòng phản xạ
Con người không chỉ cảm thấy áp lực rồi gửi dữ liệu lên não để phân tích chậm. Nhiều phản ứng với contact xảy ra theo vòng feedback rất nhanh. Robotics đang đi theo hướng tương tự: tactile sensor phải đủ nhanh, model phải hiểu tín hiệu, và controller phải thay đổi lực hoặc quỹ đạo trước khi vật tuột khỏi tay.
Đó là lý do touch quan trọng hơn việc chỉ thêm một modality vào bảng thông số. Khi xúc giác được nối trực tiếp với control, robot có thể chuyển từ “nhìn rồi thực hiện quỹ đạo đã tính” sang “liên tục cảm nhận kết quả của chính hành động và sửa nó”.
Camera vẫn sẽ là giác quan chủ lực cho việc hiểu cảnh ở khoảng cách xa. Nhưng với những nhiệm vụ khiến humanoid thực sự hữu ích — lấy đồ trong ngăn kéo, cầm túi mềm, lắp chi tiết, lau một bề mặt hay làm việc sát con người — phần khó nhất thường bắt đầu sau khi vật đã biến mất sau những ngón tay.
Bước tiếp theo của robot vì thế có thể không nằm ở camera nhiều megapixel hơn. Nó nằm ở việc cho máy biết một điều rất cơ bản mà cơ thể con người đã biết từ lâu: khi chạm vào thế giới, thế giới đang chạm lại mình như thế nào.
Nguồn: Nature Sensors – Embodied sensorimotor integration for whole-arm tactile sensing and adaptive robotic manipulation; Nature Sensors – Biomimetic multimodal tactile sensing enables human-like robotic perception; Science Robotics – Visual-tactile pretraining and online multitask learning for humanlike manipulation dexterity; Meta FAIR – touch perception, Digit 360 and Sparsh; Figure – Helix 02; Unitree – Dex5-1.