Camera vốn tạo ảnh cho con người: Robot tương lai có thể bỏ qua ảnh và nhìn thế giới bằng token
FLEET, một nghiên cứu từ Leibniz University Hannover, cho robot học điều khiển trực tiếp từ dòng sự kiện của event camera thay vì dựng chúng thành ảnh hoặc tensor dạng lưới. Hệ thống nén các thay đổi sáng thành token phục vụ hành động; kết quả mô phỏng cho thấy lợi thế rõ ở bài toán chuyển động nhanh, nhưng chưa được chứng minh trên robot và camera thật.
Một chiếc camera thông thường làm một việc rất quen thuộc: cứ sau một khoảng thời gian, nó ghi lại toàn bộ khung hình. Cách biểu diễn này cực kỳ thuận tiện vì con người có thể nhìn, lưu và kiểm tra ảnh. Nhưng nếu người nhận dữ liệu không phải con người mà là một robot chỉ cần biết phải đánh lái, tránh vật cản hay giữ thăng bằng, việc dựng một bức ảnh hoàn chỉnh trước rồi mới suy luận từ ảnh có thể là một vòng trung gian không cần thiết.
Một nhóm tại Institute of Information Processing và L3S Research Centre, Leibniz University Hannover, đang thử đi thẳng qua vòng đó. Trong nghiên cứu FLEET: Token-Based Feature Extraction for Event Camera-based Reinforcement Learning, Tristan Gottwald, Maximilian Schier, Melanie Schaller và Bodo Rosenhahn cho một tác nhân reinforcement learning xử lý trực tiếp dòng dữ liệu bất đồng bộ từ event camera, nén nó thành một tập token ẩn rồi dùng những token này để ra quyết định điều khiển.
Ở các hình minh họa thí nghiệm, nhóm thậm chí phải gom dữ liệu event trở lại thành ảnh chỉ để con người nhìn được. Với tác nhân điều khiển, bước đó không tồn tại.
Event camera không thực sự chụp “ảnh”
Camera RGB thông thường đọc hàng triệu pixel cùng lúc theo từng frame: 30, 60 hay hàng trăm lần mỗi giây. Dù cảnh gần như không thay đổi, toàn bộ ma trận pixel vẫn được ghi lại.
Event camera hoạt động khác. Mỗi pixel tự theo dõi độ sáng tại vị trí của nó và chỉ phát một sự kiện khi độ sáng thay đổi vượt một ngưỡng nhất định. Mỗi event về cơ bản chứa bốn thông tin: thời điểm xảy ra, tọa độ x-y và dấu của thay đổi sáng. Đầu ra vì vậy không phải chuỗi ảnh hoàn chỉnh mà là một dòng những điểm hoạt động rải rác theo không gian và thời gian.
Cách cảm nhận này có một số thuộc tính hấp dẫn đối với robot: dữ liệu có thể xuất hiện với độ trễ rất thấp, thông tin thời gian rất chi tiết và những vùng không thay đổi gần như không tạo dữ liệu. Một vật lao vào trường nhìn có thể tạo event ngay khi pixel tương ứng thay đổi, thay vì phải chờ tới frame kế tiếp.
Rắc rối là phần lớn computer vision hiện đại được xây quanh ảnh. CNN, nhiều pipeline thị giác và cả hạ tầng phần mềm đều thích dữ liệu nằm trên một lưới vuông đồng bộ. Vì vậy, một cách phổ biến để xử lý event camera là gom các event trong một khoảng thời gian thành frame hoặc voxel rồi đưa cấu trúc đó vào mạng neural.
Nhưng khi làm vậy, một phần lợi thế ban đầu của event camera biến mất. Dòng dữ liệu bất đồng bộ lại bị ép vào các “lát thời gian” đồng bộ; một tensor lớn phải được xử lý dù phần lớn vị trí trống; và chi phí tính toán bắt đầu phụ thuộc vào độ phân giải của sensor thay vì lượng thông tin thực sự xuất hiện.
FLEET bỏ lưới pixel và đi thẳng tới token
FLEET không cố tái dựng một cảnh đẹp để con người xem. Nó giữ event ở dạng chuỗi.
Trong pipeline của nhóm Hannover, mỗi event mang vị trí và thời gian được chuẩn hóa rồi ánh xạ vào một không gian embedding bằng random Fourier features. Một cơ chế temporal gating kết hợp thông tin không gian với thời điểm xảy ra event. Sau đó, cross-attention kiểu Perceiver dùng một số lượng cố định các vector học được để “hỏi” toàn bộ dòng event và cô đặc nó thành một tập latent token.
Có thể hình dung camera tạo ra rất nhiều tín hiệu kiểu “ở tọa độ này vừa có thứ gì đó sáng hơn”, “vị trí kia vừa tối đi”. Thay vì ghép chúng lại thành một bức ảnh, FLEET tìm cách nén trực tiếp dòng thay đổi đó thành các biểu diễn mà policy điều khiển cần.
Đây là một khác biệt quan trọng về mục tiêu học. Một autoencoder được huấn luyện để tái dựng dữ liệu phải giữ lại thông tin đủ để tạo lại cảnh. FLEET không có loss tái dựng ảnh. Feature extractor được huấn luyện end-to-end bằng reward của bài toán reinforcement learning, nên về nguyên tắc nó chỉ cần giữ những gì hữu ích cho hành động.
Nói cách khác, nếu texture của bức tường không giúp xe chạy nhanh hơn hay tránh va chạm, mô hình không có lý do rõ ràng để dành năng lực biểu diễn cho việc tái tạo texture đó.
“Nhìn bằng token” không có nghĩa camera đã xuất token
Cách nói này cần một giới hạn kỹ thuật. Sensor trong FLEET vẫn là event camera, và đầu ra nguyên thủy vẫn là các event với tọa độ, thời gian và polarity. Token xuất hiện ở tầng xử lý phía sau sensor, khi mạng neural nén chuỗi event thành latent representation.
Điều nghiên cứu thực sự bỏ đi là bước biến dữ liệu sensor thành một biểu diễn giống ảnh trước khi học điều khiển. Đây không phải một loại camera mới có phần cứng phát token trực tiếp, và FLEET cũng không chứng minh rằng mọi robot nên vứt bỏ camera RGB.
Dù vậy, sự thay đổi này đáng chú ý vì nó đảo ngược một giả định lâu đời của machine vision: dữ liệu thị giác không nhất thiết phải được định dạng theo thứ mà con người gọi là “hình ảnh” trước khi máy có thể sử dụng nó.
Trong bài đua mô phỏng, token thắng cả pipeline RGB
Nhóm đánh giá FLEET trên ba bài toán continuous control: xe chạy trên đường đua, đỗ xe và con lắc kép đảo ngược. Hai bài toán xe sử dụng môi trường Event-CarEnv do nhóm mở rộng từ CarEnv; event camera trong nghiên cứu là camera mô phỏng, với event được ước lượng từ các frame render của simulator chứ chưa phải sensor vật lý trên robot.
Ở bài Racing, FLEET đạt interquartile mean của episodic return là 46,96. Baseline event-camera mạnh nhất trong so sánh, DMRCNN, đạt 12,94; CNN dùng ảnh RGB đạt 23,89. Trong Parking, FLEET đạt 5,67 so với 5,01 của RGB CNN.
Kết quả này phù hợp với trường hợp mà event camera được kỳ vọng có lợi: cảnh thay đổi nhanh, dữ liệu thưa và thông tin thời gian quan trọng. Các CNN nhận event đã gom thành lưới gặp khó khi tensor trở nên quá sparse; trong bài Racing, tác giả cho biết nhiều baseline cuối cùng học chính sách gần như chỉ chạy thẳng rồi đâm ở khúc cua đầu tiên.
Nhưng kết quả thứ ba là lời nhắc rằng token event không mặc nhiên tốt hơn ảnh. Với bài inverted double pendulum, FLEET đạt 6.390,41 điểm và vượt xa các baseline event khác, nhưng CNN dùng RGB đạt 8.980,69. Camera ở bài này đứng yên và quan sát toàn bộ môi trường; khi bandwidth không bị hạn chế, một frame dày đặc có thể chứa trạng thái rất thuận tiện cho policy.
Vì vậy, paper không chứng minh “ảnh đã lỗi thời”. Nó cho thấy có những bài toán điều khiển mà việc ép một sensor bất đồng bộ trở lại thành ảnh có thể chính là phần làm hệ thống kém hiệu quả.
Độ phân giải tăng, phần backbone không phình theo pixel
Một lợi thế khác của FLEET xuất hiện khi nhóm tăng độ phân giải event camera mô phỏng từ 96×64 lên 384×256. CNN phải xử lý grid lớn hơn nên FLOPs và bộ nhớ tăng mạnh. FLEET lấy một chuỗi event có độ dài cố định rồi cô đặc thành số token cố định; vì thế phần tính toán chính sau bottleneck không tăng theo số pixel của sensor.
Trong benchmark của paper, FLEET giữ mức 83,28 GFLOPs và 4,09 GB VRAM trên cả bốn độ phân giải được kiểm tra. Ở 384×256, DMRCNN cần 1.053,09 GFLOPs còn NatureCNN cần 2.876,33 GFLOPs.
Nhóm cũng đo thời gian xử lý một minibatch 5.120 transition trên RTX 3090. Ở độ phân giải cao nhất, FLEET mất 11,76 ms trong thiết lập của họ, trong khi DMRCNN mất 3.690,64 ms và NatureCNN 4.778,59 ms. Đây là con số benchmark của implementation và batch cụ thể, không nên diễn giải thành độ trễ của một robot ngoài đời; nhưng nó minh họa khá rõ chi phí của việc biến dữ liệu thưa thành một grid ngày càng lớn.
Một hướng khác cũng đang bỏ frame: Spiking Patches
FLEET không phải nghiên cứu duy nhất đi theo hướng này. Một nhóm tại Technical University of Denmark gần đây giới thiệu Spiking Patches, một tokenizer cho event camera được chấp nhận tại IROS 2026.
Spiking Patches gom các event theo quan hệ không gian và thời gian thành token nhưng vẫn cố giữ hai đặc tính gốc của event camera: tính bất đồng bộ và spatial sparsity. Nhóm thử representation này với graph neural network, point-cloud network và Transformer trên gesture recognition cùng object detection.
Trong các benchmark của họ, token cho thời gian inference nhanh hơn tới 3,4 lần so với voxel và tới 10,4 lần so với frame, trong khi độ chính xác nhìn chung ngang bằng hoặc cao hơn tùy cấu hình. Đây là một bài toán khác FLEET — perception thay vì reinforcement-learning control — nhưng cả hai cùng đặt ra một câu hỏi giống nhau: nếu sensor đã cho dữ liệu thưa và bất đồng bộ, tại sao phải biến nó thành ảnh rồi mới đưa cho model?
Khoảng cách từ simulator tới robot thật vẫn còn lớn
Giới hạn quan trọng nhất của FLEET là phần thực nghiệm hiện tại vẫn nằm trong môi trường mô phỏng. Paper chưa cho thấy một robot thật chạy bằng event camera thật, với noise của sensor, độ trễ truyền dữ liệu, rung cơ học, thay đổi ánh sáng, calibration và các failure mode của phần cứng thực.
Event camera cũng không phải bản thay thế đầy đủ cho RGB. Nó đặc biệt nhạy với thay đổi độ sáng, chứ không tạo ra một ảnh màu hoàn chỉnh của cảnh tĩnh. Những tác vụ cần đọc chữ, nhận màu, phân biệt texture hay hiểu những vật không chuyển động có thể vẫn hưởng lợi lớn từ frame camera hoặc hệ sensor kết hợp.
Ngay cả trong FLEET, việc đưa chuỗi event về độ dài cố định đồng nghĩa một số event phải được lấy mẫu khi dòng dữ liệu quá dày. Kiến trúc tránh grid, nhưng không khiến lượng thông tin vật lý trở nên miễn phí.
Vì vậy, bước tiếp theo đáng quan tâm không phải là robot “không còn cần camera”, mà là thử cùng ý tưởng trên hardware thật và xem pipeline event-to-token có giữ được lợi thế khi toàn bộ hệ thống — sensor, bus dữ liệu, accelerator và actuator — cùng tham gia.
Ảnh có thể trở thành giao diện cho con người, không phải định dạng bắt buộc của máy
Một chi tiết trong paper FLEET tóm gọn khá tốt ý tưởng này. Khi trình bày dữ liệu event trong các hình minh họa, tác giả phải tạm thời gom chúng thành ảnh “strictly for human interpretability” — chỉ để con người có thể hiểu hình đang cho thấy điều gì.
Với model điều khiển, bức ảnh đó không cần được tạo ra.
Nếu cách tiếp cận này tiếp tục hoạt động trên robot thật, camera của máy có thể dần tách khỏi quan niệm camera của con người. Một robot tốc độ cao không nhất thiết phải “nhìn” thế giới như một chuỗi ảnh 60 fps. Nó có thể nhận những thay đổi khi chúng xảy ra, cô đặc chúng thành token và chuyển gần như trực tiếp từ cảm nhận sang hành động. Bức ảnh khi ấy vẫn hữu ích — nhưng chủ yếu vì kỹ sư đứng cạnh robot muốn nhìn xem chuyện gì đang xảy ra.
Nguồn: Tristan Gottwald và cộng sự, FLEET: Token-Based Feature Extraction for Event Camera-based Reinforcement Learning, 2026; repository chính thức FLEET; danh mục công bố của Institute of Information Processing, Leibniz University Hannover; Christoffer Koo Øhrstrøm, Ronja Güldenring và Lazaros Nalpantidis, Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras.