Chip ánh sáng đã đủ nhanh để gây chú ý: Cuộc đua tiếp theo là ai xây được “CUDA cho photon”
Photonic accelerator đã chạy ResNet, BERT, diffusion model và những bài toán tối ưu ở độ trễ vài nano-giây. Nhưng phần cứng nhanh chưa đủ. Q.ANT, Lightmatter, Lightelligence và các compiler độc lập đang đụng vào bài toán khó hơn: làm sao để một model PyTorch có thể đi từ code quen thuộc xuống phần cứng ánh sáng mà developer không phải tự điều khiển từng modulator, laser và bộ chuyển đổi analog–digital.
Một photonic chip có thể thực hiện phép nhân ma trận với độ trễ tính bằng nano-giây. Điều đó gây ấn tượng trong paper, nhưng gần như vô nghĩa với developer nếu để chạy một model họ phải tự hiểu phase của ánh sáng, hiệu chỉnh modulator, quản lý ADC/DAC và viết lại toàn bộ pipeline cho một kiến trúc riêng.
Đó là lý do cuộc đua photonic computing đang bắt đầu chuyển tầng. Sau nhiều năm các nhóm nghiên cứu cạnh tranh bằng TOPS, độ trễ và năng lượng trên mỗi phép toán, câu hỏi tiếp theo ngày càng giống câu hỏi từng quyết định số phận của GPU: ai xây được lớp phần mềm khiến phần cứng mới trở nên đủ dễ dùng?
Ngày 23/9/2026, Q.ANT đẩy câu hỏi này ra trước công chúng khi phát hành Native Computing Toolkit dưới giấy phép Apache 2.0. Bộ SDK cung cấp API Python và C/C++, tài liệu, ví dụ và một CPU backend để developer viết chương trình mà chưa cần sở hữu photonic processor. Trong khi đó, Lightmatter đã xây một software stack tên Idiom cho Envise với graph compiler, runtime, profiler và debugger; Lightelligence cũng từng công bố stack gồm SDK, compiler, graph tools, runtime, simulator và profiling cho phần cứng quang tử của mình.
Chưa hệ nào là “CUDA cho photon” theo đúng nghĩa. Nhưng chúng cho thấy photonic computing đã tới giai đoạn mà software stack không còn là phần phụ đặt sau slide benchmark.
Phần cứng không còn chỉ là một thí nghiệm quang học
Gọi photonic computing là “máy tính bằng ánh sáng” dễ tạo cảm giác rằng photon sắp thay transistor trong toàn bộ CPU. Thực tế hiện tại hẹp hơn nhiều. Phần lớn hệ thống thương mại và prototype tiên tiến là accelerator lai quang–điện: ánh sáng đảm nhiệm những phép toán tuyến tính như matrix–vector multiplication, còn memory, control flow, activation, giao tiếp host và nhiều phép toán khác vẫn chạy trong điện tử.
Dù vậy, khoảng cách từ lab tới workload thực đã thu hẹp rõ rệt. Năm 2025, nhóm Lightmatter báo cáo trên Nature một photonic AI processor có thể chạy các model như ResNet, BERT và bài toán reinforcement learning Atari với độ chính xác gần hệ điện tử trên những workload được thử nghiệm. Đây là bước khác với các demo optical neural network nhỏ vốn chỉ phân loại vài lớp dữ liệu đơn giản.
Cũng trong Nature năm 2025, nhóm Lightelligence trình diễn hệ PACE gồm hơn 16.000 thành phần quang tử, ma trận 64 × 64 và xung nhịp tới 1 GHz. Với workload Ising cụ thể, một vòng lặp của hệ có thể xuống khoảng 5 ns; nhóm đo một vòng tương ứng trên NVIDIA A10 ở hơn 2.300 ns. So sánh này không có nghĩa PACE nhanh hơn GPU hàng trăm lần với mọi AI workload. Nó chỉ cho thấy khi một bài toán khớp rất tốt với optical matrix multiply và vòng lặp được thiết kế quanh phần cứng đó, lợi thế độ trễ có thể trở nên rất lớn.
Q.ANT chọn một hướng khác. Native Processing Unit của hãng đã được Leibniz Supercomputing Centre đưa vào môi trường HPC để đánh giá thực tế. LRZ báo cáo NPU thế hệ hai có throughput matrix multiplication cao hơn hơn 50 lần, inference ResNet-18 nhanh hơn 25 lần và dùng ít năng lượng hơn sáu lần so với thế hệ Q.ANT đầu tiên. Đây không phải benchmark thắng GPU; nó cho thấy kiến trúc đang tiến đủ nhanh để software ecosystem trở thành vấn đề thực tế, thay vì chỉ là câu chuyện tương lai.
CUDA thành công không chỉ vì có một ngôn ngữ lập trình GPU
Ví von “CUDA cho photon” có ích nếu hiểu CUDA rộng hơn một API. Hệ sinh thái CUDA gồm compiler, runtime, các thư viện toán học đã tối ưu, debugger, profiler, mô hình memory, công cụ tracing và tích hợp với những framework mà developer dùng hàng ngày. NVIDIA không yêu cầu mỗi lập trình viên machine learning phải hiểu cách từng SM trên GPU lập lịch warp trước khi gọi matrix multiplication.
Đó chính là khoảng cách mà photonic computing phải lấp. Một developer muốn đưa model lên accelerator quang tử không thực sự quan tâm MZI nào thay đổi phase bao nhiêu radian. Họ muốn biết layer nào chạy được, precision nào được hỗ trợ, tensor phải có shape gì, khi nào dữ liệu bị copy, latency thực tế là bao nhiêu và đoạn nào đang trở thành bottleneck.
Q.ANT mới đi vào lớp đầu tiên của vấn đề này. Repository chính thức hiện cho phép cài package Python hoặc thư viện C/C++. Có hai đường chạy: backend cho hardware thật và cpu-backend để phát triển standalone mà không cần driver Q.ANT. Đây là một lựa chọn quan trọng cho hệ sinh thái mới, vì nó phá vòng lặp quen thuộc: không ai viết ứng dụng vì không có phần cứng, và không ai mua phần cứng vì chưa có ứng dụng.
Nhưng SDK hiện chưa biến một model PyTorch bất kỳ thành workload quang tử chỉ bằng một flag. Chính khoảng trống đó đang tạo chỗ cho một lớp công cụ khác.
Compiler có thể là nơi cuộc đua thực sự diễn ra
Daisytuner là một ví dụ đáng chú ý. Công ty compiler này đã đưa một object-detection model từ PyTorch xuống Q.ANT NPU Gen 2 mà không yêu cầu viết lại model bằng một DSL quang tử riêng. Theo Daisytuner, pipeline của họ xử lý cả preprocessing, inference và post-processing, đồng thời tự quyết định phần nào có thể offload xuống accelerator.
Nếu hướng này mở rộng được, “CUDA cho photon” có thể không nhất thiết thuộc về nhà sản xuất photonic chip. Một compiler trung gian có thể nhận graph từ PyTorch, TensorFlow hoặc ONNX, phân tích operator nào phù hợp với optical core rồi sinh code cho nhiều backend khác nhau. Đây là mô hình gần với MLIR, XLA hay những compiler cho heterogeneous computing hơn là một SDK khóa chặt vào một loại phần cứng.
Lightmatter từng thiết kế Idiom theo hướng khá đầy đủ. Tài liệu của hãng mô tả idCompile có thể partition neural network giữa nhiều Envise blade, chuyển precision, tạo execution schedule và chọn data/model parallelism; idProfiler theo dõi memory và bottleneck; idBug hỗ trợ tìm lỗi; còn idML cung cấp front-end PyTorch cùng các công cụ quantization. Đây gần với hình hài của một accelerator software stack trưởng thành hơn một API gọi kernel.
Có một chi tiết đáng lưu ý: chiến lược thương mại gần hạn của Lightmatter hiện tập trung mạnh vào Passage — nền tảng optical interconnect cho AI cluster — hơn là đẩy Envise thành đối thủ GPU ngay lập tức. Nhưng việc Idiom tồn tại vẫn cho thấy software mà một photonic compute platform cần cuối cùng sẽ phức tạp tới mức nào.
Lightelligence cũng đã đi theo hướng vertically integrated. Tài liệu Hummingbird của hãng liệt kê TensorFlow ở tầng framework, phía dưới là SDK, compiler, graph tools, debugger, profiler, runtime, simulator, driver và firmware. PACE 2 hiện là accelerator card lập trình được với optical matrix 128 × 128. Vấn đề là những stack kiểu này chủ yếu gắn với phần cứng của từng vendor, trong khi chưa có một abstraction chung đủ mạnh để model dễ dàng chuyển giữa nhiều photonic architecture.
Compiler cho photon phải giải quyết những thứ CUDA ban đầu không gặp
Một optical accelerator không đơn giản là GPU với transistor được thay bằng photon. Nhiều thiết kế thực hiện phép toán trong miền analog. Điều đó đưa thêm những biến số mà compiler và runtime phải biết: nhiễu, calibration, dynamic range, precision thực tế, drift theo nhiệt độ và chi phí chuyển đổi giữa tín hiệu điện với quang.
Trong hệ PACE được công bố trên Nature, dữ liệu và weight đi qua DAC, modulator quang, photodetector, amplifier và comparator trước khi quay lại phần điện tử. Hệ đạt throughput khoảng 8,19 TOPS trong cấu hình được báo cáo, nhưng chính paper cũng nhấn mạnh rằng photonic computing chưa có optical memory đủ thực dụng và vẫn phải dựa vào cointegration điện–quang. Mỗi lần dữ liệu phải rời vùng quang, lợi thế của phần core có thể bị bào mòn.
Vì vậy một compiler tốt không thể chỉ hỏi “operator này có matrix multiplication không?”. Nó còn phải quyết định liệu offload có đáng hay không sau khi tính cả transfer, quantization, conversion và synchronization. Một matrix nhỏ có thể nhanh hơn nếu giữ trên CPU/GPU. Một matrix lớn được reuse nhiều lần có thể đáng đưa sang optical core. Hai layer riêng lẻ có thể rất nhanh trên photon nhưng toàn graph lại chậm nếu phải đổi miền tín hiệu liên tục.
Đây là lý do profiler đặc biệt quan trọng. Benchmark một optical core trong isolation không nói cho developer biết model end-to-end nhanh hơn bao nhiêu. Software cần cho thấy thời gian bị tiêu ở host, I/O, conversion, photonic execution hay memory; nếu không, “5 ns” ở một block có thể biến mất trong microsecond hoặc millisecond của hệ thống xung quanh.
“CUDA cho photon” có thể không phải một CUDA duy nhất
GPU có lợi thế lịch sử là một kiến trúc số tương đối thống nhất. Photonic computing hiện phân mảnh hơn. Có hệ dùng Mach–Zehnder interferometer, hệ dùng thin-film lithium niobate, hệ dùng free-space optics, wavelength multiplexing hoặc các kiến trúc analog lai khác nhau. Precision, reconfigurability và loại phép toán native cũng khác đáng kể.
Điều đó tạo ra hai con đường. Một vendor có thể xây stack tích hợp dọc thật tốt và biến phần cứng của mình thành đích mặc định, giống cách CUDA gắn với GPU NVIDIA. Hoặc ngành có thể tiến về compiler/runtime trung gian, nơi PyTorch graph được hạ xuống một intermediate representation rồi target nhiều loại optical accelerator.
Con đường thứ hai hấp dẫn với developer, nhưng khó hơn về kỹ thuật. Một abstraction chung chỉ hữu ích nếu nó không xóa mất chính những đặc tính khiến từng photonic architecture nhanh. Nếu mọi chip bị ép giả vờ giống một GPU, compiler có thể bỏ phí khả năng native của photon. Nếu API phơi bày quá nhiều chi tiết vật lý, portability lại biến mất.
Benchmark tiếp theo nên bắt đầu từ một repository, không phải một slide TOPS
Trong vài năm tới, một phép thử hữu ích cho photonic computing có thể đơn giản hơn việc hỏi chip đạt bao nhiêu TOPS: lấy một model phổ biến, clone repository, compile nó cho accelerator, profile toàn pipeline và xem developer phải sửa bao nhiêu dòng code.
Q.ANT vừa làm một phần của bài kiểm tra đó có thể bắt đầu ngay trên laptop. Daisytuner cho thấy PyTorch có thể được biên dịch xuống hardware thật. Lightmatter và Lightelligence đã chứng minh rằng compiler, profiler và simulator không phải phụ kiện — chúng là một phần của kiến trúc sản phẩm.
Photon đã chứng minh rằng nó có thể nhân ma trận rất nhanh trong những điều kiện phù hợp. Câu hỏi khó hơn bây giờ là liệu developer có thể khai thác lợi thế đó mà không cần trở thành kỹ sư quang học.
Nếu câu trả lời cuối cùng là có, công nghệ quyết định cuộc đua photonic computing có thể không phải một modulator nhanh hơn hay một laser hiệu quả hơn. Nó có thể là lớp phần mềm đủ tốt để developer quên rằng phía dưới chương trình của mình đang tính toán bằng ánh sáng.