Thiết kế quantum computer từng phải chờ mô phỏng gần hai tuần: 8 GPU H100 đưa một bài toán xuống 2 phút

Google Quantum AI và NVIDIA cho thấy GPU cổ điển có thể rút ngắn mạnh một số mô phỏng vật lý dùng để thiết kế QPU. Trong một benchmark cụ thể, mô hình transmon–resonator–Purcell filter giảm từ hơn 12 ngày trên CPU xuống khoảng 2 phút với 8 H100; một thử nghiệm khác dùng 1.024 H100 để mô phỏng chính xác hệ 40 qubit.

Thiết kế quantum computer từng phải chờ mô phỏng gần hai tuần: 8 GPU H100 đưa một bài toán xuống 2 phút

Một trong những công việc tốn thời gian nhất khi phát triển quantum computer không diễn ra trên chính quantum computer. Trước khi chế tạo hoặc thay đổi một QPU, kỹ sư thường phải mô phỏng trên máy tính cổ điển xem qubit, resonator, bộ lọc và môi trường xung quanh sẽ tương tác ra sao. Với các mô hình đủ chi tiết, một lần chạy có thể kéo dài nhiều ngày.

Google Quantum AI và NVIDIA đã cho thấy GPU có thể làm vòng lặp này ngắn đi đáng kể. Trong một benchmark công bố từ cuối năm 2024, mô phỏng một hệ gồm transmon qubit, resonator và Purcell filter mất hơn 12 ngày khi chạy bằng Qiskit Dynamics trên máy hai socket Intel Xeon 8480CL. Với cuQuantum trên tám GPU NVIDIA H100, cùng loại workload được báo cáo hoàn thành trong khoảng 2 phút.

Đây không phải bằng chứng rằng mọi bài toán thiết kế quantum computer đều từ hàng tuần xuống vài phút, cũng không có nghĩa GPU đang thay thế quantum processor. Điều được tăng tốc ở đây là mô phỏng vật lý của phần cứng quantum trên máy tính cổ điển — một công cụ dùng để thử thiết kế, nghiên cứu nhiễu và thu hẹp số phương án cần chế tạo thật.

Quantum computer cũng cần một “digital twin” trước khi được chế tạo

Mô phỏng quantum circuit và mô phỏng vật lý của QPU là hai việc khác nhau. Circuit simulator thường xem qubit như những phần tử logic lý tưởng, rồi mô phỏng chuỗi cổng quantum tác động lên trạng thái của chúng. Cách này hữu ích để nghiên cứu thuật toán và kiểm tra circuit.

Nhưng khi thiết kế phần cứng, kỹ sư cần đi xuống một tầng thấp hơn. Họ phải tính đến cách hệ quantum tiến hóa theo thời gian, cách qubit ghép với resonator, cách năng lượng rò rỉ ra môi trường và cách nhiễu ảnh hưởng đến quá trình đo. NVIDIA so sánh cách làm này với ngành bán dẫn: logic 0 và 1 đủ để mô tả chức năng của transistor ở mức trừu tượng, nhưng muốn thiết kế transistor tốt hơn vẫn phải mô phỏng điện áp, dòng điện, điện dung và nhiều hiệu ứng vật lý khác.

Trong QPU siêu dẫn, một ví dụ quan trọng là transmon qubit ghép với resonator và Purcell filter. Resonator giúp đọc trạng thái qubit; Purcell filter được dùng để hạn chế một số cơ chế mất năng lượng trong quá trình đó. Thiết kế các thành phần này là bài toán cân bằng: muốn đo nhanh nhưng không được làm qubit mất coherence quá sớm.

Từ hơn 12 ngày xuống 2 phút là benchmark nào?

Benchmark chi tiết nhất mà NVIDIA công bố mô phỏng một transmon có tối đa 64 mức, một resonator có tối đa 256 mức và một Purcell filter có bốn mức. Workload giả định 100 bước thời gian, với tích phân Runge–Kutta bậc bốn, tương đương tổng cộng 400 lần tác động toán tử.

Ở cấu hình lớn nhất, NVIDIA báo cáo thời gian đánh giá master equation vượt 12 ngày khi dùng Qiskit Dynamics trên hệ hai socket Intel Xeon 8480CL. Khi chuyển sang cuQuantum và tám GPU H100, thời gian giảm còn khoảng 2 phút.

Khoảng cách này rất lớn, nhưng cần đọc đúng phạm vi. Đây là một workload cụ thể, trên hai cấu hình phần cứng và hai software stack cụ thể. NVIDIA không công bố từ benchmark đó một hệ số tăng tốc có thể áp dụng cho mọi mô phỏng QPU. Chi phí sử dụng tám H100, mức tiêu thụ điện và hiệu quả kinh tế của toàn bộ workflow cũng không được đưa vào phép so sánh thời gian.

Ý nghĩa thực tế nằm ở vòng lặp thiết kế. Nếu một cấu hình qubit phải chờ nhiều ngày mới có kết quả, số phương án mà nhóm phần cứng có thể thử sẽ rất hạn chế. Khi một số mô phỏng được rút xuống vài phút, kỹ sư có thể quét nhiều bộ tham số hơn trước khi quyết định thiết kế nào đáng để đem đi chế tạo và đo trên phần cứng thật.

1.024 GPU H100 cho một mô phỏng 40 qubit là câu chuyện khác

Cùng dự án, Google và NVIDIA còn thực hiện một thử nghiệm có quy mô phần cứng lớn hơn nhiều: mô phỏng động lực học chính xác một chuỗi spin 40 qubit trên siêu máy tính NVIDIA Eos, sử dụng 1.024 GPU H100.

Hai kết quả này thường dễ bị gộp lại thành một con số duy nhất, nhưng chúng không phải cùng benchmark. Mốc hơn 12 ngày xuống 2 phút đến từ mô hình transmon–resonator–filter chạy trên tám GPU. Mô phỏng 40 qubit lại là bài toán spin-chain phân tán trên 1.024 GPU, nhằm cho thấy cuQuantum có thể mở rộng qua nhiều node và xử lý một không gian trạng thái lớn hơn.

Trong thử nghiệm spin-chain, nhóm nghiên cứu quan sát các measurement-induced phase transition khi thay đổi tần suất phép đo trên từng qubit. Theo NVIDIA, đây là mô phỏng động lực học chính xác của QPU lớn nhất mà họ đã thực hiện tại thời điểm công bố.

Con số 40 qubit nghe nhỏ nếu so với QPU vật lý có hàng chục hoặc hàng trăm qubit, nhưng với mô phỏng cổ điển chính xác, độ khó không tăng tuyến tính. Trạng thái đầy đủ của hệ n qubit có kích thước tỷ lệ với 2n. Mỗi qubit thêm vào về nguyên tắc có thể làm lượng thông tin cần lưu tăng gấp đôi. Đó là lý do một bài toán vài chục qubit có thể cần cả một cụm GPU lớn.

Vì sao GPU hợp với loại mô phỏng này?

Các phương trình mô tả quantum dynamics đòi hỏi lượng lớn phép toán tuyến tính trên vector và ma trận. Đây là nhóm công việc mà GPU có lợi thế nhờ hàng nghìn lõi thực hiện nhiều phép toán song song cùng lúc, cộng với băng thông bộ nhớ cao và kết nối GPU–GPU nhanh trong hệ thống HPC.

CUDA-Q cung cấp tầng phần mềm ở mức cao hơn cho các workflow quantum–classical, còn cuQuantum cung cấp các thư viện thấp hơn để tăng tốc những primitive tính toán như thao tác state vector, tensor network và quantum dynamics. Với mô phỏng động lực học, CUDA-Q còn có solver tích hợp cho các phương trình như Lindblad master equation, dùng để mô tả hệ quantum mở chịu tác động từ môi trường.

Trong một benchmark khác của cùng bài công bố, CUDA-Q chạy mô phỏng noisy spin chain 14 qubit trên một H100 nhanh gần 22 lần so với kết quả CPU được so sánh. Một trong các simulator CPU thậm chí không đủ bộ nhớ để đi xa hơn 12 qubit trong cấu hình thử nghiệm đó.

GPU không làm quantum computer “nhanh hơn” theo cách dễ hiểu nhầm

Điều đáng tránh nhất khi đọc những benchmark này là kết luận rằng GPU đang biến máy tính cổ điển thành quantum computer hoặc khiến thuật toán quantum chạy nhanh hơn hàng nghìn lần.

GPU đang làm một công việc hỗ trợ: mô phỏng, hiệu chuẩn, thiết kế, giải mã sửa lỗi hoặc xử lý cổ điển quanh QPU. Một QPU thật vẫn cần qubit vật lý, hệ điều khiển, cryogenics hoặc các cơ chế đặc thù tùy công nghệ, và cuối cùng phải chứng minh fidelity, coherence cùng khả năng sửa lỗi ở quy mô lớn.

Cũng không thể dùng tốc độ mô phỏng 40 qubit để suy ra rằng máy tính cổ điển sẽ mô phỏng hiệu quả quantum computer ở mọi kích thước. Chính tốc độ tăng 2n của state space khiến exact simulation sớm trở nên quá đắt khi số qubit tăng. GPU chủ yếu đẩy giới hạn đó ra xa hơn và giúp những mô hình trước đây quá chậm trở nên thực dụng trong phạm vi nhất định.

Từ simulation sang codesign fault-tolerant

Hướng đi này vẫn tiếp tục sau kết quả năm 2024. Ngày 14/9/2026, NVIDIA mở rộng CUDA-Q với CUDA-Q Logical, một lớp orchestration nhằm mô hình hóa đồng thời thuật toán, error correction, logical qubit và kiến trúc phần cứng cho quantum computer chịu lỗi.

Trong một kết quả NVIDIA công bố cùng đợt, Fermilab dùng CUDA-Q Logical để biến quy trình đánh giá kiến trúc fault-tolerant vốn mất khoảng năm tháng thành workflow khoảng ba tuần. Đây là loại tăng tốc khác với benchmark 2 phút của Google, nhưng cùng phản ánh một xu hướng: khi quantum hardware còn đắt, chậm và khó thay đổi, càng nhiều quyết định được chuyển sang mô phỏng trên hạ tầng GPU trước khi chạm tới QPU thật.

Nút thắt vì vậy không chỉ là chế tạo qubit tốt hơn. Ngành quantum còn phải rút ngắn vòng lặp giữa thiết kế, mô phỏng, fabrication, calibration và error correction. GPU không giải quyết bản thân bài toán quantum computing, nhưng nếu nó biến một số lần thử từ nhiều ngày thành vài phút, số thiết kế mà kỹ sư có thể loại bỏ trước khi vào phòng lab sẽ tăng lên đáng kể.

Nguồn: NVIDIA Technical Blog — Accelerating Google’s QPU Development with New Quantum Dynamics Capabilities; NVIDIA Newsroom — Google Quantum AI processor design; NVIDIA — CUDA-Q Logical, 14/9/2026.

Chia sẻ