NVIDIA DGX Spark 64GB giá 4.999 USD: ghép hai máy cho mô hình 200 tỷ tham số

Cấu hình mới giữ chip GB10 và bán qua các hãng OEM từ 23/10; hai máy nối bằng ConnectX-7 có tổng 128 GB bộ nhớ nhưng hiệu năng không tăng gấp đôi.

NVIDIA DGX Spark 64GB giá 4.999 USD: ghép hai máy cho mô hình 200 tỷ tham số

NVIDIA ngày 2/10 công bố cấu hình DGX Spark mới với 64 GB bộ nhớ hợp nhất, giá khởi điểm 4.999 USD và bắt đầu bán từ ngày 23/10 qua Acer, ASUS, Dell, Gigabyte, HP và MSI. Đây không phải một kiến trúc DGX Spark hoàn toàn mới: máy vẫn dùng GB10 Grace Blackwell, DGX OS và bộ phần mềm AI của NVIDIA. Thay đổi chính là lựa chọn bộ nhớ thấp hơn bản 128 GB, đồng thời hãng đẩy mạnh cách ghép hai máy bằng ConnectX-7 và NVIDIA Sync.

Thông báo đáng chú ý vì nó đặt một mốc giá mới cho máy AI để bàn của NVIDIA, nhưng các con số “100 tỷ” hay “200 tỷ tham số” cần được hiểu là giới hạn mô hình mà hãng nói hệ thống có thể hỗ trợ, không phải cam kết rằng mọi mô hình ở kích thước đó đều chạy với cùng tốc độ, ngữ cảnh hay chất lượng.

Một cấu hình 64 GB, không phải DGX Spark thế hệ mới

Theo thông báo chính thức của NVIDIA, bản 64 GB giữ GB10 Grace Blackwell Superchip và toàn bộ ngăn xếp phần mềm như bản 128 GB. trang thông số sản phẩm liệt kê CPU Arm 20 lõi, bộ nhớ LPDDR5X hợp nhất với băng thông 273 GB/giây, mạng ConnectX-7 200 Gb/giây, tối đa 4 TB NVMe và công suất AI tối đa 1 PFLOP ở độ chính xác FP4.

“Tối đa” là từ khóa quan trọng. Một con số FP4 không thể đại diện cho mọi workload; tốc độ thực tế còn phụ thuộc độ chính xác số, kiến trúc mô hình, runtime và mức tối ưu. Tương tự, NVIDIA nói một máy 64 GB hỗ trợ mô hình tới 100 tỷ tham số. Khả năng vừa bộ nhớ còn phụ thuộc cách lượng tử hóa trọng số, KV cache, độ dài ngữ cảnh và phần bộ nhớ dành cho hệ điều hành. Người mua không nên đọc mốc 100B như bảo đảm rằng bất kỳ model 100B nào cũng có thể chạy ở thiết lập đầy đủ.

Hai máy ghép thành 128 GB, nhưng hiệu năng không tăng gấp đôi

Mỗi DGX Spark có NIC ConnectX-7. Hai máy có thể nối trực tiếp bằng cáp QSFP, sau đó NVIDIA Sync Cluster Assistant kiểm tra cấu hình, thiết lập mạng tốc độ cao và SSH giữa các node. Khi workload và runtime hỗ trợ chạy đa node, cụm hai máy 64 GB có tổng cộng 128 GB bộ nhớ và NVIDIA nói nó có thể phục vụ mô hình tới 200 tỷ tham số.

Điểm đáng chú ý là hãng không tuyên bố hiệu năng tăng 2 lần. Trong thử nghiệm Qwen 3.8 27B do NVIDIA công bố, hai hệ thống đạt mức tăng “tới 1,7 lần” so với một máy. Bài viết không cung cấp đầy đủ batch size, độ dài đầu vào, lượng tử hóa, số token đầu ra hoặc kết quả lặp lại, nên đây nên được xem là số đo của nhà sản xuất trong một cấu hình cụ thể, chưa phải benchmark độc lập.

Ghép bộ nhớ cũng không biến hai máy thành một GPU duy nhất theo nghĩa mọi ứng dụng tự động sử dụng được. tài liệu NVIDIA Sync nói Cluster Assistant chuẩn bị mạng ConnectX-7 cho các thư viện như NCCL và MPI; phần mềm chạy mô hình vẫn phải biết phân phối công việc qua nhiều node. Sync Model Launcher, công cụ mà NVIDIA quảng bá để tải và chạy Qwen3.8 27B bằng vài thao tác, mới được hẹn vào cuối tháng 10.

Giá 4.999 USD chỉ là điểm bắt đầu

Một máy có giá khởi điểm 4.999 USD; cấu hình hai máy tương đương ít nhất 9.998 USD trước thuế, cáp, lưu trữ và khác biệt giá giữa các OEM. NVIDIA chưa nêu cấu hình SSD cụ thể đi kèm mức giá thấp nhất trong bài công bố. Bản 64 GB cũng chỉ bán qua đối tác sản xuất, không phải SKU NVIDIA trực tiếp cung cấp.

Đổi lại, nền tảng hỗ trợ CUDA-X, PyTorch, Ollama, vLLM và các công cụ agent của NVIDIA. Với nhóm cần giữ dữ liệu tại chỗ, thử inference hoặc xây agent luôn hoạt động, một máy để bàn có bộ nhớ hợp nhất lớn có thể giảm số lần phải thuê GPU đám mây. Tuy vậy, “chạy cục bộ” không tự động đồng nghĩa “an toàn”: ứng dụng vẫn có thể gửi telemetry, gọi API ngoài hoặc được cấp quyền đọc dữ liệu quá rộng. Quyền truy cập và luồng mạng vẫn phải được kiểm soát riêng.

Điều cần chờ sau ngày 23/10

DGX Spark 64 GB làm rõ chiến lược của NVIDIA: hạ giá vào cửa, rồi cho phép mở rộng bằng cụm nhỏ khi workload lớn hơn. Điều cần kiểm chứng là hiệu năng trên nhiều mô hình, điện năng và độ ổn định khi chạy dài, chi phí cáp/kết nối, cũng như mức dễ dùng thực tế của Sync Model Launcher. Cho tới khi có thử nghiệm độc lập, các mốc 100B, 200B và 1,7 lần nên được giữ đúng phạm vi là tuyên bố kỹ thuật của nhà sản xuất.

Nguồn tham khảo

Nguồn ảnh: NVIDIA, ảnh sản phẩm DGX Spark 64 GB trong thông báo ngày 2/10/2026.

Chia sẻ