Upscale ra mắt Token Fabric để nối GPU và chip AI khác hãng bằng một mạng chung

Kiến trúc kết hợp switch scale-up, thiết bị Spectrum-X và lớp điều phối chung; bản đầy đủ vẫn được triển khai theo giai đoạn sang năm 2027.

Upscale ra mắt Token Fabric để nối GPU và chip AI khác hãng bằng một mạng chung

Startup hạ tầng mạng Upscale ngày 8/10 giới thiệu Token Fabric, kiến trúc nhằm kết nối nhiều loại bộ tăng tốc AI trong cùng trung tâm dữ liệu. Thay vì bán một switch đơn lẻ, công ty ghép chip mạng scale-up của mình, hệ thống scale-out dùng NVIDIA Spectrum-X, hệ điều hành mạng và lớp điều phối vào một nền tảng chung.

Mục tiêu là giải quyết một vấn đề ngày càng rõ khi các nhà vận hành không chỉ dùng GPU của một hãng. Một cụm có thể gồm GPU, XPU chuyên suy luận và nhiều thế hệ card mạng. Nếu từng vùng dùng giao thức, công cụ quan sát và quy trình vận hành riêng, tài nguyên tính toán đắt tiền có thể chờ dữ liệu dù bản thân chip vẫn rảnh.

Token Fabric hiện là một lộ trình sản phẩm đang triển khai, không phải bằng chứng rằng mọi chip đã hoạt động tương thích ở quy mô thương mại. Upscale nói chương trình tiếp cận sớm và xác nhận chung đã bắt đầu; thời điểm cung cấp rộng rãi được dự kiến đầu năm 2027.

Scale-up và scale-out giải hai quãng đường khác nhau

Trong cụm AI, scale-up nối các bộ tăng tốc rất gần nhau, thường trong một rack hoặc pod, để chúng trao đổi dữ liệu với độ trễ thấp như các phần của một hệ lớn. Scale-out nối nhiều pod qua trung tâm dữ liệu, ưu tiên khả năng mở rộng, định tuyến và vận hành mạng diện rộng hơn.

Tài liệu ra mắt của Upscale đặt SkyFabriX ở lớp scale-up. Chip switch này được công bố băng thông 115,2 Tbps và hỗ trợ các hướng tiêu chuẩn mở như ESUN, UALoE, SUE-T, Ethernet/IP cùng lộ trình UALink. Các switch tray có thể dùng dạng rack tiêu chuẩn, ORV3 hoặc thiết kế riêng.

Ở lớp scale-out, thiết bị do Upscale thiết kế sử dụng silicon NVIDIA Spectrum-X, với kết nối từ 400G, 800G tới 1,6T trong lộ trình. Đây không phải tuyên bố rằng Upscale thay thế NVIDIA; công ty dùng công nghệ NVIDIA cho một phần nền tảng và dùng chip riêng cho phần khác.

Một hệ điều hành và bảng điều khiển cho cả hai lớp

SkyOS là lớp hệ điều hành mạng chung, còn SkyCMD gom điều phối và quan sát. Upscale mô tả SkyCMD có thể theo dõi hàng nghìn phần tử, phát hiện nút thắt và cảnh báo thiết bị có khả năng cần thay thế. Reuters cho biết mục tiêu là giữ bộ tăng tốc bận xử lý thay vì đứng chờ luồng dữ liệu.

Ý tưởng “một mặt phẳng vận hành” có giá trị vì lỗi hiệu năng AI thường không nằm ở một switch duy nhất. Nó có thể xuất hiện ở đường đi giữa các rack, cấu hình hàng đợi, card mạng hoặc mất cân bằng lưu lượng. Nếu dữ liệu quan sát của hai lớp được chuẩn hóa, đội vận hành có cơ hội tìm nguyên nhân nhanh hơn.

Tuy nhiên, những mô tả như “AI-native” hay “agent-native” là ngôn ngữ sản phẩm. Upscale chưa công bố bộ đo độc lập về độ trễ, mức sử dụng GPU, điện năng hoặc chi phí trên mỗi token so với giải pháp cạnh tranh. Khả năng quan sát không đồng nghĩa hệ thống tự động sửa mọi sự cố.

Mở tiêu chuẩn không tự động bảo đảm cắm là chạy

Token Fabric nhấn mạnh “bất kỳ GPU, XPU hay NIC nào” và các chuẩn mở. Lợi ích tiềm năng là giảm khóa chặt vào một hệ sinh thái, cho phép khách hàng chọn bộ tăng tốc phù hợp từng công việc. Nhưng một tiêu chuẩn chỉ xác định giao diện; hiệu năng thực còn phụ thuộc firmware, driver, topologie, quản lý bộ nhớ và việc các nhà cung cấp hoàn tất kiểm chứng chéo.

Hệ thống scale-up đòi hỏi độ trễ dự đoán được và giao tiếp gần với ngữ nghĩa bộ nhớ. Chỉ hỗ trợ cùng một giao thức trên giấy chưa chứng minh các bộ tăng tốc khác nhau sẽ đạt hiệu suất lý tưởng. Khách hàng vẫn cần xem ma trận phần cứng đã xác nhận, giới hạn quy mô và kết quả tải công việc thật.

Upscale đưa ra ba cách mua: toàn bộ stack; hệ thống tích hợp nhưng phần mềm tùy chọn; hoặc chip và switch tray để khách hàng dùng hệ điều hành mạng riêng. Sự linh hoạt này phù hợp từ doanh nghiệp nhỏ tới hyperscaler, nhưng cũng khiến kết quả phụ thuộc cấu hình cụ thể.

Lịch phát hành cần đọc theo từng thành phần

Thông cáo của Upscale nói cung cấp rộng rãi dự kiến đầu năm 2027. Trong trao đổi với Reuters, công ty cho biết phần đầu tiên kết nối các nhóm chip trên toàn trung tâm dữ liệu sẽ ra trong quý IV/2026, còn toàn bộ nền tảng triển khai theo giai đoạn trong năm 2027. Hai mốc có thể chỉ các phạm vi khác nhau, nhưng người mua cần xác nhận chính xác phần cứng và phần mềm nào có ở từng thời điểm.

Điều đáng theo dõi tiếp theo không phải danh sách đối tác hỗ trợ, mà là cụm tham chiếu có bộ tăng tốc khác hãng, số lượng thiết bị, băng thông hai chiều, tail latency và mức sử dụng dưới tải huấn luyện lẫn suy luận. Nếu Token Fabric chứng minh được các số liệu đó, mạng mở có thể trở thành một cách thực tế để phối hợp thị trường chip AI ngày càng phân mảnh.

Nguồn ảnh đại diện: Upscale, sơ đồ chính thức của Token Fabric; hình mô tả kiến trúc, không phải kết quả benchmark.

Nguồn tham khảo

Chia sẻ