Tag: Mixture-of-Experts
Mistral Large 4 vào public preview, trọng số chưa được phát hành
Mistral mở API xem trước cho mô hình MoE khoảng một nghìn tỷ tham số, nhưng trọng số, chi tiết kiến trúc và phương pháp hậu huấn l...
Kolibri‑1 mở trọng số: 78 tỷ tham số nhưng chỉ kích hoạt 3,46 tỷ ...
Mô hình song ngữ Đức–Anh của Aleph Alpha dùng kiến trúc MoE để giảm lượng tính toán mỗi token, nhưng vẫn đòi hỏi gần 78 GB bộ nhớ ...
Qwen3.8-Max củng cố tham vọng AI của Alibaba trong cuộc đua mô hì...
Qwen3.8-Max với 2,4 nghìn tỷ tham số, 95 tỷ tham số kích hoạt và context 1 triệu token cho thấy Alibaba đang đẩy mạnh chiến lược A...