Kolibri‑1 mở trọng số: 78 tỷ tham số nhưng chỉ kích hoạt 3,46 tỷ mỗi token
Mô hình song ngữ Đức–Anh của Aleph Alpha dùng kiến trúc MoE để giảm lượng tính toán mỗi token, nhưng vẫn đòi hỏi gần 78 GB bộ nhớ chỉ cho trọng số.
Aleph Alpha ngày 3/10 phát hành Kolibri‑1, một mô hình ngôn ngữ song ngữ Đức–Anh có thể tải trọng số về và sử dụng theo giấy phép Apache 2.0. Con số nổi bật nhất là 78,1 tỷ tham số tổng cộng, nhưng kiến trúc mixture-of-experts chỉ kích hoạt khoảng 3,46 tỷ tham số cho mỗi token. Cách thiết kế này nhằm giữ năng lực của một mô hình lớn trong khi giảm lượng tính toán thực tế ở từng bước suy luận.
Kolibri‑1 không phải mô hình “nhỏ” theo nghĩa có thể chạy trên mọi máy cá nhân. Model card cho biết riêng trọng số FP8 đã chiếm khoảng 78 GB. Cấu hình tối thiểu được Aleph Alpha liệt kê là hai GPU A100 80 GB, hai H100 SXM5 hoặc một GPU H200, B200 hay B300. Vì vậy, điểm đáng chú ý của mô hình nằm ở hiệu suất phục vụ trong trung tâm dữ liệu và khả năng triển khai tại chỗ, không phải chạy cục bộ trên laptop.
78 tỷ tham số nhưng chỉ một phần làm việc mỗi token
Trong mô hình dense, hầu hết tham số của các lớp chính đều tham gia xử lý mỗi token. Với mixture-of-experts, một bộ định tuyến chỉ chọn một nhóm “chuyên gia” phù hợp. Kolibri‑1 có 50 lớp MoE, mỗi lớp gồm 384 expert, trong đó một expert dùng chung và sáu expert được định tuyến hoạt động cho mỗi token.
Điều này tạo ra một đánh đổi quan trọng. Lượng phép tính cho từng token gần với mô hình khoảng 3,46 tỷ tham số hoạt động, nhưng hệ thống vẫn phải giữ toàn bộ trọng số 78 tỷ tham số trong bộ nhớ để sẵn sàng gọi các expert khác nhau. Nói ngắn gọn, MoE giảm chi phí tính toán tốt hơn là giảm yêu cầu bộ nhớ.
Ngữ cảnh một triệu token cần được đọc đúng
Aleph Alpha công bố Kolibri‑1 hỗ trợ ngữ cảnh tối đa 1.048.576 token. Tuy nhiên, model card cũng ghi rõ mô hình được pre-train ở độ dài 16.384 token, mid-train ở 65.536 token và trải qua giai đoạn huấn luyện ngữ cảnh dài ở 262.144 token. Chất lượng và hiệu quả phục vụ sau đó được kiểm chứng tới một triệu token nhờ thiết kế attention kết hợp cửa sổ trượt với một lớp full attention sau mỗi năm lớp.
Chính nhà phát triển khuyến nghị giữ ngữ cảnh không quá 262.144 token đối với tác vụ phức tạp hoặc hệ thống nhạy về độ trễ và thông lượng. Vì thế, “một triệu token” nên được xem là mức đã được kiểm tra, không phải lựa chọn mặc định luôn tối ưu. Tài liệu dài hơn làm tăng bộ nhớ KV cache, thời gian xử lý và nguy cơ mô hình bỏ sót quan hệ ở xa.
Mở trọng số gắn với câu chuyện “AI có chủ quyền”
Kolibri‑1 được phát hành trên Hugging Face với trọng số đầy đủ và giấy phép Apache 2.0. Aleph Alpha định vị mô hình cho các tổ chức châu Âu muốn triển khai trên hạ tầng của mình, đặc biệt trong hành chính công, công nghiệp và hàng không. Theo hãng, quá trình phát triển diễn ra tại Đức, còn hạ tầng huấn luyện đặt tại Đức và Phần Lan.
Mô hình tập trung có chủ đích vào tiếng Đức và tiếng Anh thay vì phủ nhiều ngôn ngữ. Aleph Alpha cho biết 21,3% token pre-training là tiếng Đức; dữ liệu dịch chỉ chiếm 6% tổng tập huấn luyện. Đây vẫn là số liệu do nhà phát triển tự công bố, nhưng nó cho thấy mục tiêu khác với các mô hình đa ngôn ngữ thường dành phần nhỏ dữ liệu cho từng ngôn ngữ ngoài tiếng Anh.
Chi phí huấn luyện và các con số benchmark
Model card ghi nhận giai đoạn pre-training dùng 768 GPU NVIDIA B200 trong 21 ngày, tương đương khoảng 392.000 GPU-giờ. Nếu tính cả pre-training, mid-training và mở rộng ngữ cảnh, Aleph Alpha ước tính mức tiêu thụ khoảng 950 MWh, đã gồm hệ số hiệu quả trung tâm dữ liệu nhưng chưa gồm SFT, reinforcement learning, các mô hình thử nghiệm và thời gian tải thấp.
Hãng cũng công bố kết quả trên AIME, GPQA, LiveCodeBench, LongBench Pro và các bài kiểm tra tool calling. Những con số này hữu ích để hình dung mục tiêu kỹ thuật, nhưng chưa thay thế đánh giá độc lập trên cùng phần cứng, cùng cấu hình suy luận và dữ liệu thực tế của người dùng. Một số phép đo theo ngành còn là bộ đánh giá nội bộ của Aleph Alpha, nên không thể so sánh trực tiếp như một bảng xếp hạng công khai.
Ai nên quan tâm, và giới hạn nằm ở đâu?
Kolibri‑1 đáng chú ý với doanh nghiệp cần xử lý tài liệu dài bằng tiếng Đức hoặc tiếng Anh, muốn gọi công cụ theo cấu trúc và không muốn gửi dữ liệu sang dịch vụ API bên ngoài. Mô hình có chế độ suy luận điều chỉnh theo bốn mức và được phục vụ qua một plugin vLLM riêng của Aleph Alpha.
Dù vậy, nhà phát triển chỉ định Kolibri‑1 cho hệ thống có con người xem lại đầu ra. Model card nói rõ nó không được thiết kế làm thành phần tự quyết định hoặc hành động mà không được kiểm tra. Kiến thức ngầm dừng ở ngày 18/6/2026; rủi ro sai sự thật, thiên lệch và kết quả thiếu ổn định vẫn tồn tại. Mở trọng số giúp kiểm tra và triển khai linh hoạt hơn, nhưng không tự động biến mô hình thành hệ thống an toàn hoặc phù hợp với mọi môi trường được quản lý.
Ảnh: Aleph Alpha, hình giới thiệu Kolibri‑1.