Dense và MoE khác nhau ở cách dùng tham số

Model dense thường dùng toàn bộ mạng tham số chính cho mỗi token được xử lý. MoE là viết tắt của Mixture of Experts: bên trong có nhiều mạng con gọi là expert, còn bộ định tuyến chọn một số expert cho từng token. Ví dụ dễ hình dung là một nhóm chuyên gia, trong đó hệ thống chuyển mỗi phần câu hỏi tới một vài người phù hợp.

Vì chỉ một phần expert được kích hoạt cho mỗi token, số tham số hoạt động có thể thấp hơn tổng số tham số của MoE. Tuy vậy, trọng số của các expert vẫn cần được lưu ở đâu đó và bộ định tuyến cũng cần tài nguyên. Do đó, nhãn MoE không có nghĩa model tự động vừa một card nhỏ hoặc luôn nhanh hơn model dense.

Phân biệt tổng tham số và tham số hoạt động

Một số model MoE được giới thiệu bằng hai con số, chẳng hạn tổng tham số và số tham số hoạt động mỗi token. Con số thứ nhất gợi ý quy mô trọng số cần lưu; con số thứ hai gợi ý phần được tính toán trong một lượt token. Cả hai đều chưa đủ để dự đoán tốc độ, vì còn phụ thuộc số expert, cách đặt chúng trong bộ nhớ, băng thông và runtime.

Khi chọn GPU, kiểm tra yêu cầu bộ nhớ cho toàn bộ trọng số theo định dạng đã tải, vùng đệm và ngữ cảnh. Một số runtime có thể phân phối expert hoặc chuyển dữ liệu theo cách riêng. Chạy thử chính xác bản model định dùng để biết cần bao nhiêu VRAM, RAM và mức độ trễ.

Model nền, Instruct và Chat

Model nền (base) được huấn luyện để tiếp tục văn bản theo mẫu đã học. Bản Instruct thường được tinh chỉnh để làm theo yêu cầu; bản Chat được thiết kế cho hội thoại theo định dạng vai trò. Tên gọi giữa các nhà phát hành không hoàn toàn đồng nhất, nên xem model card và mẫu hội thoại mà runtime yêu cầu.

Fine-tuning là tiếp tục điều chỉnh tham số bằng dữ liệu hoặc mục tiêu huấn luyện cụ thể. Adapter như LoRA lưu phần điều chỉnh gọn hơn và thường cần nạp cùng model nền tương thích. Đây không phải dữ liệu tra cứu cập nhật: nếu trợ lý phải trả lời theo chính sách mới, cần cập nhật nguồn kiến thức hoặc chỉ mục RAG phù hợp.

Một số nhãn khác người dùng thường gặp

Model đa phương thức có thể nhận hoặc tạo nhiều dạng dữ liệu như văn bản, ảnh hay âm thanh; khả năng cụ thể tùy phiên bản. Model reasoning thường được tối ưu cho bài toán cần nhiều bước suy luận và có thể tốn thêm thời gian hoặc token. Model embedding biến văn bản thành vector để tìm nội dung tương tự, thường dùng ở bước truy xuất của RAG chứ không thay model chat.

Các nhãn này mô tả mục tiêu hoặc đầu vào/đầu ra, không bảo đảm model xử lý tốt mọi tác vụ. Kiểm tra định dạng đầu vào, runtime hỗ trợ, giấy phép và ví dụ đánh giá của đúng phiên bản. Sau đó thử bằng dữ liệu được phép sử dụng và câu hỏi thực tế của nhóm.

Tài liệu tham khảo

Các nguồn dưới đây cung cấp thông số thiết bị và hướng dẫn phần mềm được dùng trong bài. Khi cài đặt, hãy đối chiếu đúng mã máy và phiên bản đang sử dụng.