Hai máy có thể phối hợp theo hai cách
Hai máy chia yêu cầu hay chia mô hình?
Chia các yêu cầu riêng
- Các yêu cầu đang chờ
- Bộ phân phối yêu cầu
- Máy AI thứ nhất
- Máy AI thứ hai
Các yêu cầu đang chờ đến Bộ phân phối yêu cầu. Bộ phân phối yêu cầu đến Máy AI thứ nhất. Bộ phân phối yêu cầu đến Máy AI thứ hai
Bộ phân phối chuyển từng yêu cầu tới một máy có sẵn mô hình và bộ nhớ để xử lý độc lập.
Chia một mô hình cho hai máy
- Phần mềm suy luận phân tán
- Máy giữ phần mô hình đầu
- Mạng giữa hai máy
- Máy giữ phần mô hình còn lại
Phần mềm suy luận phân tán đến Máy giữ phần mô hình đầu. Phần mềm suy luận phân tán đến Máy giữ phần mô hình còn lại. Máy giữ phần mô hình đầu đến Mạng giữa hai máy. Mạng giữa hai máy đến Máy giữ phần mô hình còn lại
Phần mềm suy luận chia mô hình thành các phần trên hai máy và đồng bộ dữ liệu qua mạng.
Nếu hai bộ phận dùng cùng trợ lý, bạn có thể chạy một bản mô hình trên mỗi máy rồi phân phối yêu cầu giữa chúng. Cách cân bằng tải này phục vụ các lượt hỏi độc lập. Với mô hình vượt bộ nhớ một máy, suy luận phân tán chia mô hình hoặc phép tính qua nhiều máy, đòi hỏi phần mềm hỗ trợ.
Mỗi máy trong cụm, gọi là node, vẫn giữ bộ nhớ riêng. Phần mềm quyết định dữ liệu nằm ở đâu và trao đổi qua mạng khi nào. Ray điều phối tác vụ dựa trên tài nguyên khai báo. Khả năng chia mô hình và quản lý bộ nhớ thuộc phần mềm chạy tác vụ; trao đổi giữa máy làm tăng độ trễ.
Chọn đường mạng và cáp theo thiết bị
Nối hai máy trực tiếp hoặc qua switch
Nối trực tiếp hai DGX Spark
- DGX Spark thứ nhất
- Cáp nối hai máy
- DGX Spark thứ hai
DGX Spark thứ nhất đến Cáp nối hai máy. Cáp nối hai máy đến DGX Spark thứ hai
Cáp nối cổng ConnectX-7 của hai DGX Spark tạo đường trao đổi Ethernet giữa hai máy.
Các máy nối qua switch
- Máy AI thứ nhất
- Switch Ethernet
- Máy AI thứ hai
- Máy điều khiển cụm
Máy AI thứ nhất đến Switch Ethernet. Switch Ethernet đến Máy AI thứ hai. Máy điều khiển cụm đến Switch Ethernet
Switch Ethernet nối các máy AI để trao đổi dữ liệu và nhận yêu cầu từ máy điều khiển.
NVIDIA có hướng dẫn nối trực tiếp hai DGX Spark bằng cáp QSFP cho mạng 200GbE, cùng danh sách cáp được duyệt. Cổng ConnectX-7 trên DGX Spark hoạt động ở chế độ Ethernet. Với GX10, đối chiếu mã cáp, tốc độ và cấu hình theo ASUS; chỉ nhãn QSFP56 hoặc QSFP112 chưa đủ để quyết định mua.
RoCE cho phép truyền dữ liệu trực tiếp giữa các vùng nhớ qua Ethernet bằng RDMA, giúp giảm phần xử lý truyền dữ liệu trong cấu hình phù hợp. InfiniBand là công nghệ mạng khác; tên ConnectX-7 bao phủ nhiều biến thể sản phẩm. Khi đi qua switch, cả cổng, cáp và cấu hình Ethernet phải phù hợp với topology, tức sơ đồ kết nối được hỗ trợ.
Thử đường truyền trước khi thử mô hình
Kiểm tra mạng rồi thử mô hình phân tán
Kiểm tra từ cổng mạng đến mô hình
- Cổng mạng và cáp
- Địa chỉ IP và SSH
- Bài thử truyền dữ liệu
- Tác vụ AI phân tán
Cổng mạng và cáp đến Địa chỉ IP và SSH. Địa chỉ IP và SSH đến Bài thử truyền dữ liệu. Bài thử truyền dữ liệu đến Tác vụ AI phân tán
Kiểm tra liên kết, IP, SSH và truyền dữ liệu trước khi chạy mô hình giúp xác định lớp gây lỗi.
- Xem trạng thái liên kết, tốc độ nhận được và tên giao diện.
- Thử kết nối bằng khóa và xác nhận còn đường quản trị.
- Đo băng thông và chạy bài kiểm tra NCCL theo hướng dẫn.
- Chạy mô hình sau khi kết nối và truyền dữ liệu đã qua kiểm tra.
Làm theo hướng dẫn của thiết bị: nhận diện cổng, cấu hình địa chỉ IP rồi thiết lập SSH bằng khóa giữa các máy. SSH là kênh đăng nhập mã hóa để quản trị và khởi chạy việc từ xa. Giữ đường quản trị và phương án khôi phục khi đổi cấu hình mạng, nhất là khi thao tác từ laptop.
Đo liên kết và băng thông trước, sau đó thử NCCL, thư viện trao đổi dữ liệu giữa GPU, rồi chạy mô hình phân tán. MTU quy định kích thước gói mạng; PFC điều khiển luồng theo mức ưu tiên. Áp dụng MTU 9000 hoặc PFC khi tài liệu thiết bị, switch và phần mềm yêu cầu, với cấu hình nhất quán trên đường truyền.
Chốt phạm vi mở rộng bằng bộ thử
Dùng kết quả thử để quyết định mở rộng
Đánh giá cụm hai máy trước
- Hai máy chạy thử
- Phạm vi hỗ trợ của hãng
- Tác vụ chạy trên cụm
- Phương án tăng số máy
Hai máy chạy thử đến Phạm vi hỗ trợ của hãng. Phạm vi hỗ trợ của hãng đến Tác vụ chạy trên cụm. Tác vụ chạy trên cụm đến Phương án tăng số máy
Thử hai máy với tác vụ thực tế rồi đối chiếu phạm vi hỗ trợ và kết quả khi mỗi máy phục vụ riêng.
- Đo thời gian xử lý, độ ổn định và cách khôi phục khi lỗi.
- Ghi số máy, sơ đồ kết nối, mã thiết bị và phiên bản được xác nhận.
- Chọn cơ chế chia yêu cầu hoặc chia mô hình được phần mềm hỗ trợ.
- So kết quả cụm với phương án từng máy phục vụ độc lập.
Cụm hai DGX Spark có hướng dẫn triển khai riêng. Tài liệu NVIDIA Sync hiện mô tả một số topology từ hai đến bốn DGX Spark/GB10. Với dự án từ ba đến tám máy, đề nghị hãng và đơn vị triển khai xác định tổ hợp thiết bị, phiên bản và sơ đồ được hỗ trợ trước khi đặt hàng.
Cluster Assistant giúp cấu hình mạng và SSH trong phạm vi hỗ trợ; bước cài ứng dụng và chia mô hình vẫn thuộc quy trình triển khai. Chạy bộ mẫu, đo thời gian phản hồi và thử khôi phục khi một node ngừng hoạt động. Nếu mục tiêu là phục vụ thêm người, so với phương án mỗi máy chạy riêng để chọn cách vận hành đơn giản hơn.
Tài liệu tham khảo
Các nguồn dưới đây cung cấp thông số thiết bị và hướng dẫn phần mềm được dùng trong bài. Khi cài đặt, hãy đối chiếu đúng mã máy và phiên bản đang sử dụng.