Từ cửa sổ chat tới GPU
Từ giao diện chat đến phần cứng AI
Các lớp chạy trong máy AI
- Giao diện chat và API
- Phần mềm chạy mô hình
- Thư viện tính toán AI
- Hệ điều hành và driver
- CPU và GPU của máy
Giao diện chat và API đến Phần mềm chạy mô hình. Phần mềm chạy mô hình đến Thư viện tính toán AI. Thư viện tính toán AI đến Hệ điều hành và driver. Hệ điều hành và driver đến CPU và GPU của máy
Yêu cầu từ giao diện đi qua phần mềm chạy mô hình, thư viện tính toán và driver để sử dụng CPU, GPU.
Laptop sử dụng máy AI
- Laptop gửi yêu cầu
- Đường truy cập riêng
- Dịch vụ xử lý AI
- Máy chạy AI
Laptop gửi yêu cầu đến Đường truy cập riêng. Đường truy cập riêng đến Dịch vụ xử lý AI. Dịch vụ xử lý AI đến Máy chạy AI
Laptop gửi yêu cầu qua kênh truy cập được cấp phép, còn máy AI nạp mô hình và xử lý.
Khi nhân viên gửi câu hỏi, giao diện chuyển yêu cầu tới dịch vụ chạy mô hình. Dịch vụ này dùng runtime để thực hiện suy luận; framework như PyTorch cung cấp phép tính; driver giúp hệ điều hành giao việc cho GPU. API là đầu mối để ứng dụng gửi yêu cầu và nhận kết quả từ dịch vụ.
Container đóng gói ứng dụng và thư viện, giúp giữ môi trường nhất quán. Nó vẫn phụ thuộc kiến trúc CPU và driver GPU của máy chủ. Laptop quản trị có thể gửi tác vụ, mở trình soạn thảo và xem tài nguyên qua mạng; mô hình tiếp tục dùng bộ nhớ và khả năng tính toán của máy AI.
Giữ một bộ phiên bản chạy được cùng nhau
Chốt bản phần mềm và giấy phép sử dụng
Kiểm tra bản sẽ bàn giao
- Máy đích
- Bộ phiên bản phần mềm
- Quyền dùng mô hình và công cụ
- Bản cài đặt đã kiểm thử
Máy đích đến Bộ phiên bản phần mềm. Bộ phiên bản phần mềm đến Bản cài đặt đã kiểm thử. Quyền dùng mô hình và công cụ đến Bản cài đặt đã kiểm thử
Nền tảng, chuỗi phiên bản và giấy phép được đối chiếu trước khi lưu bản chạy đã kiểm thử.
- Ghi kiến trúc CPU, GPU và hệ điều hành, gồm Arm64 trên GB10.
- Ghép driver, CUDA, thư viện AI và phần mềm chạy mô hình tương thích.
- Đọc điều khoản triển khai, thương mại và dịch vụ hỗ trợ.
- Lưu phiên bản và thiết lập để tái tạo máy khi bàn giao.
Với GB10, chọn bản Linux Arm64 và các thành phần hỗ trợ GPU Blackwell. Đối chiếu driver, CUDA, PyTorch và runtime như vLLM hoặc TensorRT-LLM theo tài liệu phát hành. Ví dụ, container đang dùng trên máy x86 có thể cần bản Arm64 và thư viện khác để chạy cùng mô hình trên GX10.
Lưu bộ phiên bản đã chạy thử thay vì cập nhật từng thành phần riêng lẻ. Với triển khai thương mại, đối chiếu giấy phép mô hình, gói hỗ trợ và quyền dùng phần mềm. NVIDIA phân biệt quyền tải một số NIM, các gói dịch vụ mô hình, với entitlement AI Enterprise, tức quyền sử dụng theo gói doanh nghiệp. Hồ sơ mua hàng nên ghi rõ quyền và thời hạn đi kèm.
Truy cập từ laptop bằng đường riêng
Truy cập máy AI trong LAN và từ xa
Quản trị trong LAN
- Laptop của quản trị viên
- Mạng LAN nội bộ
- Cổng truy cập SSH
- Máy AI được quản lý
Laptop của quản trị viên đến Mạng LAN nội bộ. Mạng LAN nội bộ đến Cổng truy cập SSH. Cổng truy cập SSH đến Máy AI được quản lý
Laptop truy cập máy AI qua LAN sau khi SSH xác nhận danh tính và quyền của người quản trị.
Quản trị qua VPN
- Laptop ngoài văn phòng
- Kết nối VPN
- SSH và cổng chuyển tiếp
- Máy AI trong mạng riêng
Laptop ngoài văn phòng đến Kết nối VPN. Kết nối VPN đến SSH và cổng chuyển tiếp. SSH và cổng chuyển tiếp đến Máy AI trong mạng riêng
VPN đưa laptop từ xa vào mạng được cấp phép rồi SSH mở quyền truy cập tới máy AI nội bộ.
Trong văn phòng, đặt dịch vụ trên mạng nội bộ và cấp tài khoản theo vai trò. Khi làm từ xa, dùng VPN để vào mạng riêng hoặc chuyển tiếp cổng qua SSH. Giữ SSH, API mô hình, dashboard và dịch vụ Ray sau lớp kiểm soát truy cập; cấp khóa riêng cho từng người quản trị và đối chiếu danh tính máy chủ khi kết nối.
NVIDIA Sync hỗ trợ SSH, mở ứng dụng và trình soạn thảo từ xa, chuyển tiếp cổng, theo dõi tài nguyên cùng tích hợp Tailscale. Cluster Assistant xử lý mạng ConnectX-7 và SSH theo topology hỗ trợ. Sau bước này, người triển khai tiếp tục cài tác vụ suy luận hoặc huấn luyện và thiết lập cách phục vụ người dùng.
Bảo trì theo quy mô sử dụng
Theo dõi máy và chuẩn bị khôi phục
Giám sát, sao lưu, khôi phục
- Bản cấu hình đang dùng
- Bảng theo dõi máy
- Bản sao lưu phục hồi
- Bài thử khôi phục
Bản cấu hình đang dùng đến Bảng theo dõi máy. Bản cấu hình đang dùng đến Bản sao lưu phục hồi. Bản sao lưu phục hồi đến Bài thử khôi phục. Bài thử khôi phục đến Bản cấu hình đang dùng
Từ bản cấu hình ổn định, người vận hành theo dõi tài nguyên, sao lưu và thử khôi phục về trạng thái đã ghi.
- Lưu phiên bản phần mềm, giới hạn số phiên và danh sách tài khoản.
- Theo dõi nhiệt độ, bộ nhớ đang dùng và dung lượng SSD còn lại.
- Giữ cấu hình và dữ liệu cần thiết để dựng lại dịch vụ.
- Thử phục hồi dữ liệu, quay lại phiên bản trước và thu hồi khóa.
Một nhóm nhỏ có thể bắt đầu bằng runtime ổn định, giao diện có tài khoản và sao lưu. Khi việc tăng, chọn công cụ theo nhu cầu: Ray phân phối tác vụ, Slurm xếp hàng công việc, Kubernetes quản lý dịch vụ container. Mỗi công cụ cần cấu hình và hỗ trợ nền tảng phù hợp; các máy vẫn có vùng nhớ riêng.
Giả sử sau cập nhật, trợ lý lỗi khi nạp mô hình. Bộ phiên bản cũ và bản sao cấu hình giúp quay lại môi trường đã thử. Theo dõi nhiệt, bộ nhớ, SSD và hàng đợi để đặt giới hạn phiên theo tải đo được. Phân công người xử lý sự cố, thử phục hồi bản sao và thu hồi tài khoản, khóa khi nhân sự rời nhóm.
Tài liệu tham khảo
Các nguồn dưới đây cung cấp thông số thiết bị và hướng dẫn phần mềm được dùng trong bài. Khi cài đặt, hãy đối chiếu đúng mã máy và phiên bản đang sử dụng.