Từ cửa sổ chat tới GPU

Từ giao diện chat đến phần cứng AI

Các lớp chạy trong máy AI

  1. Giao diện chat và API
  2. Phần mềm chạy mô hình
  3. Thư viện tính toán AI
  4. Hệ điều hành và driver
  5. CPU và GPU của máy

Giao diện chat và API đến Phần mềm chạy mô hình. Phần mềm chạy mô hình đến Thư viện tính toán AI. Thư viện tính toán AI đến Hệ điều hành và driver. Hệ điều hành và driver đến CPU và GPU của máy

Yêu cầu từ giao diện đi qua phần mềm chạy mô hình, thư viện tính toán và driver để sử dụng CPU, GPU.

Laptop sử dụng máy AI

  1. Laptop gửi yêu cầu
  2. Đường truy cập riêng
  3. Dịch vụ xử lý AI
  4. Máy chạy AI

Laptop gửi yêu cầu đến Đường truy cập riêng. Đường truy cập riêng đến Dịch vụ xử lý AI. Dịch vụ xử lý AI đến Máy chạy AI

Laptop gửi yêu cầu qua kênh truy cập được cấp phép, còn máy AI nạp mô hình và xử lý.

Laptop gửi yêu cầu và nhận kết quả; mô hình dùng tài nguyên của máy AI. Với GB10, các lớp phần mềm được chọn cho Arm64 và GPU Blackwell.

Khi nhân viên gửi câu hỏi, giao diện chuyển yêu cầu tới dịch vụ chạy mô hình. Dịch vụ này dùng runtime để thực hiện suy luận; framework như PyTorch cung cấp phép tính; driver giúp hệ điều hành giao việc cho GPU. API là đầu mối để ứng dụng gửi yêu cầu và nhận kết quả từ dịch vụ.

Container đóng gói ứng dụng và thư viện, giúp giữ môi trường nhất quán. Nó vẫn phụ thuộc kiến trúc CPU và driver GPU của máy chủ. Laptop quản trị có thể gửi tác vụ, mở trình soạn thảo và xem tài nguyên qua mạng; mô hình tiếp tục dùng bộ nhớ và khả năng tính toán của máy AI.

Giữ một bộ phiên bản chạy được cùng nhau

Chốt bản phần mềm và giấy phép sử dụng

Kiểm tra bản sẽ bàn giao

  1. Máy đích
  2. Bộ phiên bản phần mềm
  3. Quyền dùng mô hình và công cụ
  4. Bản cài đặt đã kiểm thử

Máy đích đến Bộ phiên bản phần mềm. Bộ phiên bản phần mềm đến Bản cài đặt đã kiểm thử. Quyền dùng mô hình và công cụ đến Bản cài đặt đã kiểm thử

Nền tảng, chuỗi phiên bản và giấy phép được đối chiếu trước khi lưu bản chạy đã kiểm thử.

  • Ghi kiến trúc CPU, GPU và hệ điều hành, gồm Arm64 trên GB10.
  • Ghép driver, CUDA, thư viện AI và phần mềm chạy mô hình tương thích.
  • Đọc điều khoản triển khai, thương mại và dịch vụ hỗ trợ.
  • Lưu phiên bản và thiết lập để tái tạo máy khi bàn giao.
Trên GB10, phần mềm chạy với Arm64 và Blackwell. Quyền sử dụng NIM, NVIDIA AI Enterprise và dịch vụ hỗ trợ đi theo từng gói cung cấp.

Với GB10, chọn bản Linux Arm64 và các thành phần hỗ trợ GPU Blackwell. Đối chiếu driver, CUDA, PyTorch và runtime như vLLM hoặc TensorRT-LLM theo tài liệu phát hành. Ví dụ, container đang dùng trên máy x86 có thể cần bản Arm64 và thư viện khác để chạy cùng mô hình trên GX10.

Lưu bộ phiên bản đã chạy thử thay vì cập nhật từng thành phần riêng lẻ. Với triển khai thương mại, đối chiếu giấy phép mô hình, gói hỗ trợ và quyền dùng phần mềm. NVIDIA phân biệt quyền tải một số NIM, các gói dịch vụ mô hình, với entitlement AI Enterprise, tức quyền sử dụng theo gói doanh nghiệp. Hồ sơ mua hàng nên ghi rõ quyền và thời hạn đi kèm.

Truy cập từ laptop bằng đường riêng

Truy cập máy AI trong LAN và từ xa

Quản trị trong LAN

  1. Laptop của quản trị viên
  2. Mạng LAN nội bộ
  3. Cổng truy cập SSH
  4. Máy AI được quản lý

Laptop của quản trị viên đến Mạng LAN nội bộ. Mạng LAN nội bộ đến Cổng truy cập SSH. Cổng truy cập SSH đến Máy AI được quản lý

Laptop truy cập máy AI qua LAN sau khi SSH xác nhận danh tính và quyền của người quản trị.

Quản trị qua VPN

  1. Laptop ngoài văn phòng
  2. Kết nối VPN
  3. SSH và cổng chuyển tiếp
  4. Máy AI trong mạng riêng

Laptop ngoài văn phòng đến Kết nối VPN. Kết nối VPN đến SSH và cổng chuyển tiếp. SSH và cổng chuyển tiếp đến Máy AI trong mạng riêng

VPN đưa laptop từ xa vào mạng được cấp phép rồi SSH mở quyền truy cập tới máy AI nội bộ.

Tài khoản và mạng riêng xác định ai có thể truy cập máy. NVIDIA Sync hỗ trợ kết nối và theo dõi; người quản trị cài ứng dụng AI và cấp quyền sử dụng.

Trong văn phòng, đặt dịch vụ trên mạng nội bộ và cấp tài khoản theo vai trò. Khi làm từ xa, dùng VPN để vào mạng riêng hoặc chuyển tiếp cổng qua SSH. Giữ SSH, API mô hình, dashboard và dịch vụ Ray sau lớp kiểm soát truy cập; cấp khóa riêng cho từng người quản trị và đối chiếu danh tính máy chủ khi kết nối.

NVIDIA Sync hỗ trợ SSH, mở ứng dụng và trình soạn thảo từ xa, chuyển tiếp cổng, theo dõi tài nguyên cùng tích hợp Tailscale. Cluster Assistant xử lý mạng ConnectX-7 và SSH theo topology hỗ trợ. Sau bước này, người triển khai tiếp tục cài tác vụ suy luận hoặc huấn luyện và thiết lập cách phục vụ người dùng.

Bảo trì theo quy mô sử dụng

Theo dõi máy và chuẩn bị khôi phục

Giám sát, sao lưu, khôi phục

  1. Bản cấu hình đang dùng
  2. Bảng theo dõi máy
  3. Bản sao lưu phục hồi
  4. Bài thử khôi phục

Bản cấu hình đang dùng đến Bảng theo dõi máy. Bản cấu hình đang dùng đến Bản sao lưu phục hồi. Bản sao lưu phục hồi đến Bài thử khôi phục. Bài thử khôi phục đến Bản cấu hình đang dùng

Từ bản cấu hình ổn định, người vận hành theo dõi tài nguyên, sao lưu và thử khôi phục về trạng thái đã ghi.

  • Lưu phiên bản phần mềm, giới hạn số phiên và danh sách tài khoản.
  • Theo dõi nhiệt độ, bộ nhớ đang dùng và dung lượng SSD còn lại.
  • Giữ cấu hình và dữ liệu cần thiết để dựng lại dịch vụ.
  • Thử phục hồi dữ liệu, quay lại phiên bản trước và thu hồi khóa.
Bộ phiên bản đã chạy thử và bản sao cấu hình giúp đưa dịch vụ trở lại khi cập nhật gặp lỗi. Ray, Slurm hoặc Kubernetes được triển khai theo cách nhóm tổ chức công việc.

Một nhóm nhỏ có thể bắt đầu bằng runtime ổn định, giao diện có tài khoản và sao lưu. Khi việc tăng, chọn công cụ theo nhu cầu: Ray phân phối tác vụ, Slurm xếp hàng công việc, Kubernetes quản lý dịch vụ container. Mỗi công cụ cần cấu hình và hỗ trợ nền tảng phù hợp; các máy vẫn có vùng nhớ riêng.

Giả sử sau cập nhật, trợ lý lỗi khi nạp mô hình. Bộ phiên bản cũ và bản sao cấu hình giúp quay lại môi trường đã thử. Theo dõi nhiệt, bộ nhớ, SSD và hàng đợi để đặt giới hạn phiên theo tải đo được. Phân công người xử lý sự cố, thử phục hồi bản sao và thu hồi tài khoản, khóa khi nhân sự rời nhóm.

Tài liệu tham khảo

Các nguồn dưới đây cung cấp thông số thiết bị và hướng dẫn phần mềm được dùng trong bài. Khi cài đặt, hãy đối chiếu đúng mã máy và phiên bản đang sử dụng.