Kiến trúc GPU trung tâm dữ liệu qua các thế hệ
NVIDIA đặt tên mỗi thế hệ kiến trúc GPU trung tâm dữ liệu theo tên nhà khoa học (Ampere, Hopper, Blackwell...). Mỗi thế hệ mới thường tăng dung lượng và băng thông bộ nhớ, cải tiến công nghệ kết nối nhiều GPU (NVLink), và bổ sung định dạng tính toán mới giúp huấn luyện/suy luận mô hình AI nhanh hơn với cùng mức điện năng. Trang này tổng hợp thông số các model được nhắc tới nhiều nhất hiện nay, lấy trực tiếp từ trang sản phẩm chính thức của NVIDIA.
| Model | Kiến trúc | Năm | Bộ nhớ | Băng thông bộ nhớ | NVLink | FP8 / FP4 |
|---|---|---|---|---|---|---|
| NVIDIA A100 80GB SXM | Ampere | 2020 | 80GB HBM2e | 2.039 GB/s | 600 GB/s (NVLink 3) | — |
| NVIDIA L40S | Ada Lovelace | 2023 | 48GB GDDR6 (có ECC) | 864 GB/s | Không hỗ trợ | — |
| NVIDIA GeForce RTX 4090 | Ada Lovelace | 2022 | 24GB GDDR6X | Chưa công bố | Không hỗ trợ | — |
| NVIDIA H100 SXM | Hopper | 2022 | 80GB HBM3 | 3.350 GB/s | 900 GB/s (NVLink 4) | FP8 |
| NVIDIA H200 SXM | Hopper | 2024 | 141GB HBM3e | 4.800 GB/s | 900 GB/s (NVLink 4) | FP8 |
| NVIDIA B200 | Blackwell | 2024 | 180GB HBM3e | 8.000 GB/s | 1.800 GB/s (NVLink 5) | FP8 + FP4 |
Nguồn số liệu: trang sản phẩm chính thức của NVIDIA cho từng model (xem mục Nguồn cuối trang). Ghi chú riêng cho từng model (bản PCIe/SXM, cách quy đổi từ thông số hệ thống…) xem trong src/data/gpu-architecture.ts.
1. Một GPU đơn lẻ
Mỗi GPU có bộ nhớ riêng (VRAM/HBM) gắn trực tiếp trên card. Với một tác vụ AI vừa và nhỏ, một GPU với đủ VRAM để chứa toàn bộ mô hình là đủ dùng — đây là cách phần lớn dịch vụ suy luận (inference) mô hình vừa hoặc dựng hình đồ hoạ vận hành.
2. Tám GPU trong một máy chủ, nối qua NVLink/NVSwitch
Khi một mô hình AI lớn hơn tổng VRAM của một GPU, nhiều GPU trong CÙNG MỘT máy chủ được nối lại bằng NVLink — thông qua một chip trung gian gọi là NVSwitch — để chúng có thể chia sẻ dữ liệu với băng thông cao hơn nhiều lần so với đường PCIe thông thường. Cấu hình phổ biến nhất là 8 GPU trên một máy chủ (ví dụ nền tảng HGX của NVIDIA).
3. Nhiều máy chủ nối thành một cụm qua InfiniBand/Ethernet
Khi một mô hình quá lớn để chạy trong một máy chủ (dù đã có 8 GPU), nhiều máy chủ được nối với nhau thành một cụm (cluster) bằng mạng tốc độ cao — thường là InfiniBand hoặc Ethernet chuyên dụng tốc độ rất cao (ví dụ NVIDIA Spectrum-X). Đây là lý do các hệ thống huấn luyện mô hình ngôn ngữ lớn hiện nay được xây theo quy mô rack thay vì một máy chủ đơn lẻ.
Ví dụ thực tế ở quy mô rack: NVIDIA GB200 NVL72. Một rack kết nối 72 GPU Blackwell và 36 CPU Grace bằng hệ thống chuyển mạch NVLink 5 (NVLink Switch System), đạt băng thông giao tiếp GPU-GPU tổng cộng 130 TB/s TRONG PHẠM VI MỘT RACK. Giữa các rack với nhau, hệ thống vẫn cần InfiniBand hoặc Ethernet tốc độ cao để mở rộng thêm. Nguồn: NVIDIA GB200 NVL72
Vì sao mạng tốc độ cao lại quan trọng?
Khi huấn luyện một mô hình trải trên nhiều GPU, các GPU phải liên tục đồng bộ kết quả tính toán (gradient) với nhau ở mỗi bước huấn luyện. Nếu đường kết nối giữa các GPU chậm, phần lớn thời gian huấn luyện sẽ bị "lãng phí" cho việc chờ đồng bộ dữ liệu thay vì tính toán — dù mỗi GPU riêng lẻ có mạnh đến đâu. Đây là lý do NVLink (trong một máy) và InfiniBand/Ethernet tốc độ cao (giữa các máy) là hai lớp hạ tầng mạng không thể thiếu khi mở rộng quy mô huấn luyện AI, chứ không chỉ riêng sức mạnh của từng GPU.
Nguồn
Đã tự mở kiểm tra, còn truy cập được — tra cứu ngày 15/09/2026.