Bỏ qua tới nội dung chính
VNSO

Kiến trúc GPU trung tâm dữ liệu qua các thế hệ

NVIDIA đặt tên mỗi thế hệ kiến trúc GPU trung tâm dữ liệu theo tên nhà khoa học (Ampere, Hopper, Blackwell...). Mỗi thế hệ mới thường tăng dung lượng và băng thông bộ nhớ, cải tiến công nghệ kết nối nhiều GPU (NVLink), và bổ sung định dạng tính toán mới giúp huấn luyện/suy luận mô hình AI nhanh hơn với cùng mức điện năng. Trang này tổng hợp thông số các model được nhắc tới nhiều nhất hiện nay, lấy trực tiếp từ trang sản phẩm chính thức của NVIDIA.

ModelKiến trúcNămBộ nhớBăng thông bộ nhớNVLinkFP8 / FP4
NVIDIA A100 80GB SXMAmpere202080GB HBM2e2.039 GB/s600 GB/s (NVLink 3)—
NVIDIA L40SAda Lovelace202348GB GDDR6 (có ECC)864 GB/sKhông hỗ trợ—
NVIDIA GeForce RTX 4090Ada Lovelace202224GB GDDR6XChưa công bốKhông hỗ trợ—
NVIDIA H100 SXMHopper202280GB HBM33.350 GB/s900 GB/s (NVLink 4)FP8
NVIDIA H200 SXMHopper2024141GB HBM3e4.800 GB/s900 GB/s (NVLink 4)FP8
NVIDIA B200Blackwell2024180GB HBM3e8.000 GB/s1.800 GB/s (NVLink 5)FP8 + FP4

Nguồn số liệu: trang sản phẩm chính thức của NVIDIA cho từng model (xem mục Nguồn cuối trang). Ghi chú riêng cho từng model (bản PCIe/SXM, cách quy đổi từ thông số hệ thống…) xem trong src/data/gpu-architecture.ts.

1. Một GPU đơn lẻ

Mỗi GPU có bộ nhớ riêng (VRAM/HBM) gắn trực tiếp trên card. Với một tác vụ AI vừa và nhỏ, một GPU với đủ VRAM để chứa toàn bộ mô hình là đủ dùng — đây là cách phần lớn dịch vụ suy luận (inference) mô hình vừa hoặc dựng hình đồ hoạ vận hành.

GPUVRAMVRAM

2. Tám GPU trong một máy chủ, nối qua NVLink/NVSwitch

Khi một mô hình AI lớn hơn tổng VRAM của một GPU, nhiều GPU trong CÙNG MỘT máy chủ được nối lại bằng NVLink — thông qua một chip trung gian gọi là NVSwitch — để chúng có thể chia sẻ dữ liệu với băng thông cao hơn nhiều lần so với đường PCIe thông thường. Cấu hình phổ biến nhất là 8 GPU trên một máy chủ (ví dụ nền tảng HGX của NVIDIA).

NVSwitchNVLinkGPU 1GPU 2GPU 3GPU 4GPU 5GPU 6GPU 7GPU 8

3. Nhiều máy chủ nối thành một cụm qua InfiniBand/Ethernet

Khi một mô hình quá lớn để chạy trong một máy chủ (dù đã có 8 GPU), nhiều máy chủ được nối với nhau thành một cụm (cluster) bằng mạng tốc độ cao — thường là InfiniBand hoặc Ethernet chuyên dụng tốc độ rất cao (ví dụ NVIDIA Spectrum-X). Đây là lý do các hệ thống huấn luyện mô hình ngôn ngữ lớn hiện nay được xây theo quy mô rack thay vì một máy chủ đơn lẻ.

Switch InfiniBand / Ethernet tốc độ caoMáy chủ 18× GPU + NVSwitchMáy chủ 28× GPU + NVSwitchMáy chủ 38× GPU + NVSwitch

Ví dụ thực tế ở quy mô rack: NVIDIA GB200 NVL72. Một rack kết nối 72 GPU Blackwell và 36 CPU Grace bằng hệ thống chuyển mạch NVLink 5 (NVLink Switch System), đạt băng thông giao tiếp GPU-GPU tổng cộng 130 TB/s TRONG PHẠM VI MỘT RACK. Giữa các rack với nhau, hệ thống vẫn cần InfiniBand hoặc Ethernet tốc độ cao để mở rộng thêm. Nguồn: NVIDIA GB200 NVL72

Vì sao mạng tốc độ cao lại quan trọng?

Khi huấn luyện một mô hình trải trên nhiều GPU, các GPU phải liên tục đồng bộ kết quả tính toán (gradient) với nhau ở mỗi bước huấn luyện. Nếu đường kết nối giữa các GPU chậm, phần lớn thời gian huấn luyện sẽ bị "lãng phí" cho việc chờ đồng bộ dữ liệu thay vì tính toán — dù mỗi GPU riêng lẻ có mạnh đến đâu. Đây là lý do NVLink (trong một máy) và InfiniBand/Ethernet tốc độ cao (giữa các máy) là hai lớp hạ tầng mạng không thể thiếu khi mở rộng quy mô huấn luyện AI, chứ không chỉ riêng sức mạnh của từng GPU.

Nguồn

Đã tự mở kiểm tra, còn truy cập được — tra cứu ngày 15/09/2026.