MÁY TÍNH VRAM CHẠY MODEL AI
Chọn model, mức lượng tử hoá và độ dài ngữ cảnh — công cụ tính ngay lượng VRAM cần để chạy suy luận (inference), và số GPU cần dùng cho từng dòng card.
VRAM là gì? Là bộ nhớ riêng gắn trên GPU, dùng để chứa trọng số của model và dữ liệu tạm trong lúc xử lý. VRAM không đủ là nguyên nhân phổ biến nhất khiến việc chạy hoặc huấn luyện model AI bị lỗi "out of memory". Lượng tử hoá (quantization) là kỹ thuật nén trọng số model từ số thực dài (FP32/FP16) xuống số ngắn hơn (INT8, INT4) để giảm VRAM cần dùng, đánh đổi một phần độ chính xác. Xem thêm tại từ điển thuật ngữ.
Kết quả tính VRAM
- VRAM trọng số (FP16/BF16 (nén 2 byte))
- 14.2 GB
- KV cache (FP16/BF16 (nén 2 byte), 8.192 token × batch 1)
- 0.44 GB
- Tạm tính
- 14.6 GB
- Dự phòng overhead (20%)
- 2.92 GB
- Tổng VRAM cần thiết
- 17.5 GB
Công thức: VRAM trọng số = số tham số × byte/tham số (2 byte). KV cache = 2 × batch × ngữ cảnh × số lớp × số đầu KV × head dim × byte/phần tử. Không tính bộ nhớ hoạt động trung gian khi xử lý theo lô lớn hoặc bộ nhớ framework ngoài phần dự phòng overhead — số thực tế có thể chênh lệch, đặc biệt với batch lớn.
Gói GPU VNSO chạy được cấu hình này
NVIDIA-RTX-3090 · 24 GB VRAM
8 vCPU · 24GB RAM · 500GB NVMe · còn 1/2 máy
18.500đ/giờ
10.660.000đ/tháng
NVIDIA-RTX-A5000 · 24 GB VRAM
16 vCPU · 32GB RAM · 500GB NVMe · tạm hết máy
20.200đ/giờ
11.640.000đ/tháng
NVIDIA-A100-40GB · 40 GB VRAM
16 vCPU · 48GB RAM · 1TB NVMe · tạm hết máy
43.100đ/giờ
24.830.000đ/tháng
NVIDIA-A100-80GB · 80 GB VRAM
32 vCPU · 96GB RAM · 2TB NVMe · tạm hết máy
Liên hệ báo giá
Giá theo bảng công khai gpu.vnso.vn (bản lưu ngày 15/9/2026). Xem tất cả gói thuê theo giờ.
Số GPU cần dùng theo từng model card
| GPU | VRAM/card | Số card cần | Trạng thái VNSO |
|---|---|---|---|
| AMD Instinct MI300X | 192 GB | 1 card | VNSO chưa có |
| NVIDIA B200 | 180 GB | 1 card | VNSO chưa có |
| NVIDIA H200 SXM | 141 GB | 1 card | VNSO chưa có |
| NVIDIA H100 SXM | 80 GB | 1 card | VNSO chưa có |
| NVIDIA H100 PCIe | 80 GB | 1 card | VNSO chưa có |
| NVIDIA A100 80GB SXM | 80 GB | 1 card | Có theo yêu cầu |
| NVIDIA L40S | 48 GB | 1 card | VNSO chưa có |
| NVIDIA RTX 6000 Ada | 48 GB | 1 card | VNSO đang cho thuê |
| NVIDIA RTX 5880 Ada | 48 GB | 1 card | VNSO đang cho thuê |
| NVIDIA Tesla V100 32GB | 32 GB | 1 card | VNSO đang cho thuê |
| NVIDIA RTX 4090 | 24 GB | 1 card | VNSO đang cho thuê |
| NVIDIA RTX 3090 | 24 GB | 1 card | VNSO đang cho thuê |
| NVIDIA Tesla P100 16GB | 16 GB | 2 card(cần NVLink/tensor-parallel để ghép VRAM nhiều card) | VNSO đang cho thuê |
Số card giả định VRAM có thể ghép tuyến tính qua NVLink hoặc chia model theo tensor-parallel — thực tế còn phụ thuộc băng thông kết nối giữa các card và cách chia mô hình.
Nguồn công thức
- Hugging Face Accelerate — Model size estimator — công thức VRAM trọng số theo độ chính xác (byte/tham số).
- EleutherAI — Transformer Math 101 — công thức KV cache và mức dự phòng overhead suy luận (≤20%).
Số liệu model (số lớp, số đầu attention/KV, hidden size) lấy từ config.json công khai của từng model trên Hugging Face — xem link nguồn ngay dưới ô chọn model. Công cụ không tính bộ nhớ hoạt động trung gian (activation) khi xử lý theo lô lớn; model kiến trúc Mixture-of-Experts hoặc Multi-head Latent Attention (như DeepSeek-V3/R1) không dùng được công thức này.