Bỏ qua tới nội dung chính
VNSO

MÁY TÍNH VRAM CHẠY MODEL AI

Chọn model, mức lượng tử hoá và độ dài ngữ cảnh — công cụ tính ngay lượng VRAM cần để chạy suy luận (inference), và số GPU cần dùng cho từng dòng card.

VRAM là gì? Là bộ nhớ riêng gắn trên GPU, dùng để chứa trọng số của model và dữ liệu tạm trong lúc xử lý. VRAM không đủ là nguyên nhân phổ biến nhất khiến việc chạy hoặc huấn luyện model AI bị lỗi "out of memory". Lượng tử hoá (quantization) là kỹ thuật nén trọng số model từ số thực dài (FP32/FP16) xuống số ngắn hơn (INT8, INT4) để giảm VRAM cần dùng, đánh đổi một phần độ chính xác. Xem thêm tại từ điển thuật ngữ.

28 lớp · 28 đầu attention (4 đầu KV) · hidden 3584. Xem config.json nguồn

8.192 token
1
20%

Kết quả tính VRAM

VRAM trọng số (FP16/BF16 (nén 2 byte))
14.2 GB
KV cache (FP16/BF16 (nén 2 byte), 8.192 token × batch 1)
0.44 GB
Tạm tính
14.6 GB
Dự phòng overhead (20%)
2.92 GB
Tổng VRAM cần thiết
17.5 GB

Công thức: VRAM trọng số = số tham số × byte/tham số (2 byte). KV cache = 2 × batch × ngữ cảnh × số lớp × số đầu KV × head dim × byte/phần tử. Không tính bộ nhớ hoạt động trung gian khi xử lý theo lô lớn hoặc bộ nhớ framework ngoài phần dự phòng overhead — số thực tế có thể chênh lệch, đặc biệt với batch lớn.

Gói GPU VNSO chạy được cấu hình này

  • NVIDIA-RTX-3090 · 24 GB VRAM

    8 vCPU · 24GB RAM · 500GB NVMe · còn 1/2 máy

    18.500đ/giờ

    10.660.000đ/tháng

  • NVIDIA-RTX-A5000 · 24 GB VRAM

    16 vCPU · 32GB RAM · 500GB NVMe · tạm hết máy

    20.200đ/giờ

    11.640.000đ/tháng

  • NVIDIA-A100-40GB · 40 GB VRAM

    16 vCPU · 48GB RAM · 1TB NVMe · tạm hết máy

    43.100đ/giờ

    24.830.000đ/tháng

  • NVIDIA-A100-80GB · 80 GB VRAM

    32 vCPU · 96GB RAM · 2TB NVMe · tạm hết máy

    Liên hệ báo giá

Giá theo bảng công khai gpu.vnso.vn (bản lưu ngày 15/9/2026). Xem tất cả gói thuê theo giờ.

Số GPU cần dùng theo từng model card

GPUVRAM/cardSố card cầnTrạng thái VNSO
AMD Instinct MI300X192 GB1 cardVNSO chưa có
NVIDIA B200180 GB1 cardVNSO chưa có
NVIDIA H200 SXM141 GB1 cardVNSO chưa có
NVIDIA H100 SXM80 GB1 cardVNSO chưa có
NVIDIA H100 PCIe80 GB1 cardVNSO chưa có
NVIDIA A100 80GB SXM80 GB1 cardCó theo yêu cầu
NVIDIA L40S48 GB1 cardVNSO chưa có
NVIDIA RTX 6000 Ada48 GB1 cardVNSO đang cho thuê
NVIDIA RTX 5880 Ada48 GB1 cardVNSO đang cho thuê
NVIDIA Tesla V100 32GB32 GB1 cardVNSO đang cho thuê
NVIDIA RTX 409024 GB1 cardVNSO đang cho thuê
NVIDIA RTX 309024 GB1 cardVNSO đang cho thuê
NVIDIA Tesla P100 16GB16 GB2 card(cần NVLink/tensor-parallel để ghép VRAM nhiều card)VNSO đang cho thuê

Số card giả định VRAM có thể ghép tuyến tính qua NVLink hoặc chia model theo tensor-parallel — thực tế còn phụ thuộc băng thông kết nối giữa các card và cách chia mô hình.

Nguồn công thức

Số liệu model (số lớp, số đầu attention/KV, hidden size) lấy từ config.json công khai của từng model trên Hugging Face — xem link nguồn ngay dưới ô chọn model. Công cụ không tính bộ nhớ hoạt động trung gian (activation) khi xử lý theo lô lớn; model kiến trúc Mixture-of-Experts hoặc Multi-head Latent Attention (như DeepSeek-V3/R1) không dùng được công thức này.