Bỏ qua tới nội dung chính
VNSO
Training AI local · chọn host/VPS

Huấn luyện & chạy model AI ngay trên máy chủ của bạn, dữ liệu không rời Việt Nam.

Chọn mục đích và cỡ model — hệ thống cho biết cần bao nhiêu VRAM và máy chủ GPU VNSO nào chạy được, kèm cách cấu hình.

Dữ liệu ở VNToàn quyền máy chủKỹ sư MLOps hỗ trợ

1 · Bạn muốn làm gì?

2 · Cỡ model (số tham số)

~6 GB
VRAM cần (ước lượng)
Tính chính xác

Ước lượng theo hệ số phổ biến (chạy 4-bit ~0,6GB/tỉ · QLoRA ~0,9GB/tỉ · huấn luyện đầy đủ ~16GB/tỉ). Dùng công cụ để tính theo ngữ cảnh (độ dài, batch).

Server GPU-4xP100
2× Tesla P100 16GB
cần ~6GB16GB×2 = 32GB
Thoải mái19.500.000đ/th
Server GPU-V100
1× Tesla V100 32GB
cần ~6GB32GB
Thoải mái22.000.000đ/th
Server GPU-4090
1× RTX 4090 24GB
Phổ biến
cần ~6GB24GB
Thoải mái27.500.000đ/th
Server GPU-2x3090
2× RTX 3090 24GB
cần ~6GB24GB×2 = 48GB
Thoải mái28.500.000đ/th
Server GPU-2x4090
2× RTX 4090 24GB
cần ~6GB24GB×2 = 48GB
Thoải mái37.000.000đ/th
Server GPU-5880
RTX 5880 ADA 48GB
cần ~6GB48GB
Thoải mái47.000.000đ/th
Server GPU-6000
RTX 6000 ADA 48GB
cần ~6GB48GB
Thoải mái49.000.000đ/th

“Chia GPU” = model lớn hơn 1 GPU, cần chạy phân tán nhiều GPU (FSDP/DeepSpeed) — kỹ sư VNSO hỗ trợ cấu hình.

Cấu hình để training local — 4 bước

01

Chọn & khởi tạo máy chủ GPU

Chọn host phù hợp ở trên, VNSO bàn giao máy có GPU, toàn quyền root.

02

Cài driver + CUDA + PyTorch

Cài NVIDIA driver, CUDA toolkit, PyTorch bản CUDA — theo hướng dẫn chi tiết.

03

Chọn framework

Transformers + TRL + PEFT + bitsandbytes cho fine-tune; vLLM/Ollama để chạy.

04

Chạy / huấn luyện

Nạp dữ liệu, chạy QLoRA hoặc suy luận; theo dõi VRAM và tiến trình.

Cấu hình theo cỡ model — bé đến lớn nhất

VRAM ước lượng cho 3 việc, và GPU VNSO gợi ý. Dùng bộ chọn ở trên để tính theo cấu hình cụ thể của bạn.

Cỡ modelVí dụChạy (4-bit)Fine-tune QLoRAHuấn luyện đầy đủGPU VNSO gợi ý
1–1.5BQwen2.5-1.5B~1 GB~6 GB~24 GBRTX A4000 16GB
3BLlama-3.2-3B~2 GB~6 GB~48 GBRTX A4000 / 3090
7–8BLlama-3.1-8B, Qwen2.5-7B~5 GB~8 GB~128 GB (cụm)RTX 3090 / 4090 24GB
13BQwen2.5-14B~8 GB~12 GB~208 GB (cụm)RTX 4090 / A5000 24GB
30–34BQwen2.5-32B~20 GB~31 GBcụm nhiều GPUA100 40GB / 5880·6000 ADA 48GB
70BLlama-3.1-70B~42 GB~63 GBcụm nhiều GPUADA 48GB ×nhiều / chia GPU

Số liệu ước lượng theo hệ số phổ biến (chạy ~0,6GB/tỉ · QLoRA ~0,9GB/tỉ · đầy đủ ~16GB/tỉ). “Cụm” = cần nhiều GPU chạy phân tán (FSDP/DeepSpeed). Dùng máy tính VRAM / ước lượng huấn luyện để tính chính xác.

VPS thường (không GPU)? Chỉ nên dùng để chạy model rất nhỏ (1–3B, 4-bit) hoặc gọi API — CPU không đủ cho huấn luyện. Cần training thật thì chọn máy chủ GPU ở trên.