Huấn luyện & chạy model AI ngay trên máy chủ của bạn, dữ liệu không rời Việt Nam.
Chọn mục đích và cỡ model — hệ thống cho biết cần bao nhiêu VRAM và máy chủ GPU VNSO nào chạy được, kèm cách cấu hình.
1 · Bạn muốn làm gì?
2 · Cỡ model (số tham số)
Ước lượng theo hệ số phổ biến (chạy 4-bit ~0,6GB/tỉ · QLoRA ~0,9GB/tỉ · huấn luyện đầy đủ ~16GB/tỉ). Dùng công cụ để tính theo ngữ cảnh (độ dài, batch).
“Chia GPU” = model lớn hơn 1 GPU, cần chạy phân tán nhiều GPU (FSDP/DeepSpeed) — kỹ sư VNSO hỗ trợ cấu hình.
Cấu hình để training local — 4 bước
Chọn & khởi tạo máy chủ GPU
Chọn host phù hợp ở trên, VNSO bàn giao máy có GPU, toàn quyền root.
Cài driver + CUDA + PyTorch
Cài NVIDIA driver, CUDA toolkit, PyTorch bản CUDA — theo hướng dẫn chi tiết.
Chọn framework
Transformers + TRL + PEFT + bitsandbytes cho fine-tune; vLLM/Ollama để chạy.
Chạy / huấn luyện
Nạp dữ liệu, chạy QLoRA hoặc suy luận; theo dõi VRAM và tiến trình.
Cấu hình theo cỡ model — bé đến lớn nhất
VRAM ước lượng cho 3 việc, và GPU VNSO gợi ý. Dùng bộ chọn ở trên để tính theo cấu hình cụ thể của bạn.
| Cỡ model | Ví dụ | Chạy (4-bit) | Fine-tune QLoRA | Huấn luyện đầy đủ | GPU VNSO gợi ý |
|---|---|---|---|---|---|
| 1–1.5B | Qwen2.5-1.5B | ~1 GB | ~6 GB | ~24 GB | RTX A4000 16GB |
| 3B | Llama-3.2-3B | ~2 GB | ~6 GB | ~48 GB | RTX A4000 / 3090 |
| 7–8B | Llama-3.1-8B, Qwen2.5-7B | ~5 GB | ~8 GB | ~128 GB (cụm) | RTX 3090 / 4090 24GB |
| 13B | Qwen2.5-14B | ~8 GB | ~12 GB | ~208 GB (cụm) | RTX 4090 / A5000 24GB |
| 30–34B | Qwen2.5-32B | ~20 GB | ~31 GB | cụm nhiều GPU | A100 40GB / 5880·6000 ADA 48GB |
| 70B | Llama-3.1-70B | ~42 GB | ~63 GB | cụm nhiều GPU | ADA 48GB ×nhiều / chia GPU |
Số liệu ước lượng theo hệ số phổ biến (chạy ~0,6GB/tỉ · QLoRA ~0,9GB/tỉ · đầy đủ ~16GB/tỉ). “Cụm” = cần nhiều GPU chạy phân tán (FSDP/DeepSpeed). Dùng máy tính VRAM / ước lượng huấn luyện để tính chính xác.