Bỏ qua tới nội dung chính
VNSO

ƯỚC LƯỢNG TÀI NGUYÊN HUẤN LUYỆN AI

Nhập số tham số model và số token huấn luyện — công cụ tính ra tổng GPU-giờ cần thiết, dựa trên FLOPS đỉnh chính thức của từng dòng GPU.

40%

Mặc định 40% — mức thực tế phổ biến khi huấn luyện phân tán (nguồn: EleutherAI, xem mục "Nguồn" bên dưới).

Ước lượng tài nguyên huấn luyện

Tổng phép tính (FLOPs)
4.36e+22
Thời gian chạy thực tế (wall-clock)
12.136,1 giờ (~505,7 ngày)
Tổng GPU-giờ cần
97.089 giờ
Chi phí thuê GPU ước tính4.184.521.902đ

97.089 GPU-giờ × 43.100đ/giờ — theo bảng giá công khai của gói CBA100-40GB trên gpu.vnso.vn (bản lưu ngày 15/9/2026). Chưa gồm thời gian chuẩn bị dữ liệu, chạy thử, lưu trữ và thuế. Kéo thanh MFU bên trái để xem khoảng dao động.

Công thức: C ≈ 6 × số tham số × số token (EleutherAI / Chinchilla). GPU-giờ = C ÷ (FLOPS đỉnh GPU × MFU × số GPU) × số GPU. Đây là ước lượng lý thuyết, chưa tính thời gian nghỉ do lỗi phần cứng, đồng bộ mạng, hay giai đoạn khởi động/checkpoint.

Bộ nhớ khi full fine-tune (Adam)

Trạng thái model (trọng số + gradient + optimizer)
1.083,3 GB

Full fine-tune với optimizer AdamW, mixed-precision ≈ 16 byte/tham số (2 byte trọng số fp16/bf16 + 12 byte trạng thái optimizer AdamW + 2 byte gradient fp16 — nguồn EleutherAI). Số này CHƯA gồm bộ nhớ activation, nên VRAM thực tế cần lớn hơn. LoRA/QLoRA cần VRAM thấp hơn nhiều so với full fine-tune vì chỉ huấn luyện một số ít tham số phụ — chưa có nguồn số liệu cụ thể để đưa công thức riêng ở đây.

Nguồn công thức

Chỉ đưa vào những GPU có datasheet chính thức kiểm chứng được FLOPS Tensor Core dense — GPU nào chưa tìm được nguồn thì chưa đưa vào danh sách để tránh suy đoán số liệu.