Trung tâm AI · Hướng dẫn
Cài đặt môi trường huấn luyện AI trên máy chủ GPU
Từ lúc nhận máy chủ GPU Linux đến khi fine-tune được model: mỗi bước có giải thích ngắn cho người mới, lệnh để sao chép, cách kiểm tra đã làm đúng và link tài liệu chính thức.
- Ubuntu 22.04 / 24.04 / 26.04 LTS
- CUDA 13.4
- PyTorch 2.14.0
- Tra cứu 15/09/2026
Trước khi bắt đầu: máy chủ chạy Ubuntu LTS (22.04, 24.04 hoặc 26.04 — các bản được tài liệu driver NVIDIA và Docker liệt kê), có quyền sudo và đăng nhập được qua SSH. Chưa rõ SSH là gì? Đọc SSH là gì. Chưa có máy? Xem máy chủ GPU hoặc Cloud GPU theo giờ (mở tab mới).
Bước 1Kiểm tra máy chủ đã nhận GPU
Trước khi cài gì, hãy chắc chắn hệ điều hành nhìn thấy card NVIDIA. Nếu lệnh nvidia-smi đã chạy được nghĩa là driver đã có sẵn — bạn có thể bỏ qua bước cài driver.
TerminalXem card NVIDIA gắn trên máy lspci | grep -i nvidiaTerminalNếu driver đã cài: xem GPU, bộ nhớ, tiến trình đang chạy nvidia-smiKiểm tra đã làm đúng
lspci liệt kê được thiết bị NVIDIA. Nếu nvidia-smi báo không tìm thấy lệnh, chuyển sang mục “Cài NVIDIA driver”.
Tài liệu chính thức: CUDA Installation Guide for Linux (bản 13.4) (mở tab mới) · nvidia-smi — tài liệu dòng lệnh (mở tab mới)
Bước 2Cài NVIDIA driver
Driver là phần mềm để hệ điều hành điều khiển GPU. Dù bạn cài thẳng lên máy hay dùng Docker, driver luôn phải nằm trên máy chủ (máy host) — container không mang driver theo.
Tài liệu NVIDIA dùng dấu nhắc # cho lệnh cần quyền root — ở đây viết sẵn sudo. Thay ubuntu2404 bằng ubuntu2204 hoặc ubuntu2604 đúng phiên bản Ubuntu của bạn (máy x86_64).Terminal1. Cài kernel headers cho kernel đang chạy sudo apt install linux-headers-$(uname -r)Terminal2. Thêm kho phần mềm của NVIDIA (gói cuda-keyring) wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-keyring_1.1-1_all.deb sudo dpkg -i cuda-keyring_1.1-1_all.deb sudo apt updateTerminal3. Cài driver (open kernel modules) rồi khởi động lại sudo apt install nvidia-open sudo rebootMáy chủ chỉ dùng để tính toán, không cần giao diện đồ hoạ: tài liệu NVIDIA có phương án gọn hơn là sudo apt -V install libnvidia-compute nvidia-dkms-open.Kiểm tra đã làm đúng
TerminalSau khi khởi động lại nvidia-smi cat /proc/driver/nvidia/versionHai lệnh in ra tên GPU và phiên bản driver. Ghi lại số phiên bản driver: CUDA 13.x cần driver từ 580 trở lên, CUDA 12.x cần từ 525 (bảng driver tối thiểu trong CUDA Release Notes).
Tài liệu chính thức: NVIDIA Driver Installation Guide — Ubuntu (mở tab mới) · NVIDIA Driver Installation Guide — Post-installation Actions (mở tab mới) · CUDA Toolkit Release Notes — bảng driver tối thiểu (mở tab mới)
Bước 3Docker + NVIDIA Container Toolkit
Docker đóng gói phần mềm và thư viện vào container, chạy giống nhau trên mọi máy. NVIDIA Container Toolkit là cầu nối để container dùng được GPU của máy chủ.
Máy chủ riêng
Nếu bạn cài thẳng lên máy chủ và không dùng container, có thể bỏ qua mục này. Chuyển sang tab “Container Docker” để xem lệnh.
Container Docker
Terminal1. Thêm kho Docker sudo apt update sudo apt install ca-certificates curl sudo install -m 0755 -d /etc/apt/keyrings sudo curl -fsSL https://download.docker.com/linux/ubuntu/gpg -o /etc/apt/keyrings/docker.asc sudo chmod a+r /etc/apt/keyrings/docker.asc sudo tee /etc/apt/sources.list.d/docker.sources <<EOF Types: deb URIs: https://download.docker.com/linux/ubuntu Suites: $(. /etc/os-release && echo "${UBUNTU_CODENAME:-$VERSION_CODENAME}") Components: stable Architectures: $(dpkg --print-architecture) Signed-By: /etc/apt/keyrings/docker.asc EOF sudo apt updateTerminal2. Cài Docker Engine và chạy thử sudo apt install docker-ce docker-ce-cli containerd.io docker-buildx-plugin docker-compose-plugin sudo docker run hello-worldTài liệu Docker cảnh báo: thêm tài khoản vào nhóm docker (để khỏi gõ sudo) là cấp quyền tương đương root. Chỉ làm với tài khoản bạn tin tưởng.Terminal3. Thêm kho NVIDIA Container Toolkit sudo apt-get update && sudo apt-get install -y --no-install-recommends \ ca-certificates \ curl \ gnupg2 curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg \ && curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | \ sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | \ sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list sudo apt-get updateTerminal4. Cài toolkit (bản 1.20.0-1 lúc tra cứu) export NVIDIA_CONTAINER_TOOLKIT_VERSION=1.20.0-1 sudo apt-get install -y \ nvidia-container-toolkit=${NVIDIA_CONTAINER_TOOLKIT_VERSION} \ nvidia-container-toolkit-base=${NVIDIA_CONTAINER_TOOLKIT_VERSION} \ libnvidia-container-tools=${NVIDIA_CONTAINER_TOOLKIT_VERSION} \ libnvidia-container1=${NVIDIA_CONTAINER_TOOLKIT_VERSION}Terminal5. Nối toolkit với Docker rồi khởi động lại Docker sudo nvidia-ctk runtime configure --runtime=docker sudo systemctl restart dockerKiểm tra đã làm đúng
TerminalChạy nvidia-smi bên trong một container sudo docker run --rm --runtime=nvidia --gpus all ubuntu nvidia-smiKết quả hiện bảng GPU giống như khi chạy nvidia-smi trên máy chủ là container đã thấy GPU.
Tài liệu chính thức: Install Docker Engine on Ubuntu (mở tab mới) · Linux post-installation steps for Docker Engine (mở tab mới) · NVIDIA Container Toolkit — Installing (mở tab mới) · NVIDIA Container Toolkit — Running a Sample Workload (mở tab mới)
Bước 4Cài CUDA Toolkit (tuỳ chọn)Tuỳ chọn
CUDA Toolkit là bộ công cụ để biên dịch chương trình chạy trên GPU (trình biên dịch nvcc, thư viện). Theo trang cài đặt PyTorch, bạn chỉ phải tự cài CUDA khi build PyTorch từ mã nguồn. Hãy cài khi cần biên dịch mã CUDA — ví dụ build llama.cpp bản CUDA — hoặc khi thư viện bạn dùng yêu cầu.
Máy chủ riêng
TerminalCài từ kho NVIDIA đã thêm ở mục cài driver (hai lệnh chạy riêng) sudo apt update sudo apt install cuda-toolkitTerminalThêm đường dẫn CUDA vào PATH (thêm dòng này vào ~/.bashrc để giữ lâu dài) export PATH=/usr/local/cuda-13.4/bin${PATH:+:${PATH}}Terminal(Tuỳ chọn) cuDNN cho CUDA 13 sudo apt-get -y install cudnn9-cuda-13Container Docker
Với Docker, bạn không cần cài CUDA Toolkit lên máy chủ: dùng image đã đóng gói sẵn. Ví dụ image PyTorch 26.08 trên NGC của NVIDIA dựa trên Ubuntu 24.04 và CUDA 13.4.1 (xem mục “Cài PyTorch đúng bản CUDA”).
Kiểm tra đã làm đúng
TerminalMáy chủ riêng: kiểm tra thư mục cài đặt ls /usr/local/cuda-13.4/bin/Thư mục có nvcc là cài xong. Gặp lỗi “nvcc: No such file or directory” nghĩa là PATH chưa đúng (mục 15.2 trong hướng dẫn CUDA). Muốn kiểm tra kỹ, NVIDIA khuyên build và chạy mẫu deviceQuery trong kho cuda-samples. Số 13.4 là bản hiện hành lúc tra cứu — nếu kho đã lên bản mới, đổi theo tên thư mục thật trong /usr/local/.
Tài liệu chính thức: CUDA Installation Guide for Linux (bản 13.4) (mở tab mới) · cuDNN — Installing on Linux (mở tab mới) · PyTorch — Get Started Locally (Stable 2.14.0) (mở tab mới) · PyTorch Release 26.08 (NGC) (mở tab mới)
Bước 5Tạo môi trường Python riêng
Môi trường ảo giữ thư viện của từng dự án tách biệt, tránh việc cài bản mới cho dự án này làm hỏng dự án khác. Chọn MỘT trong ba cách. PyTorch bản ổn định hiện yêu cầu Python 3.10 trở lên.
Máy chủ riêng
TerminalCách 1 — venv có sẵn của Python sudo apt install python3-venv python3 -m venv ~/venvs/ai source ~/venvs/ai/bin/activateTerminalCách 2 — uv (tạo môi trường nhanh, tự tải Python nếu thiếu) curl -LsSf https://astral.sh/uv/install.sh | sh uv venv --python 3.12 --seed source .venv/bin/activateTerminalCách 3 — conda qua Miniforge wget "https://github.com/conda-forge/miniforge/releases/latest/download/Miniforge3-$(uname)-$(uname -m).sh" bash Miniforge3-$(uname)-$(uname -m).sh conda create -n ai python=3.12 conda activate aiContainer Docker
Container đã là một môi trường tách biệt. Image PyTorch của NGC có sẵn Python và PyTorch, bạn chỉ cần cài thêm thư viện riêng của dự án bằng pip bên trong container.
Kiểm tra đã làm đúng
Dấu nhắc lệnh hiện tên môi trường (ví dụ (ai) hoặc (.venv)). Gõ deactivate để thoát môi trường.
Tài liệu chính thức: venv — Creation of virtual environments (mở tab mới) · Gói python3-venv (Ubuntu 24.04 noble) (mở tab mới) · uv — Installation (mở tab mới) · uv — Using Python environments (mở tab mới) · Miniforge README (mở tab mới) · conda — Managing environments (mở tab mới) · PyTorch — Get Started Locally (Stable 2.14.0) (mở tab mới)
Bước 6Cài PyTorch đúng bản CUDA
Mỗi bản PyTorch được đóng gói cho vài phiên bản CUDA. Chọn bản khớp với driver: driver từ 580 trở lên dùng được các bản CUDA 13.x. Lệnh dưới đây lấy từ trang “Get Started” của pytorch.org (Stable 2.14.0, Linux, pip).
Máy chủ riêng
TerminalCUDA 13.0 (lựa chọn mặc định trên trang PyTorch) pip3 install torch torchvisionTerminalCUDA 13.2 pip3 install torch torchvision --index-url https://download.pytorch.org/whl/cu132TerminalCUDA 12.6 (máy có driver dòng 525–579) pip3 install torch torchvision --index-url https://download.pytorch.org/whl/cu126Container Docker
Cần làm xong mục “Docker + NVIDIA Container Toolkit” trước. Tài liệu NGC khuyên thêm --ipc=host (hoặc --shm-size) để PyTorch có đủ bộ nhớ chia sẻ khi nạp dữ liệu nhiều tiến trình.TerminalChạy container PyTorch 26.08 của NVIDIA, gắn thư mục làm việc docker run --gpus all -it --rm --ipc=host -v $HOME/work:/work nvcr.io/nvidia/pytorch:26.08-py3Kiểm tra đã làm đúng
PythonChạy trong môi trường (hoặc container) vừa tạo import torch x = torch.rand(5, 3) print(x) print(torch.cuda.is_available())In ra một ma trận số ngẫu nhiên và True là PyTorch đã dùng được GPU. Nếu ra False: kiểm tra lại driver (mục “Cài NVIDIA driver”) và bản CUDA của PyTorch.
Tài liệu chính thức: PyTorch — Get Started Locally (Stable 2.14.0) (mở tab mới) · CUDA Toolkit Release Notes — bảng driver tối thiểu (mở tab mới) · PyTorch Release Notes (NGC) — Running PyTorch (mở tab mới) · PyTorch Release 26.08 (NGC) (mở tab mới)
Bước 7Chạy Jupyter an toàn qua SSH tunnel
Jupyter cho phép viết và chạy code ngay trên trình duyệt — nhưng ai vào được Jupyter là chạy được lệnh trên máy chủ của bạn. Đừng mở cổng Jupyter ra internet. Cách an toàn: để Jupyter chỉ nghe trên máy chủ, rồi dùng SSH “đào đường hầm” từ máy tính của bạn.
Máy chủ riêng
TerminalTrên máy chủ (trong môi trường Python đã kích hoạt) pip install jupyterlab jupyter labMặc định Jupyter Server chỉ nghe ở localhost (127.0.0.1:8888), máy khác trên mạng không vào được.
Container Docker
TerminalPublish cổng CHỈ về 127.0.0.1 của máy chủ, rồi chạy Jupyter trong container docker run --gpus all -it --rm --ipc=host -p 127.0.0.1:8888:8888 -v $HOME/work:/work nvcr.io/nvidia/pytorch:26.08-py3 # bên trong container: pip install jupyterlab jupyter lab --ServerApp.ip=0.0.0.0Theo tài liệu Docker, publish cổng mà không ghi 127.0.0.1 sẽ mở cổng ra bên ngoài, và luật tường lửa ufw không chặn được cổng Docker publish. Luôn ghi rõ 127.0.0.1.Kiểm tra đã làm đúng
TerminalTrên máy tính của bạn: mở đường hầm (-N: chỉ chuyển cổng, không chạy lệnh) ssh -N -L 8888:localhost:8888 user@IP_MAY_CHUMở http://127.0.0.1:8888 trên trình duyệt và đăng nhập bằng token Jupyter in ra ở terminal máy chủ. Có thể đặt mật khẩu bằng lệnh jupyter server password.
Tài liệu chính thức: JupyterLab — Installation (mở tab mới) · Jupyter Server — Running a public Jupyter Server (mở tab mới) · ssh(1) — OpenBSD manual page (tuỳ chọn -L, -N) (mở tab mới) · Docker — Port publishing and mapping (mở tab mới) · Docker — Packet filtering and firewalls (Docker và ufw) (mở tab mới)
Bước 8Fine-tune bằng LoRA / QLoRA (ví dụ tối thiểu)
Fine-tune là dạy thêm cho model có sẵn bằng dữ liệu của bạn. LoRA chỉ huấn luyện một phần rất nhỏ tham số gắn thêm vào model; QLoRA nạp model gốc ở dạng nén 4-bit để giảm VRAM. Ví dụ dưới đây ghép đúng các đoạn mã trong tài liệu PEFT và Transformers.
TerminalCài thư viện pip install --upgrade transformers accelerate bitsandbytes pip install peftPythonqlora_setup.py — nạp model 4-bit và gắn LoRA import torch from transformers import AutoModelForCausalLM, BitsAndBytesConfig from peft import LoraConfig, get_peft_model, prepare_model_for_kbit_training # Model mở, giấy phép Apache-2.0 (xem model card trước khi dùng) model_id = "Qwen/Qwen2.5-7B-Instruct" config = BitsAndBytesConfig( load_in_4bit=True, bnb_4bit_quant_type="nf4", bnb_4bit_use_double_quant=True, bnb_4bit_compute_dtype=torch.bfloat16, ) model = AutoModelForCausalLM.from_pretrained(model_id, quantization_config=config) model = prepare_model_for_kbit_training(model) lora_config = LoraConfig( r=16, lora_alpha=8, target_modules=["q_proj", "k_proj", "v_proj", "o_proj"], lora_dropout=0.05, bias="none", task_type="CAUSAL_LM" ) model = get_peft_model(model, lora_config) model.print_trainable_parameters()PythonHuấn luyện bằng Trainer rồi lưu adapter (khung theo PEFT quicktour) from transformers import Trainer, TrainingArguments training_args = TrainingArguments( output_dir="qwen-lora-adapter", num_train_epochs=2, save_strategy="epoch", save_total_limit=3, report_to="tensorboard", ) trainer = Trainer( model=model, args=training_args, train_dataset=tokenized_datasets["train"], # dữ liệu đã token hoá của bạn data_collator=data_collator, ) trainer.train() model.save_pretrained("qwen-lora-adapter")Tên lớp q_proj, k_proj, v_proj, o_proj đã đối chiếu với danh sách trọng số của Qwen2.5-7B-Instruct. Đổi sang model khác phải kiểm tra lại tên lớp. Muốn biết cần bao nhiêu VRAM, dùng máy tính VRAM; muốn ước lượng số GPU-giờ, dùng công cụ ước lượng huấn luyện.Kiểm tra đã làm đúng
print_trainable_parameters() in ra số tham số được huấn luyện chỉ chiếm một tỷ lệ nhỏ trong tổng số — đó là dấu hiệu LoRA đã gắn đúng. Trong lúc train, loss được ghi vào thư mục output_dir.
Tài liệu chính thức: PEFT — Installation (mở tab mới) · PEFT — Quicktour (LoraConfig, get_peft_model) (mở tab mới) · PEFT — Quantization (QLoRA, prepare_model_for_kbit_training) (mở tab mới) · Transformers — bitsandbytes (mở tab mới) · Transformers — Trainer / TrainingArguments (mở tab mới)
Bước 9Huấn luyện trên nhiều GPU
Khi một GPU không đủ bộ nhớ hoặc chạy quá lâu, ta chia việc cho nhiều GPU. Data parallel: mỗi GPU giữ một bản model, chia nhau dữ liệu. FSDP và DeepSpeed ZeRO: “xẻ” trạng thái optimizer, gradient, thậm chí cả tham số model ra nhiều GPU để tiết kiệm bộ nhớ. Ba công cụ khởi chạy phổ biến:
Terminaltorchrun — trình khởi chạy của PyTorch (1 máy, NUM_TRAINERS = số GPU) torchrun \ --standalone \ --nnodes=1 \ --nproc-per-node=$NUM_TRAINERS \ train.pyTerminalAccelerate — hỏi cấu hình một lần, sau đó chạy accelerate config accelerate launch --multi_gpu --num_processes=4 train.pyTerminalDeepSpeed — cài và chạy với Trainer pip install deepspeed deepspeed --num_gpus 4 train.pyJSONds_config.json — ZeRO stage 2, để "auto" cho DeepSpeed lấy giá trị từ TrainingArguments { "bf16": { "enabled": "auto" }, "zero_optimization": { "stage": 2 }, "gradient_clipping": "auto", "train_micro_batch_size_per_gpu": "auto", "train_batch_size": "auto", "gradient_accumulation_steps": "auto" }PythonTrỏ Trainer tới file cấu hình DeepSpeed args = TrainingArguments( deepspeed="ds_config.json", ... )ZeRO stage 1 chia trạng thái optimizer; stage 2 chia thêm gradient; stage 3 chia cả tham số model. Với PyTorch thuần, FSDP2 dùng hàm fully_shard() và cũng khởi chạy bằng torchrun. Nếu dùng Docker, nhớ thêm --ipc=host như mục “Cài PyTorch đúng bản CUDA”.
Kiểm tra đã làm đúng
Mở nvidia-smi ở cửa sổ khác: tất cả GPU được giao việc đều có tiến trình và bộ nhớ đang dùng.
Tài liệu chính thức: torchrun (Elastic Launch) — PyTorch 2.14 (mở tab mới) · Accelerate — Launching distributed code (mở tab mới) · Accelerate — Fully Sharded Data Parallel (mở tab mới) · Transformers — DeepSpeed (mở tab mới) · DeepSpeed — Getting Started (mở tab mới) · DeepSpeed — ZeRO tutorial (mở tab mới) · Getting Started with Fully Sharded Data Parallel (FSDP2) (mở tab mới)
Bước 10Theo dõi GPU và quá trình huấn luyện
Theo dõi giúp phát hiện sớm GPU “ngồi chơi” (thường do nạp dữ liệu chậm), bộ nhớ sắp đầy, hay loss không giảm.
Terminalnvidia-smi: làm mới 5 giây một lần / dmon: in số liệu từng GPU theo dòng nvidia-smi -l 5 nvidia-smi dmonTerminalTensorBoard: xem biểu đồ loss trên trình duyệt pip install tensorboard tensorboard --logdir=runsTensorBoard cũng là một trang web — mở bằng SSH tunnel như mục “Chạy Jupyter an toàn qua SSH tunnel”, dùng đúng cổng mà TensorBoard in ra. Với Trainer, đặt report_to="tensorboard" hoặc report_to="wandb" để tự ghi log.
TerminalWeights & Biases (dịch vụ bên ngoài — cân nhắc nếu dữ liệu nhạy cảm) pip install wandb wandb loginTài liệu chính thức: nvidia-smi — tài liệu dòng lệnh (mở tab mới) · torch.utils.tensorboard (PyTorch 2.14) (mở tab mới) · Transformers — Trainer / TrainingArguments (mở tab mới) · Weights & Biases — Quickstart (mở tab mới) · DCGM Exporter (mở tab mới)
Bước 11Lưu checkpoint và sao lưu
Checkpoint là “bản lưu game” của quá trình huấn luyện. Máy chủ có thể khởi động lại, hết hạn thuê, hoặc bạn lỡ tay xoá — có checkpoint thì học tiếp từ chỗ dừng, không phải chạy lại từ đầu.
PythonPyTorch thuần: lưu cả model, optimizer, epoch torch.save({ 'epoch': epoch, 'model_state_dict': model.state_dict(), 'optimizer_state_dict': optimizer.state_dict(), 'loss': loss, }, PATH) checkpoint = torch.load(PATH, weights_only=True) model.load_state_dict(checkpoint['model_state_dict']) optimizer.load_state_dict(checkpoint['optimizer_state_dict'])PythonTrainer: học tiếp từ checkpoint mới nhất trong output_dir trainer.train(resume_from_checkpoint=True)save_total_limit giới hạn số checkpoint giữ lại để ổ đĩa không đầy. Nguyên tắc sao lưu: chép checkpoint quan trọng ra ngoài máy đang train (ví dụ kho lưu trữ riêng), vì dữ liệu chỉ nằm trên một máy là dữ liệu có thể mất.
Tài liệu chính thức: Saving and Loading Models — checkpoint (mở tab mới) · Transformers — Trainer / TrainingArguments (mở tab mới)
Bước 12Sự cố thường gặp
Ba nhóm lỗi hay gặp khi mới làm quen và hướng xử lý theo tài liệu chính thức.
1) CUDA out of memory — model, batch hoặc độ dài chuỗi vượt VRAM. Thử giảm batch size, dùng gradient accumulation, nạp model 4-bit (QLoRA) hoặc chia ra nhiều GPU (ZeRO/FSDP). PyTorch có biến môi trường PYTORCH_ALLOC_CONF để chỉnh bộ cấp phát bộ nhớ, ví dụ bật expandable_segments khi kích thước cấp phát thay đổi liên tục (tính năng thử nghiệm).
TerminalBật expandable_segments trước khi chạy script export PYTORCH_ALLOC_CONF=expandable_segments:True2) Lệch phiên bản driver / CUDA — torch.cuda.is_available() trả về False hoặc báo driver quá cũ. So phiên bản driver (cat /proc/driver/nvidia/version) với bảng tối thiểu: CUDA 13.x cần driver từ 580, CUDA 12.x cần từ 525. Cách xử lý: nâng driver, hoặc cài bản PyTorch dựng cho CUDA thấp hơn.
3) Lỗi NCCL / treo khi chạy nhiều GPU — NCCL là thư viện để các GPU trao đổi dữ liệu. Bật log để xem lỗi dừng ở đâu. Máy có nhiều card mạng có thể chỉ định card bằng NCCL_SOCKET_IFNAME. Trong Docker, thiếu bộ nhớ chia sẻ cũng gây lỗi — thêm --ipc=host hoặc --shm-size.
TerminalBật log NCCL export NCCL_DEBUG=INFOTài liệu chính thức: CUDA semantics — PYTORCH_ALLOC_CONF (PyTorch 2.14) (mở tab mới) · CUDA Toolkit Release Notes — bảng driver tối thiểu (mở tab mới) · CUDA Compatibility (mở tab mới) · NCCL Troubleshooting — Logging (mở tab mới) · NCCL — Environment Variables (mở tab mới) · PyTorch Release Notes (NGC) — Running PyTorch (mở tab mới)
Bước tiếp theo
Nguồn
Mọi lệnh, phiên bản và giấy phép trên trang được đối chiếu trực tiếp với các trang dưới đây. Tra cứu ngày 15/09/2026.
- CUDA Installation Guide for Linux (bản 13.4) (mở tab mới)NVIDIA · tra cứu
- nvidia-smi — tài liệu dòng lệnh (mở tab mới)NVIDIA · tra cứu
- NVIDIA Driver Installation Guide — Ubuntu (mở tab mới)NVIDIA · tra cứu
- NVIDIA Driver Installation Guide — Post-installation Actions (mở tab mới)NVIDIA · tra cứu
- CUDA Toolkit Release Notes — bảng driver tối thiểu (mở tab mới)NVIDIA · tra cứu
- Install Docker Engine on Ubuntu (mở tab mới)Docker · tra cứu
- Linux post-installation steps for Docker Engine (mở tab mới)Docker · tra cứu
- NVIDIA Container Toolkit — Installing (mở tab mới)NVIDIA · tra cứu
- NVIDIA Container Toolkit — Running a Sample Workload (mở tab mới)NVIDIA · tra cứu
- cuDNN — Installing on Linux (mở tab mới)NVIDIA · tra cứu
- PyTorch — Get Started Locally (Stable 2.14.0) (mở tab mới)PyTorch Foundation · tra cứu
- PyTorch Release 26.08 (NGC) (mở tab mới)NVIDIA · tra cứu
- venv — Creation of virtual environments (mở tab mới)Python Software Foundation · tra cứu
- Gói python3-venv (Ubuntu 24.04 noble) (mở tab mới)Canonical · tra cứu
- uv — Installation (mở tab mới)Astral · tra cứu
- uv — Using Python environments (mở tab mới)Astral · tra cứu
- Miniforge README (mở tab mới)conda-forge · tra cứu
- conda — Managing environments (mở tab mới)conda · tra cứu
- PyTorch Release Notes (NGC) — Running PyTorch (mở tab mới)NVIDIA · tra cứu
- JupyterLab — Installation (mở tab mới)Project Jupyter · tra cứu
- Jupyter Server — Running a public Jupyter Server (mở tab mới)Project Jupyter · tra cứu
- ssh(1) — OpenBSD manual page (tuỳ chọn -L, -N) (mở tab mới)OpenBSD · tra cứu
- Docker — Port publishing and mapping (mở tab mới)Docker · tra cứu
- Docker — Packet filtering and firewalls (Docker và ufw) (mở tab mới)Docker · tra cứu
- PEFT — Installation (mở tab mới)Hugging Face · tra cứu
- PEFT — Quicktour (LoraConfig, get_peft_model) (mở tab mới)Hugging Face · tra cứu
- PEFT — Quantization (QLoRA, prepare_model_for_kbit_training) (mở tab mới)Hugging Face · tra cứu
- Transformers — bitsandbytes (mở tab mới)Hugging Face · tra cứu
- Transformers — Trainer / TrainingArguments (mở tab mới)Hugging Face · tra cứu
- torchrun (Elastic Launch) — PyTorch 2.14 (mở tab mới)PyTorch Foundation · tra cứu
- Accelerate — Launching distributed code (mở tab mới)Hugging Face · tra cứu
- Accelerate — Fully Sharded Data Parallel (mở tab mới)Hugging Face · tra cứu
- Transformers — DeepSpeed (mở tab mới)Hugging Face · tra cứu
- DeepSpeed — Getting Started (mở tab mới)DeepSpeed · tra cứu
- DeepSpeed — ZeRO tutorial (mở tab mới)DeepSpeed · tra cứu
- Getting Started with Fully Sharded Data Parallel (FSDP2) (mở tab mới)PyTorch Foundation · tra cứu
- torch.utils.tensorboard (PyTorch 2.14) (mở tab mới)PyTorch Foundation · tra cứu
- Weights & Biases — Quickstart (mở tab mới)Weights & Biases · tra cứu
- DCGM Exporter (mở tab mới)NVIDIA · tra cứu
- Saving and Loading Models — checkpoint (mở tab mới)PyTorch Foundation · tra cứu
- CUDA semantics — PYTORCH_ALLOC_CONF (PyTorch 2.14) (mở tab mới)PyTorch Foundation · tra cứu
- CUDA Compatibility (mở tab mới)NVIDIA · tra cứu
- NCCL Troubleshooting — Logging (mở tab mới)NVIDIA · tra cứu
- NCCL — Environment Variables (mở tab mới)NVIDIA · tra cứu
Cần máy chủ GPU để làm theo hướng dẫn?
Cho VNSO biết model, dữ liệu và thời gian bạn định huấn luyện để được tư vấn cấu hình phù hợp.