Bỏ qua tới nội dung chính
VNSO

Trung tâm AI · Thuật ngữ

Thuật ngữ AI dễ hiểu

Những khái niệm hay gặp khi đọc tài liệu model, cài môi trường huấn luyện hay chọn GPU — mỗi thuật ngữ có giải thích ngắn và ví dụ đời thường.

Thuật ngữ hosting, cloud, bảo mật xem ở từ điển thuật ngữ chung.

Đang xem 32/32 thuật ngữ

LLM dự đoán phần chữ tiếp theo dựa trên phần chữ đã có. Nhờ học từ rất nhiều văn bản, nó trả lời câu hỏi, tóm tắt, dịch, viết code… “Lớn” ở đây là số tham số (hàng tỷ) và lượng dữ liệu huấn luyện.

Ví dụ: Bạn gõ “Viết email xin nghỉ phép” — LLM viết ra từng câu dựa trên những gì nó đã học.

Liên quan:

Tham số giống các “núm vặn” quyết định model phản ứng thế nào với dữ liệu vào. Model 7B có khoảng 7 tỷ tham số. Càng nhiều tham số thì model càng cần nhiều bộ nhớ để chạy.

Ví dụ: Model 7 tỷ tham số lưu ở dạng 16-bit cần khoảng 14 GB chỉ để chứa trọng số (7 tỷ × 2 byte).

Liên quan:

Model không đọc từng chữ cái mà cắt văn bản thành token theo bộ từ vựng riêng. Cùng một câu, mỗi model có thể cắt ra số token khác nhau. Giới hạn độ dài và chi phí API thường tính theo token.

Ví dụ: Câu “Xin chào VNSO” có thể bị cắt thành vài token như “Xin”, “ chào”, “ VN”, “SO”.

Liên quan:

Mọi thứ bạn gửi và mọi thứ model viết ra phải nằm gọn trong cửa sổ ngữ cảnh. Vượt quá thì phần đầu bị cắt hoặc model báo lỗi. Ngữ cảnh dài hơn cũng cần nhiều bộ nhớ hơn (KV cache).

Ví dụ: Giống bàn làm việc: bàn rộng thì trải được nhiều tài liệu cùng lúc, bàn hẹp thì phải cất bớt.

Liên quan:

Prompt gồm yêu cầu, bối cảnh, ví dụ mẫu và định dạng mong muốn. Prompt rõ ràng giúp kết quả ổn định hơn. System prompt là phần hướng dẫn chung đặt sẵn cho mọi cuộc hội thoại.

Ví dụ: “Tóm tắt văn bản sau thành 3 gạch đầu dòng, giọng trang trọng” tốt hơn “tóm tắt giúp tôi”.

Liên quan:

LLM tạo văn bản “nghe hợp lý” chứ không tự kiểm chứng sự thật. Cách giảm: cho model tài liệu đúng để dựa vào (RAG), yêu cầu trích nguồn, và luôn có người kiểm tra với nội dung quan trọng.

Ví dụ: Hỏi về một điều luật, model đưa ra số điều khoản không tồn tại — cần đối chiếu văn bản gốc.

Liên quan:

Thay vì chỉ trả lời, agent có thể quyết định bước tiếp theo: tra dữ liệu, gọi phần mềm khác, rồi tổng hợp kết quả. Vì agent “làm” được việc thật, cần giới hạn quyền và có người duyệt ở bước quan trọng.

Ví dụ: Agent đọc email đặt hàng, tra tồn kho, rồi soạn sẵn phiếu xuất để nhân viên bấm duyệt.

Liên quan:

Model MoE có tổng số tham số lớn nhưng mỗi lần tính chỉ kích hoạt một phần, nên phần tính toán nhẹ hơn so với tổng kích thước. Tuy vậy vẫn phải nạp toàn bộ trọng số vào bộ nhớ.

Ví dụ: Qwen3-30B-A3B có 30,5 tỷ tham số tổng nhưng mỗi token chỉ kích hoạt 3,3 tỷ (theo model card).

Liên quan:

Model embedding đổi văn bản thành véc-tơ sao cho các đoạn có nghĩa gần nhau thì véc-tơ cũng gần nhau. Nhờ vậy máy tìm được “đoạn liên quan” dù không trùng từ khoá.

Ví dụ: “Cách đổi mật khẩu” và “quên pass thì làm sao” cho ra hai véc-tơ nằm gần nhau.

Liên quan:

Khi có hàng triệu đoạn tài liệu, cơ sở dữ liệu véc-tơ giúp tìm đoạn liên quan trong tích tắc. Có thể là phần mềm chuyên dụng (Qdrant, Milvus) hoặc tiện ích mở rộng của PostgreSQL (pgvector).

Ví dụ: Thư viện sắp sách theo chủ đề: tìm một cuốn là thấy ngay các cuốn cùng chủ đề đứng cạnh.

Liên quan:

RAG giúp model trả lời theo tài liệu của bạn mà không cần huấn luyện lại: tài liệu được cắt nhỏ, tạo embedding, lưu vào cơ sở dữ liệu véc-tơ. Khi có câu hỏi, hệ thống lấy các đoạn liên quan, ghép vào prompt cho LLM.

Ví dụ: Nhân viên hỏi “chính sách nghỉ phép năm nay?” — chatbot tìm đúng mục trong sổ tay nhân sự rồi trả lời kèm trích dẫn.

Liên quan:

Thay vì huấn luyện từ đầu (rất tốn kém), ta lấy model đã biết ngôn ngữ và dạy thêm phong cách, định dạng hay nghiệp vụ riêng. Muốn model biết thông tin hay thay đổi thì RAG thường phù hợp hơn; muốn đổi cách model trả lời thì fine-tune.

Ví dụ: Dạy model trả lời theo đúng mẫu phiếu tư vấn của công ty thay vì văn phong chung chung.

Liên quan:

LoRA đóng băng trọng số gốc và thêm vài lớp “chỉnh sửa” rất nhỏ. Kết quả là file adapter nhẹ, cần ít VRAM hơn fine-tune toàn bộ, và có thể thay adapter cho nhiều việc khác nhau trên cùng một model gốc.

Ví dụ: Giống dán thêm ghi chú lên sách giáo khoa thay vì in lại cả cuốn.

Liên quan:

Model gốc được nạp ở dạng lượng tử hoá 4-bit (kiểu NF4), còn phần LoRA vẫn huấn luyện ở độ chính xác cao hơn. Thư viện bitsandbytes và PEFT hỗ trợ cách làm này.

Ví dụ: Fine-tune một model cỡ vài tỷ tham số trên một GPU mà bản đầy đủ không vừa bộ nhớ.

Liên quan:

Huấn luyện thường chạy nhiều epoch. Quá ít thì model chưa học đủ; quá nhiều dễ học vẹt (overfitting). Theo dõi kết quả trên tập kiểm tra sau mỗi epoch để quyết định dừng.

Ví dụ: Ôn một cuốn đề cương từ đầu đến cuối là một epoch.

Liên quan:

Batch lớn tận dụng GPU tốt hơn nhưng tốn nhiều VRAM. Khi thiếu bộ nhớ, có thể dùng batch nhỏ kết hợp gradient accumulation (cộng dồn nhiều bước rồi mới cập nhật) để mô phỏng batch lớn. Khi chạy model phục vụ người dùng, batch là số yêu cầu được gộp xử lý chung.

Ví dụ: Chấm 32 bài kiểm tra rồi mới tổng kết một lần, thay vì chấm xong từng bài lại tổng kết.

Liên quan:

Learning rate quá lớn khiến loss dao động hoặc tăng vọt; quá nhỏ thì học rất chậm. Thường dùng lịch giảm dần learning rate trong quá trình huấn luyện.

Ví dụ: Chỉnh vòi nước: vặn mạnh quá thì tràn, vặn nhẹ quá thì chờ mãi mới đầy.

Liên quan:

Dấu hiệu: loss trên tập huấn luyện tiếp tục giảm nhưng loss trên tập kiểm tra lại tăng. Cách xử lý: thêm dữ liệu đa dạng, giảm số epoch, dùng dropout hoặc dừng sớm.

Ví dụ: Học sinh thuộc đáp án đề mẫu nhưng đổi số liệu là không làm được.

Liên quan:

Checkpoint cho phép học tiếp khi bị gián đoạn, hoặc quay lại phiên bản tốt hơn. Nên giữ vài checkpoint gần nhất và sao lưu bản quan trọng ra ngoài máy đang huấn luyện.

Ví dụ: Giống “save game”: mất điện vẫn chơi tiếp được từ màn đã lưu.

Liên quan:

Sau mỗi bước, các GPU trao đổi gradient để giữ các bản sao giống nhau. Cách này tăng tốc khi model vừa một GPU. Các kỹ thuật như DeepSpeed ZeRO hay FSDP chia nhỏ thêm trạng thái để tiết kiệm bộ nhớ.

Ví dụ: 4 người cùng chấm bài theo cùng đáp án, mỗi người một chồng bài.

Liên quan:

Dùng khi một lớp của model quá lớn so với một GPU. Các GPU phải trao đổi dữ liệu liên tục, nên kết nối tốc độ cao giữa các GPU (như NVLink) giúp ích nhiều. vLLM hỗ trợ tensor parallel khi chạy model.

Ví dụ: Một bức tranh khổ lớn chia thành nhiều mảnh cho nhiều hoạ sĩ vẽ đồng thời.

Liên quan:

DeepSpeed ZeRO có ba mức: stage 1 chia trạng thái optimizer, stage 2 chia thêm gradient, stage 3 chia cả tham số model. FSDP là cách tương tự có sẵn trong PyTorch.

Ví dụ: Thay vì mỗi người giữ trọn bộ hồ sơ, cả nhóm chia nhau giữ từng phần và gom lại khi cần.

Liên quan:

Huấn luyện là “học”, inference là “làm bài”. Inference cần ít bộ nhớ hơn huấn luyện, nhưng khi nhiều người dùng cùng lúc thì cần công cụ phục vụ hiệu quả như vLLM.

Ví dụ: Mỗi lần bạn gửi câu hỏi cho chatbot là một lần inference.

Liên quan:

Trọng số gốc thường ở 16-bit. Lượng tử hoá xuống 8-bit hoặc 4-bit giúp model vừa GPU nhỏ hơn, đổi lại có thể giảm phần nào chất lượng — cần thử trên dữ liệu thật của bạn.

Ví dụ: Nén ảnh RAW thành JPEG: nhẹ hơn nhiều, nhìn gần giống, nhưng có mất chi tiết.

Liên quan:

FP16 và BF16 đều dùng 16 bit mỗi số: BF16 giữ được dải giá trị rộng như 32-bit nên thường ổn định hơn khi huấn luyện, FP16 chính xác hơn ở số nhỏ nhưng dễ tràn số. FP8 dùng 8 bit, cần GPU và phần mềm hỗ trợ.

Ví dụ: Ghi số tiền làm tròn đến nghìn đồng thay vì đến từng đồng: gọn hơn, đủ dùng cho nhiều việc.

Liên quan:

Khi model viết từng token, nó lưu lại thông tin của các token đã xử lý. KV cache lớn dần theo độ dài ngữ cảnh và số người dùng đồng thời — đây là lý do VRAM cần nhiều hơn phần trọng số model.

Ví dụ: Ghi chú lại các ý đã nói trong cuộc họp để khỏi phải nghe lại từ đầu.

Liên quan:

vLLM quản lý bộ nhớ KV cache và gộp các yêu cầu để phục vụ nhiều người dùng. Ứng dụng đang gọi API OpenAI có thể trỏ sang máy chủ vLLM với ít thay đổi.

Ví dụ: Công ty chạy model mở trên máy chủ GPU riêng và cho các phần mềm nội bộ gọi qua một API chung.

Liên quan:

GGUF gói trọng số và thông tin cần thiết vào một file, tiện chạy trên CPU hoặc GPU nhỏ với llama.cpp và các công cụ dựa trên nó.

Ví dụ: Tải một file .gguf 4-bit của model để chạy thử trên máy không có GPU lớn.

Liên quan:

Thiếu VRAM là nguyên nhân phổ biến gây lỗi “CUDA out of memory”. Nhu cầu VRAM phụ thuộc số tham số, định dạng số (FP16, 4-bit…), độ dài ngữ cảnh, batch và việc đang huấn luyện hay chỉ suy luận.

Ví dụ: Dùng máy tính VRAM trên site để ước lượng trước khi chọn GPU.

Liên quan:

PyTorch và hầu hết thư viện AI dùng CUDA để chạy trên GPU NVIDIA. Mỗi phiên bản CUDA đòi hỏi driver tối thiểu — ví dụ theo ghi chú phát hành của NVIDIA, CUDA 13.x cần driver từ 580.

Ví dụ: Giống “ngôn ngữ chung” để phần mềm ra lệnh cho GPU.

Liên quan:

cuDNN cung cấp sẵn các phép tính hay dùng trong deep learning như tích chập, attention. Nhiều framework dùng cuDNN bên dưới; bản PyTorch cài từ pip hoặc image container thường đã kèm theo thư viện cần thiết.

Ví dụ: Bộ dao chuyên dụng cho đầu bếp: cùng việc cắt nhưng nhanh và gọn hơn dao thường.

Liên quan:

Khi huấn luyện nhiều GPU, NCCL lo việc gom và chia gradient, tham số giữa các GPU. Lỗi NCCL thường liên quan mạng, cấu hình card mạng hoặc bộ nhớ chia sẻ; bật NCCL_DEBUG=INFO để xem log chi tiết.

Ví dụ: Tổng đài nội bộ giúp các GPU “gọi điện” cho nhau đồng bộ công việc.

Liên quan:

Nguồn

Mọi lệnh, phiên bản và giấy phép trên trang được đối chiếu trực tiếp với các trang dưới đây. Tra cứu ngày 15/09/2026.

  1. PEFT — Quicktour (LoraConfig, get_peft_model) (mở tab mới)Hugging Face · tra cứu
  2. PEFT — Quantization (QLoRA, prepare_model_for_kbit_training) (mở tab mới)Hugging Face · tra cứu
  3. Transformers — bitsandbytes (mở tab mới)Hugging Face · tra cứu
  4. DeepSpeed — ZeRO tutorial (mở tab mới)DeepSpeed · tra cứu
  5. Getting Started with Fully Sharded Data Parallel (FSDP2) (mở tab mới)PyTorch Foundation · tra cứu
  6. CUDA Toolkit Release Notes — bảng driver tối thiểu (mở tab mới)NVIDIA · tra cứu
  7. cuDNN — Installing on Linux (mở tab mới)NVIDIA · tra cứu
  8. NCCL Troubleshooting — Logging (mở tab mới)NVIDIA · tra cứu
  9. vLLM — Quickstart (vllm serve, --api-key) (mở tab mới)vLLM · tra cứu
  10. llama.cpp — README (mở tab mới)ggml-org · tra cứu
  11. Qwen3-30B-A3B — model card (số tham số tổng và kích hoạt) (mở tab mới)Qwen · tra cứu

Đọc thuật ngữ xong vẫn chưa chắc nên chọn gì?

Thử trình gợi ý giải pháp AI theo mục đích, hoặc liên hệ VNSO để trao đổi trực tiếp.

Liên hệ tư vấn

Mở trình chọn giải pháp AI