Trung tâm AI · Danh mục
Model AI mã nguồn mở dùng được với tiếng Việt
Chỉ gồm model mà model card, README hoặc blog chính thức của tổ chức phát hành xác nhận có hỗ trợ tiếng Việt. Danh mục không xếp hạng — hãy thử trên dữ liệu thật của bạn trước khi chọn.
Giấy phép quan trọng với doanh nghiệp. Cột “thương mại” chỉ là tóm tắt để định hướng từ giấy phép khai báo trên model card, tra cứu 15/09/2026 — không phải tư vấn pháp lý. Giấy phép có thể thay đổi theo phiên bản; đọc văn bản gốc và hỏi bộ phận pháp chế trước khi đưa vào sản phẩm.
Danh mục model
Nút “Tính VRAM” mở máy tính VRAM để ước lượng bộ nhớ GPU cần cho model.
Đang hiện 22/22 model
- Mô hình ngôn ngữ (LLM)Cho phép dùng thương mại
Qwen2.5-7B-Instruct
- Phát hành
- Qwen (Alibaba Cloud)
- Kích thước
- 7,6 tỷ tham số
- Giấy phép
- Apache-2.0 (mở tab mới)
- Tiếng Việt
- Model card liệt kê tiếng Việt trong hơn 29 ngôn ngữ hỗ trợ.
Không phải mọi kích thước Qwen2.5 cùng giấy phép: bản 3B dùng giấy phép qwen-research, bản 72B dùng giấy phép qwen riêng (theo model card).
- Mô hình ngôn ngữ (LLM)Cho phép dùng thương mại
Qwen3-8B
- Phát hành
- Qwen (Alibaba Cloud)
- Kích thước
- 8,2 tỷ tham số
- Giấy phép
- Apache-2.0 (mở tab mới)
- Tiếng Việt
- Blog ra mắt Qwen3 liệt kê tiếng Việt (nhóm Austroasiatic) trong 119 ngôn ngữ và phương ngữ.
- Mô hình ngôn ngữ (LLM)Cho phép dùng thương mại
Qwen3-30B-A3B
- Phát hành
- Qwen (Alibaba Cloud)
- Kích thước
- 30,5 tỷ tham số tổng, 3,3 tỷ kích hoạt (MoE)
- Giấy phép
- Apache-2.0 (mở tab mới)
- Tiếng Việt
- Blog ra mắt Qwen3 liệt kê tiếng Việt trong 119 ngôn ngữ và phương ngữ.
Kiến trúc MoE: mỗi token chỉ dùng một phần tham số, nhưng vẫn phải nạp toàn bộ trọng số vào bộ nhớ.
- Mô hình ngôn ngữ (LLM)Thương mại có điều kiện
SeaLLMs-v3-7B-Chat
- Phát hành
- DAMO Academy (Alibaba)
- Kích thước
- 7,6 tỷ tham số
- Giấy phép
- SeaLLMs License (mở tab mới)
- Tiếng Việt
- Model card: xây dựng cho các ngôn ngữ Đông Nam Á, trong đó có tiếng Việt.
Giấy phép SeaLLMs: sản phẩm thương mại có trên 100 triệu người dùng hoạt động hằng tháng phải xin phép; không được dùng model hoặc đầu ra để cải thiện LLM khác; luật áp dụng là luật Trung Quốc.
- Mô hình ngôn ngữ (LLM)Cần đọc kỹ giấy phépTruy cập giới hạn
Vistral-7B-Chat
- Phát hành
- Viet-Mistral
- Kích thước
- 7,3 tỷ tham số
- Giấy phép
- AFL-3.0 (khai báo trên model card)
- Tiếng Việt
- Model card: mô hình hội thoại cho tiếng Việt, mở rộng từ Mistral 7B.
Truy cập giới hạn: phải đồng ý điều kiện trên Hugging Face trước khi tải. Đọc kỹ điều kiện truy cập cùng giấy phép.
- Mô hình ngôn ngữ (LLM)Cho phép dùng thương mại
PhoGPT-4B-Chat
- Phát hành
- VinAI Research
- Kích thước
- 3,7 tỷ tham số (bản gốc PhoGPT-4B)
- Giấy phép
- BSD-3-Clause
- Tiếng Việt
- Model card: huấn luyện từ đầu trên kho văn bản tiếng Việt 102 tỷ token.
- Mô hình ngôn ngữ (LLM)Cho phép dùng thương mại
Mistral-Small-3.1-24B-Instruct-2503
- Phát hành
- Mistral AI
- Kích thước
- 24 tỷ tham số
- Giấy phép
- Apache-2.0
- Tiếng Việt
- Model card liệt kê tiếng Việt trong danh sách ngôn ngữ hỗ trợ.
Nhận cả ảnh và văn bản đầu vào.
- Mô hình ngôn ngữ (LLM)Phi thương mạiTruy cập giới hạn
Aya Expanse 8B
- Phát hành
- Cohere Labs
- Kích thước
- 8 tỷ tham số
- Giấy phép
- CC-BY-NC-4.0
- Tiếng Việt
- Model card liệt kê tiếng Việt trong 23 ngôn ngữ.
Giấy phép phi thương mại; truy cập giới hạn trên Hugging Face.
- Embedding (tìm kiếm ngữ nghĩa)Cho phép dùng thương mại
multilingual-e5-large
- Phát hành
- intfloat (nhóm tác giả Multilingual E5)
- Kích thước
- 560 triệu tham số
- Giấy phép
- MIT
- Tiếng Việt
- Model card khai báo tiếng Việt (vi) trong danh sách ngôn ngữ.
- Embedding (tìm kiếm ngữ nghĩa)Cho phép dùng thương mại
multilingual-e5-large-instruct
- Phát hành
- intfloat (nhóm tác giả Multilingual E5)
- Kích thước
- 560 triệu tham số
- Giấy phép
- MIT
- Tiếng Việt
- Model card khai báo tiếng Việt (vi) trong danh sách ngôn ngữ.
- Embedding (tìm kiếm ngữ nghĩa)Cho phép dùng thương mại
snowflake-arctic-embed-l-v2.0
- Phát hành
- Snowflake
- Kích thước
- 568 triệu tham số
- Giấy phép
- Apache-2.0
- Tiếng Việt
- Model card khai báo tiếng Việt (vi) trong danh sách ngôn ngữ.
- Embedding (tìm kiếm ngữ nghĩa)Cho phép dùng thương mại
Halong Embedding
- Phát hành
- contextboxai
- Kích thước
- 278 triệu tham số
- Giấy phép
- Apache-2.0
- Tiếng Việt
- Model card: embedding tiếng Việt cho RAG, tinh chỉnh từ multilingual-e5-base (MIT).
- Giọng nói → văn bảnCho phép dùng thương mại
Whisper large-v3
- Phát hành
- OpenAI
- Kích thước
- 1,55 tỷ tham số
- Giấy phép
- Apache-2.0 (model card)
- Tiếng Việt
- Model card khai báo tiếng Việt (vi) trong danh sách ngôn ngữ.
Kho mã GitHub của Whisper ghi mã nguồn và trọng số theo giấy phép MIT.
- Giọng nói → văn bảnCho phép dùng thương mại
Whisper large-v3-turbo
- Phát hành
- OpenAI
- Kích thước
- 809 triệu tham số
- Giấy phép
- MIT
- Tiếng Việt
- Model card khai báo tiếng Việt (vi) trong danh sách ngôn ngữ.
- Giọng nói → văn bảnCho phép dùng thương mại
PhoWhisper (tiny → large)
- Phát hành
- VinAI Research
- Kích thước
- 5 bản: 39 triệu đến 1,55 tỷ tham số
- Giấy phép
- BSD-3-Clause
- Tiếng Việt
- README: tinh chỉnh Whisper trên 844 giờ tiếng Việt nhiều vùng miền.
- Giọng nói → văn bảnPhi thương mại
wav2vec2-base-vietnamese-250h
- Phát hành
- nguyenvulebinh
- Kích thước
- Model card không ghi rõ
- Giấy phép
- CC-BY-NC-4.0
- Tiếng Việt
- Model card: nhận dạng tiếng nói tiếng Việt, tinh chỉnh trên 250 giờ dữ liệu VLSP có nhãn.
- Văn bản → giọng nóiCho phép dùng thương mại
VieNeu-TTS
- Phát hành
- pnnbao-ump
- Kích thước
- 553 triệu tham số
- Giấy phép
- Apache-2.0
- Tiếng Việt
- Model card: chuyển văn bản tiếng Việt thành giọng nói.
Có tính năng nhân bản giọng nói: chỉ dùng giọng của người đã đồng ý. Model gốc neuphonic/neutts-air cũng khai báo Apache-2.0.
- Văn bản → giọng nóiPhi thương mại
F5-TTS-Vietnamese-ViVoice
- Phát hành
- hynt
- Kích thước
- Model card không ghi rõ
- Giấy phép
- CC-BY-NC-SA-4.0
- Tiếng Việt
- Model card: tinh chỉnh F5-TTS trên 1.000 giờ giọng nói tiếng Việt.
Model card ghi rõ: chỉ dùng cho nghiên cứu phi thương mại.
- Văn bản → giọng nóiPhi thương mại
MMS-TTS tiếng Việt (mms-tts-vie)
- Phát hành
- Meta (facebook)
- Kích thước
- 36 triệu tham số
- Giấy phép
- CC-BY-NC-4.0
- Tiếng Việt
- Model card: bản TTS tiếng Việt thuộc dự án Massively Multilingual Speech.
- Đọc chữ trong ảnh / tài liệuCho phép dùng thương mại
Vintern-1B-v3.5
- Phát hành
- 5CD-AI
- Kích thước
- 938 triệu tham số
- Giấy phép
- MIT
- Tiếng Việt
- Model card: mô hình thị giác–ngôn ngữ tinh chỉnh bằng nhiều dữ liệu tiếng Việt, hướng tới hiểu văn bản và tài liệu tiếng Việt.
Tinh chỉnh từ OpenGVLab/InternVL2_5-1B (model card khai báo MIT).
- Đọc chữ trong ảnh / tài liệuCho phép dùng thương mại
VietOCR (thư viện)
- Phát hành
- pbcquoc
- Kích thước
- Model card không ghi rõ
- Giấy phép
- Apache-2.0
- Tiếng Việt
- README: thư viện nhận dạng chữ tiếng Việt.
- Đọc chữ trong ảnh / tài liệuCho phép dùng thương mại
Tesseract OCR + dữ liệu vie
- Phát hành
- tesseract-ocr
- Kích thước
- Model card không ghi rõ
- Giấy phép
- Apache-2.0
- Tiếng Việt
- Kho tessdata_best chính thức có file vie.traineddata (tiếng Việt).
Gợi ý cách chọn
1. Lọc theo giấy phép trước
Dùng cho sản phẩm thương mại thì loại ngay model phi thương mại. Giấy phép riêng (không phải MIT, Apache, BSD) cần đọc kỹ điều kiện.
2. Thử trên dữ liệu của bạn
Chuẩn bị vài chục câu hỏi, đoạn ghi âm hoặc ảnh tài liệu thật, chấm kết quả của từng model theo cùng một tiêu chí.
3. Ước lượng hạ tầng
Dùng máy tính VRAM và chọn GPU cho model, rồi xem cách triển khai.
Đã tìm hiểu nhưng chưa đưa vào
Các model dưới đây đã được tìm hiểu nhưng chưa đưa vào danh mục vì nguồn chính thức chưa xác nhận hỗ trợ tiếng Việt hoặc thiếu thông tin giấy phép. Không có nghĩa là model kém — chỉ là chưa đủ căn cứ theo tiêu chí của trang.
Llama 3.1 / 3.2 / 3.3 (Meta) (mở tab mới)
Model card chỉ liệt kê 8 ngôn ngữ hỗ trợ chính thức (Anh, Đức, Pháp, Ý, Bồ Đào Nha, Hindi, Tây Ban Nha, Thái) — không có tiếng Việt, và khuyến cáo không dùng cho ngôn ngữ ngoài danh sách khi chưa tinh chỉnh.
Gemma 3 (Google) (mở tab mới)
Model card nói hỗ trợ hơn 140 ngôn ngữ nhưng không nêu đích danh tiếng Việt; giấy phép là Gemma Terms of Use riêng.
BGE-M3 (BAAI) (mở tab mới)
Model card nói hỗ trợ hơn 100 ngôn ngữ nhưng không nêu đích danh tiếng Việt.
Qwen3-Embedding (mở tab mới)
Model card nói hỗ trợ hơn 100 ngôn ngữ nhưng không nêu đích danh tiếng Việt.
gpt-oss-20b (OpenAI) (mở tab mới)
Model card không nêu danh sách ngôn ngữ hay tiếng Việt.
Qwen2.5-VL-7B-Instruct (mở tab mới)
Model card không nêu đích danh tiếng Việt cho khả năng đọc chữ trong ảnh.
vietnamese-sbert (keepitreal) (mở tab mới)
Model card không khai báo giấy phép — không đủ căn cứ để doanh nghiệp sử dụng.
Nguồn
Mọi lệnh, phiên bản và giấy phép trên trang được đối chiếu trực tiếp với các trang dưới đây. Tra cứu ngày 15/09/2026.
- Model card / README — Qwen2.5-7B-Instruct (mở tab mới)Qwen (Alibaba Cloud) · tra cứu
- Model card / README — Qwen3-8B (mở tab mới)Qwen (Alibaba Cloud) · tra cứu
- Model card / README — Qwen3-30B-A3B (mở tab mới)Qwen (Alibaba Cloud) · tra cứu
- Model card / README — SeaLLMs-v3-7B-Chat (mở tab mới)DAMO Academy (Alibaba) · tra cứu
- Model card / README — Vistral-7B-Chat (mở tab mới)Viet-Mistral · tra cứu
- Model card / README — PhoGPT-4B-Chat (mở tab mới)VinAI Research · tra cứu
- Model card / README — Mistral-Small-3.1-24B-Instruct-2503 (mở tab mới)Mistral AI · tra cứu
- Model card / README — Aya Expanse 8B (mở tab mới)Cohere Labs · tra cứu
- Model card / README — multilingual-e5-large (mở tab mới)intfloat (nhóm tác giả Multilingual E5) · tra cứu
- Model card / README — multilingual-e5-large-instruct (mở tab mới)intfloat (nhóm tác giả Multilingual E5) · tra cứu
- Model card / README — snowflake-arctic-embed-l-v2.0 (mở tab mới)Snowflake · tra cứu
- Model card / README — Halong Embedding (mở tab mới)contextboxai · tra cứu
- Model card / README — Whisper large-v3 (mở tab mới)OpenAI · tra cứu
- Model card / README — Whisper large-v3-turbo (mở tab mới)OpenAI · tra cứu
- Model card / README — PhoWhisper (tiny → large) (mở tab mới)VinAI Research · tra cứu
- Model card / README — wav2vec2-base-vietnamese-250h (mở tab mới)nguyenvulebinh · tra cứu
- Model card / README — VieNeu-TTS (mở tab mới)pnnbao-ump · tra cứu
- Model card / README — F5-TTS-Vietnamese-ViVoice (mở tab mới)hynt · tra cứu
- Model card / README — MMS-TTS tiếng Việt (mms-tts-vie) (mở tab mới)Meta (facebook) · tra cứu
- Model card / README — Vintern-1B-v3.5 (mở tab mới)5CD-AI · tra cứu
- Model card / README — VietOCR (thư viện) (mở tab mới)pbcquoc · tra cứu
- Model card / README — Tesseract OCR + dữ liệu vie (mở tab mới)tesseract-ocr · tra cứu
- Qwen3: Think Deeper, Act Faster — danh sách 119 ngôn ngữ (mở tab mới)Qwen · tra cứu
- SeaLLMs License Agreement (mở tab mới)DAMO Academy · tra cứu
- Whisper — README (giấy phép MIT cho mã và trọng số) (mở tab mới)OpenAI · tra cứu
- PhoWhisper — README (5 phiên bản, số tham số) (mở tab mới)VinAI Research · tra cứu
- tessdata_best — dữ liệu huấn luyện Tesseract (vie.traineddata) (mở tab mới)tesseract-ocr · tra cứu
- Model card — Llama 3.1 / 3.2 / 3.3 (Meta) (mở tab mới)Hugging Face · tra cứu
- Model card — Gemma 3 (Google) (mở tab mới)Hugging Face · tra cứu
- Model card — BGE-M3 (BAAI) (mở tab mới)Hugging Face · tra cứu
- Model card — Qwen3-Embedding (mở tab mới)Hugging Face · tra cứu
- Model card — gpt-oss-20b (OpenAI) (mở tab mới)Hugging Face · tra cứu
- Model card — Qwen2.5-VL-7B-Instruct (mở tab mới)Hugging Face · tra cứu
- Model card — vietnamese-sbert (keepitreal) (mở tab mới)Hugging Face · tra cứu
Cần chạy model tiếng Việt trên hạ tầng riêng?
Gửi cho VNSO model bạn định dùng, số người dùng và yêu cầu lưu trữ dữ liệu để trao đổi cấu hình máy chủ GPU.