Chuyển văn bản thành giọng nói tiếng Việt chạy trên CPU với VieNeu-TTS
VieNeu-TTS v3 Turbo là bộ giọng đọc tiếng Việt mã mở, cài bằng một lệnh pip và chạy được trên CPU. Deman AI Lab đã cài và đo thử trên máy thật.

Chuyển văn bản thành giọng nói tiếng Việt ngay trên máy tính của bạn, không cần thuê dịch vụ đám mây: đó là điều VieNeu-TTS v3 Turbo làm được, theo README trên GitHub (xem ngày 07/10/2026). Mình đã cài và chạy thử, kết quả có ở dưới.
Tóm tắt nhanh
- VieNeu-TTS là bộ TTS mã mở cho tiếng Việt, giấy phép Apache 2.0, dùng được cho cả mục đích thương mại theo README.
- Bản v3 Turbo có âm thanh 48 kHz, 25 giọng đọc tiếng Việt có sẵn, hỗ trợ cảm xúc và phát trực tiếp (streaming).
- Cài bằng một lệnh pip hoặc bộ cài Windows, chạy được trên CPU.
- Việc nhân bản cần đoạn mẫu 3-8 giây. Phần này mình chưa kiểm chứng.
- Bản v4 tốt hơn nhưng đóng mã, chỉ dùng qua API trên vieneu.io.
Cách dùng rất dễ dàng: nhập văn bản vào lệnh infer, chọn giọng, rồi lưu thành file âm thanh WAV. Đây là kiểu chuyển đổi văn bản thành âm thanh mà bạn có thể gắn vào quy trình làm video, làm sách nói hay lồng tiếng nội bộ. Điều mình chưa rõ là chất lượng giọng nói tự nhiên ở các câu dài, và mình sẽ nói rõ ở phần dưới.

VieNeu-TTS là gì và dùng cho việc gì
Đây là một công cụ text to speech tiếng Việt do tác giả pnnbao97 phát triển. Mô tả trên trang GitHub nhấn vào ba điều: nhân bản giọng tức thì, suy luận thời gian thực trên CPU và chất lượng âm thanh 48 kHz.
Với người làm nội dung, giá trị nằm ở chỗ bạn có thêm một nguồn giọng đọc tiếng Việt chạy cục bộ. Không phải gửi kịch bản lên dịch vụ nào, không tính phí theo ký tự, không bị giới hạn số lần tạo. Sử dụng cho lồng tiếng video ngắn, đọc tin, làm sách nói nội bộ, hay tạo bản đọc thử cho kịch bản quảng cáo đều là việc hợp lý để thử.
Nếu bạn từng làm video đọc tiếng Việt từ văn bản, bài MoneyPrinterTurbo chạy thử cho video tiếng Việt cho thấy khâu giọng đọc quan trọng thế nào với cả quy trình.
Chạy thử thực tế: chuyển văn bản thành giọng nói tiếng Việt
Mình tạo môi trường ảo Python rồi chạy pip install vieneu. Toàn bộ quá trình cài mất 1 phút 28 giây và kéo về phiên bản vieneu 3.8.3, cùng nhiều thư viện đi kèm như gradio, librosa, onnxruntime.

Sau đó mình chạy đúng ví dụ nhanh trong README: gọi Vieneu(), đọc câu chào bằng giọng "Hải Đăng", lưu ra file WAV. Lần chạy đầu phải tải mô hình từ Hugging Face nên mất 40,2 giây. Các lần sau không cần tải lại.
from vieneu import Vieneuvieneu = Vieneu()audio = vieneu.infer("Xin chào!", voice="Hải Đăng")vieneu.save(audio, "output.wav")Vì chỉ có một ngôn ngữ cần xử lý là tiếng Việt, ta không phải chọn ngôn ngữ nào cả. Mình đổi câu thành một câu dài hơn để đo tốc độ. Kết quả: đoạn âm thanh dài 3,4 giây được sinh ra trong 1,4 giây, tức hệ số thời gian thực (RTF) khoảng 0,41 trên máy của Deman, không cấu hình gì thêm. File xuất ra có tần số 48000 Hz đúng như mô tả.

Lưu ý: mình chưa ngồi nghe kỹ để đánh giá độ tự nhiên của giọng đọc, nên bài này không kết luận về chất lượng nghe. Bạn nên tự nghe thử trước khi dùng cho video thật.
Tốc độ, phần cứng và nhân bản giọng nói
README nêu số liệu: trên GPU chạy theo lô, RTF khoảng 0,02 (nhanh gấp chừng 50 lần thời gian thực). Trên CPU độ chính xác fp32, RTF khoảng 0,55 đến 0,62. Thời gian đến mẫu âm thanh đầu tiên khi streaming khoảng 115 ms trên GPU và 260-400 ms trên CPU. Đây là số của tác giả, mình chỉ tự đo được con số 0,41 ở trên.
Nhân bản giọng là điểm hấp dẫn thứ hai: README cho biết chỉ cần đoạn mẫu 3-8 giây, có tuỳ chọn khử nhiễu tự động. Mình chưa thử phần này, nên chưa kiểm chứng kết quả. Khi thử, hãy chỉ dùng giọng của chính bạn hoặc người đã đồng ý, vì giọng là dữ liệu cá nhân.
Với TTS chạy trên CPU, bạn có thể xử lý hàng loạt kịch bản ngay trên laptop mà không cần card đồ hoạ. Đó là lợi thế rõ cho shop nhỏ và đội làm nội dung ít kỹ thuật.
Hạn chế cần nói thẳng
Điểm đáng chú ý là phiên bản. Theo README, v4 có khả năng nhân bản giọng tốt hơn nhưng không mở mã, chỉ dùng qua API chính thức trên vieneu.io. Bản miễn phí bạn tải về là v3 Turbo. Nếu cần khả năng nhân bản cao hơn của dự án, bạn sẽ phải dùng dịch vụ bên ngoài.
Thứ hai, lần đầu chạy phải tải mô hình và mất khoảng 40 giây trên máy mình, kèm cảnh báo về việc Windows không hỗ trợ liên kết tượng trưng (symlink) cho bộ nhớ đệm. Cảnh báo này không làm hỏng kết quả nhưng sẽ tốn thêm dung lượng đĩa.
Thứ ba, đây là dự án do một tác giả chính duy trì, nên hãy kiểm tra giấy phép và điều khoản trên văn bản gốc trước khi dùng thương mại. Bài này không phải tư vấn pháp lý.
Câu hỏi thường gặp khi chuyển văn bản sang giọng nói
Giọng nói AI này khác gì dịch vụ trực tuyến? Dịch vụ trực tuyến thường tính theo ký tự và giữ kịch bản của bạn trên máy chủ của họ. VieNeu-TTS chạy trên máy bạn, nên việc chuyển đổi nằm trong tầm kiểm soát của bạn, còn phần giọng nói tự nhiên thì cần nghe thử mới biết.
Có làm sách nói được không? Về nguyên tắc là có thể: chia văn bản thành từng đoạn, chuyển đổi từng đoạn thành âm thanh rồi ghép lại. Mình chưa thử với sách dài, nên chưa dám nói kết quả khi chạy nhiều giờ liền.
Có dễ dàng cho người mới không? Cần biết dùng dòng lệnh và Python ở mức cơ bản. Người không quen kỹ thuật có thể thử bộ cài Windows mà README nhắc tới, nhưng mình chưa chạy bộ cài này nên chưa kiểm chứng. Khi có kết quả thử, bạn cũng nên so sánh nhiều giọng khác nhau, vì cách đọc dấu câu và số có thể khác nhau giữa các giọng.
Ý nghĩa với người làm nội dung và bán hàng
Nếu bạn đang trả tiền cho giọng đọc AI theo ký tự, VieNeu-TTS đáng để thử như một phương án giọng đọc AI miễn phí chạy cục bộ. Bạn có thể nhập văn bản dài, chuyển đổi hàng loạt và tạo âm thanh cho nhiều ngôn ngữ khác nhau nếu mô hình hỗ trợ (mình mới thử tiếng Việt). Hãy dùng nó cho các bản nháp, video nội bộ hoặc loạt video số lượng lớn, rồi so sánh với dịch vụ trả phí ở khâu cuối.
Quy trình gợi ý cho đội làm video: viết kịch bản, chạy VieNeu-TTS tạo giọng đọc, ghép với hình bằng công cụ dựng quen thuộc, rồi nghe lại toàn bộ trước khi đăng. Nếu muốn theo dõi thêm các công cụ tương tự, bài tổng hợp công cụ và mã nguồn đáng chú ý tuần này là điểm bắt đầu hợp lý.
Nguồn gốc dự án nằm tại kho mã VieNeu-TTS trên GitHub. Tóm lại, VieNeu-TTS cài nhanh, chạy gọn trên máy cá nhân và đáng thử để chuyển văn bản thành giọng nói tiếng Việt trước khi bạn trả tiền cho dịch vụ khác.
