Bỏ qua tới nội dung
Deman AI Lab
Tất cả bài viết
Công cụ2026 · 10 phút đọc

MoneyPrinterTurbo chạy thử: ra video dọc tiếng Việt trong 1 phút, nhưng phụ đề mất dấu

Chúng tôi cài MoneyPrinterTurbo, chạy một video dọc tiếng Việt không cần khoá API trả phí, và gặp lỗi font làm vỡ dấu phụ đề. Bài kể lại lệnh, thời gian, cách sửa và phần chưa kiểm chứng.

Ảnh chụp màn hình: Deman AI Lab
Ảnh chụp màn hình: Deman AI Lab

MoneyPrinterTurbo là một dự án mã nguồn mở nhận vào một chủ đề hoặc một kịch bản, rồi tự ghép thành video ngắn có giọng đọc, phụ đề và nhạc nền. Chúng tôi đã cài và chạy nó trên máy Windows mà không dùng khoá API trả phí nào. Bài này kể lại những gì chạy được, chỗ nào vấp (có một lỗi chữ tiếng Việt đáng biết trước), và nó hợp với ai.

Tóm tắt nhanh

Thông tin tính đến ngày 03/10/2026, đọc từ README và mã nguồn của repo harry0703/MoneyPrinterTurbo (phiên bản trong giao diện là v1.3.8), cộng với lần chạy thử của chính chúng tôi.

  • Giấy phép MIT (chúng tôi đã mở file LICENSE trong repo). Bạn nên tự đọc điều khoản MIT và kiểm tra bản quyền của footage, nhạc và giọng đọc mà bạn chọn.
  • Cài bằng uv sync --frozen, cần Python 3.11 trở lên. Có giao diện web (Streamlit), có API và có dòng lệnh cli.py.
  • Giọng đọc Edge TTS miễn phí, không cần khoá, và đọc được tiếng Việt (chúng tôi đã thử với giọng vi-VN-HoaiMyNeural).
  • Chạy theo cách mặc định (LLM viết kịch bản và Pexels cung cấp footage) cần khoá API. Chúng tôi chưa thử đường này vì không nhập khoá trả phí, nên phần chất lượng kịch bản do AI viết và chất lượng footage tự động là chưa kiểm chứng.
  • Lỗi cần biết: font phụ đề mặc định làm mất dấu tiếng Việt. Đổi sang font BeVietnamPro-Bold.ttf có sẵn trong repo là hết.
  • Chưa rõ: tốc độ trên máy yếu, chất lượng khi chạy hàng loạt, và độ ổn định của các nguồn footage trả phí.

Dự án này làm gì

Ý tưởng khá thẳng: bạn đưa một chủ đề, hệ thống nhờ một mô hình ngôn ngữ viết kịch bản, tách từ khoá để tìm cảnh quay minh hoạ, đọc kịch bản thành giọng nói, sinh phụ đề, ghép các đoạn quay khớp độ dài giọng đọc, rồi xuất file MP4. Theo README, ngoài giao diện web còn có API và dòng lệnh, và có hỗ trợ khổ 9:16, 16:9, 1:1.

Nguồn cảnh quay gồm ảnh và video tự tải lên, hoặc kho Pexels, Pixabay, Coverr. README cũng liệt kê vài dịch vụ tạo video bằng AI trả phí. Danh sách mô hình ngôn ngữ hỗ trợ khá dài: Kimi/Moonshot, OpenAI, Anthropic Claude, Gemini, DeepSeek, Qwen và nhiều bên khác.

Về giọng đọc, README ghi Edge TTS là lựa chọn miễn phí không cần khoá, bên cạnh Azure, Gemini, ElevenLabs, Fish Audio và một số dịch vụ khác. Với người Việt, đây là điểm đáng chú ý: giọng Edge TTS tiếng Việt có sẵn, không tốn tiền.

README chính chỉ có bản tiếng Trung, tiếng Anh và tiếng Nhật, không có bản tiếng Việt. Chúng tôi không thấy tài liệu nào nói riêng về tiếng Việt, nên mọi thứ liên quan đến tiếng Việt dưới đây là do tự thử.

Chạy thử thực tế

Môi trường: Windows 10, Python 3.13 có sẵn, uv và FFmpeg đã cài từ trước, mạng bình thường. Không dùng GPU.

#

Cài đặt

Hai lệnh theo README:

Terminal
git clone --depth 1 https://github.com/harry0703/MoneyPrinterTurbo.gituv sync --frozen

Clone mất khoảng 36 giây, uv sync --frozen mất khoảng 40 giây. Cả hai chạy một lần là xong, không có lỗi. Sau đó chúng tôi chép config.example.toml thành config.toml và bật giao diện web:

Terminal
.venv/Scripts/python.exe -m streamlit run ./webui/Main.py --server.address=127.0.0.1 --server.port=8501

Trên Windows, README hướng dẫn chạy webui.bat, file này thực chất gọi đúng lệnh streamlit run như trên và tự chọn cổng trống. Giao diện lên sau chừng 20 giây.

Giao diện web sau khi chạy lệnh khởi động
Giao diện web sau khi chạy lệnh khởi động

Ảnh trên là trang chủ lúc mới mở. Bốn cột lần lượt là thiết lập kịch bản, thiết lập video (nguồn footage mặc định là Pexels, khổ 9:16), thiết lập âm thanh (giọng Edge TTS) và thiết lập phụ đề. Cửa sổ hướng dẫn ở góc phải nhắc bước đầu tiên là cấu hình mô hình AI, tức là bạn cần khoá LLM trước khi bấm "Generate Video" theo cách thông thường.

Chúng tôi không nhập khoá nào, nên không bấm tạo video trên giao diện này.

#

Chạy một video hoàn chỉnh, không cần khoá

Dòng lệnh cli.py cho phép đi đường tắt. Phần trợ giúp của cli.py ghi rõ cách mặc định cần LLM và khoá Pexels, nhưng giọng Edge TTS không cần khoá. Hai cờ giúp bỏ phần tốn tiền: --video-script (đưa sẵn kịch bản, bỏ qua bước LLM) và --video-source local kèm --video-materials (dùng cảnh quay của bạn thay vì Pexels).

Chúng tôi tạo một clip nền dọc 8 giây bằng FFmpeg (một nền gradient, chỉ để thử), rồi chạy lệnh với một kịch bản tiếng Việt hai câu về cách mở đầu video bán hàng:

Terminal
uv run python cli.py --video-script "..." --video-language vi-VN --voice-name vi-VN-HoaiMyNeural-Female --video-source local --video-materials nen1.mp4 --video-aspect 9:16 --bgm-type none

Lần chạy đầu mất khoảng 64 giây và ra video 1080x1920, dài 9,2 giây, có giọng đọc và phụ đề. Phần lớn thời gian nằm ở bước kết xuất cuối cùng (khoảng 30 đến 40 giây cho một video chín giây trên CPU).

Một chi tiết nhỏ nhưng thực tế: --task-id bắt buộc là UUID, nếu bạn gõ tên tuỳ ý như thu1 thì lệnh dừng ngay với thông báo lỗi. Trong log, chúng tôi cũng thấy cảnh báo rằng clip nền ngắn hơn giọng đọc nên hệ thống tự lặp lại clip cho đủ độ dài.

#

Lỗi font làm mất dấu tiếng Việt

Mở khung hình đầu tiên của video, chúng tôi thấy phụ đề bị vỡ: các chữ có dấu phức tạp như "Một", "ngắn", "thể", "được" hiện thành ô vuông trống. Chữ có dấu đơn giản như "bán", "hàng", "khách" vẫn hiển thị bình thường. Nghĩa là không phải mọi dấu đều hỏng, mà cụ thể là các ký tự Việt nằm ngoài bộ glyph của font mặc định, MicrosoftYaHeiBold.ttc, theo đúng đường dẫn mà log in ra.

Lỗi nằm ở font, không ở kịch bản hay giọng đọc. File phụ đề .srt do hệ thống tạo vẫn đúng chữ. Repo đã có sẵn font Be Vietnam Pro trong thư mục resource/fonts, nên chúng tôi chạy lại với cờ --font-name BeVietnamPro-Bold.ttf.

Kết quả log sau khi chạy lại bằng font tiếng Việt
Kết quả log sau khi chạy lại bằng font tiếng Việt

Ảnh trên là một phần log của lần chạy thứ hai, lấy từ cùng file log (chúng tôi chọn dòng quan trọng, không sửa chữ nào, chỉ bỏ phần đường dẫn module). Lần này mất khoảng 48 giây, kết thúc bằng dòng SUCCESS và generated 1 videos. Giọng đọc có sẵn từ lần đầu, chỉ khác phụ đề.

So sánh phụ đề trước và sau khi đổi font
So sánh phụ đề trước và sau khi đổi font

Ảnh so sánh cắt đúng phần phụ đề của hai khung hình. Bên trái là font mặc định với những ô vuông thay cho chữ có dấu. Bên phải là Be Vietnam Pro Bold, đủ dấu, dễ đọc và cân đối hơn. Nếu bạn định làm video tiếng Việt, hãy coi việc đổi font là bước cài đặt bắt buộc, không phải tuỳ chọn.

#

Những gì chưa thử

Chúng tôi chưa thử các phần sau, nên bài không đưa ra nhận định nào về chúng:

  • LLM tự viết kịch bản và tách từ khoá (cần khoá API).
  • Footage tự động từ Pexels, Pixabay, Coverr (cần khoá).
  • Các dịch vụ tạo video bằng AI trả phí được liệt kê trong README.
  • Đăng thẳng lên TikTok, Instagram, YouTube Shorts mà README nhắc đến.
  • Chạy hàng loạt nhiều video.

Vì sao đáng chú ý, và vì sao nên thận trọng

Điểm mạnh nhìn từ lần chạy thử là phần "lắp ráp" khá gọn. Một lệnh cho ra video có giọng, phụ đề, đúng khổ dọc, trong chưa đầy một phút. Việc cắt ghép, căn phụ đề theo thời gian giọng đọc, lặp clip khi thiếu hình, tất cả đều tự làm. Đây chính là công đoạn lặt vặt mà người làm nội dung ngắn hay mất nhiều thời gian.

Điểm cần thận trọng cũng rõ. Một là, chất lượng hình ảnh phụ thuộc hoàn toàn vào nguồn footage. Ghép cảnh stock theo từ khoá thường cho video chung chung, không nói được về sản phẩm cụ thể của bạn. Nếu bạn dùng --video-source local với cảnh quay thật của sản phẩm, kết quả sẽ sát với thương hiệu hơn nhiều, nhưng lúc đó phần "tự động tìm cảnh" gần như không còn giá trị.

Hai là, README có ghi chú rằng dự án kèm một số bản nhạc mặc định lấy từ video YouTube và khuyên xoá nếu có vấn đề bản quyền. Nếu bạn đăng video thương mại, nên dùng nhạc có giấy phép rõ ràng, hoặc tắt nhạc nền bằng --bgm-type none như chúng tôi đã làm.

Ba là, giấy phép MIT chỉ áp dụng cho mã nguồn của dự án. Nó không cấp quyền cho footage từ Pexels, giọng từ dịch vụ TTS, hay nội dung do mô hình ngôn ngữ sinh ra. Mỗi nguồn có điều khoản riêng, hãy đọc kỹ trước khi dùng thương mại. Chúng tôi không tư vấn pháp lý, chỉ nêu những gì văn bản nói.

Bốn là, README có nhắc nhà tài trợ là Kimi, và file cấu hình mẫu đặt sẵn llm_provider = "moonshot". Nếu bạn muốn dùng OpenAI, Gemini hay Claude, README nói đều được hỗ trợ, nhưng chúng tôi chưa thử.

Ý nghĩa với người làm nội dung và bán hàng

Với người làm video bán hàng, giá trị thực tế của dự án này nằm ở một chỗ cụ thể: biến một kịch bản bạn đã viết thành video dọc có giọng và phụ đề, với cảnh quay của chính bạn. Đó là cách dùng mà chúng tôi đã chạy được mà không tốn khoá nào.

Một quy trình hợp lý cho shop nhỏ có thể trông như sau:

  1. Bạn tự viết kịch bản ngắn, đi thẳng vào lợi ích trong ba giây đầu.
  2. Quay hoặc gom vài clip sản phẩm thật, đặt chung một thư mục.
  3. Chạy cli.py với --video-script, --video-source local, giọng Edge TTS tiếng Việt và font Be Vietnam Pro.
  4. Xem lại bản xuất, chỉnh nhịp và cảnh trong một trình dựng quen thuộc nếu cần, rồi mới đăng.

Cách này phù hợp với việc làm nhiều biến thể của cùng một ý, ví dụ đổi lời mở đầu để thử nội dung nào kéo được người xem. Bạn chỉ thay kịch bản và chạy lại, mỗi lần chưa tới một phút.

Với người muốn "nhập chủ đề, bấm nút, nhận video", cần kỳ vọng thận trọng. Cách đó cần khoá LLM và khoá footage, chúng tôi chưa kiểm chứng chất lượng, và video ghép từ footage stock có nguy cơ giống nhau giữa nhiều kênh. Giọng đọc Edge TTS dùng được cho bản nháp, nhưng khi làm quảng cáo thương hiệu, bạn nên nghe kỹ và cân nhắc giọng khác.

Một lưu ý về vận hành: giao diện web, API và CLI dùng chung một config.toml. Khoá API nếu có sẽ nằm trong file này, vì vậy đừng đưa file đó lên kho mã công khai.

#

Khi nào nên chọn công cụ này, khi nào không

Nên thử nếu bạn thành thạo dòng lệnh vừa phải, muốn tự động hoá khâu lắp ráp video ngắn và chấp nhận chỉnh font, cấu hình. Dự án mã nguồn mở, chạy cục bộ, không bắt bạn trả phí thuê bao.

Chưa phù hợp nếu bạn cần video quảng cáo chỉn chu ngay từ lần đầu, cần giọng tiếng Việt có cảm xúc, hoặc không muốn đụng đến thiết lập kỹ thuật. Khi đó một quy trình dựng thủ công, hoặc công cụ có giao diện hoàn thiện cho tiếng Việt, sẽ đỡ vất vả hơn.

Kết

MoneyPrinterTurbo chạy được trên Windows, cài trong khoảng một phút rưỡi, và cho ra video dọc có giọng Việt, phụ đề khi bạn tự cấp kịch bản và cảnh quay. Hãy nhớ đổi font phụ đề trước khi làm tiếng Việt, và đọc kỹ điều khoản của từng nguồn footage, nhạc, giọng. Phần tự động hoàn toàn bằng LLM và footage stock vẫn là điều chúng tôi chưa kiểm chứng, nên đáng thử với video nháp trước khi đưa vào quy trình bán hàng thật.

Tất cả bài viết