ComfyUI OmniVoice TTS: Hướng dẫn cài đặt và sử dụng TTS đa ngôn ngữ

ByNgọc Trai MKT11/07/2026in GitHub Tools 0
comfy-ui-omni-voice-tts

ComfyUI OmniVoice TTS là bộ custom node cho ComfyUI giúp bạn tổng hợp giọng nói đa ngôn ngữ theo kiểu zero-shot, không cần dữ liệu trước, kèm khả năng clone giọng từ 3-15 giây âm thanh và thiết kế giọng hoàn toàn mới từ mô tả văn bản. Nó giải quyết bài toán tích hợp TTS chất lượng cao vào pipeline AI, dành cho developers, content creators, và những ai muốn tự động hóa sản xuất audio đa ngôn ngữ mà không cần studio thu âm.

Thank you for reading this post, don't forget to subscribe!
  • Hỗ trợ hơn 600 ngôn ngữ và phương ngữ — phạm vi rộng nhất trong các mô hình TTS zero-shot hiện nay.
  • Clone giọng nói chỉ từ 3-15 giây audio tham khảo, hoặc thiết kế giọng mới bằng mô tả như ‘female, young, high pitch, british accent’.
  • Tạo hội thoại nhiều người nói với cú pháp [Speaker_N]: và gán audio riêng cho từng speaker.
  • Tối ưu VRAM: hỗ trợ CPU offload, bf16, và cache thông minh — chạy được trên GPU từ 4GB (bf16) lên 12GB (fp32).
  • Cài đặt dễ dàng qua ComfyUI Manager hoặc git clone, model tự động tải từ HuggingFace.

ComfyUI OmniVoice TTS là gì và giải quyết vấn đề gì?

ComfyUI OmniVoice TTS là gì và giải quyết vấn đề gì?
ComfyUI OmniVoice TTS là gì và giải quyết vấn đề gì?

ComfyUI OmniVoice TTS là một dự án mã nguồn mở trên GitHub biến ComfyUI thành công cụ tổng hợp giọng nói đa ngôn ngữ mạnh mẽ. Nếu bạn đã từng mày mò với các mô hình TTS như Bark, XTTS hay CosyVoice, bạn sẽ thấy OmniVoice vượt trội ở chỗ hỗ trợ hơn 600 ngôn ngữ — từ tiếng Anh, Trung, Việt cho đến các phương ngữ như 四川话 (Tứ Xuyên) hay 河南话 (Hà Nam). Vấn đề mà repo này giải quyết là sự phức tạp khi tích hợp TTS vào pipeline AI: bạn không cần viết code dài dòng, chỉ cần kéo thả node trong ComfyUI, kết nối audio input, và nhận ra output giọng nói ngay lập tức. Nó đặc biệt hữu ích cho việc tạo nội dung đa ngôn ngữ, lồng tiếng tự động, và các ứng dụng cần nhiều giọng nói khác nhau.

Những tính năng nổi bật

Những tính năng nổi bật
Những tính năng nổi bật

Voice Cloning và Voice Design

Clone giọng từ file audio ngắn (3-15 giây) — chỉ cần một đoạn ghi âm giọng người thật, node OmniVoice Voice Clone TTS sẽ tái tạo chính xác âm sắc, ngữ điệu. Nếu bạn không có mẫu, dùng OmniVoice Voice Design TTS: gõ ‘female, young, high pitch, british accent, whisper’ và mô hình sẽ tạo ra giọng hoàn toàn mới. Cả hai đều hỗ trợ chỉnh sửa tham số như steps (4-64), guidance scale, speed, và duration.

Multi-Speaker và Longform TTS

Muốn tạo kịch bản đối thoại hai hoặc nhiều người? Dùng node OmniVoice Multi-Speaker TTS, viết text với tag [Speaker_1]:, [Speaker_2]:, và kết nối audio riêng cho từng speaker. Node OmniVoice Longform TTS dành cho văn bản dài tự động chia chunk, hỗ trợ voice cloning và hướng dẫn dialect/style (ví dụ ‘male, indian accent’ hoặc ‘男,河南话’).

Non-Verbal Tags và Attention Backend

Bạn có thể chèn các tag cảm xúc trực tiếp vào text: [laughter], [sigh], [sniff], [surprise-oh] — giúp giọng nói tự nhiên hơn. Về hiệu năng, OmniVoice hỗ trợ SageAttention (CUDA SM80+) để tăng tốc, nhưng lưu ý nó chỉ hoạt động với các cuộc gọi unmasked attention, còn masked diffusion vẫn dùng eager mặc định.

Hướng dẫn cài đặt & sử dụng

Hướng dẫn cài đặt   sử dụng
Hướng dẫn cài đặt sử dụng

Cài đặt cực kỳ đơn giản. Có hai cách:

  1. Qua ComfyUI Manager: Mở ComfyUI Manager, tìm ‘OmniVoice’, nhấn Install.
  2. Thủ công: Mở terminal, gõ các lệnh sau:
    cd ComfyUI/custom_nodes
    git clone https://github.com/saganaki22/ComfyUI-OmniVoice-TTS.git
    cd ComfyUI-OmniVoice-TTS
    python install.py

Lưu ý: script install.py dùng flag –no-deps để tránh downgrade PyTorch xuống CPU-only. Nếu lỡ bị lỗi PyTorch, xem bảng tương thích trong repo. Sau khi cài, khởi động lại ComfyUI. Các node xuất hiện trong menu với tên ‘OmniVoice’.
Ví dụ workflow đơn giản: Kéo node OmniVoice Voice Clone TTS, upload file audio (3-15s) vào input ref_audio, nhập text cần đọc, chọn model (auto-download lần đầu), set steps=32, guidance_scale=2.0, nhấn generate. Kết quả là audio file ở output.

Ai nên dùng — ai không nên?

Ai nên dùng — ai không nên?
Ai nên dùng — ai không nên?

Nên dùng nếu bạn là người dùng ComfyUI muốn mở rộng pipeline ra lĩnh vực audio, hoặc là developer cần TTS đa ngôn ngữ, clone giọng nhanh. Content creator sản xuất video đa ngôn ngữ cũng sẽ hưởng lợi lớn từ multi-speaker và voice design.

Ngược lại, người chỉ cần TTS đơn giản một giọng có thể thấy quá nhiều tham số; những ai không có GPU (chỉ CPU) vẫn chạy được nhưng chậm (~2-4GB VRAM với CPU offload). Ngoài ra, mô hình fp32 nặng ~4GB, nếu bạn dùng GPU 4GB thì nên chọn bf16 (~2GB) và bật CPU offload. Một điểm trừ nhỏ: OmniVoice yêu cầu transformers>=5.3.0, có thể xung đột với các custom node cũ — hãy kiểm tra trước khi nâng cấp.

Bạn có thể xem chi tiết tại repository gốc trên GitHub.

Câu hỏi thường gặp

Làm thế nào để tránh lỗi ‘CUDA out of memory’?

Set keep_model_loaded = False, chọn dtype = bf16 hoặc fp16, hoặc chuyển device = cpu. Mô hình bf16 chỉ ngốn ~4-6GB, còn với CPU offload thì ~2-4GB.

OmniVoice có hỗ trợ tiếng Việt không?

Có, vì nó hỗ trợ hơn 600 ngôn ngữ, trong đó có tiếng Việt. Bạn có thể dùng voice cloning với audio tiếng Việt hoặc voice design với instruct field để chỉnh giọng.

Tôi cần GPU gì để chạy mượt?

GPU từ 6GB VRAM trở lên (RTX 3060, 3070) dùng bf16 chạy ổn. Nếu dùng fp32 cần 8-12GB. GPU không hỗ trợ SageAttention (dưới SM80) vẫn chạy với eager attention mặc định.

Làm sao để tránh Whisper re-download mỗi lần?

Kết nối node OmniVoice Whisper Loader đến input whisper_model của Voice Clone TTS. Model được cache lại, không tải lại.

Tôi có thể dùng giọng clone từ file dài hơn 15 giây không?

Có, nhưng khi preprocess_prompt = True, node tự động cắt xuống tối đa 15 giây. Nếu bạn cung cấp ref_text, nó giữ nguyên file. Tốt nhất nên cắt thủ công 3-15 giây để chất lượng tốt và tiết kiệm bộ nhớ.

Kết luận

ComfyUI OmniVoice TTS là một trong những bộ node TTS mạnh mẽ nhất hiện nay cho hệ sinh thái ComfyUI, với vũ khí là vùng phủ ngôn ngữ khổng lồ, clone giọng siêu tốc, và khả năng tạo giọng mới từ mô tả. Nếu bạn đã có ComfyUI và muốn thêm audio vào pipeline, hãy thử ngay repo này — cài đặt không mất 5 phút. Đừng quên ghé qua GitHub để đọc thêm tài liệu và cập nhật mới nhất.

Related Posts