Studio Fish Voice / endpoint Replicate

Tạo giọng nói tiếng Việt với Grok

Grok đổi một bài diễn thành file nghe được qua endpoint xai/grok-text-to-speech trên Replicate. Studio có 5 giọng Eve, Ara, Rex, Sal và Leo, không lấy từ thư viện công khai. Tiếng Việt nằm trong các ngôn ngữ đầu ra đã khai báo, và trang này mở với Tiếng Việt đang được chọn. Bạn có thể gắn thẻ diễn xuất, chọn trong 20 ngôn ngữ cộng tự nhận diện, rồi xuất một trong 5 định dạng.

Precision audio workstation

Studio Grok

Viết và chỉ đạo bản thu bên trái, rồi đặt giọng cùng định dạng bên phải.

Script and performance direction
0 / 120 ký tự

Tài khoản miễn phí gửi tối đa 120 ký tự mỗi bản tạo.

Chi phí ước tính: 0 credit

Chèn chỉ đạo diễn xuất

Voice and delivery
Cài đặt audio nâng cao+
Đang kiểm tra tài khoản và credit…

Đầu vào / 01

Grok chuyển văn bản thành giọng nói là gì?

Grok đổi kịch bản viết thành audio nghe tự nhiên. Trang này chạy model xai/grok-text-to-speech do Replicate cung cấp, rồi lưu đầu ra thành công vào kho Fish Voice để tài khoản phát lại và tải về.

Endpoint đang gọi cho studio này năm giọng có tên, 20 ngôn ngữ đã chỉ định cộng tự nhận diện, thẻ chỉ đạo lời, năm cách mã hóa đầu ra, chỉnh tần số lấy mẫu, chỉnh bit rate MP3, và tùy chọn chuẩn hóa chữ.

Đây không phải trang chính thức của xAI. Sản phẩm Voice của xAI mô tả thêm giọng, ngôn ngữ, phát trực tuyến, mốc thời gian và nhân bản giọng. Studio chạy trên Replicate không hứa những khả năng rộng hơn đó. Việc Grok có tiếng Việt trong danh sách cũng không suy ra khả năng clone giọng nói.

Chọn giọng / 02

Chọn giọng Grok TTS cho đúng việc

Endpoint ghi năm ID giọng. Đây không phải thư viện công khai. Hãy nghe cùng một câu dễ lộ lỗi trước khi tạo bản dài, vì tên giọng không bảo đảm hợp chủ đề, ngôn ngữ hay bản mix.

V-01

Eve

Giọng mặc định của endpoint, chỗ bắt đầu trung tính khi nghe thử vòng đầu.

V-02

Ara

Lựa chọn được ghi trong tài liệu, để so khi Eve chưa khớp cách đọc bạn muốn.

V-03

Rex

Phương án khác, đáng thử với lời dẫn trực tiếp, câu sản phẩm và lời nhắc ngắn.

V-04

Sal

Một giọng riêng để nghe song song, cùng câu chữ và cùng cài ngôn ngữ.

V-05

Leo

Giọng thứ năm trong tài liệu, đủ bộ để so năm cách đọc trên một câu.

Quy trình / 03

Dùng Grok để đọc một bài viết

Một đường làm ổn tách phần viết, phần chỉ đạo diễn, phần kỹ thuật xuất file, và phần nghe cuối.

  1. 01

    Viết một kịch bản duyệt được

    Bắt đầu bằng đúng lời sẽ đọc, và đưa vào tên, số hoặc câu dài dễ lộ lỗi nhất.

  2. 02

    Chỉ đạo và chọn giọng

    Chèn thẻ diễn xuất có chừng mực, chọn một trong năm giọng, và giữ nguyên câu khi so các ứng viên.

  3. 03

    Chọn định dạng nơi đến

    Dùng MP3 khi cần chia sẻ gọn, WAV hoặc PCM khi cần dựng, và codec điện thoại chỉ khi tổng đài nhận yêu cầu đúng loại đó.

  4. 04

    Tạo, nghe và tải

    Đăng nhập, xác nhận ước tính credit, nghe đầu ra phát được trên trình duyệt, rồi tải file thuộc tài khoản về để sản xuất.

Diễn xuất / 04

Thẻ diễn xuất cho Grok TTS

Thẻ diễn xuất đặt chỉ dẫn ngắn ngay trong kịch bản. Chỉ dùng những cue bạn nghe và kiểm tra được trong một bản thử.

[pause]

Kết quả đã xong. [pause] Nghe lại cùng nhau nhé.

Tạo một chỗ ngắt có chủ đích giữa hai ý.

[laugh]

Đoạn này đâu có trong kịch bản. [laugh]

Thử một tiếng cười ngắn ở câu thật sự cần nó.

[sigh]

[sigh] Phải thu thêm một bản nữa.

Báo một đổi thái độ nghe thấy được, ngay trước câu.

[breath]

Khoan đã. [breath] Làm lại từ đầu.

Thêm một nhịp người nhỏ mà không viết lại câu.

<whisper>

<whisper> Giữ chuyện này giữa hai ta.

Nghe thử một hướng nhỏ tiếng trên cụm từ ngắn, tách riêng.

Xuất file / 05

Định dạng cho nhà sáng tạo, ứng dụng và tổng đài

Chọn định dạng theo nơi file sẽ đến, không theo một bảng xếp hạng chất lượng chung.

MP3

Chọn MP3 cho bản xem gọn, link duyệt, ghép podcast và nháp video.

Chỉnh bit rate trên endpoint này chỉ áp dụng cho MP3.

WAV

Chọn WAV khi trình dựng hoặc phần mềm audio cần một file không nén, phát được trên trình duyệt.

Giữ tần số lấy mẫu khớp timeline sản xuất.

PCM

Chọn PCM khi phần mềm phía sau yêu cầu rõ audio xung mã thô.

PCM thô ưu tiên tải về, và có thể cần cài đặt nhập trong ứng dụng đích.

μ-law

Chọn μ-law cho điện thoại hoặc tổng đài có đặc tả kỹ thuật nêu đúng codec này.

Đối chiếu tần số lấy mẫu với hệ thống nhận.

A-law

Chọn A-law cho hạ tầng điện thoại yêu cầu đúng audio A-law.

Đừng thay μ-law bằng A-law nếu chưa xem đặc tả triển khai.

Sản xuất / 06

Take Grok đã chỉ đạo hợp với việc nào

Xem ba đầu việc thực tế — lời dẫn có chỉ đạo, tài sản đa ngôn ngữ, và lời nhắc tổng đài — trước khi chọn giọng và định dạng cho sản xuất.

Lời podcast Grok TTS được nghe cạnh timeline video, sóng âm, kịch bản đã chỉ đạo và bản thu đã duyệtTình huống 01

Lời podcast và video

Chọn câu mở bằng một dòng có kiểm soát, đặt chỗ ngắt quanh ý chính, xuất file để duyệt, và chỉ thay bản thu không qua hình hoặc bản mix.

Bàn giao bản địa hóa Grok TTS với kịch bản ghép cặp, các bản ngôn ngữ, sóng âm và file audio cuốiTình huống 02

Bản địa hóa nhiều ngôn ngữ

Giữ kịch bản gốc và bản dịch thành cặp, chọn đúng ngôn ngữ đích đã khai báo, rồi duyệt tên và số trước khi xuất file của từng ngôn ngữ.

Gói điện thoại Grok TTS với luồng cuộc gọi IVR đã xong, sóng âm lời nhắc và file codec đã kiểm traTình huống 03

Lời nhắc tổng đài và hỗ trợ

Tạo đủ các nhánh, xét thời lượng và độ rõ, rồi chỉ giao μ-law hoặc A-law sau khi nền tảng điện thoại đã xác nhận codec và tần số lấy mẫu.

Lựa chọn / 07

Grok TTS, ElevenLabs và OpenAI TTS

Không có bên thắng cho mọi bài. Hãy chọn theo bộ điều khiển, nguồn giọng và cách tích hợp mà việc của bạn thật sự cần.

01

Grok TTS tại đây

Chọn Grok khi…

bạn muốn chạy endpoint năm giọng đã ghi trên Replicate ngay trong trình duyệt, chỉ đạo bằng thẻ diễn xuất, chọn MP3, WAV, audio thô hoặc đầu ra điện thoại, và giữ kết quả trong lịch sử Fish Voice.

02

ElevenLabs

Chọn ElevenLabs khi…

dự án phụ thuộc thư viện giọng lớn hơn trong tài liệu của họ, việc chọn model, hoặc một luồng clone giọng của ElevenLabs. Hãy đối chiếu gói và tài liệu model hiện tại trước khi chốt.

03

OpenAI TTS

Chọn OpenAI khi…

ứng dụng của bạn đã xây quanh API OpenAI, và cách điều khiển bằng chỉ dẫn là mô hình bạn cần. Hãy xác nhận model và giọng đang có trong tài liệu OpenAI.

Giới hạn / 08

Giới hạn endpoint và phạm vi đã có căn cứ

  • Việc tạo cần tài khoản Fish Voice đã đăng nhập và credit. Tài khoản miễn phí giới hạn 120 ký tự mỗi yêu cầu; tài khoản trả phí đang hoạt động giới hạn 1,000.
  • Studio này mở năm giọng, 20 ngôn ngữ cộng tự nhận diện, các định dạng, tần số lấy mẫu, bit rate MP3, công tắc chuẩn hóa, và luồng thẻ diễn xuất mà tích hợp Replicate hỗ trợ.
  • Trang không nhận kho giọng rộng hơn của xAI, không nhận phát trực tuyến, mốc thời gian, ghi đè phát âm hay clone giọng, và không đăng các bảng xếp hạng chất lượng, tốc độ hoặc giá không kiểm được.
  • File PCM thô, μ-law và A-law được đưa dưới dạng tải về, vì trình phát audio thông thường trên trình duyệt không đọc chắc mọi định dạng thô gắn với từng hệ thống.
Giải đáp / 09

Hỏi đáp Grok chuyển văn bản thành giọng nói

Đây có phải trang Grok TTS chính thức của xAI?+

Không. Fish Voice cung cấp một luồng trên trình duyệt quanh endpoint xai/grok-text-to-speech có qua Replicate. xAI và Replicate vẫn là nguồn cho tài liệu sản phẩm và endpoint của họ.

Ở đây dùng được những giọng Grok TTS nào?+

Các lựa chọn endpoint hiện có trong studio này là Eve, Ara, Rex, Sal và Leo. Hãy nghe cùng một bài trên các ứng viên trước khi chọn giọng sản xuất. Bộ này không phải thư viện công khai.

Studio Grok này hỗ trợ bao nhiêu ngôn ngữ?+

Bộ chọn liệt kê 20 ngôn ngữ cộng thêm tự nhận diện, trong đó có tiếng Việt. Trang tiếng Việt mở sẵn mục Tiếng Việt. Khi duyệt tên riêng, số và thuật ngữ đã bản địa hóa, hãy chọn đúng ngôn ngữ đích.

Nên chọn định dạng audio nào?+

Dùng MP3 để chia sẻ gọn, WAV hoặc PCM khi luồng dựng hoặc phần mềm yêu cầu, và μ-law hoặc A-law chỉ khi hệ thống điện thoại chỉ định codec đó.

Mọi đầu ra đều phát được trên trình duyệt?+

Trình phát kết quả dùng được với MP3 và WAV. PCM, μ-law và A-law vẫn tải được, nhưng việc phát phụ thuộc cài đặt audio thô của hệ thống đích.

Tạo audio có cần tài khoản?+

Có. Đăng nhập bảo vệ phần dùng dịch vụ trả phí, và để Fish Voice áp credit của tài khoản, giới hạn chữ, quyền sở hữu file đã lưu, cùng lịch sử bản tạo.

Tạo thất bại thì sao?+

Trình soạn giữ kịch bản và cài đặt. Máy chủ đi theo đường đối soát credit của bản tạo thất bại đang có, và trả về một nhóm lỗi làm được việc, không lộ chi tiết nhạy cảm.

Trang này có clone giọng hoặc phát trực tuyến của xAI không?+

Không. Những khả năng đó nằm ngoài các điều khiển endpoint Replicate được làm ở đây, kể cả khi các trang sản phẩm xAI rộng hơn có mô tả thêm chức năng giọng.

Căn cứ / 10

Nguồn năng lực

Tài liệu chính thức xác định các điều trang này nhận và các ranh giới. Khả năng có thể đổi, nên hãy xem nguồn được liên kết trước khi lên kế hoạch tích hợp sản xuất.

Sẵn sàng / Studio

Chỉ đạo một bản Grok, từ kịch bản tới file của bạn

Bắt đầu bằng câu dễ lỗi phát âm hoặc nhịp nhất, rồi nghe đầu ra trước khi kéo dài kịch bản.