Eve
Giọng mặc định của endpoint, chỗ bắt đầu trung tính khi nghe thử vòng đầu.
Studio Fish Voice / endpoint Replicate
Grok đổi một bài diễn thành file nghe được qua endpoint xai/grok-text-to-speech trên Replicate. Studio có 5 giọng Eve, Ara, Rex, Sal và Leo, không lấy từ thư viện công khai. Tiếng Việt nằm trong các ngôn ngữ đầu ra đã khai báo, và trang này mở với Tiếng Việt đang được chọn. Bạn có thể gắn thẻ diễn xuất, chọn trong 20 ngôn ngữ cộng tự nhận diện, rồi xuất một trong 5 định dạng.
015 giọng
0220 ngôn ngữ + tự nhận
035 định dạng xuất
Precision audio workstation
Viết và chỉ đạo bản thu bên trái, rồi đặt giọng cùng định dạng bên phải.
Đầu vào / 01
Grok đổi kịch bản viết thành audio nghe tự nhiên. Trang này chạy model xai/grok-text-to-speech do Replicate cung cấp, rồi lưu đầu ra thành công vào kho Fish Voice để tài khoản phát lại và tải về.
Endpoint đang gọi cho studio này năm giọng có tên, 20 ngôn ngữ đã chỉ định cộng tự nhận diện, thẻ chỉ đạo lời, năm cách mã hóa đầu ra, chỉnh tần số lấy mẫu, chỉnh bit rate MP3, và tùy chọn chuẩn hóa chữ.
Đây không phải trang chính thức của xAI. Sản phẩm Voice của xAI mô tả thêm giọng, ngôn ngữ, phát trực tuyến, mốc thời gian và nhân bản giọng. Studio chạy trên Replicate không hứa những khả năng rộng hơn đó. Việc Grok có tiếng Việt trong danh sách cũng không suy ra khả năng clone giọng nói.
Chọn giọng / 02
Endpoint ghi năm ID giọng. Đây không phải thư viện công khai. Hãy nghe cùng một câu dễ lộ lỗi trước khi tạo bản dài, vì tên giọng không bảo đảm hợp chủ đề, ngôn ngữ hay bản mix.
Giọng mặc định của endpoint, chỗ bắt đầu trung tính khi nghe thử vòng đầu.
Lựa chọn được ghi trong tài liệu, để so khi Eve chưa khớp cách đọc bạn muốn.
Phương án khác, đáng thử với lời dẫn trực tiếp, câu sản phẩm và lời nhắc ngắn.
Một giọng riêng để nghe song song, cùng câu chữ và cùng cài ngôn ngữ.
Giọng thứ năm trong tài liệu, đủ bộ để so năm cách đọc trên một câu.
Quy trình / 03
Một đường làm ổn tách phần viết, phần chỉ đạo diễn, phần kỹ thuật xuất file, và phần nghe cuối.
Bắt đầu bằng đúng lời sẽ đọc, và đưa vào tên, số hoặc câu dài dễ lộ lỗi nhất.
Chèn thẻ diễn xuất có chừng mực, chọn một trong năm giọng, và giữ nguyên câu khi so các ứng viên.
Dùng MP3 khi cần chia sẻ gọn, WAV hoặc PCM khi cần dựng, và codec điện thoại chỉ khi tổng đài nhận yêu cầu đúng loại đó.
Đăng nhập, xác nhận ước tính credit, nghe đầu ra phát được trên trình duyệt, rồi tải file thuộc tài khoản về để sản xuất.
Thẻ diễn xuất đặt chỉ dẫn ngắn ngay trong kịch bản. Chỉ dùng những cue bạn nghe và kiểm tra được trong một bản thử.
[pause]Kết quả đã xong. [pause] Nghe lại cùng nhau nhé.
Tạo một chỗ ngắt có chủ đích giữa hai ý.
[laugh]Đoạn này đâu có trong kịch bản. [laugh]
Thử một tiếng cười ngắn ở câu thật sự cần nó.
[sigh][sigh] Phải thu thêm một bản nữa.
Báo một đổi thái độ nghe thấy được, ngay trước câu.
[breath]Khoan đã. [breath] Làm lại từ đầu.
Thêm một nhịp người nhỏ mà không viết lại câu.
<whisper><whisper> Giữ chuyện này giữa hai ta.
Nghe thử một hướng nhỏ tiếng trên cụm từ ngắn, tách riêng.
Chọn định dạng theo nơi file sẽ đến, không theo một bảng xếp hạng chất lượng chung.
Chọn MP3 cho bản xem gọn, link duyệt, ghép podcast và nháp video.
Chỉnh bit rate trên endpoint này chỉ áp dụng cho MP3.
Chọn WAV khi trình dựng hoặc phần mềm audio cần một file không nén, phát được trên trình duyệt.
Giữ tần số lấy mẫu khớp timeline sản xuất.
Chọn PCM khi phần mềm phía sau yêu cầu rõ audio xung mã thô.
PCM thô ưu tiên tải về, và có thể cần cài đặt nhập trong ứng dụng đích.
Chọn μ-law cho điện thoại hoặc tổng đài có đặc tả kỹ thuật nêu đúng codec này.
Đối chiếu tần số lấy mẫu với hệ thống nhận.
Chọn A-law cho hạ tầng điện thoại yêu cầu đúng audio A-law.
Đừng thay μ-law bằng A-law nếu chưa xem đặc tả triển khai.
Sản xuất / 06
Xem ba đầu việc thực tế — lời dẫn có chỉ đạo, tài sản đa ngôn ngữ, và lời nhắc tổng đài — trước khi chọn giọng và định dạng cho sản xuất.
Tình huống 01Chọn câu mở bằng một dòng có kiểm soát, đặt chỗ ngắt quanh ý chính, xuất file để duyệt, và chỉ thay bản thu không qua hình hoặc bản mix.
Tình huống 02Giữ kịch bản gốc và bản dịch thành cặp, chọn đúng ngôn ngữ đích đã khai báo, rồi duyệt tên và số trước khi xuất file của từng ngôn ngữ.
Tình huống 03Tạo đủ các nhánh, xét thời lượng và độ rõ, rồi chỉ giao μ-law hoặc A-law sau khi nền tảng điện thoại đã xác nhận codec và tần số lấy mẫu.
Lựa chọn / 07
Không có bên thắng cho mọi bài. Hãy chọn theo bộ điều khiển, nguồn giọng và cách tích hợp mà việc của bạn thật sự cần.
Chọn Grok khi…
bạn muốn chạy endpoint năm giọng đã ghi trên Replicate ngay trong trình duyệt, chỉ đạo bằng thẻ diễn xuất, chọn MP3, WAV, audio thô hoặc đầu ra điện thoại, và giữ kết quả trong lịch sử Fish Voice.
Chọn ElevenLabs khi…
dự án phụ thuộc thư viện giọng lớn hơn trong tài liệu của họ, việc chọn model, hoặc một luồng clone giọng của ElevenLabs. Hãy đối chiếu gói và tài liệu model hiện tại trước khi chốt.
Chọn OpenAI khi…
ứng dụng của bạn đã xây quanh API OpenAI, và cách điều khiển bằng chỉ dẫn là mô hình bạn cần. Hãy xác nhận model và giọng đang có trong tài liệu OpenAI.
Không. Fish Voice cung cấp một luồng trên trình duyệt quanh endpoint xai/grok-text-to-speech có qua Replicate. xAI và Replicate vẫn là nguồn cho tài liệu sản phẩm và endpoint của họ.
Các lựa chọn endpoint hiện có trong studio này là Eve, Ara, Rex, Sal và Leo. Hãy nghe cùng một bài trên các ứng viên trước khi chọn giọng sản xuất. Bộ này không phải thư viện công khai.
Bộ chọn liệt kê 20 ngôn ngữ cộng thêm tự nhận diện, trong đó có tiếng Việt. Trang tiếng Việt mở sẵn mục Tiếng Việt. Khi duyệt tên riêng, số và thuật ngữ đã bản địa hóa, hãy chọn đúng ngôn ngữ đích.
Dùng MP3 để chia sẻ gọn, WAV hoặc PCM khi luồng dựng hoặc phần mềm yêu cầu, và μ-law hoặc A-law chỉ khi hệ thống điện thoại chỉ định codec đó.
Trình phát kết quả dùng được với MP3 và WAV. PCM, μ-law và A-law vẫn tải được, nhưng việc phát phụ thuộc cài đặt audio thô của hệ thống đích.
Có. Đăng nhập bảo vệ phần dùng dịch vụ trả phí, và để Fish Voice áp credit của tài khoản, giới hạn chữ, quyền sở hữu file đã lưu, cùng lịch sử bản tạo.
Trình soạn giữ kịch bản và cài đặt. Máy chủ đi theo đường đối soát credit của bản tạo thất bại đang có, và trả về một nhóm lỗi làm được việc, không lộ chi tiết nhạy cảm.
Không. Những khả năng đó nằm ngoài các điều khiển endpoint Replicate được làm ở đây, kể cả khi các trang sản phẩm xAI rộng hơn có mô tả thêm chức năng giọng.
Căn cứ / 10
Tài liệu chính thức xác định các điều trang này nhận và các ranh giới. Khả năng có thể đổi, nên hãy xem nguồn được liên kết trước khi lên kế hoạch tích hợp sản xuất.
Sẵn sàng / Studio
Bắt đầu bằng câu dễ lỗi phát âm hoặc nhịp nhất, rồi nghe đầu ra trước khi kéo dài kịch bản.