Eve
기본으로 선택되는 목소리로, 첫 비교를 시작하기 좋은 중립적인 옵션입니다.
Fish Voice 스튜디오 / Replicate 엔드포인트
Grok 텍스트 음성 변환은 Replicate의 xai/grok-text-to-speech 엔드포인트를 통해 대본을 다운로드 가능한 오디오로 바꿉니다. 5가지 목소리에 연출 태그를 적용하고, 20개 언어와 자동 감지 중에서 선택한 뒤 5가지 형식으로 내보낼 수 있습니다.
01목소리 5종
0220개 언어 + 자동 감지
03출력 형식 5종
Precision audio workstation
왼쪽에서 대본과 음성 연출을 작성한 뒤 오른쪽에서 목소리와 출력 형식을 설정하세요.
엔드포인트 / 01
Grok 텍스트 음성 변환은 작성한 대본을 자연스러운 오디오로 바꿉니다. 이 페이지는 Replicate에서 제공하는 xai/grok-text-to-speech 모델을 사용하고, 생성된 결과를 Fish Voice 저장소에 보관해 계정에서 재생하고 다운로드할 수 있게 합니다.
현재 이 스튜디오에서는 5가지 목소리, 20개 언어와 자동 감지, 음성 연출 태그, 5가지 출력 인코딩, 샘플 레이트와 MP3 비트레이트 설정, 선택형 텍스트 정규화를 사용할 수 있습니다.
이곳은 xAI 공식 웹사이트가 아닙니다. xAI Voice 제품에 소개된 추가 목소리, 언어, 스트리밍, 타임스탬프, 보이스 클로닝은 이 Replicate 기반 스튜디오의 지원 범위에 포함되지 않습니다.
목소리 선택 / 02
엔드포인트는 5개의 목소리 ID를 제공합니다. 이름만으로는 주제, 언어, 믹스와의 궁합을 알 수 없으므로 전체 대본을 생성하기 전에 같은 테스트 문장으로 들어보세요.
기본으로 선택되는 목소리로, 첫 비교를 시작하기 좋은 중립적인 옵션입니다.
Eve가 원하는 전달 방식과 맞지 않을 때 비교해 볼 수 있는 또렷한 대안입니다.
직접적인 내레이션, 제품 소개 문구, 짧은 프롬프트에 시험해 볼 만한 목소리입니다.
같은 대본과 언어 설정으로 나란히 비교 청취하기 좋은 별도의 목소리입니다.
5가지 목소리를 같은 조건에서 비교할 때 마지막 후보로 사용할 수 있습니다.
작업 순서 / 03
효율적인 Grok TTS 작업은 대본 작성, 음성 연출, 출력 설정, 최종 검토를 나누어 진행합니다.
실제로 읽을 문장을 정확히 쓰고, 발음 문제를 확인할 수 있도록 이름, 숫자 또는 긴 문장을 포함하세요.
필요한 곳에만 음성 태그를 넣고 5가지 목소리 중 하나를 선택하세요. 후보를 비교할 때는 같은 문장을 사용하세요.
간편한 공유에는 MP3, 편집에는 WAV 또는 PCM을 사용하고, 전화용 코덱은 연결할 전화 시스템에서 요구할 때만 선택하세요.
로그인하고 예상 크레딧을 확인한 뒤 브라우저에서 결과를 들어보세요. 검토가 끝나면 제작용 파일을 다운로드할 수 있습니다.
음성 태그는 짧은 연출 지시를 대본에 바로 넣는 기능입니다. 테스트 결과에서 직접 듣고 확인할 수 있는 태그만 사용하세요.
[pause]결과가 준비됐습니다. [pause] 함께 확인해 볼까요?
두 문장 사이에 의도적인 쉼을 넣습니다.
[laugh]그 내용은 요청서에 없었는데요. [laugh]
문맥상 필요한 위치에 짧은 웃음을 시험합니다.
[sigh][sigh] 한 번 더 녹음해야겠네요.
문장을 시작하기 전에 감정 변화를 표현합니다.
[breath]잠깐만요. [breath] 처음부터 다시 할게요.
문장을 고치지 않고도 자연스러운 호흡을 더합니다.
<whisper><whisper> 이건 우리끼리만 알아요.
짧고 독립된 구절을 더 조용한 톤으로 시험합니다.
일률적인 품질 순위가 아니라 다음 작업 환경에 맞춰 형식을 선택하세요.
용량이 작은 미리듣기, 검토 링크, 팟캐스트 편집, 영상 초안에는 MP3를 선택하세요.
이 엔드포인트에서 비트레이트 설정은 MP3에만 적용됩니다.
편집기나 오디오 워크스테이션에서 브라우저 재생이 가능한 비압축 컨테이너가 필요할 때 WAV를 선택하세요.
샘플 레이트는 제작 타임라인과 동일하게 맞추세요.
후속 소프트웨어에서 원시 펄스 부호 오디오를 명시적으로 요구할 때 PCM을 선택하세요.
원시 PCM은 다운로드용이며 대상 앱에서 가져오기 설정이 필요할 수 있습니다.
전화 또는 IVR 시스템 사양에서 μ-law 코덱을 요구할 때 선택하세요.
연결할 시스템에서 필요한 샘플 레이트를 확인하세요.
전화 인프라에서 A-law 오디오를 명시적으로 요구할 때 선택하세요.
배포 사양을 확인하지 않고 μ-law 대신 사용하지 마세요.
제작 사례 / 06
목소리와 형식을 결정하기 전에 연출된 내레이션, 다국어 콘텐츠, 전화 안내 음성이라는 세 가지 실제 활용 사례를 확인하세요.
사례 01같은 문장으로 도입부 목소리를 비교하고, 핵심 문구 앞뒤에 쉼을 연출하세요. 검토용 파일을 내보낸 뒤 영상이나 믹스와 맞지 않는 부분만 다시 생성할 수 있습니다.
사례 02원문과 번역 대본을 나란히 관리하고 대상 언어를 직접 선택하세요. 이름과 숫자를 검토한 뒤 언어별 오디오 파일을 내보낼 수 있습니다.
사례 03통화 흐름의 각 분기를 완성된 문장으로 생성하고 길이와 명료도를 확인하세요. 전화 플랫폼의 코덱과 샘플 레이트 요구 사항을 확인한 뒤에만 μ-law 또는 A-law로 전달하세요.
서비스 비교 / 07
모든 상황에 가장 좋은 서비스는 없습니다. 실제 작업에 필요한 제어 방식, 목소리 제공 방식, 연동 구조를 기준으로 선택하세요.
Grok이 적합한 경우
Replicate가 제공하는 5가지 목소리 엔드포인트를 브라우저에서 사용하고, 음성 태그를 연출하며, MP3·WAV·원시 오디오·전화용 형식을 선택하고, 결과를 Fish Voice 기록에 보관하려는 경우에 적합합니다.
ElevenLabs가 적합한 경우
더 큰 공식 목소리 라이브러리, 모델 선택 기능 또는 ElevenLabs의 보이스 클로닝 작업이 필요한 프로젝트에 적합합니다. 도입 전에 현재 요금제와 모델 문서를 확인하세요.
OpenAI가 적합한 경우
앱이 이미 OpenAI API를 중심으로 구축되어 있고 지시문 기반 음성 생성 방식이 필요한 경우에 적합합니다. 현재 제공되는 모델과 목소리는 OpenAI 문서에서 확인하세요.
아닙니다. Fish Voice는 Replicate에서 제공하는 xai/grok-text-to-speech 엔드포인트를 브라우저에서 사용할 수 있게 합니다. 각 제품과 엔드포인트의 공식 정보는 xAI와 Replicate 문서를 확인하세요.
현재 이 스튜디오에서는 Eve, Ara, Rex, Sal, Leo를 선택할 수 있습니다. 제작용 목소리를 고르기 전에 모든 후보를 같은 대본으로 비교해 보세요.
엔드포인트 선택 목록에는 20개 언어와 자동 감지가 제공됩니다. 현지화된 이름, 숫자, 용어를 검토할 때는 대상 언어를 직접 선택하세요.
간편한 공유에는 MP3를 사용하고, 편집기나 소프트웨어에서 요구할 때는 WAV 또는 PCM을 선택하세요. μ-law와 A-law는 전화 시스템에서 해당 코덱을 명시한 경우에만 사용하세요.
결과 플레이어에서는 MP3와 WAV를 재생할 수 있습니다. PCM, μ-law, A-law는 다운로드할 수 있지만 재생 여부는 대상 시스템의 원시 오디오 설정에 따라 달라집니다.
예. 로그인하면 유료 제공자 사용을 보호하고, 계정의 크레딧과 글자 수 제한, 저장된 파일 소유권, 생성 기록을 정확히 적용할 수 있습니다.
대본과 설정은 편집기에 그대로 유지됩니다. 서버는 기존 실패 처리 절차에 따라 크레딧을 조정하고, 문제 해결에 도움이 되는 안전한 오류 유형을 반환합니다.
아닙니다. xAI의 다른 제품 페이지에서 추가 음성 기능을 소개하더라도, 해당 기능은 이 페이지에 구현된 Replicate 엔드포인트의 제어 범위에 포함되지 않습니다.
근거 자료 / 10
이 페이지의 기능 설명과 지원 범위는 공식 문서를 기준으로 합니다. 제공 여부는 바뀔 수 있으므로 실제 연동을 계획하기 전에 링크된 원문을 확인하세요.
준비 완료 / 스튜디오
발음이나 타이밍이 가장 까다로운 문장부터 생성하고 결과를 확인한 뒤 전체 대본으로 확장하세요.