Eve
एंडपॉइंट की डिफ़ॉल्ट आवाज, और शुरुआती कास्टिंग पास के लिए सबसे तेज़ तटस्थ शुरुआत।
Fish Voice स्टूडियो / Replicate एंडपॉइंट
Grok टेक्स्ट टू स्पीच लिखित परफ़ॉर्मेंस को Replicate के xai/grok-text-to-speech एंडपॉइंट से डाउनलोड योग्य ऑडियो बनाता है। पाँच आवाजों को स्पीच टैग से दिशा दें, 20 भाषाएँ और ऑटो डिटेक्शन चुनें, और पाँच फ़ॉर्मेट में एक्सपोर्ट करें। भाषा सूची में hi है, इसलिए हिंदी चुना जा सकता है। यह आधिकारिक xAI साइट नहीं है।
015 आवाजें
0220 भाषाएँ + auto
035 आउटपुट फ़ॉर्मेट
Precision audio workstation
बाईं ओर टेक लिखें और उसे दिशा दें, फिर दाईं ओर आवाज और डिलीवरी फ़ॉर्मेट सेट करें।
एंडपॉइंट / 01
Grok टेक्स्ट टू स्पीच लिखित स्क्रिप्ट को प्राकृतिक लगने वाले ऑडियो में बदलता है। यह पेज Replicate द्वारा उपलब्ध xai/grok-text-to-speech मॉडल चलाता है, फिर सफल आउटपुट Fish Voice स्टोरेज में सेव करता है ताकि अकाउंट का प्लेबैक और डाउनलोड हो।
जो एंडपॉइंट यहाँ कॉल होता है, उसमें पाँच नाम वाली आवाजें, 20 तय भाषाएँ और ऑटो डिटेक्शन, स्पीच-डायरेक्शन टैग, पाँच आउटपुट एनकोडिंग, सैंपल-रेट कंट्रोल, MP3 बिट-रेट कंट्रोल और वैकल्पिक टेक्स्ट नॉर्मलाइज़ेशन है। भाषा सूची में hi शामिल है, इसलिए यह स्टूडियो हिंदी चुन सकता है। इसे किसी मानव सुनवाई परीक्षा के पास होने का दावा न समझें।
यह आधिकारिक xAI वेबसाइट नहीं है। xAI का व्यापक Voice प्रोडक्ट अतिरिक्त आवाजें, भाषाएँ, स्ट्रीमिंग, टाइमस्टैम्प और वॉइस क्लोनिंग बताता है। वे व्यापक क्षमताएँ इस Replicate-आधारित स्टूडियो का वादा नहीं हैं।
कास्ट / 02
एंडपॉइंट पाँच वॉइस आईडी दर्ज करता है। पूरे रेंडर से पहले वही खुलकर बताने वाला वाक्य सुनें, क्योंकि नाम अकेले विषय, भाषा या मिक्स की फिट की गारंटी नहीं देते।
एंडपॉइंट की डिफ़ॉल्ट आवाज, और शुरुआती कास्टिंग पास के लिए सबसे तेज़ तटस्थ शुरुआत।
एक अलग दर्ज विकल्प, जब Eve इच्छित डिलीवरी से न मेल खाए तो तुलना के लिए।
सीधी नैरेशन, प्रोडक्ट लाइन और छोटे प्रॉम्प्ट पर टेस्ट करने लायक दर्ज विकल्प।
एक अलग आवाज, एक जैसे टेक्स्ट और भाषा सेटिंग के साथ साथ-साथ ऑडिशन के लिए।
पाँच-तरफ़ा नियंत्रित कास्टिंग टेस्ट पूरा करने के लिए पाँचवीं दर्ज एंडपॉइंट आवाज।
वर्कफ़्लो / 03
अच्छा Grok TTS वर्कफ़्लो लिखने, परफ़ॉर्मेंस दिशा, तकनीकी डिलीवरी और अंतिम रिव्यू को अलग रखता है।
ठीक वे बोले जाने वाले शब्द से शुरू करें, और वह नाम, संख्या या लंबा वाक्य शामिल करें जो समस्या सबसे पहले दिखाए।
संयम से स्पीच टैग डालें, पाँच आवाजों में से एक चुनें, और उम्मीदवारों की तुलना करते समय वही लाइन रखें।
आसान शेयरिंग के लिए MP3, एडिटिंग के लिए WAV या PCM, और टेलीफ़ोनी कोडेक तभी जब रिसीविंग फ़ोन सिस्टम उन्हें माँगे।
साइन इन करें, क्रेडिट अनुमान की पुष्टि करें, ब्राउज़र में चलने योग्य आउटपुट रिव्यू करें, फिर प्रोडक्शन के लिए अपनी फ़ाइल डाउनलोड करें।
स्पीच टैग स्क्रिप्ट में छोटे परफ़ॉर्मेंस संकेत रखते हैं। केवल वे संकेत इस्तेमाल करें जिन्हें आप टेस्ट रेंडर में सुन और जाँच सकें।
[pause]नतीजा तैयार है। [pause] चलिए इसे देख लें।
विचारों के बीच सोच-समझकर रखा विराम बनाएँ।
[laugh]यह ब्रीफ में नहीं था। [laugh]
जहाँ लाइन सच में माँगे, वहाँ छोटी हँसी टेस्ट करें।
[sigh][sigh] एक और टेक चाहिए।
लाइन से पहले रुख का दिखने वाला बदलाव संकेत दें।
[breath]रुकिए। [breath] ऊपर से शुरू करें।
वाक्य दोबारा लिखे बिना एक छोटा मानवीय ठहराव जोड़ें।
<whisper><whisper> यह हमारे बीच ही रहे।
छोटे, अलग वाक्यांश पर शांत दिशा की ऑडिशन करें।
फ़ॉर्मेट अगले गंतव्य से चुनें, किसी सार्वभौमिक क्वालिटी रैंकिंग से नहीं।
कॉम्पैक्ट प्रीव्यू, रिव्यू लिंक, पॉडकास्ट असेंबली और वीडियो ड्राफ्ट के लिए MP3 चुनें।
इस एंडपॉइंट में बिट-रेट कंट्रोल केवल MP3 पर लागू होता है।
जब एडिटर या ऑडियो वर्कस्टेशन को ब्राउज़र में चलने वाला अनकंप्रेस्ड कंटेनर चाहिए, WAV चुनें।
सैंपल रेट को प्रोडक्शन टाइमलाइन से मिलाकर रखें।
जब आगे का सॉफ़्टवेयर साफ़ तौर पर रॉ पल्स-कोड ऑडियो माँगे, PCM चुनें।
रॉ PCM पहले डाउनलोड के लिए है और टारगेट ऐप में इंपोर्ट सेटिंग माँग सकता है।
उस फ़ोन या IVR सिस्टम के लिए μ-law चुनें जिसके तकनीकी स्पेसिफ़िकेशन में यह कोडेक लिखा हो।
ज़रूरी सैंपल रेट रिसीविंग सिस्टम से पुष्टि करें।
उस टेलीफ़ोनी इंफ़्रास्ट्रक्चर के लिए A-law चुनें जिसे खास तौर पर A-law ऑडियो चाहिए।
डिप्लॉयमेंट स्पेसिफ़िकेशन जाँचे बिना इसे μ-law की जगह न लगाएँ।
प्रोडक्शन / 06
प्रोडक्शन के लिए आवाज और फ़ॉर्मेट चुनने से पहले तीन व्यावहारिक डिलिवरेबल देखें: निर्देशित नैरेशन, मल्टीलिंगुअल एसेट और टेलीफ़ोनी प्रॉम्प्ट।
केस 01हुक को एक नियंत्रित लाइन से कास्ट करें, मुख्य दावे के आसपास पॉज को दिशा दें, रिव्यू फ़ाइल एक्सपोर्ट करें, और केवल वह टेक बदलें जो तस्वीर या मिक्स में फेल हो।
केस 02स्रोत और अनुवादित स्क्रिप्ट जोड़े रखें, घोषित लक्ष्य भाषा चुनें, और हर लोकल की अपनी एसेट एक्सपोर्ट करने से पहले नाम और संख्या रिव्यू करें।
केस 03पूरे ब्रांच रेंडर करें, अवधि और स्पष्टता जाँचें, फिर μ-law या A-law तभी दें जब फ़ोन प्लेटफ़ॉर्म की कोडेक और सैंपल-रेट शर्तें पुष्ट हों।
फ़ैसला / 07
कोई सार्वभौमिक विजेता नहीं है: वे नियंत्रण, वॉइस स्रोत और इंटीग्रेशन मॉडल चुनें जिनकी आपके असली वर्कफ़्लो को ज़रूरत हो।
Grok तब चुनें जब…
आप Replicate का दर्ज पाँच-आवाज एंडपॉइंट ब्राउज़र में चलाना चाहें, स्पीच टैग से दिशा दें, MP3, WAV, रॉ या टेलीफ़ोनी आउटपुट चुनें, और नतीजा Fish Voice हिस्ट्री में रखें।
ElevenLabs तब चुनें जब…
आपका प्रोजेक्ट उसकी बड़ी दर्ज वॉइस लाइब्रेरी, मॉडल चयन, या ElevenLabs वॉइस-क्लोनिंग वर्कफ़्लो पर निर्भर हो। प्रतिबद्ध होने से पहले मौजूदा प्लान और मॉडल दस्तावेज़ जाँचें।
OpenAI तब चुनें जब…
आपका ऐप्लिकेशन पहले से OpenAI API के आसपास बना हो और निर्देश-आधारित स्पीच जनरेशन वही नियंत्रण मॉडल हो जिसकी आपको ज़रूरत है। OpenAI के दस्तावेज़ में मौजूदा मॉडल और आवाज की उपलब्धता पुष्टि करें।
नहीं। Fish Voice, Replicate के ज़रिए उपलब्ध xai/grok-text-to-speech एंडपॉइंट के आसपास एक ब्राउज़र वर्कफ़्लो देता है। xAI और Replicate अपने प्रोडक्ट और एंडपॉइंट दस्तावेज़ के स्रोत बने रहते हैं। पाँच आवाजें हैं, और यह आधिकारिक xAI साइट नहीं है।
इस स्टूडियो में मौजूदा एंडपॉइंट विकल्प Eve, Ara, Rex, Sal और Leo हैं। प्रोडक्शन आवाज चुनने से पहले उम्मीदवारों पर एक जैसी कॉपी सुनें।
एंडपॉइंट चयनकर्ता 20 भाषा विकल्प और ऑटोमैटिक डिटेक्शन सूचीबद्ध करता है। मौजूदा प्रोवाइडर भाषा सूची में hi शामिल है, इसलिए यह स्टूडियो हिंदी चुन सकता है। स्थानीय नाम, संख्या और शब्दावली रिव्यू करते समय स्पष्ट लक्ष्य भाषा चुनें। यहाँ यह दावा नहीं है कि कोई मानव सुनवाई परीक्षा पास हो चुकी है।
कॉम्पैक्ट शेयरिंग के लिए MP3 इस्तेमाल करें, WAV या PCM जब एडिटिंग या सॉफ़्टवेयर वर्कफ़्लो उन्हें माँगे, और μ-law या A-law केवल जब फ़ोन सिस्टम कोडेक निर्दिष्ट करे।
नतीजा प्लेयर MP3 और WAV के लिए उपलब्ध है। PCM, μ-law और A-law डाउनलोड हो सकते हैं, पर उनका प्लेबैक टारगेट सिस्टम की रॉ-ऑडियो सेटिंग पर निर्भर करता है।
हाँ। साइन इन पेड प्रोवाइडर इस्तेमाल की सुरक्षा करता है और Fish Voice को अकाउंट के क्रेडिट, टेक्स्ट सीमा, सेव एसेट के स्वामित्व और जनरेशन हिस्ट्री लागू करने देता है।
एडिटर आपकी स्क्रिप्ट और सेटिंग रखता है। सर्वर मौजूदा असफल-जनरेशन क्रेडिट समाधान पथ पर चलता है और एक कार्रवाई योग्य, गैर-संवेदनशील त्रुटि श्रेणी लौटाता है।
नहीं। वे क्षमताएँ यहाँ लागू Replicate एंडपॉइंट नियंत्रणों से बाहर हैं, भले व्यापक xAI प्रोडक्ट पेज अतिरिक्त वॉइस फ़ंक्शन बताएँ।
सबूत / 10
आधिकारिक दस्तावेज़ इस पेज के दावों और सीमाओं को परिभाषित करते हैं। उपलब्धता बदल सकती है, इसलिए प्रोडक्शन इंटीग्रेशन की योजना से पहले लिंक किया स्रोत देखें।
तैयार / स्टूडियो
उस वाक्य से शुरू करें जिसमें उच्चारण या टाइमिंग का सबसे बड़ा जोखिम हो, फिर स्क्रिप्ट बढ़ाने से पहले आउटपुट रिव्यू करें।