सप्त भाषण इन और आउट (STT / TTS)
ऐआईहमर हैंडल्स बॉक्स में और बॉक्स से बाहर भाषण — कोई भुगतान की गई स्पीच API की जरूरत नहीं। आने वाले ऑडियो क्लिप का लिप्यंतरण किया जाता है (STT), टेक्स्ट सामान्य एजेंट टर्न को चलाता है, और उत्तर बोला जाता है (TTS)। दोनों इंजन हैं मुफ्त और स्थानीय और के रूप में चलाएँ साइडकार: ट्रांसक्रिप्शन के लिए faster-whisper और सिंथेसिस के लिए edge-tts।
वॉइस ट्यून कैसे काम करता है
वॉइस टर्न एक सामान्य एजेंट टर्न है जिसमें दोनों सिरों पर ऑडियो होता है:
- गेटवे इनबाउंड ऑडियो को भेजता है एसटीटी साइडकार (
:8001, फास्टर-व्हिस्पर) और टेक्स्ट वापस प्राप्त करता है। - वह पाठ सामान्य फ़ंक्शन-कालिंग टर्न चलाता है — वही राउटर, ऑर्केस्ट्रेटर, उपकरण और स्मृति को एक टेक्स्ट संदेश के रूप में।
- उत्तर पाठ को भेजा जाता है टीटीएस साइडकार (
:8002, edge-tts) और बोली गई ऑडियो कॉल करने वाले को लौटाई जाती है।
यह एकल एंडपॉइंट के रूप में उजागर किया गया है, POST /v1/voice/turn, ताकि कोई चैनल या क्लाइंट ऑडियो सौंप सके और ऑडियो प्राप्त कर सके बिना खुद चरणों का आयोजन किए।
अंत बिंदु
| विधि | अंत बिंदु | उद्देश्य |
|---|---|---|
POST |
/v1/voice/turn |
ऑडियो इन → एजेंट टर्न → ऑडियो आउट |
GET |
/v1/voice/config |
वर्तमान ध्वनि विन्यास (इंजन, ट्यूनिंग नॉब्स) |
POST /v1/voice/turn HTTP/1.1
Host: localhost:8780
Content-Type: application/json
{
"audio": "<base64-encoded clip>",
"format": "wav"
}
[!NOTE] भाषण विशेषताएँ का हिस्सा हैं कोर — वे SIP प्लगइन से जुड़े नहीं हैं। SIP चैनल इसके लिए इन्हीं STT/TTS इंजन का उपयोग करता है
localइंजन, लेकिन आवाज़ इन/आउट किसी भी क्लाइंट के लिए काम करता है जो कॉल करता है/v1/voice/turn.
वॉइस साइडकार्स
| बंदरगाह | साइडकार | इंजन | भूमिका | वायर से जुड़ा हुआ |
|---|---|---|---|---|
| 8001 | एसटीटी | फास्ट-व्हिस्पर | भाषण → पाठ | AIHUMMER_STT_URL |
| 8002 | टीटीएस | एज-टीटीएस | पाठ → वाक् | AIHUMMER_TTS_URL |
दोनों इंजन मुफ्त और स्थानीय हैं: कुछ भी एक भुगतान किए गए स्पीच विक्रेता को नहीं भेजा जाता। हर साइडकार की तरह, गेटवे उन्हें पहुँचता है। यूआरएल द्वारा, ताकि आप उन्हें गेटवे के पास या किसी साझा उदाहरण पर चला सकें।
वायरिंग
होस्ट-नेटिव इंस्टॉलर आपके लिए STT और TTS URL सेट करता है। वे हैं कैटलॉग सेटिंग्स — इन्हें एडमिन UI से बदलें (प्रबंधन → सेटिंग्स) या के साथ aihummer settings set; gateway.env केवल बूटस्ट्रैप-के लिए है और इन्हें अनदेखा किया जाता है:
# Voice in/out (auto-configured by the installer)
aihummer settings set AIHUMMER_STT_URL http://127.0.0.1:8001
aihummer settings set AIHUMMER_TTS_URL http://127.0.0.1:8002
[!TIP] क्योंकि प्रत्येक साइडकार सिर्फ एक URL है, कई गेटवे एक STT/TTS को साझा कर सकते हैं उदाहरण। प्रति चलाने के बजाय भारी भाषण सेवाओं को केंद्रीकृत करें मेज़बान.
ऑडियो पथ को ट्यून करना
वॉइस क्वालिटी नॉब्स में रहते हैं मीडिया · वॉइस सेटिंग्स समूह और इन्हें वेब एडमिन UI से कॉन्फ़िगर किया जा सकता है — पुनः तैनाती की आवश्यकता नहीं। वे रियल-टाइम ऑडियो पथ को कवर करते हैं:
| घुंडी | यह क्या नियंत्रित करता है |
|---|---|
| डुप्लेक्स | पूर्ण-द्विपथ (बोलते समय सुनना) बनाम अर्ध-द्विपथ |
| AEC | ध्वनिक प्रतिध्वनि रद्दीकरण |
| शोर नियंत्रण | STT से पहले पृष्ठभूमि के शोर को फ़िल्टर करता है |
| एजीसी | स्वचालित लाभ नियंत्रण (स्तर सामान्यीकरण) |
| VAD सीमा | वॉइस-गतिविधि संवेदनशीलता |
| बाधा डालना | कॉलर को एजेंट के उत्तर के बीच में बाधा डालने दें |
GET /v1/voice/config प्रभावी कॉन्फ़िगरेशन लौटाता है ताकि एक ग्राहक सक्रिय इंजन और इन सेटिंग्स को खोज सके।
अपने आप ध्वनि में जवाब
तैयार जवाब कब बोला जाए, यह «Media · Voice» समूह की तीन सेटिंग तय करती हैं (वेब इंटरफ़ेस → प्रबंधन → सेटिंग):
| सेटिंग | कुंजी | मान |
|---|---|---|
| अपने आप ध्वनि में जवाब | AIHUMMER_TTS_AUTO_REPLY |
off — कभी नहीं; always — हमेशा; inbound (डिफ़ॉल्ट) — केवल आने वाले ऑडियो के जवाब में; tagged — एजेंट के स्पष्ट ध्वनि चिह्न पर |
| बोले जाने वाले जवाब की अक्षर सीमा | AIHUMMER_TTS_MAX_CHARS |
0 (डिफ़ॉल्ट) — पूरा जवाब बोलना; 100–10000 — बोले जाने वाले पाठ की सीमा |
| लंबे ध्वनि जवाबों का सारांश | AIHUMMER_TTS_SUMMARIZE |
डिफ़ॉल्ट रूप से चालू: लंबा जवाब मॉडल द्वारा सीमा तक छोटा किया जाता है; मॉडल उपलब्ध न हो तो पाठ की शुरुआत बोली जाती है |
जवाब का पूरा पाठ हर मोड में संवाद इतिहास में रहता है। off केवल स्वचालित
बोलना बंद करता है — tts उपकरण से स्पष्ट संश्लेषण अनुरोध पहले की तरह काम
करता है।
किसी एक संवाद के लिए एजेंट वार्ताकार के अनुरोध पर इन मानों को
voice_preferences (प्रभावी मान पढ़ना) और set_voice_preferences (auto,
max_chars, summarize सेट करना; खाली ऑब्जेक्ट इंस्टेंस के डिफ़ॉल्ट लौटाता है)
उपकरणों से ओवरराइड कर सकता है। लिखना केवल संवाद के प्रतिभागी को उपलब्ध है।
ध्वनि आउटपुट गेटवे शुरू होने के बाद जुड़े प्रदाता को अपनाता है और विशिष्ट
उपयोगकर्ता की सेटिंग को ध्यान में रखता है।
अगला कहाँ
- इन सेवाओं के पीछे परिवहन मॉडल: साइडकार.
- भाषण अनुवाद और वीडियो समझ: भाषण अनुवाद और वीडियो.
- फोन लाइन पर आवाज़: एसआईपी टेलीफ़ोनी.