सप्त भाषण इन और आउट (STT / TTS)
ऐआईहमर हैंडल्स बॉक्स में और बॉक्स से बाहर भाषण — कोई भुगतान की गई स्पीच API की जरूरत नहीं। आने वाले ऑडियो क्लिप का लिप्यंतरण किया जाता है (STT), टेक्स्ट सामान्य एजेंट टर्न को चलाता है, और उत्तर बोला जाता है (TTS)। दोनों इंजन हैं मुफ्त और स्थानीय और के रूप में चलाएँ साइडकार: ट्रांसक्रिप्शन के लिए faster-whisper और सिंथेसिस के लिए edge-tts।
वॉइस ट्यून कैसे काम करता है
वॉइस टर्न एक सामान्य एजेंट टर्न है जिसमें दोनों सिरों पर ऑडियो होता है:
- गेटवे इनबाउंड ऑडियो को भेजता है एसटीटी साइडकार (
:8001, फास्टर-व्हिस्पर) और टेक्स्ट वापस प्राप्त करता है। - वह पाठ सामान्य फ़ंक्शन-कालिंग टर्न चलाता है — वही राउटर, ऑर्केस्ट्रेटर, उपकरण और स्मृति को एक टेक्स्ट संदेश के रूप में।
- उत्तर पाठ को भेजा जाता है टीटीएस साइडकार (
:8002, edge-tts) और बोली गई ऑडियो कॉल करने वाले को लौटाई जाती है।
यह एकल एंडपॉइंट के रूप में उजागर किया गया है, POST /v1/voice/turn, ताकि कोई चैनल या क्लाइंट ऑडियो सौंप सके और ऑडियो प्राप्त कर सके बिना खुद चरणों का आयोजन किए।
अंत बिंदु
| विधि | अंत बिंदु | उद्देश्य |
|---|---|---|
POST |
/v1/voice/turn |
ऑडियो इन → एजेंट टर्न → ऑडियो आउट |
GET |
/v1/voice/config |
वर्तमान ध्वनि विन्यास (इंजन, ट्यूनिंग नॉब्स) |
POST /v1/voice/turn HTTP/1.1
Host: localhost:8780
Content-Type: application/json
{
"audio": "<base64-encoded clip>",
"format": "wav"
}
[!NOTE] भाषण विशेषताएँ का हिस्सा हैं कोर — वे SIP प्लगइन से जुड़े नहीं हैं। SIP चैनल इसके लिए इन्हीं STT/TTS इंजन का उपयोग करता है
localइंजन, लेकिन आवाज़ इन/आउट किसी भी क्लाइंट के लिए काम करता है जो कॉल करता है/v1/voice/turn.
वॉइस साइडकार्स
| बंदरगाह | साइडकार | इंजन | भूमिका | वायर से जुड़ा हुआ |
|---|---|---|---|---|
| 8001 | एसटीटी | फास्ट-व्हिस्पर | भाषण → पाठ | AIHUMMER_STT_URL |
| 8002 | टीटीएस | एज-टीटीएस | पाठ → वाक् | AIHUMMER_TTS_URL |
दोनों इंजन मुफ्त और स्थानीय हैं: कुछ भी एक भुगतान किए गए स्पीच विक्रेता को नहीं भेजा जाता। हर साइडकार की तरह, गेटवे उन्हें पहुँचता है। यूआरएल द्वारा, ताकि आप उन्हें गेटवे के पास या किसी साझा उदाहरण पर चला सकें।
वायरिंग
होस्ट-नेटिव इंस्टॉलर आपके लिए STT और TTS URL सेट करता है। वे हैं कैटलॉग सेटिंग्स — इन्हें एडमिन UI से बदलें (प्रबंधन → सेटिंग्स) या के साथ aihummer settings set; gateway.env केवल बूटस्ट्रैप-के लिए है और इन्हें अनदेखा किया जाता है:
# Voice in/out (auto-configured by the installer)
aihummer settings set AIHUMMER_STT_URL http://127.0.0.1:8001
aihummer settings set AIHUMMER_TTS_URL http://127.0.0.1:8002
[!TIP] क्योंकि प्रत्येक साइडकार सिर्फ एक URL है, कई गेटवे एक STT/TTS को साझा कर सकते हैं उदाहरण। प्रति चलाने के बजाय भारी भाषण सेवाओं को केंद्रीकृत करें मेज़बान.
ऑडियो पथ को ट्यून करना
वॉइस क्वालिटी नॉब्स में रहते हैं मीडिया · वॉइस सेटिंग्स समूह और इन्हें वेब एडमिन UI से कॉन्फ़िगर किया जा सकता है — पुनः तैनाती की आवश्यकता नहीं। वे रियल-टाइम ऑडियो पथ को कवर करते हैं:
| घुंडी | यह क्या नियंत्रित करता है |
|---|---|
| डुप्लेक्स | पूर्ण-द्विपथ (बोलते समय सुनना) बनाम अर्ध-द्विपथ |
| AEC | ध्वनिक प्रतिध्वनि रद्दीकरण |
| शोर नियंत्रण | STT से पहले पृष्ठभूमि के शोर को फ़िल्टर करता है |
| एजीसी | स्वचालित लाभ नियंत्रण (स्तर सामान्यीकरण) |
| VAD सीमा | वॉइस-गतिविधि संवेदनशीलता |
| बाधा डालना | कॉलर को एजेंट के उत्तर के बीच में बाधा डालने दें |
GET /v1/voice/config प्रभावी कॉन्फ़िगरेशन लौटाता है ताकि एक ग्राहक सक्रिय इंजन और इन सेटिंग्स को खोज सके।
अगला कहाँ
- इन सेवाओं के पीछे परिवहन मॉडल: साइडकार.
- भाषण अनुवाद और वीडियो समझ: भाषण अनुवाद और वीडियो.
- फोन लाइन पर आवाज़: एसआईपी टेलीफ़ोनी.