Traducere vorbită și video
Dincolo de vorbire în și afară, AiHummer oferă două funcționalități media suplimentare: traducere a discursului și înțelegerea videoclipului. Ambele funcționează pe motoare gratuite/locale: traducerea este realizată din partea STT/TTS și LLM-ul pe care îl ai deja, în timp ce videoclipul rulează ca entitate separată sidecar accesat prin URL.
[!NOTE] Diarizarea vorbitorului și clonarea vocii sunt nu parte din produs — acelea capacitățile au fost eliminate. Dacă le-ai văzut în materialele mai vechi, nu planifica în jurul lor: stiva de voce este STT, TTS, schimbul de voce (
/v1/voice/turn), traducerea vorbirii și înțelegerea videoclipurilor.
Traducere a discursului
Traducerea discursului transformă audio-ul într-o limbă în audio vorbit într-o altă limbă, astfel încât un agent să poată deservi apelanți care vorbesc diferite limbi. Este un conducta de traducere pură fără schimbare de agent: audio-ul de intrare este transcris (STT), textul este tradus cu o completare LLM într-o singură încercare, iar traducerea este redată oral (TTS).
audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out
Nu este nevoie de un sidecar suplimentar: pipeline-ul folosește aceleași sidecar-uri gratuite/locale ca și vocea - faster-whisper:8001) și edge-tts (:8002) — plus furnizorul dvs. configurat de LLM.
| Articol | Valoare |
|---|---|
| Punct final | POST /v1/voice/translate?target=<lang> |
target parametru |
Limba țintă (BCP-47 sau numele unei limbi simple); necesar |
| Intrare | Audio în corpul cererii (Content-Type, implicit la audio/ogg) |
| Ieșire | Audio tradus (audio/mpeg) |
| Antetele răspunsului | X-Voice-Transcript — text sursă, X-Voice-Reply — traducerea |
| Necesită | Furnizor STT, TTS și LLM configurat |
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg
<binary audio>
Întelegerea videoclipului
Înțelegerea videoclipului extrage ceea ce conține un clip prin demuxarea audio și eșantionarea cadrelor cheie cu ffmpeg — există niciun model ML în acest sidecar; pregătește audio și cadre pentru runda agentului.
| Articol | Valoare |
|---|---|
| Susținut de | ffmpeg (demux + cadre cheie, fără ML) |
| Port sidecar | :8005 |
| Punct final | POST /v1/video/understand |
| Conectat cu cablu | AIHUMMER_VIDEO_URL |
Încărcare cabluri
Traducerea vorbirii nu necesită o variabilă dedicată: este activă odată ce STT, TTS și un furnizor LLM sunt configurate. Înțelegerea videoclipului este activată prin URL-ul său sidecar — a setare catalog setezi din interfața de administrare (Management → Setări) sau cu aihummer settings set (gateway.env este doar pentru bootstrap și este ignorat pentru acesta); instalatorul nativ al gazdei îl poate provisiona sau poate indica către o instanță pe care o rulezi deja.
# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005
[!TIP] Capabilitățile sunt independente — activează doar pe cele de care ai nevoie. O implementare care doar necesită transcriere și sinteză poate rula singur perechea STT/TTS și lăsați video sidecar neconfigurat.
Unde următor?
- Calea implicită pentru vorbire: Vorbit în și afară.
- Cum sunt conectate și partajate atașurile: Atelaje laterale.