AiHummer
Română
AutentificareCont personal
v1.2.x
{ }Swagger

Traducere vorbită și video

v1.2.x · actualizat 2026-07-05

Dincolo de vorbire în și afară, AiHummer oferă două funcționalități media suplimentare: traducere a discursului și înțelegerea videoclipului. Ambele funcționează pe motoare gratuite/locale: traducerea este realizată din partea STT/TTS și LLM-ul pe care îl ai deja, în timp ce videoclipul rulează ca entitate separată sidecar accesat prin URL.

[!NOTE] Diarizarea vorbitorului și clonarea vocii sunt nu parte din produs — acelea capacitățile au fost eliminate. Dacă le-ai văzut în materialele mai vechi, nu planifica în jurul lor: stiva de voce este STT, TTS, schimbul de voce (/v1/voice/turn), traducerea vorbirii și înțelegerea videoclipurilor.

Traducere a discursului

Traducerea discursului transformă audio-ul într-o limbă în audio vorbit într-o altă limbă, astfel încât un agent să poată deservi apelanți care vorbesc diferite limbi. Este un conducta de traducere pură fără schimbare de agent: audio-ul de intrare este transcris (STT), textul este tradus cu o completare LLM într-o singură încercare, iar traducerea este redată oral (TTS).

audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out

Nu este nevoie de un sidecar suplimentar: pipeline-ul folosește aceleași sidecar-uri gratuite/locale ca și vocea - faster-whisper:8001) și edge-tts (:8002) — plus furnizorul dvs. configurat de LLM.

Articol Valoare
Punct final POST /v1/voice/translate?target=<lang>
target parametru Limba țintă (BCP-47 sau numele unei limbi simple); necesar
Intrare Audio în corpul cererii (Content-Type, implicit la audio/ogg)
Ieșire Audio tradus (audio/mpeg)
Antetele răspunsului X-Voice-Transcript — text sursă, X-Voice-Reply — traducerea
Necesită Furnizor STT, TTS și LLM configurat
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg

<binary audio>

Întelegerea videoclipului

Înțelegerea videoclipului extrage ceea ce conține un clip prin demuxarea audio și eșantionarea cadrelor cheie cu ffmpeg — există niciun model ML în acest sidecar; pregătește audio și cadre pentru runda agentului.

Articol Valoare
Susținut de ffmpeg (demux + cadre cheie, fără ML)
Port sidecar :8005
Punct final POST /v1/video/understand
Conectat cu cablu AIHUMMER_VIDEO_URL

Încărcare cabluri

Traducerea vorbirii nu necesită o variabilă dedicată: este activă odată ce STT, TTS și un furnizor LLM sunt configurate. Înțelegerea videoclipului este activată prin URL-ul său sidecar — a setare catalog setezi din interfața de administrare (Management → Setări) sau cu aihummer settings set (gateway.env este doar pentru bootstrap și este ignorat pentru acesta); instalatorul nativ al gazdei îl poate provisiona sau poate indica către o instanță pe care o rulezi deja.

# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005

[!TIP] Capabilitățile sunt independente — activează doar pe cele de care ai nevoie. O implementare care doar necesită transcriere și sinteză poate rula singur perechea STT/TTS și lăsați video sidecar neconfigurat.

Unde următor?