Taltolkning och video
Bortom tal in och ut, AiHummer erbjuder två ytterligare mediakapaciteter: taltolkning och videoförståelse. Både körs på gratis/lokala motorer: översättningen sätts samman från STT/TTS-sidvagnen och LLM du redan har, medan videon körs som sin egen sidvagn åtkomlig via URL.
[!NOTE] Talardiarisering och röstkloning är inte en del av produkten — de funktioner togs bort. Om du såg dem i äldre material, planera inte runt dem: röststacken är STT, TTS, rösttur (
/v1/voice/turn), talöversättning och videoförståelse.
Talöversättning
Talöversättning omvandlar ljud på ett språk till talat ljud på ett annat, så att en agent kan serva uppringare på olika språk. Det är en ren översättningspipeline utan agentomgång: den inkommande ljudet transkriberas (STT), texten översätts med en one-shot LLM-completion, och översättningen talas tillbaka (TTS).
audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out
Ingen extra sidovagn behövs: pipelinen använder samma gratis/lokala sidovagnar som röstvändningen — faster-whisper (:8001) och edge-tts (:8002) — plus din konfigurerade LLM-leverantör.
| Artikel | Värde |
|---|---|
| Slutpunkt | POST /v1/voice/translate?target=<lang> |
target parameter |
Mål språk (BCP-47 eller ett vanligt språk namn); krävs |
| Inmatning | Ljud i begärans kropp (Content-Type, standardvärde är audio/ogg) |
| Utdata | Översatt ljud (audio/mpeg) |
| Svarshuvuden | X-Voice-Transcript — källtext, X-Voice-Reply — översättningen |
| Kräver | STT, TTS och en LLM-leverantör konfigurerad |
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg
<binary audio>
Videoförståelse
Videoförståelse extraherar vad ett klipp innehåller genom att demuxa ljud och sampla nyckelbilder med ffmpeg — det finns ingen ML-modell i denna sidovagn; den förbereder ljud och ramar för agentens tur.
| Artikel | Värde |
|---|---|
| Stöds av | ffmpeg (demux + nyckelbilder, ingen ML) |
| Sidecar-port | :8005 |
| Slutpunkt | POST /v1/video/understand |
| Uppkopplad med | AIHUMMER_VIDEO_URL |
Kablar
Talöversättning behöver ingen särskild variabel: den är aktiv när STT, TTS och en LLM-leverantör är konfigurerade. Videoförståelse aktiveras av dess sidovagns-URL — en kataloginställning du ställer in från administrationsgränssnittet (Administration → Inställningar) eller med aihummer settings set (gateway.env är enbart för bootstrap och ignoreras för det); installationsprogrammet som körs på värden kan tillhandahålla det, eller peka på en instans du redan kör.
# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005
[!TIP] Kapaciteterna är oberoende — aktivera endast de du behöver. En distribution som bara behöver transkription och syntes kan köra STT/TTS-paret ensam och lämna videositens sidvagn okonfigurerad.
Vart härnäst
- Standard talväg: Tal in och ut.
- Hur sidovagnar är kopplade och delade: Sidvagnar.