AiHummer
Norsk
Logg påKonto
v1.1.x
{ }Swagger

Taletolkning og video

v1.1.x · oppdatert 2026-07-05

Bortenfor tale inn og ut, AiHummer tilbyr to ekstra mediefunksjoner: taletolkning og videoforståelse. Begge kjører på gratis/lokale motorer: oversettelsen settes sammen fra STT/TTS-sidevognene og LLM-en du allerede har, mens videoen kjører som sin egen sidevogn nådd via URL.

[!NOTE] Høyttalerdialysering og stemmekloning er ikke en del av produktet — de funksjoner ble fjernet. Hvis du så dem i eldre materiale, ikke planlegg rundt dem: stemmestakken er STT, TTS, stemmesvingen (/v1/voice/turn), taleoversettelse og videoforståelse.

Taletolking

Taleoversettelse gjør lyd på ett språk om til talelyd på et annet, slik at en agent kan betjene innringere på tvers av språk. Det er en ren oversettelsesprosess uten agentvending: den innkommende lyden blir transkribert (STT), teksten blir oversatt med en éngangs LLM-utførelse, og oversettelsen blir lest opp (TTS).

audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out

Ingen ekstra sidecar er nødvendig: pipeline bruker de samme gratis/lokale sidecarene som stemmesvingen — faster-whisper (:8001) og edge-tts (:8002) — pluss din konfigurerte LLM-leverandør.

Vare Verdi
Endepunkt POST /v1/voice/translate?target=<lang>
target parameter Mål språk (BCP-47 eller et vanlig språk navn); påkrevd
Inndata Lyd i forespørselens kropp (Content-Type, standardinnstillinger til audio/ogg)
Utdata Oversatt lyd (audio/mpeg)
Svaroverskrifter X-Voice-Transcript — kilde tekst, X-Voice-Reply — oversettelsen
Krever STT, TTS og en LLM-leverandør konfigurert
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg

<binary audio>

Videoforståelse

Videoforståelse utvinner hva en video inneholder ved å demuxe lyd og prøve ut nøkkelrammer med ffmpeg — det er ingen ML-modell i denne sidekaren; den forbereder lyd og rammer for agentens tur.

Vare Verdi
Støttet av ffmpeg (demux + nøkkelrammer, ingen ML)
Sidecar-port :8005
Endepunkt POST /v1/video/understand
Kablet med AIHUMMER_VIDEO_URL

Ledningsføring

Taleoversettelse trenger ingen dedikert variabel: den er aktiv så snart STT, TTS og en LLM-leverandør er konfigurert. Videoforståelse aktiveres via sin sidecar-URL — en kataloginnstilling du setter fra admin UI (Administrasjon → Innstillinger) eller med aihummer settings set (gateway.env er bare bootstrap og ignoreres for det); vertens native-installer kan provisionere det, eller peke på en instans du allerede kjører.

# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005

[!TIP] Funksjonene er uavhengige — aktiver bare de du trenger. En distribusjon som bare trenger transkripsjon og syntese kan kjøre STT/TTS-paret alene og la videosidevognen være ukonfigurert.

Hvor til neste