Traducción de habla y video
Más allá hablar dentro y fuera, AiHummer ofrece dos capacidades adicionales de medios: traducción de discurso y comprensión de video. Ambos funcionan con motores gratuitos/locales: la traducción se ensambla a partir de los sidecars de STT/TTS y el LLM que ya tienes, mientras que el video se ejecuta por sí mismo sidecar alcanzado por URL.
[!NOTE] La diarización del hablante y la clonación de voz son no parte del producto — esos las capacidades fueron eliminadas. Si las viste en material antiguo, no planees alrededor de ellos: la pila de voz es STT, TTS, el turno de voz (
/v1/voice/turn), traducción de discursos y comprensión de videos.
Traducción de discurso
La traducción de voz convierte el audio en un idioma en audio hablado en otro, de modo que un agente puede atender a los llamantes en diferentes idiomas. Es un tubería de traducción pura sin turno de agente: el audio entrante se transcribe (STT), el texto se traduce con una finalización de LLM de una sola vez, y la traducción se reproduce en voz (TTS).
audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out
No se necesita un sidecar adicional: la canalización utiliza los mismos sidecars gratuitos/locales que el turno de voz — faster-whisper (:8001) y edge-tts (:8002) — además de su proveedor de LLM configurado.
| Artículo | Valor |
|---|---|
| Punto final | POST /v1/voice/translate?target=<lang> |
target parámetro |
Idioma de destino (BCP-47 o un nombre de idioma simple); requerido |
| entrada | Audio en el cuerpo de la solicitud (Content-Type, por defecto a audio/ogg) |
| Salida | Audio traducido (audio/mpeg) |
| Encabezados de respuesta | X-Voice-Transcript — texto fuente, X-Voice-Reply — la traducción |
| Requiere | Proveedor de STT, TTS y un LLM configurado |
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg
<binary audio>
Comprensión de video
La comprensión de videos extrae lo que contiene un clip mediante la demultiplexación del audio y el muestreo de fotogramas clave con ffmpeg — hay sin modelo de ML en este sidecar; prepara audio y fotogramas para el turno del agente.
| Artículo | Valor |
|---|---|
| Respaldado por | ffmpeg (demultiplexar + fotogramas clave, sin ML) |
| Puerto de sidecar | :8005 |
| Punto final | POST /v1/video/understand |
| Conectado con | AIHUMMER_VIDEO_URL |
Cableado
La traducción de voz no necesita una variable dedicada: está activa una vez que se configuran STT, TTS y un proveedor de LLM. La comprensión de video se habilita mediante su URL de acompañamiento — una configuración del catálogo configuras desde la interfaz de administración (Gestión → Configuración) o con aihummer settings set (gateway.env es solo para bootstrap y se ignora para ello); el instalador nativo del host puede proveerlo, o señalar a una instancia que ya ejecutes.
# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005
[!TIP] Las capacidades son independientes: habilita solo las que necesites. Una implementación eso que solo necesita transcripción y síntesis puede ejecutar el par STT/TTS solo y deja el video sidecar sin configurar.
¿A dónde vamos ahora?
- La ruta de habla predeterminada: Discurso dentro y fuera.
- Cómo están cableados y compartidos los sidecars: Sidecares.