AiHummer
中文
登录帐户
v1.2.x
{ }Swagger

语音翻译与视频

v1.2.x · 已更新 2026-07-05

超越 进出语音,AiHummer 提供另外两种媒体功能: 语音翻译视频理解两者都运行在 免费/本地引擎: 翻译是由您已有的 STT/TTS 辅助程序和 LLM 组合而成,而视频则作为独立运行 边车 通过 URL 访问。

[!NOTE] 说话人分离和语音克隆是 产品的一部分——那些 功能已被移除。如果你在旧资料中看到它们,不要计划使用 围绕他们:语音堆栈是语音转文字(STT)、文字转语音(TTS)、语音轮次(/v1/voice/turn), 语音翻译与视频理解。

语音翻译

语音翻译将一种语言的音频转换为另一种语言的语音音频,因此代理可以为不同语言的来电者提供服务。它是一个 纯翻译流程,无代理回合: 输入的音频被转录(STT),文本通过一次性 LLM 完成进行翻译,并将翻译内容以语音形式返回(TTS)。

audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out

不需要额外的 sidecar:该管道使用与语音轮次相同的免费/本地 sidecar — faster-whisper(:8001) 和 edge-tts (:8002) — 外加你配置的 LLM 提供商。

物品 价值
终端 POST /v1/voice/translate?target=<lang>
target 参数 目标语言(BCP-47 或普通语言名称); 必需的
输入 请求正文中的音频(Content-Type,默认为 audio/ogg)
输出 翻译音频(audio/mpeg)
响应头 X-Voice-Transcript — 源文本, X-Voice-Reply —— 翻译
需要 已配置 STT、TTS 和大型语言模型提供商
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg

<binary audio>

视频理解

视频理解通过解复用音频和采样关键帧来提取剪辑所包含的内容 ffmpeg ——那里有 没有机器学习模型 在这个边车中;它为代理回合准备音频和帧。

物品 价值
由……支持 ffmpeg(解复用 + 关键帧,无机器学习)
旁车端口 :8005
终端 POST /v1/video/understand
连接有 AIHUMMER_VIDEO_URL

布线

语音翻译不需要专门的变量:一旦配置了语音转文本(STT)、文本转语音(TTS)和大型语言模型(LLM)提供者,它就会自动启用。视频理解通过其旁车 URL 启用 — 一个 目录设置 你可以从管理员界面设置(管理 → 设置) 或者与 aihummer settings set (gateway.env 仅限引导程序,并被忽略); 主机本地安装程序可以配置它,或者指向你已经运行的实例。

# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005

[!TIP] 这些功能是独立的——只启用你需要的功能。一次部署 只需要转录和合成的可以单独运行STT/TTS组合并 保持视频附属文件未配置。

接下来去哪儿