跳到主要内容

语音与听写

Anyy 把“听懂音频”和“用声音回复”分成两项能力:

  • Speech-to-Text(STT):把会话里的音频附件转成文字;
  • Text-to-Speech(TTS):把 Anyy 的回答生成为音频。

两者可以分别启用,不要求同时配置。

在 Dashboard 中设置

打开 Dashboard → ToolsVoice

TTS 需要选择 Provider/Protocol、Model、Voice、Endpoint、Response Format、Timeout 和最大输入长度。开启自动语音回复前,先使用 Preview。

STT 需要选择 Provider、Model、可选语言、Endpoint 与 Timeout,并用支持的音频样本或 Provider Probe 做验证。

也可以使用 CLI 向导:

anyy tools voice tts
anyy tools voice stt

可用路由类型

语音可以连接受支持的 OpenAI 或 OpenAI-compatible Endpoint。TTS 还可以使用已配置的 Chat Audio 或本地 Command 路由;STT 也支持 Command 路由。Command 会执行 Profile 中准确配置的程序,不能指向未经检查的可执行文件。

转写音频

把支持的 Audio/Voice 文件附在消息中,要求 Anyy 转写或直接回答。文件先进入当前会话的附件作用域,需要转写时再发给配置好的 STT 路由。

Provider 支持时,Language Hint 可以提高准确率;多语言录音不要错误固定成单一语言。

生成语音回复

可以明确要求:

用简短的语音回答,语气平静。

TTS 成功后,Anyy 返回音频附件。能否最终送达取决于当前界面及渠道支持的媒体类型。

自动语音回复

Profile 可以启用 Auto TTS。支持的渠道会话中,/voice 用来管理该会话的语音回复;Weixin 的渠道命令目录包含 /voice

语音模式可能把内容发送给服务商

录音、转写文字或回复文字都可能离开设备。处理敏感音频前,应了解 Provider 的隐私、留存、地区和计费规则。

常见问题

现象检查项
已附音频但没有转写确认 STT 已启用、格式受支持,并通过路由测试
找不到 TTS 工具启用 TTS,并确认 tts Toolset 可用
Voice Preview 失败核对 Endpoint、Credential、Model、Voice 与 Response Format
渠道只收到文字检查 Auto TTS/会话 Voice Mode 与渠道音频投递能力
语音内容被截断检查最大字符数、附件大小和 Timeout