语音与听写
Anyy 把“听懂音频”和“用声音回复”分成两项能力:
- Speech-to-Text(STT):把会话里的音频附件转成文字;
- Text-to-Speech(TTS):把 Anyy 的回答生成为音频。
两者可以分别启用,不要求同时配置。
在 Dashboard 中设置
打开 Dashboard → Tools → Voice。
TTS 需要选择 Provider/Protocol、Model、Voice、Endpoint、Response Format、Timeout 和最大输入长度。开启自动语音回复前,先使用 Preview。
STT 需要选择 Provider、Model、可选语言、Endpoint 与 Timeout,并用支持的音频样本或 Provider Probe 做验证。
也可以使用 CLI 向导:
anyy tools voice tts
anyy tools voice stt
可用路由类型
语音可以连接受支持的 OpenAI 或 OpenAI-compatible Endpoint。TTS 还可以使用已配置的 Chat Audio 或本地 Command 路由;STT 也支持 Command 路由。Command 会执行 Profile 中准确配置的程序,不能指向未经检查的可执行文件。
转写音频
把支持的 Audio/Voice 文件附在消息中,要求 Anyy 转写或直接回答。文件先进入当前会话的附件作用域,需要转写时再发给配置好的 STT 路由。
Provider 支持时,Language Hint 可以提高准确率;多语言录音不要错误固定成单一语言。
生成语音回复
可以明确要求:
用简短的语音回答,语气平静。
TTS 成功后,Anyy 返回音频附件。能否最终送达取决于当前界面及渠道支持的媒体类型。
自动语音回复
Profile 可以启用 Auto TTS。支持的渠道会话中,/voice 用来管理该会话的语音回复;Weixin 的渠道命令目录包含 /voice。
语音模式可能把内容发送给服务商
录音、转写文字或回复文字都可能离开设备。处理敏感音频前,应了解 Provider 的隐私、留存、地区和计费规则。
常见问题
| 现象 | 检查项 |
|---|---|
| 已附音频但没有转写 | 确认 STT 已启用、格式受支持,并通过路由测试 |
| 找不到 TTS 工具 | 启用 TTS,并确认 tts Toolset 可用 |
| Voice Preview 失败 | 核对 Endpoint、Credential、Model、Voice 与 Response Format |
| 渠道只收到文字 | 检查 Auto TTS/会话 Voice Mode 与渠道音频投递能力 |
| 语音内容被截断 | 检查最大字符数、附件大小和 Timeout |