媒体理解
配置了兼容的理解模型后,Anyy 可以把媒体附件作为对话输入。图片、视频和音频是三条独立能力路径,配置其中一种不会自动启用另外两种。
在 Dashboard 添加附件
打开 Dashboard → Chat,选择或创建会话,在发送消息前添加文件。一次上传最多 5 个文件,每个不超过 50 MiB。尚未被消息使用的临时附件会在 24 小时后过期。
附件应配合明确问题:
读取这张截图,按出现顺序列出可见的错误信息。
总结视频中的主要步骤,并标出需要复查的时间点。
可用于理解的格式
| 类型 | 运行时输入 |
|---|---|
| 图片 | JPEG 或 PNG,用于图片理解 |
| 视频 | MP4、WebM 或 QuickTime,用于视频理解 |
| 音频 | 通过已配置的音频/STT 路径先转成文字 |
Dashboard 可以保存其他文件附件,但模型能否理解,取决于媒体类型是否受支持,以及对应能力是否启用。
配置理解模型
在 Dashboard → Model 中设置主模型,以及图片、视频或语音辅助路径。Anyy 会校验所选提供商和模型是否声明了该槽位要求的能力。
认证方式、Fallback 和辅助模型配置见模型与服务商。
处理方式
图片和视频可以配置为优先使用原生理解能力,或先生成有长度限制的摘要;音频采用 transcript-first。失败策略由 Profile 统一决定,例如终止请求,或者在音频转写失败时标注/忽略。
通常不需要在每条消息中选择模式,Anyy 会按当前 Profile 的配置路由。
问题越具体,结果越可验证
图片可要求可见文字、布局或差异;视频可要求时间点和顺序;音频可说明需要逐字稿、摘要、说话人还是行动项。
隐私、延迟与费用
媒体内容可能被发送到所配置的提供商。上传敏感资料前,应了解对方的数据保留和区域条款。大图片、长视频和音频转写也会增加延迟、Token 用量和费用。
故障排查
| 现象 | 检查项 |
|---|---|
| 上传成功但没有理解 | 对应媒体路径是否启用,模型是否声明能力 |
| 图片被拒绝 | 改用 JPEG/PNG,并确认文件没有超过限制 |
| 视频被拒绝 | 改用 MP4/WebM/QuickTime,并选择兼容视频模型 |
| 音频没有转写 | 配置并测试音频/STT 路径 |
| 提供商提示尺寸或上下文超限 | 压缩、裁剪媒体,或改用兼容模型 |