跳到主要内容

媒体理解

配置了兼容的理解模型后,Anyy 可以把媒体附件作为对话输入。图片、视频和音频是三条独立能力路径,配置其中一种不会自动启用另外两种。

在 Dashboard 添加附件

打开 Dashboard → Chat,选择或创建会话,在发送消息前添加文件。一次上传最多 5 个文件,每个不超过 50 MiB。尚未被消息使用的临时附件会在 24 小时后过期。

附件应配合明确问题:

读取这张截图,按出现顺序列出可见的错误信息。
总结视频中的主要步骤,并标出需要复查的时间点。

可用于理解的格式

类型运行时输入
图片JPEG 或 PNG,用于图片理解
视频MP4、WebM 或 QuickTime,用于视频理解
音频通过已配置的音频/STT 路径先转成文字

Dashboard 可以保存其他文件附件,但模型能否理解,取决于媒体类型是否受支持,以及对应能力是否启用。

配置理解模型

在 Dashboard → Model 中设置主模型,以及图片、视频或语音辅助路径。Anyy 会校验所选提供商和模型是否声明了该槽位要求的能力。

认证方式、Fallback 和辅助模型配置见模型与服务商

处理方式

图片和视频可以配置为优先使用原生理解能力,或先生成有长度限制的摘要;音频采用 transcript-first。失败策略由 Profile 统一决定,例如终止请求,或者在音频转写失败时标注/忽略。

通常不需要在每条消息中选择模式,Anyy 会按当前 Profile 的配置路由。

问题越具体,结果越可验证

图片可要求可见文字、布局或差异;视频可要求时间点和顺序;音频可说明需要逐字稿、摘要、说话人还是行动项。

隐私、延迟与费用

媒体内容可能被发送到所配置的提供商。上传敏感资料前,应了解对方的数据保留和区域条款。大图片、长视频和音频转写也会增加延迟、Token 用量和费用。

故障排查

现象检查项
上传成功但没有理解对应媒体路径是否启用,模型是否声明能力
图片被拒绝改用 JPEG/PNG,并确认文件没有超过限制
视频被拒绝改用 MP4/WebM/QuickTime,并选择兼容视频模型
音频没有转写配置并测试音频/STT 路径
提供商提示尺寸或上下文超限压缩、裁剪媒体,或改用兼容模型