1. 概述

多模态模型支持处理多种媒体类型,包括:
  1. 视觉理解:理解图片内容、OCR、图像描述。
  2. 视频分析:提取视频帧、理解视频内容、动作识别。
  3. 音频处理:语音识别、音频内容分析。
  4. 多模态融合:同时处理多种媒体类型的综合分析。

2. 支持模型概览

您可以访问 模型广场 查看所支持的多模态模型。

3. 使用方式

3.1 基本消息格式

多模态模型通过 messages 中的 content 字段传入多媒体内容。图片支持两种传入方式: 方式一:公网 URL 公网 URL 必须是模型服务可以直接访问的图片地址。请使用真实图片直链,不要使用 https://example.com/image.jpg 这类占位地址,也不要使用需要登录、带防盗链或会跳转到 HTML 页面的地址。
方式二:本地图片(Base64 编码)

3.2 通用参数说明

提示:支持的图片格式:pngjpg/jpegwebp
排查建议:如果返回 Error while downloading ... Upstream status code: 404,说明模型服务无法下载你传入的图片 URL。请先在浏览器或脚本中确认该 URL 能直接打开图片,并且响应状态码为 200