跳到主要内容

什么是多模态 AI?

多模态 AI 是能接收或生成多种数据类型(如文本、图片、音频或视频)的 AI,而不只限于文本。

有些模型本身就是多模态的;另一些系统则组合多个单一用途的模型,分别处理语音、文本和图片。

工作原理

多模态模型会把各类输入转换为共同的内部形式,因此能同时理解一张照片和一个问题。没有这种模型的系统也可以通过串联模型实现多模态:语音转成文字,针对文字作答,再把回答朗读出来。

示例

  • 询问一张报错截图里出了什么问题。
  • 读取图表或拍下的收据。
  • 和助手说话并听它回答。

局限

  • 模型会误读小字、手写字和杂乱的图片。
  • 串联系统在语音转成文字时会丢失语气和重音。
  • 处理图片和音频比处理文本成本更高。

Venta 如何使用

你拖入对话的图片会发送给能看图的模型。语音双向可用:你说的话会被转写,回复也可以朗读出来。

大家最先问的问题

我可以和 Venta 说话而不是打字吗?
可以。语音可在浏览器、手机和 Windows 应用中使用;语音页面介绍了具体方式。
Venta 能读截图吗?
能。把图片拖入对话并就它提问即可。
多模态 AI 和生成式 AI 是一回事吗?
不是。生成式 AI 指生成新内容;多模态指处理多种数据类型。一个系统可以是其中之一、两者兼有,或都不是。