术语 · AI

多模态

Multimodal

不只能读文字,还能看图片、听声音、看视频的模型。截图、照片、录音可以直接发给它,不用先自己转成文字。

图片也被切成词元,和文字一起读

描述会漏,截图不会
图片和文字一起进入上下文
多模态模型会把图片切成很多小块,每一块转成和文字同一种「语言」的词元。图和字进了同一个上下文窗口,模型就能对照着一起理解。

换个角度想

只能读文字的 AI 像隔着电话帮你修电脑:你得把屏幕上的每一行字念给他听,念漏一个他就不知道。多模态 AI 像同事走到你身后直接看屏幕,弹窗、按钮、哪里标红,一眼都看得到。

打字描述和直接发截图,差在哪?

  1. 你发给 AI 的内容

    文字「App 弹了个错,好像是网络什么的,怎么办」

    你发给 AI 的内容

    图片📷 报错弹窗截图

    文字「这是什么意思,怎么办」

  2. 你的一句描述

    约 20 个词元,错误码没写进去

    截图被切成小块编码

    约 1000 个词元,弹窗上每个字都在里面

  3. 「网络什么的」可能是断网、超时、没权限,它只能挨个猜
    读到弹窗上的「403 Forbidden」:登录状态失效,没有权限
  4. 泛泛先检查 Wi-Fi,再重启 App 试试信息不够,只能给一份通用排查清单
    对症退出账号重新登录回答直接对准了画面里的报错

把截图、照片或录音直接发过去

什么时候会遇到它

  1. 截图提问

    报错弹窗、看不懂的设置页面、表格截图,直接发图比打字描述更准。

  2. 拍照识别

    拍下菜单、药品说明书、手写笔记,让它翻译、解释或整理成文字。

  3. 语音对话

    开车、做饭腾不出手时直接说话,有的模型还能听出语气、直接用语音回答。

想一想

把一张写满数字的财务报表截图发给 AI,让它算出全年合计,结果和你手算的对不上。可能是什么原因?怎么办?

看答案

看得见不等于看得准:截图太小、数字太密时,模型可能把某个数认错,算错也就跟着来了。更稳的做法是发原始表格文件,或者先让它把截图里的数字逐行列出来,你核对无误后再让它计算。

最容易踩的坑

看得见不等于看得准。小字、密集的数字、数东西的个数、读指针表,都是多模态模型容易出错的地方,重要的数字要自己核对。截图里如果有别人的姓名、手机号等隐私信息,发送前记得先打码。

⌘K搜索知识库

最近收录

正在载入知识索引…