换个角度想
只能读文字的 AI 像隔着电话帮你修电脑:你得把屏幕上的每一行字念给他听,念漏一个他就不知道。多模态 AI 像同事走到你身后直接看屏幕,弹窗、按钮、哪里标红,一眼都看得到。
术语 · AI
Multimodal
不只能读文字,还能看图片、听声音、看视频的模型。截图、照片、录音可以直接发给它,不用先自己转成文字。
图片也被切成词元,和文字一起读
只能读文字的 AI 像隔着电话帮你修电脑:你得把屏幕上的每一行字念给他听,念漏一个他就不知道。多模态 AI 像同事走到你身后直接看屏幕,弹窗、按钮、哪里标红,一眼都看得到。
文字「App 弹了个错,好像是网络什么的,怎么办」
图片📷 报错弹窗截图
文字「这是什么意思,怎么办」
你的一句描述
约 20 个词元,错误码没写进去
截图被切成小块编码
约 1000 个词元,弹窗上每个字都在里面
把截图、照片或录音直接发过去
报错弹窗、看不懂的设置页面、表格截图,直接发图比打字描述更准。
拍下菜单、药品说明书、手写笔记,让它翻译、解释或整理成文字。
开车、做饭腾不出手时直接说话,有的模型还能听出语气、直接用语音回答。
把一张写满数字的财务报表截图发给 AI,让它算出全年合计,结果和你手算的对不上。可能是什么原因?怎么办?
看得见不等于看得准:截图太小、数字太密时,模型可能把某个数认错,算错也就跟着来了。更稳的做法是发原始表格文件,或者先让它把截图里的数字逐行列出来,你核对无误后再让它计算。
看得见不等于看得准。小字、密集的数字、数东西的个数、读指针表,都是多模态模型容易出错的地方,重要的数字要自己核对。截图里如果有别人的姓名、手机号等隐私信息,发送前记得先打码。