多模态
Multimodal
AI 编程也叫:多模态模型、图文理解、识图
一句话:模型不只能处理文字,还能理解图片、截图、设计稿等多种类型的输入,有的还能生成图片或语音。
详细解释
纯文本模型只能「听你描述」,多模态模型还能「看图」。对前端新手来说很实用:一张截图往往比一大段文字更能说清问题,比如「这里的间距不对」「按钮被遮住了」「我想要这种布局」。
常见用法有:把设计稿或参考页面的截图发给 AI 让它照着实现(截图生成代码);把页面错位的截图发给它,让它定位样式问题。
要注意,模型看图也会看错细节,比如具体的像素值、颜色值、小字内容。最好在截图旁补充文字说明,指出你关心的区域;报错信息尽量复制文字原文,而不是只发截图。
怎么跟 AI 说
可以直接贴给 Cursor、Claude Code 等工具,把里面的业务内容换成你自己的。
附图是手机上订单页的截图,红框标出的区域里,价格文字和按钮挤在一起,还超出了卡片右边。请根据截图找出对应组件的样式问题,修改后在 375px 宽的屏幕上也能正常显示,桌面端保持不变。