Multimodality
多模态的统一与分工
文字、图像、语音和视频可以进入同一产品,但并非同一种能力。
The Question
模型“看得见”图片,是否等于读得准表格和古籍?
Must Know
必须掌握
- 图像理解、OCR、语音转写、图像生成和视频生成是不同任务。
- 所谓原生多模态与调用外部专用模型,在延迟、错误和可追踪性上不同。
- 文档、表格和字幕任务应保留 OCR、转写或帧定位等中间结果。
Know Enough
应当了解
- 跨模态表示
- 分辨率、采样和压缩影响
- 生成内容的水印与来源权利
Put It to Work
落实到工作
- 01
关键表格先转成结构化数据再分析。
- 02
对古籍页同时保存原图、OCR 文本和人工校改层。
- 03
音视频结论记录时间码,不以整体摘要替代定位。
Common Mistakes
不要这样理解
- 用一张演示图推断通用视觉能力
- 把 OCR 错误归为推理错误
- 不保存中间层便直接改写原材料
Primary Sources