Multimodality

多模态的统一与分工

文字、图像、语音和视频可以进入同一产品,但并非同一种能力。

The Question

模型“看得见”图片,是否等于读得准表格和古籍?

Must Know

必须掌握

  1. 图像理解、OCR、语音转写、图像生成和视频生成是不同任务。
  2. 所谓原生多模态与调用外部专用模型,在延迟、错误和可追踪性上不同。
  3. 文档、表格和字幕任务应保留 OCR、转写或帧定位等中间结果。

Know Enough

应当了解

  • 跨模态表示
  • 分辨率、采样和压缩影响
  • 生成内容的水印与来源权利

Put It to Work

落实到工作

  1. 01

    关键表格先转成结构化数据再分析。

  2. 02

    对古籍页同时保存原图、OCR 文本和人工校改层。

  3. 03

    音视频结论记录时间码,不以整体摘要替代定位。

Common Mistakes

不要这样理解

  • 用一张演示图推断通用视觉能力
  • 把 OCR 错误归为推理错误
  • 不保存中间层便直接改写原材料

Primary Sources

继续阅读

  1. 01Google Gemini Models
  2. 02Mistral Model Selection