Context & Attention

Token、上下文与长文处理

理解上下文窗口的真正含义,以及“装得下”为什么不等于“用得好”。

The Question

百万 token 窗口是否意味着模型能可靠读完一本书?

Must Know

必须掌握

  1. Token 不是字数;系统提示、历史对话、文件、工具结果和输出都可能占用上下文。
  2. 标称窗口只说明输入上限,不说明模型能均匀记住并使用每个位置的信息。
  3. 长文可靠性来自结构、检索、分段、定位和复核的组合,而不是单纯扩大窗口。

Know Enough

应当了解

  • 注意力的基本直觉
  • 位置与中段信息衰减
  • 缓存、延迟和长上下文成本

Put It to Work

落实到工作

  1. 01

    给长材料加稳定章节编号和段落锚点。

  2. 02

    先做目录与问题清单,再按问题提取证据。

  3. 03

    让模型返回原文位置,并抽查中段和跨章节结论。

Common Mistakes

不要这样理解

  • 以窗口大小直接比较阅读质量
  • 一次塞入全部材料而不给任务结构
  • 用摘要替代需要逐条覆核的原文

Primary Sources

继续阅读

  1. 01Attention Is All You Need
  2. 02Lost in the Middle