Context & Attention
Token、上下文与长文处理
理解上下文窗口的真正含义,以及“装得下”为什么不等于“用得好”。
The Question
百万 token 窗口是否意味着模型能可靠读完一本书?
Must Know
必须掌握
- Token 不是字数;系统提示、历史对话、文件、工具结果和输出都可能占用上下文。
- 标称窗口只说明输入上限,不说明模型能均匀记住并使用每个位置的信息。
- 长文可靠性来自结构、检索、分段、定位和复核的组合,而不是单纯扩大窗口。
Know Enough
应当了解
- 注意力的基本直觉
- 位置与中段信息衰减
- 缓存、延迟和长上下文成本
Put It to Work
落实到工作
- 01
给长材料加稳定章节编号和段落锚点。
- 02
先做目录与问题清单,再按问题提取证据。
- 03
让模型返回原文位置,并抽查中段和跨章节结论。
Common Mistakes
不要这样理解
- 以窗口大小直接比较阅读质量
- 一次塞入全部材料而不给任务结构
- 用摘要替代需要逐条覆核的原文
Primary Sources