视频加载失败

提示词补完计划 02:上下文与注意力——重要的事要放对位置

1292 字
6 分钟
提示词补完计划 02:上下文与注意力——重要的事要放对位置

上下文窗口:它的工作台就那么大#

上一篇说了,模型没有记忆。它”记住”的东西,全部来自这次请求里塞给它的文本——这个容量上限就是上下文窗口(Context Window)。

模型上下文窗口
GPT-4o128K token
Claude200K token
Gemini1M token

听起来很大?但注意:输入 + 输出共享这个窗口。而且塞得越满,问题越多。

注意力机制:它会”走神”#

Transformer 架构的核心是注意力——模型生成每个词时,会”回头看”上下文里所有的词,给每个词分配一个注意力权重,决定参考谁多一点。

理想很美好,但现实有两个坑:

坑一:距离越远,关注越少#

模型对最近的内容关注最高,对很久以前的内容关注衰减。这就是为什么 RP 玩到 50 轮后,角色会忘记开场时的约定——不是模型不努力,是注意力天然偏向最近。

坑二:Lost in the Middle(中间丢失)#

斯坦福大学 2024 年的研究(Liu et al.)实锤:在长上下文里,模型对开头和结尾的信息回忆最好,中间部分的信息回忆率下降 20-30%。

记忆强度
████ ████
████ ████
██████ ▄▄▄▄▄▄▄▄ ████████
██████ ▄▄▄▄▄▄▄▄▄▄▄▄ ████████
↑开头 ↑中间(弱) ↑结尾

精心设计的 2K token 提示词,效果往往胜过杂乱的 30K token。

新一代模型的注意力不一样了#

上面说的”均匀衰减”规律,适用于传统架构(MHA/GQA,以及 DeepSeek V3 时代的 MLA)。但 2026 年的新旗舰走了两条不同的路:

DeepSeek V4:CSA + HCA 双轨注意力

V4 干脆把 MLA 换掉了,改成两种压缩注意力交错排布:

  • HCA 层(重压缩):把 128 个 token 压成 1 份笔记,做全局速览——建立”整篇文档的地图”
  • CSA 层(稀疏压缩):4 倍压缩 + top-512 检索——在全局理解之上精准定位关键信息
  • 外加 128 token 滑动窗口:最近的内容永远保留原始细节

类比人类读书:先翻目录速览全文(HCA),再精读关键段落(CSA)。KV Cache 压到传统架构的 2%,百万上下文才真正能用。

Kimi K3:KDA + AttnRes

K3 是另一条路线——自研的 KDA(Kimi Delta Attention)混合线性注意力,加上 Attention Residuals:每一层都能从前面所有层里选择性检索信息,而不只是回看原始 token。

对你写提示词意味着什么#

老架构(V3/K2 及更早)新架构(V4/K3)
长上下文中间的信息明显衰减(Lost in the Middle)减轻很多——全局层兜住了结构
中间的精确细节(数值、原文措辞)衰减可能被”速览层”压缩掉细节——粗读记得大概,精读靠检索
局部最近的上下文清晰一样清晰(滑窗保留)

实战结论:首尾放重点的铁律依然成立(精确细节别赌检索),但新架构下”超长上下文中部的剧情背景”被记住的概率高了不少。百万上下文不是噱头了——但细节控的规矩不能松。

实战启示:位置就是权力#

明白了注意力规律,提示词布局就有了策略:

✅ 该做的#

  1. 核心规则放开头(系统提示顶部)——身份、铁律、底线
  2. 当前任务放结尾——用户最新消息天然在最后,模型最关注
  3. 重要设定首尾各放一份——关键规则可以在开头写一遍,结尾用”重申”的方式再点一次
  4. 定期总结——长 RP 里定期把剧情要点浓缩到最近的位置

❌ 别做的#

  1. 把关键设定埋在几千字的中间
  2. 一股脑倾倒所有资料(“多就是好”是幻觉)
  3. 指望模型自己从长篇大论里捞重点

SillyTavern 里的对应#

ST 的提示词结构天然利用了这个规律:

[系统提示] ← 开头:角色定义、规则(高注意力)
[世界书条目] ← 中部:按需注入的背景
[示例对话] ← 中部偏后
[聊天历史] ← 尾部:最近的对话(高注意力)
[用户最新消息] ← 最末:当前焦点(最高注意力)

世界书的”Depth 注入”(插入到倒数第 N 条消息处)就是把设定往高注意力区推的手段——后面第 04 篇会细讲。

小结#

  • 上下文窗口是稀缺资源,不是仓库
  • 注意力向首尾倾斜,中间会”迷失”
  • 布局提示词时:开头放法则,结尾放焦点,中间放可牺牲的细节
  • 少即是多(Less is More)

下一篇进入正题:提示词工程的具体技法。

参考资料#

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

提示词补完计划 02:上下文与注意力——重要的事要放对位置
https://akaka.ccwu.cc/posts/llm-02-context-attention/
作者
安琪
发布于
2026-08-29
许可协议
CC BY-NC-SA 4.0
Profile Image of the Author
阿咔咔
阿咔咔和安琪的小窝。记录生活,分享热爱。
公告
欢迎来到第三新东京市——阿咔咔和安琪的小窝!初号机,启动!
分类
标签
最新动态
站点统计
文章
12
分类
2
标签
20
总字数
16,745
运行时长
0
最后活动
0 天前
站点信息
构建平台
Local
博客版本
Firefly v6.16.5
文章许可
CC BY-NC-SA 4.0