CCA 领域 5 复习技巧:Context Management 与可靠性
CCA 领域 5(Context Management 与可靠性)复习技巧:31 篇文章按什么顺序读、六条一句话原则怎么用、要背什么、怎么练。
更新于
领域 5(Context Management & Reliability,占 CCA-F 的 15%)放到最后学,分四次,按任务顺序读完 31 篇文章,并把它们归到六条你能随口背出的一句话原则之下:数字死在摘要里、注意力是 U 形的、按可观察条件升级、组件之间的错误要有结构、具体性随时间衰减、聚合掩盖失败。这篇文章给你阅读顺序、“该背 vs 该推理”的划分、练习节奏、自测题和值得复盘两遍的错误。
至于领域 5 覆盖什么、为什么权重是 15%,请读CCA 领域 5 详解。本文只讲怎么学。
领域 5 的文章按什么顺序读?
按领域 5 学习指南页的任务顺序。建议分成四次:
| 学习次数 | 文章 | 目标 |
|---|---|---|
| 1 | 任务 5.1:“$127.50 退款”变成了”客户请求退款”——结果处理了 $50、来源 1-2:96%。来源 5-6:52%。来源 9-10:94%。U 形注意力曲线。、返回 40 个字段,需要 5 个——4 次调用就把上下文撑满了,本该能撑 11 次、API 不记得你的对话——你必须每次都发送完整历史、case-facts 追踪器、没有 Tracker 时 28% 的问题被遗漏。有 Tracker 后:3%。、2,800 Token 的推理链 → 280 Token 的结构化事实。同样的发现,1/10 的上下文。 | 给一段示例客服对话写一个 case_facts 块 |
| 2 | 任务 5.2 和 5.3:基于情绪的升级:40% 的量,30% 需要人工。换掉它。、立即升级、高置信度(0.9+):12% 出错。低置信度(<0.5):68% 正确。这个信号坏了。、多匹配消歧、政策空白、通用的”失败”→ 18% 恢复率。结构化错误 → 71%。、下线的数据库、静默吞掉、访问失败 vs 空结果、“AI 对表演艺术影响很小”——其实是搜索超时了 | 不看笔记列出四个可靠触发条件和两个不可靠的 |
| 3 | 任务 5.4:第 0 分钟:“src/auth/jwt.ts:12 → verifyJWT()“。第 45 分钟:“典型的 JWT 验证模式”。、Scratchpad:在上下文遗忘之前把发现写下来、子代理委派:让别人来装数据、崩溃恢复:一个 Manifest 文件让你不用从头开始、保存、压缩、恢复:/compact 的三步工作流 | 说清四种对策以及各自适用的场合 |
| 4 | 任务 5.5 和 5.6:96% 准确率,升级多了 40%:为什么聚合指标在骗人、分层抽样:为什么随机监控漏掉了最重要的问题、字段级置信度:审查不确定的字段,不是整份文档、置信度校准:模型说 0.9——这到底意味着什么?、每条事实都需要一个回溯地址、数据冲突:两个都保留,一个都别编、时间元数据、已确立 vs 有争议、格式匹配 | 给你两个互相冲突的数字,写出正确的一句话输出 |
如果你还没学领域 1 和 2,先学它们。领域 5 的题默认你已经懂子代理的上下文隔离和 isError 的区分。
哪些该背,哪些该靠推理?
要背的:
- 摘要留存的方向:情绪和类别活下来;精确金额、日期和 ID 大多活不下来。修法:一个永远不被压缩的持久化结构化事实块。
- 注意力是 U 形的;中间的来源被吸收的比例大约只有一半;窗口大小修不好它;标题加一段前置摘要能修。
- 可靠的升级触发条件:明确要求人工、政策空白、两次尝试后没有进展、需要政策例外。不可靠的:负面情绪、模型置信度低。
- 两条客户记录都匹配时,要求提供一个消歧信息,绝不自动选(自动选”最近活跃”:27% 选错人。要求提供邮箱:2%。)。
- 访问失败是错误,不是空结果,接口两侧都是。
/compact工作流:把发现存进文件,压缩,再读文件恢复。- 冲突要带归因和日期保留下来;取平均等于编造。
要推理的:
- 摘要丢了什么?找一个用了错误数字或 ID 的下游动作。
- 这个升级触发条件可观察吗?取决于情绪或置信度分数的,就不可观察。
- 错误该在哪里处理?临时且有限的就地处理;会改变编排器该做什么的,就带结构向上传播(两种反模式叠加:35% 的报告有隐藏缺口,25% 的查询被直接杀掉)。
- 这是退化还是任务本身难?具体性随时间下降而不是随难度下降,就是退化;上 scratchpad 和委派。
- 聚合数字藏了什么?信任一个总体数字之前,先按类别和字段拆开。
- 这是矛盾,还是时间、范围或方法上的差异?判定为冲突之前先查元数据(时间元数据:不是每个差异都是矛盾)。
和其他领域一样,文章标题里的百分比说明方向,不是考试事实。
领域 5 用什么练习节奏?
- 每次学习之后,做 15 道领域 5 练习题。揭晓之前先从本文开头那六条原则里说出对应的一条。如果正确答案依赖的是你没说出的原则,重读那个任务。
- 第四次学习之后,做一组 30 题的题块。领域 5 的情景比平均更长,用这个题块专门练习读症状的时间线(第 30 轮、第 45 分钟、摘要之后),而不是读系统的设计。
- 每周回顾错题。 常见的有:按情绪升级、以为更大的上下文能修好注意力、把冲突的数字取平均。
- 最后一周:免费 CCA-F 模拟考的 60 题里大约会有 9 道领域 5(报名前请到 Anthropic / Pearson VUE 官方页面核对当前权重)。
进入下一领域前的自测题
- 摘要之后 agent 处理了 50 美元退款而不是 127.50 美元。丢了什么,怎么防?
- 十个来源拼接在一起。哪些位置有风险,哪两个改动最有帮助?
- 客户第一句话就说”我要找人”。agent 该怎么做,为什么不先尝试解决?(“我要找人”→ 先尝试解决 → CSAT 2.1。立即升级 → 3.8。)
- 子代理报告”数据库错误”;编排器对一个已下线的系统重试了五次。缺了什么?(“数据库错误”——编排器重试了 5 次。数据库早就永久下线了。)
- 一份报告说”不存在相关研究”,其实是搜索超时了。报告应该怎么写?
- 到第 45 分钟,一个探索 agent 开始和自己早先的发现矛盾。说出两个对策。
- 总体准确率 97%,但一个占 10% 的类别只有 72%。监控本该怎么设计?
- 两个来源分别说 35% 和 42%。正确的输出是什么?
值得复盘两遍的错误
- 用增大上下文窗口来修 lost-in-the-middle。
- 把”客户好像生气了”当成升级规则。
- 没有校准数据就相信一个 0.9 的置信度(置信度校准:模型说 0.9——这到底意味着什么?)。
- 质量监控用随机抽样,稀有类别永远查不到。
- 挑”最新”或”最权威”的数字,而不是两个都展示。
- 把分析写进表格、把数字写成散文(内容类型与格式匹配:数字用表格,分析用散文)。
下一步
领域 1 和 2 做完之后,从领域 5 学习指南页开始第一次学习,一周内做完领域 5 练习集。它是最后一个领域,所以紧接着就做免费 CCA-F 模拟考,再用领域权重与复习策略决定剩下的复习时间往哪投。
常见问题
领域 5 短,是不是应该先学?
expand_more
不,放最后学。它复用领域 1 和 2 里的结构化错误和子代理概念,那两个到位之后学起来快得多;而且它只占 15%,不该在早期挤占更重的领域。
领域 5 有多少篇文章?
expand_more
我们的学习指南里有 31 篇,是所有领域里最多的,但它们分成六个任务,很多是共享同一条原则的短案例。分四次学习是比较舒服的节奏。
Prompt caching 属于领域 5 吗?
expand_more
它不是学习指南的重点。考的内容是摘要丢什么、升级触发条件、组件间的错误结构、上下文退化、监控和溯源。用得上 caching 就去 API 文档学,但别指望它在领域 5 的题里占大头。
动手练起来
做一套免费 60 题 Claude Certified Architect 模拟考,或按领域逐个啃 CCA-F 学习指南。
Certified Architect 是社区独立搭建的备考站点。文中考试信息来自 Anthropic / Pearson VUE 的公开资料,随时可能调整,报名前请以官方页面为准。