CCA 领域 4 复习技巧:Prompt Engineering 精通
CCA 领域 4(Prompt Engineering)复习技巧:25 篇文章按什么顺序读、提示词 / schema / 代码三层怎么分、要背什么、怎么练。
更新于
复习领域 4(Prompt Engineering & Structured Output,占 CCA-F 的 20%)的方法是:分四次按任务顺序读完 25 篇文章,并且对每一个场景都问一句:这个修法属于哪一层——提示词、schema,还是调用周围的代码?光这一个习惯就能答对大多数领域 4 的题。这篇文章给你阅读顺序、“该背 vs 该推理”的划分、练习节奏、自测题和值得复盘两遍的错误。
至于领域 4 覆盖什么、为什么权重是 20%,请看CCA 领域 4 详解。本文只讲怎么学。
领域 4 的文章按什么顺序读?
领域 4 学习指南页上的任务顺序就是对的。建议分成四次:
| 学习次数 | 文章 | 目标 |
|---|---|---|
| 1 | 任务 4.1 和 4.2:“保守一点”等于没说——47% 一致率。“缺少样本量”才有意义——94%。、一个 60% 误报率的类别,让开发者连 95% 准确率的也不看了、只有标签:41%。加文字条件:72%。文字+代码示例:94%。、纯文字指令做到 64%。两个示例做到 91%。、3 个多样化示例打败 8 个同质化示例、few-shot 幻觉、配对的 REPORT + SKIP 示例:67% → 94% 边界准确率 | 把一条含糊的判据改写成可验证的条件;设计一组带边界案例的三示例集 |
| 2 | 任务 4.3:tool_use 消灭了结构错误。语义错误还在。、Forced、Any、Auto——三种模式,三种保证,三种失败方式、必填字段遇上可选数据:幻觉的头号结构性成因、没有格式规则,同一个日期能输出三种写法 | 写一个带一个 nullable 字段和一个 enum 的 schema,并说出你会用哪种 tool_choice 模式 |
| 3 | 任务 4.4:盲目重试:3 次修了 12%。带错误反馈:1 次修了 87%。、对缺失数据重试会导致幻觉——格式错误会收敛,缺失数据会发散、置信度分流、Schema 说合法。行项目加起来不等于总计。两个都是事实。 | 把五个示例失败分类为格式、结构、缺失或歧义 |
| 4 | 任务 4.5 和 4.6:省 50% 成本——但最多等 24 小时、custom_id、batch 错误、过期、成本优化、全量提交前永远先抽样测试——18% 失败 vs 3%、同会话审查:0.3 条发现。独立实例:3.7 条。人类基线:4.1 条。、逐文件与跨文件两轮、独立实例、按类别校准置信度——“HIGH”在风格检查里是 92%,在安全检查里是 70% | 勾勒一个带有意义 custom_id 和重提规则的 batch 任务;勾勒一个两次调用的审查 |
第二次学习之前,重读 Foundations 的虚拟工具:借 tool_use 拿到保证格式的 JSON和required、nullable 和 enum:塑造输出的 Schema 特性。两篇都短,能让任务 4.3 一下子落地。
哪些该背,哪些该靠推理?
要背的:
- 三种
tool_choice的保证:强制指定的工具一定会被调用;any一定会调用某个工具;auto可能返回文本。 - Nullable 写法:
"type": ["string", "null"],并把字段从required里移除。 - Schema 约束压过提示词指令和 few-shot 例子。Schema 要求字符串,提示词怎么写都产生不了 null。
- 重试分类学:格式和结构错误在具体反馈下会收敛;缺失数据会发散(每次重试一个不同的值);歧义数据给一次消歧重试,然后加限定语。
- Batch 的形状:约半价、最长 24 小时、结果乱序、
custom_id是唯一的关联手段(结果以任意顺序返回——custom_id 是你唯一的关联手段)、不支持多轮工具调用、结果会过期(轮询、下载、本地存储——结果 29 天后过期)。 - 独立审查的意思是:单独一次调用,上下文里只有产物和判据,没有生成时的提示词。
要推理的:
- 这条判据可验证吗?如果一位讲理的同事可能对它是否适用有不同看法,它就是含糊的。用条件替换形容词。
- 例子覆盖边界了吗?多样化的例子,包含一个 SKIP 或反例,至少一个展示 null 字段。
- 哪一层能修?含糊是提示词层;形状是 schema 层;跨字段一致性、重试和成本是代码层。
- 重试还是接受 null?问一句:反复尝试会收敛吗?
- 同步还是 batch?延迟容忍以小时计、单轮请求就用 batch;任何交互式或要调工具的都留在同步。
- 同会话还是独立?如果审查者能看到代码为什么这么写,发现就会被压制(哪怕只是生成 Prompt 里的设计目标,也会压制审查发现)。
标题里的百分比说明的是方向。考试不考数字。
领域 4 用什么练习节奏?
- 每次学习之后,做 15 到 20 道领域 4 练习题。揭晓之前先写下你认为答案所在的层(提示词、schema、代码)。追踪你判断错层的次数;到第四次学习时这个数应该接近零。
- 第四次学习之后,做一组 40 题的题块。领域 4 的干扰项很细(一个”加一句指令”的选项常常听起来合理但是错的),长题块能帮你察觉这个模式。
- 每隔几天回顾错题。 反复出现的是用加重语气代替 schema 修改、对缺失数据重试、忘了
auto可以返回文本。 - 最后一周:免费 CCA-F 模拟考的 60 题里大约会有 12 道领域 4(报名前请到 Anthropic / Pearson VUE 官方页面核对当前权重)。
进入下一领域前的自测题
- 一个分类器的多次运行一致率不到 50%。最可能的原因和修法是什么?
- 八个 few-shot 例子全是几乎一样的正例。有哪两个问题?
warranty_expiry是必填字符串,文档里没有保修信息。模型会怎么做,怎么修?- 你有三个抽取 schema,而且必须始终拿到结构。用哪种
tool_choice模式? - 一个 license 字段重试三次分别得到 MIT、Apache-2.0、BSD。这说明什么?
- 一张 JSON 发票通过了 schema,但行项目之和不等于总计。哪一层校验能抓住它?
- 1,000 个 batch 请求成功了 985 个。你重新提交什么,先检查什么?(940 成功,45 出错,15 过期——只重新提交这 60 个、不同错误需要不同修复——别重新提交整个 Batch)
- 让同一个会话”严格审查”几乎什么也查不出。为什么,怎么修?
值得复盘两遍的错误
- 把指令改成大写,就指望得到结构层面的保证。
- 把 schema 合法的输出当成正确的输出。
- 加更多同类例子,而不是更多样的例子(每个示例都填满了所有字段——于是模型开始编造缺失的字段)。
- 对原文里根本不存在的数据,在重试提示词里不断加码催促。
- 给审查规定最少发现数量,结果产出编造的问题。
- 按领域 4 的方式用置信度门控输出,却没有补上能修正底层校准问题的 SKIP 例子(追踪开发者驳回了哪些模式——然后加 SKIP 示例)。
下一步
今天就从领域 4 学习指南页开始第一次学习,一周内做完领域 4 练习集,并记录每个答案落在哪一层。然后读CCA 考试反模式了解跨领域的干扰项,正确率稳住之后去做免费 CCA-F 模拟考。
常见问题
领域 4 主要考的是怎么把提示词写好吗?
expand_more
只占大约三分之一。剩下的是通过 tool_use 强制 schema、重试策略、Batch API 和多轮审查。只准备提示词措辞的考生,往往在 schema 和重试的题上丢分。
领域 4 有多少篇文章,要花多久?
expand_more
六个任务共 25 篇。通常是四次一小时左右的学习加练习。任务 4.3(结构化输出)和任务 4.4(重试)值得花最多时间,因为它们的区分最细。
需要背 Batch API 的限制吗?
expand_more
记住大致形状就行:约半价、最长 24 小时、结果乱序、结果在保留窗口后过期、不支持多轮工具调用。考试考的是你会不会选 batch、怎么处理部分失败,不是精确数字。
动手练起来
做一套免费 60 题 Claude Certified Architect 模拟考,或按领域逐个啃 CCA-F 学习指南。
Certified Architect 是社区独立搭建的备考站点。文中考试信息来自 Anthropic / Pearson VUE 的公开资料,随时可能调整,报名前请以官方页面为准。