CCA 领域 4 详解:Prompt Engineering 与结构化输出
CCA 领域 4 prompt engineering 与结构化输出考什么:具体判据、few-shot、tool_use schema、重试与 Batch API,附情景题和陷阱。
更新于
CCA-F 考试的领域 4 叫 Prompt Engineering & Structured Output,占总分 20%。它考的是你知不知道提示词能塑造什么、只有 schema 才能保证什么。具体判据胜过形容词,几个精心挑选的例子胜过成段的指令,tool_use 消灭结构错误但消灭不了语义错误,对缺失的数据反复重试只会编造出答案而不是找到答案。
这篇文章会讲领域 4 包含什么、为什么占五分之一、必须烂熟的概念、题目怎么出、一道完整情景题的推理,以及常见陷阱。内容建立在我们 25 篇文章的领域 4 学习指南之上,每个观点都链到来源文章。
CCA 领域 4 考什么?
六个任务,各有一篇入门文章:
| 任务 | 考点 | 从这里开始 |
|---|---|---|
| 4.1 具体判据与规则 | 用可验证的条件替换含糊的修饰词;严重度定义 | ”保守一点”等于没说——47% 一致率。“缺少样本量”才有意义——94%。 |
| 4.2 Few-shot 校准 | 多样化示例、成对的正反例、格式一致性 | 纯文字指令做到 64%。两个示例做到 91%。 |
| 4.3 通过 tool_use 拿结构化输出 | Schema 强制、tool_choice 模式、nullable 字段、封闭 enum | tool_use 消灭了结构错误。语义错误还在。 |
| 4.4 语义校验与重试 | Schema 之外的校验、纠错反馈、缺失数据分类 | 盲目重试:3 次修了 12%。带错误反馈:1 次修了 87%。 |
| 4.5 Batch API | 什么时候批处理、custom_id、部分失败、结果过期 | 省 50% 成本——但最多等 24 小时 |
| 4.6 多轮审查 | 独立审查实例、逐文件与跨文件两轮 | 同会话审查:0.3 条发现。独立实例:3.7 条。人类基线:4.1 条。 |
如果你还不熟悉”用 tool_use 拿结构化输出”这个机制,Foundations 的虚拟工具:借 tool_use 拿到保证格式的 JSON一页就把这个技巧讲清楚了。
领域 4 为什么占 20%?
因为大多数生产环境的 Claude 工作负载都是抽取、分类或审查,这三类活的生死都系于两件事:判据够不够具体、能不能被一致地执行;输出结构够不够可靠、能不能被解析。考纲给领域 4 五分之一的分量,是因为这些决策每个项目都要做,而且失败模式(编造出的必填字段、发散的重试、什么也查不出的自我审查)既昂贵又常见。按 60 题的试卷算大约 12 题(报名前请到 Anthropic / Pearson VUE 官方页面核对当前权重)。
必须烂熟的概念
含糊的词会从多种合理解释里随机采样。 “保守一点”的多次运行一致率是 47%;“当方法论缺少样本量或对照组时标记”是 94%。严重度标签需要文字条件加代码示例(只有标签:41%。加文字条件:72%。文字+代码示例:94%。)。而且只要有一个类别噪声大,开发者就会连带无视一个本来很准的审查器(一个 60% 误报率的类别,让开发者连 95% 准确率的也不看了)。
Few-shot 是校准,不是装饰。 三个多样化的例子胜过八个相似的(3 个多样化示例打败 8 个同质化示例)。如果每个例子都把所有字段填满了,模型就会给缺失的字段编一个(每个示例都填满了所有字段——于是模型开始编造缺失的字段)。用成对的 REPORT 和 SKIP 例子教会模型边界在哪(配对的 REPORT + SKIP 示例:67% → 94% 边界准确率)。
tool_use 保证形状,不保证真假。 强制工具调用总能返回符合 schema 的合法 JSON;但内容仍然可能是错的。三种 tool_choice 各保证什么要记牢(Forced、Any、Auto——三种模式,三种保证,三种失败方式):单 schema 流水线用强制指定,必须始终产出结构的多 schema 流水线用 any,只有部分输入确实该返回文本时才用 auto。
可选数据上的必填字段会引发幻觉。 如果 warranty_expiry 是必填的而文档里根本没有,模型就会发明一个。改成 ["string","null"],并从 required 里去掉(必填字段遇上可选数据:幻觉的头号结构性成因)。封闭 enum 能防止同一个日期以三种写法出现(没有格式规则,同一个日期能输出三种写法)。
重试之前先给错误分类。 格式错误在纠错反馈下会收敛;缺失数据错误会发散(每次重试编出一个不同的值)。第一种带着具体错误信息重试;第二种接受 null(对缺失数据重试会导致幻觉——格式错误会收敛,缺失数据会发散)。再加上 schema 表达不了的跨字段检查,比如行项目之和要等于总计(Schema 说合法。行项目加起来不等于总计。两个都是事实。)。
Batch 是成本杠杆,代价是延迟。 大约半价、最长 24 小时、不支持多轮工具调用、结果乱序返回,所以 custom_id 是唯一的关联手段(结果以任意顺序返回——custom_id 是你唯一的关联手段)。只重新提交失败的条目,而且先看清它们为什么失败(940 成功,45 出错,15 过期——只重新提交这 60 个)。
同会话自我审查几乎不算审查。 生成时的推理还在上下文里,模型会为自己的选择辩护。只拿到产物和判据的独立实例,发现数量接近人类水平(单轮审查 13+ 文件:43% 检出率。多轮:86%。)。
考试怎么考领域 4?
题目会给一条抽取或审查流水线、一个测出来的症状和四种修法。常见形态:
- “同一份文档这一轮评为高质量,下一轮评为低质量。“(判据含糊;换成可验证的条件。)
- “模型大约八次里有一次返回文本而不是调用抽取工具。“(
tool_choice: auto;改成any或强制指定工具。) - “没有 PO 号的文档,输出里却有 PO 号。“(可选数据上的必填字段;改成 nullable,并且别再对它重试。)
- “用’再试一次’重试只修好了 12% 的失败。“(把具体的校验错误反馈回去。)
- “每晚分类 5 万份文档太贵了。“(Batch API,预算按满 24 小时算,先抽样测试,见全量提交前永远先抽样测试——18% 失败 vs 3%。)
- “让 Claude 严格审查自己的代码,几乎什么也查不出。“(独立的审查实例。)
完整情景题:从客服邮件里抽取保修数据
背景。 一条流水线用强制工具调用从来信里抽取 customer_name、order_id、issue_category 和 warranty_expiry。四个字段都是 required 的字符串。大约三分之一的邮件根本没提保修。下游发现,这些邮件的 warranty_expiry 值有 82% 是原文里根本不存在的日期。有工程师提议在提示词里加”如果没有保修日期就写 N/A”,校验失败时最多重试三次。
选项。
A. 按提议加上 N/A 指令和重试循环。
B. 加两个 few-shot 例子展示 warranty_expiry: null,schema 保持不变。
C. 把 warranty_expiry 改成 ["string","null"],从 required 里移除,保留强制工具调用,并对校验失败做分类,缺失数据的情况接受 null 而不是重试。
D. 切换到 tool_choice: auto,让模型在数据缺失时可以拒绝回答。
推理。 A 和 B 都在用提示词跟 schema 打架,而 schema 会赢:一个必填的字符串字段装不下 null 或 N/A,所以模型只能编。D 为了修一个字段的问题,把每封邮件的结构保证都拆掉了。C 在 schema 层修掉了根因,也不再让重试循环把缺失数据变成发明的数据。C 是最不坏的选项,也正是必填字段遇上可选数据:幻觉的头号结构性成因和对缺失数据重试会导致幻觉——格式错误会收敛,缺失数据会发散两篇里的操作顺序。
领域 4 题目里的常见陷阱
- 相信加重语气。 “你必须返回合法 JSON”依然只是提示词。如果选项里有 schema 层面的机制,答案通常就是它。
- 把格式正确当成内容正确。 通过 schema 是第一步;跨字段和业务规则校验是第二步。
- 挑一堆相似的例子。 例子的数量不是杠杆,多样性和边界覆盖才是。
- 对缺失数据升级重试。 每一次说”PO 号必须存在”的重试都在提高编造率。
- 以为 batch 可以即插即用。 不支持多轮工具调用、结果乱序、延迟最长一天、结果会过期(轮询、下载、本地存储——结果 29 天后过期)。
- 给审查规定最少发现数量。 模型会为了凑数发明问题。该修的是架构(独立实例、逐文件加跨文件两轮),见哪怕只是生成 Prompt 里的设计目标,也会压制审查发现。
- 把领域 4 和领域 5 的置信度题搞混。 领域 4 用置信度给发现分流、并补 SKIP 例子(追踪开发者驳回了哪些模式——然后加 SKIP 示例);领域 5 考的是这个数字到底有没有校准过。
下一步
读完六篇入门文章,然后做领域 4 练习题,每道题都留意正确答案落在哪一层:提示词、schema 还是代码。正确率稳定后,去做免费 CCA-F 模拟考。领域 4 全部文章在领域 4 学习指南页,配套的复习顺序版是CCA 领域 4 复习技巧。
常见问题
CCA-F 里有多少题来自领域 4?
expand_more
领域 4 权重 20%,按 60 题的试卷算大约 12 题。报名前请到 Anthropic / Pearson VUE 官方页面确认最新考纲。
领域 4 考 XML 标签和思维链措辞吗?
expand_more
只是轻微涉及。考纲关注可衡量的结果:具体判据、few-shot 设计、通过 tool_use 强制 schema、重试策略和批处理。格式技巧不重要,重要的是知道提示词能保证什么、不能保证什么。
Batch API 真的属于提示词工程这个领域吗?
expand_more
是的。任务 4.5 覆盖什么时候用 Message Batches API、custom_id 关联和部分失败处理,因为它是大规模结构化抽取任务最主要的成本杠杆。
动手练起来
做一套免费 60 题 Claude Certified Architect 模拟考,或按领域逐个啃 CCA-F 学习指南。
Certified Architect 是社区独立搭建的备考站点。文中考试信息来自 Anthropic / Pearson VUE 的公开资料,随时可能调整,报名前请以官方页面为准。