Claude Fable 5 的安全分类器由 Anthropic 管理,用户不能修改分类规则或触发阈值;可以配置的是“请求被标记后是否自动切换模型”。在 Claude 中进入 Settings > Capabilities,在 Claude Code 中进入 Config > MODEL & OUTPUT,即可开关 Switch models when a message is flagged。计费则取决于分类器在生成前还是生成途中触发。
分类器是独立于主模型的自动安全检查,用于识别可能涉及高风险网络攻击、生物与化学双重用途、模型蒸馏攻击,以及部分前沿模型开发任务的请求。当检查触发时,Fable 5 或 Fable 5.1 不再继续处理全部内容,系统可能把请求交给限制更严格的 Opus 模型。
这种切换称为 fallback,也就是模型回退。界面会显示模型已切换,回答旁也会标明实际响应模型。它不是网络故障、额度不足或模型随机降级,而是安全机制的可见结果。
用户可以决定分类器触发后自动切换,还是暂停当前请求并自行处理。用户不能选择分类器覆盖的风险领域、降低敏感度、添加白名单,或通过提示词关闭检查。
组织管理员同样不能用普通设置绕过 Fable 安全分类器。合法的防御性网络安全工作若持续受到影响,应使用官方提供的验证或反馈渠道,而不是尝试规避安全系统。
第一次选择 Fable 5 或 Fable 5.1 时,自动模型切换默认开启。要更改设置,打开 Settings > Capabilities,找到 Switch models when a message is flagged 并切换开关。
开启后,被标记的请求会在同一对话中自动交给 Opus。关闭后,请求会暂停,不会自动产生 Opus 回答;用户可以编辑原消息后重试,也可以手动选择其他模型发送。
Claude Code 的入口位于 Config > MODEL & OUTPUT。关闭 Switch models when a message is flagged 后,分类器仍会运行,只是不再自动把被拦截请求交给回退模型。
团队部署时应统一说明该设置的含义。关闭自动切换可以避免在未确认的情况下改用另一个模型,但也可能中断长任务;开启则提高连续性,不过结果可能由不同模型完成。
自动切换发生后,模型选择器会停留在实际回退的 Opus 模型,后续消息继续由它处理。用户可以手动切回 Fable,但如果原始被标记内容仍保留在上下文中,同一安全检查可能再次触发。
分类器检查的不只是最新消息,还可能读取记忆、连接器内容、网页搜索结果和上传文件。因此,即使最新提问看起来普通,历史上下文中的敏感内容也可能导致回退。此时应在不改变合法目的的前提下,删除无关上下文或新建更聚焦的对话。
如果请求在 Fable 生成任何输出之前就被拦截,系统会直接改由 Opus 处理。此时只按 Opus 的费率和用量计算,Opus 的响应计入相应使用额度或按量消费,不会为尚未产生的 Fable 输出收取 Fable 价格。
核对时应以实际响应模型和 Usage 页面记录为准,不能只根据发送前模型选择器显示的 Fable 判断费用。
如果分类器在流式生成过程中触发,已由 Fable 处理的输入与触发前已经输出的 token 会按 Fable 费率计算;之后由 Opus 完成的部分按 Opus 费率计算。因此,同一请求可能出现分段计费。
这种情况不代表同一批 token 被重复收费,而是不同阶段由不同模型完成。需要精确归集成本的团队,应保留请求时间、实际模型提示和用量明细进行对照。
回退目标会随 Anthropic 的安全策略和模型阵容更新,不能写死在客户端逻辑中。官方当前说明,生物、化学与生命科学请求可能回退到 Opus 5,进攻性网络安全技术请求可能回退到 Opus 4.8。
早期发布资料中的目标模型可能与当前规则不同。集成方应读取响应中的实际模型信息,不要仅依赖发布时的固定映射。
预算模型至少要区分三种结果:Fable 正常完成、输入阶段直接回退、生成中途分段回退。只用“请求数乘以 Fable 单价”会高估输入阶段回退,也无法准确描述中途切换。
对关键工作流,可在测试数据中记录请求类别、输入和输出规模、是否发生回退、实际响应模型与最终费用,再用真实分布估算月度预算。不要通过故意触发分类器来获取更低价格,这既不可靠,也可能违反使用正策。
应用不应假设用户选择 Fable 后所有响应都具有同一模型特征。展示层应保留实际模型标识;质量评估、缓存、审计和成本统计也应使用服务返回的实际信息。
如果业务要求单一模型一致性,可以关闭自动切换并在请求暂停后交由用户决定。但对于允许连续完成的通用助手,保留自动切换并清楚显示实际模型通常更实用。
先检查对话历史、附件、记忆和连接器内容是否包含会触发风险分类的无关材料。然后编辑请求,使合法目的、授权范围和期望的防御性结果更明确,避免含糊的攻击性表述。
如果同类合法任务持续回退,可通过界面反馈。网络安全专业人员还应查看官方面向经过验证防御用途的计划。不要把拆词、编码或隐藏意图当作排错手段。
不能。分类器仍会检查请求;关闭开关只会让被标记的请求暂停,而不是自动交给 Opus。
不一定。如果被标记内容仍在对话上下文中,分类器可能再次触发。应先检查并编辑原消息或移除无关上下文。
不会。生成前拦截只按 Opus 计算;生成中途拦截则对已完成的 Fable 阶段和后续 Opus 阶段分别计费。
Fable 5 分类器本身不可由用户配置,真正可控的是自动模型切换。开启时请求可自动回退并继续,关闭时请求暂停等待处理。计费应按触发时点区分:生成前只计 Opus,生成中途按 Fable 与 Opus 的实际阶段分别计算。