不是每篇文章都需要事实核查循环:YMYL 分类器把成本降 5 倍

Forest Liu · 多家公司数据营销负责人#ymyl#seo-cost#ai-content

摘要

给每篇文章跑完整核查循环要约 $0.05;一个基于词表的 YMYL 分类器(4 组规则)只让高风险内容走完整核查,单篇成本降到约 $0.01——约 5 倍——规则可解释,高风险内容永不跳过。

快速答案

在事实核查前加一个基于词表的 YMYL 分类器:用钱、健康、法律、产品安全四组词表给文章分类,高风险走完整核查循环,普通文章跳过重度复核。我们因此把单篇成本从约 $0.05 降到约 $0.01,并把省下的钱投回内容生产。

刚开始搭内容管线时,我们把每一篇文章都送上同一条生产线:LLM 起草、联网事实核查、再加人工复核。结果是安全了——但也慢、也贵。后来我们回头看了看自己到底在保护什么,才发现我们是在给几乎零风险的文章付全价保险费。

问题:每篇文章付同样的保费

当时每篇文章跑完整核查循环(模型联网核查加人工复核)的成本大约是 $0.05。单看不多,但乘以每周更新的内容日历就很可观。更麻烦的是这个环节成了瓶颈:每篇稿子都要等核查通过才能发布。

但不是所有文章都同样"危险"。一篇写保健品剂量的文章,数字编错了会伤人;一篇讲字体搭配的文章,统计数字是编的,顶多尴尬。我们却在两头上花了同样的力气。

方案:基于规则词表的 YMYL 分类器

我们在事实核查之前加了一个 YMYL(Your Money or Your Life)分类器。它用 4 组规则——覆盖钱、健康、法律、产品安全参数——的纯词表,把文章分成两类:

  • 高风险 YMYL:涉及钱、健康、法律或产品安全数据的文章,走完整核查循环,和之前一模一样。
  • 普通文章:其余内容跳过重度复核,只做轻量检查就发布。

分类器刻意做成可解释的:词表是人都能读懂、能争论的东西,而不是黑盒模型。文章里出现药名或退款政策,词表就能抓住,规则会告诉你它为什么被命中。

结果

单篇核查成本从约 $0.05 降到约 $0.01,大约是 5 倍。贵的那条管线现在只跑在风险真正所在的地方,省下来的钱重新投进内容生产,而不是躺进报表。

我们不妥协的三条规矩

  • 高风险内容永远不省核查。分类器只决定哪些文章可以便宜地发布,从不会判定危险内容是安全的。
  • 规则必须可读。用词表而不是模型的直觉,让每次分类都有据可查。
  • 省下的钱投给产出。更便宜的核查是为了更多内容,而不是更便宜的报告。

可复用清单:YMYL 分类 4 步

  1. 定义高风险词表。从 4 组规则起步:钱、健康、法律、产品安全参数。
  2. 按规则分类。命中任一词表就把文章划入高风险路径。
  3. 分叉核查。高风险走完整核查管线,普通文章走轻量检查。
  4. 持续校准。一旦有风险文章漏进便宜路径(或反之),修正词表并记录改动。

如果你的内容管线也在对每篇文章一视同仁地烧钱,我们的博客规划系统正是围绕这个取舍设计的——重核查该在哪就在哪。

关于系统说明:iport 平台持续迭代。本文涉及的系统功能、界面或流程为该文写作时的版本,可能与最新版本存在出入;系统细节介绍以最新版为准。

常见问题

什么是 YMYL 分类器?

YMYL(Your Money or Your Life)页面指那些出错会伤及钱财、健康、安全或福祉的内容。YMYL 分类器用可解释的词表规则,在处理前把内容分成高风险与普通两类,而不是用黑盒模型。

哪些主题算高风险 YMYL?

我们用 4 组规则:钱(价格、退款、理财建议)、健康(医疗声称、剂量、保健品)、法律(合同、合规、法规)、产品安全参数(出错会造成伤害的规格)。

分类会降低普通文章的质量吗?

不会。普通文章仍有基础检查,草稿标准也不变;只是跳过那些与其风险不成比例的重度重复复核。

继续阅读

更多来自 Shopify 博客专家级规划生成 — 专家级文章管线