让关键词聚类真正准确的 8 维 Facet
摘要
用 8 维 Facet(属性/设备/场景/地域等)先切分再合并做关键词聚类——属性类 1167 词对场景类 120 词的悬殊证明规则必须按维度校准,并把 122 条人工修正沉淀为边界规则。
快速答案
关键词聚类要准确,关键是先按有业务语义的维度(属性、设备、场景、地域)切分再合并,而不是按词面相似分组。我们库里属性类词 1167 个、场景类仅 120 个,边界规则必须按维度分别校准——一次复核曾修正 122 条错误分类。
这些年我们反复看到关键词聚类以同一种方式失败:标准工具按词面相似把关键词分组,于是“2000W 便携太阳能发电机”和“露营用 2000W 便携电源”被放进同一组。它们看起来很像——但一个是属性驱动型购买词,一个是场景驱动型词。用一篇文章同时覆盖两个竞争意图,结果往往是哪个都排不上去。
这不是偶发问题。每一组这样聚类出来的词都藏着意图冲突,每一次冲突都意味着一篇数月不见起色的文章。问题从来不在聚类算法,而在缺少维度。
为什么纯词面聚类会失效
当一组关键词混入不同意图,文章的标题和 H2 只能干净地服务其中一个。剩下的词会稀释焦点、拉低点击率,还会让搜索引擎搞不清页面到底在讲什么。在我们自己的 SEO 子系统里,这个问题的表现就是源源不断的错误归类,需要人工一条条复核修正——慢,而且规模化后很容易出错。
8 维 Facet 标签体系
我们用 Facet 体系替代了词面分组:关键词、文章、产品知识在完全相同的 8 个维度上打标——属性、设备、场景、地域,外加四个有明确业务含义的维度。聚类时先按维度切分,再只合并真正同类的词。
我们库里的维度词量分布说明了为什么一套规则不能通吃:属性类词 1167 个、设备类 152 个、场景类 120 个。一个维度比邻近维度大十倍,就需要完全不同的边界规则。我们曾一次性修正过 122 条错误分类——这提醒我们,边界规则要持续校准,而不是搭好框架就完事。
让聚类真正准确的 3 条规则
- 维度必须有业务语义。维度只有对应你业务真正做出的区分才有用,而不是词表里发现的某种规律。
- 高频维度词优先建边界规则。最大的桶产生最多的错误,所以它们最先拿到明确规则。
- 把修正沉淀为规则。每一次人工修正都变成一条边界规则,下一轮就不会重犯同样的错误。
可复用清单:Facet 聚类 5 步
- 定义 8 个维度标签,并为每个维度指定业务归属。
- 批量打标关键词、文章与产品知识。
- 按维度切分,在各切片内部聚类。
- 应用边界规则,再人工复核剩余项。
- 把每条修正固化为新的边界规则。
这正是我们 iport SEO 内容编排模块 里关键词聚类在做的事情——也是它规划的文章很少互相打架的原因。
常见问题
为什么纯词面关键词聚类会失败?
因为它把意图不同的词塞进同一组,一篇文章无法干净地同时服务两个竞争意图,结果往往是哪个都排不上去。
8 维 Facet 包含哪些维度?
属性、设备、场景、地域,外加四个有明确业务含义的维度。词量差异悬殊——属性 1167 个、设备 152 个、场景 120 个——所以规则按维度分别校准。
如何避免错误分类重犯?
把每次人工修正都固化成边界规则。我们曾一次性修正 122 条错误分类,并把每条修正都沉淀为规则,避免同类错误重犯。