← 返回 程序化SEO质量关卡:避免AI垃圾内容惩罚 -- 线条艺术插图

程序化SEO质量门槛:避免AI垃圾内容惩罚

目录站与程序化 SEO

早在2023年初,一个旅游客户带着看起来像梦想设置的东西来找我。他们有14,000个位置页面,英国的每个城市、每个行政区、每个邮编地区,都是从酒店和餐厅数据库自动生成的。模板清晰。内部链接不错。而且有排名。大约四个月。

然后2024年3月核心更新来了。他们在六周内失去了71%的有机流量。我花了三周时间进行取证分析。内容本身没错。但它很空洞。每个页面都用略微打乱的顺序说同样的三件事,谷歌显然已经决定不值得提供给任何人。我们用适当的质量门槛重建了流程,在五个月内恢复到峰值的60%。不完美。但这是一个一直陪伴我的教训。

程序化SEO仍然是代理工具包中最强大的工具之一。但垃圾内容的容许度基本上已经消失了。

"质量门槛"在pSEO流程中实际上意味着什么

人们对这个术语使用得很松散,所以让我精确解释一下我在Seahawk中是如何使用它的。

质量关卡是一个检查点规则或测试,页面必须通过它才能发布,或者才能保持发布状态。这不是感觉检查。这是一个具体的、可测量的阈值,要么让页面通过,要么将其发回修订(或完全删除)。

可以把它看作是内容的持续集成。开发者不会推送失败单元测试的代码。你不应该发布失败内容测试的页面。这个类比不完美,但足够有用。

没有质量门的管道就是一个内容垃圾机器。在2024年,谷歌的分类器已经足够好,能够大规模识别它。

门需要存在的三个层级

我在三个时刻构建门:

  1. 生成前,在任何内容写作之前。数据质量检查。这个实体是否有足够的独特属性来支持一个独立的页面?
  2. 生成后,AI或模板生成内容之后。对长度、唯一性、实体覆盖范围的自动评分。
  3. 发布后监控,持续进行。印象或点击率下降的页面会被标记进行人工审查。

大多数团队只构建中间层。这就是他们出错的原因。

数据充分性问题(大多数人跳过这个)

关键是,最坏的程序化内容问题从一个字都没写的时候就开始了。它们始于电子表格。

如果你的源数据每个实体有12个属性,其中9个在80%的记录中完全相同,那么无论你的prompt有多聪明,都会生成近似重复的页面。我在Seahawk于2021年构建的律师事务所目录上学到了这一点。我们有6,000条律师事务所条目。其中大约4,200条除了名称、邮编和执业领域外没有任何区别。我们发布了全部6,000条。Google大概只索引了1,800条。

生成前关卡:数据丰富性评分。在我们触及任何模板之前,我现在用一个简单的Python脚本运行每个数据集。它计算每条记录中非空、非通用字段的数量,并标记任何低于阈值的内容,我通常使用7/12作为最小值。没有通过的记录进入"存根"类别,获得带noindex的瘦页面,或者根本没有页面。

这不是什么光彩的事。但这是对我们构建的爬取效率影响最大的单一改变。

生成后的唯一性评分

所以你的数据通过了第一道门槛。内容已经生成。现在怎么办?

不要发布,直到你为唯一性评分它,不是针对网络,而是针对你自己的页面库。近似重复的内部内容是更常见的问题,也是你更直接控制的问题。

我为此使用两个工具的组合:

  • [Copyscape的批量API](https://www.copyscape.com/api.php),用于标记与现有索引URL过于相似的页面
  • 一个自定义余弦相似度脚本(在Python中使用sentence-transformers),将每个新页面与同一模板系列中结构最相似的50个页面进行评分

我的阈值是 0.82 余弦相似度。超过这个值的内容进入人工审核。超过 0.91 的会被删除或大幅重写。

是的,这会给工作流程增加摩擦。很好。摩擦正是目的所在。

"独特"实际上需要意味着什么

真正独特并不仅仅意味着句子重新排列。这意味着页面回答了只有这个实体才能回答的问题。对于城市着陆页,那是超本地化数据、真实的事件列表、实际的本地统计数据、来自本地来源的具体引用。对于产品对比页面,它是区分这两个特定产品的数据点,而不是一个带有互换名词的模板介绍。

Google 自己关于有帮助内容的指导一直就是这样说的。分类器只是在执行上变得更加严格了。

实体覆盖:没人谈论的门槛

我花了更长的时间才弄清楚这一点,我对此感到恼火。

程序化构建中的每一个页面在名义上都"关于"某些内容——一个地点、一个产品、一个人、一个服务。这个实体及其属性应该在内容中通过具体提及、语义关联和结构化数据得到一致表现。如果没有,即使页面有800字,读起来也会显得薄弱。

我现在使用 spaCy 对每个生成的页面运行轻量级自然语言处理,以检查:

  • 主要实体在前 100 字内被命名
  • 页面正文中至少出现4个语义相关的实体或属性
  • 页面包含至少一个特有于该实体的事实(来自源数据,而非模型幻想)

目前这项检查是手动进行的。我想自动化它,但还没有找到可靠的方法在规模化交叉引用验证而不产生过多误报。如果你已经解决了这个问题,我真的很想知道。

薄页面陷阱:何时使用 noindex 与何时删除

假设一个页面成功生成了,但看起来内容还是很薄。也许数据稀疏、实体冷僻,输出在技术上是独特的但不太有用。

你该怎么办?

这是我的决策树,简化版,但大致反映了我的思考方式:

  1. 如果页面在GSC中90天后零搜索展示:删除并301跳转到最近的相关父页面。
  2. 如果页面有展示但点击率低于0.5%且无反向链接:noindex并合并到父页面或分类页面。
  3. 如果页面有展示、点击率不错(1%+),但平均排名较低(40+):保留,但优先考虑内容充实。
  4. 如果页面表现良好,就别动它,停止对自己的决定反复纠结。

我见过太多次代理商主把表现不错的页面设成noindex了。别去修复没坏的东西。

结构化数据作为质量信号(不仅仅是富摘要展现)

大多数人给pSEO页面添加schema是为了获得富摘要。这合理。但我开始把schema的完整性当作代理质量门槛来对待。

如果一个页面的schema有超过30%的null或占位符值,这告诉我基础数据太稀疏了,无法生成有用的页面。所以我们在管道中内置了schema验证器,它会根据我们使用的类型检查Schema.org规范中的必需和推荐属性。未通过此检查的页面会返回到enrichment队列。

Google是否将schema完整性作为直接排名信号?几乎肯定不会以简单的方式。但拥有完整、准确schema的页面往往也是拥有完整、准确数据的页面,而这些页面往往排名更好。相关性强到足以让我将schema质量视为有用的诊断工具,即使它不是实际机制。

发布后监测:持续发挥作用的门槛

质量门槛不是一次性的事。页面会退化。数据会过时。一个1月份还不错的页面,到10月可能就太薄了,因为世界变了内容却没有。

我每个月都用Screaming Frog对我们管理的每个大型pSEO网站做一次爬取,标记:

  • 字数低于350字的页面(剔除样板文本后)
  • 标题标签与网站上超过3个其他页面匹配的页面
  • 没有内部链接指向的页面(孤立风险)

我将这些与通过API导出的GSC数据交叉引用,特别是查找在过去60天内impression下降超过40%的页面。这个交集(由Screaming Frog标记且在GSC中下降)是高优先级审查队列。

老实说,这个监控步骤是大多数代理商偷工减料的地方,因为从表面上看它没有直接账单价值。但这正是区分一个pSEO项目能否持续和在下一次核心更新后崩溃的关键。

常见问题

使用AI生成内容会自动触发Google惩罚吗?

不是。Google明确表示AI生成的内容不违反他们的指南,问题在于内容不如人意,无论如何产生。信号是质量,不是来源。手工编写但薄弱和重复的页面会受到同样的处理。重要的是页面是否真正比替代方案更好地满足用户的查询。如果不能,生产方法就无关紧要了。

在Google产生怀疑之前,程序化构建"太多"页面是多少?

没有确定的数字,你在网上看到的任何具体数字都是编造的。重要的是索引页面与排名页面的比率。如果你有20,000个页面,其中只有400个获得展现,那就是爬虫预算和质量问题。Google会开始忽略其余的。我宁愿发布3,000个优质页面,也不愿发布20,000个平庸的。索引覆盖率是要关注的指标,而不是绝对页面数。

被AI垃圾内容惩罚击中后,我能恢复吗?

是的,但需要时间,而且不是线性的。我在开头提到的那个旅游客户确实恢复了,但花了五个月的持续工作:删除最差的页面,合并中等页面,充实顶级页面。单一最有影响的行动是将索引从14,000个页面减少到约4,200个。违反直觉,但这就是数据显示的内容。

识别大型网站中哪些页面是"垃圾内容"的最快方法是什么?

提取过去 16 周的完整 GSC 性能数据。筛选展现次数超过 0 但点击率低于 0.8% 且平均排名在 35 以后的页面。这个集合就是你的问题集。交叉参考字数和内部链接数。低点击率、低字数和孤立页面的重叠部分几乎总是任何程序化构建中最薄弱的部分。

---

大规模构建不会让你有权利构建得很差。我描述的这些门槛为新的pSEO项目增加了大约两到三天的设置时间。另一个选择是在core update摧毁你之后进行重建,这花费的成本要高得多。我知道是因为我两种方式都做过。

← 返回