← 返回 伦敦办公室窗户在暗淡时分被雨水浸湿,笔记本上写满手写笔记,办公桌上放着冷茶,电影般的编辑氛围

已抓取但未编入索引:我如何修复

早在 2021 年,曼彻斯特一家本地律师事务所在他们的博客在 Search Console 中已经四个月没有更新后来到了 Seahawk。四十三篇文章。零编入索引。每一篇都显示"已抓取,目前未编入索引。"他们之前的代理商耸了耸肩,告诉他们 Google"只是运行缓慢"。我在下午打开了该网站,在九十分钟内找到了根本原因。内容过薄,整个专业领域页面上的重复元描述流入了博客抓取预算,以及配置错误的 Yoast 网站地图指向了 noindex 分类存档。

"已抓取,目前未编入索引"这个短语,是 Google Search Console 可以显示的最令人恼火的状态之一。它意味着 Google 找到了该页面。它花费了资源下载它。然后它查看了那里的内容,说:不值得。理解 Google 为什么做出这个决定,以及系统地修复它,是我在 12,000+ 个网站上必须做得很好的事情。

---

"已抓取但未编入索引"实际上是什么意思

有一个常见的误解,认为这个状态意味着 Google 还没有编入索引。这不是它的意思。Google 已经抓取了该 URL。它做出了一个明确的选择,不将其包括在索引中。这是一个完全不同的问题,需要不同的应对方式。

两个主要原因是质量信号和技术信号。质量信号:Google 认为该页面对用户没有增加足够的价值。技术信号:你设置中的某些内容混淆了 Googlebot 或与你的意图相矛盾。两者都是可以修复的。都不会自行修复。

值得阅读 Google 自己关于 Google 搜索工作原理的文档,如果你想了解从抓取到索引的管道。它很枯燥,但很有用。

---

第一步:在 Search Console 中获取完整图景

不要猜测。打开 Google Search Console,进入"页面"(以前称为"覆盖")。筛选至"已抓取,目前未编入索引"。导出列表。你想要完整的 URL 集,而不仅仅是样本。

然后我将该列表与同一网站的 Screaming Frog 抓取进行交叉参考。每次都这样。Screaming Frog 会告诉你页面的字数(通过自定义提取或内置可读性指标)、是否在 XML 网站地图中、规范标签状态、元机器人指令、页面的内部链接数和响应代码。这个组合会告诉你大部分你需要知道的。

我首先看什么

  • 正文内容少于 300 个单词的页面
  • 元描述与其他已编入索引页面相同或几乎相同的页面
  • 未包含在 XML 网站地图中的页面
  • 收到零个内部链接的页面
  • 被抓取的孤立分页 URL 或薄存档页面

在曼彻斯特律师事务所案例中,博客文章平均长度为 180 个单词。这是核心问题。其他一切都是次要的。

---

质量问题:Google 认为你的页面不够好

听到这个可能不舒服,但这是我看到的最常见原因。Google 的质量阈值自 2022 年以来已大幅提高。三年前会在索引中静静坐着的页面现在被积极排除。

内容薄弱

如果一个页面少于400-500字且缺乏强劲的E-E-A-T信号(作者简介、引用、原创见解),Google往往会爬取它并将其搁置。我特别看到过这些情况:

  • WooCommerce产品页面直接复制粘贴制造商文案
  • 房产列表页面只有两行地产描述
  • 从模板构建、只更换城市名称的位置页面
  • 用一段话回答一个问题的旧FAQ页面

解决方案不仅仅是增加字数。加填充内容只会让情况更糟。解决方案是添加人类真正想读的有用具体信息。对于那些律师事务所,我重写了他们的博客文章,加入了真实案件结果(已匿名化)、具体的英国法律条款参考资料和应用示例。字数从180增加到900。八周后,四十三篇文章中有三十一篇被索引。

重复和接近重复内容

Screaming Frog的重复内容报告是你的好帮手。但如果你担心跨网站重复,也可以通过Copyscape或Siteliner运行这些URL。我有电商领域的客户,他们的供应商向其他四十家零售商提供了相同的产品描述。Google索引其中一个,忽略其余的。那不是bug,而是正常工作。

内部接近重复更加隐蔽。如果你有"Leeds水管工"、"Sheffield水管工"、"Bradford水管工"的服务页面,除了城市名称外95%相同,Google会挑选其中一个并抑制其他的。我见过这种模式导致整个分面搜索系统陷入"已爬取,当前未被索引"的困境。

---

技术问题:你的设置发出了混合信号

有时内容确实很好,但Google仍然拒绝索引。这时你需要深入挖掘技术信号。

规范标签混乱

这是我发现的头号技术罪魁祸首。一个页面规范化到自己(正确),但在上游某处,一个分类页面或分页URL的规范指向你想要索引的页面。Google有时会将此解释为规范源是重复页面的信号。我见过WordPress主题自动执行这种操作,没有爬取真的很难发现。

检查:你的"已爬取,当前未被索引"列表中的每个页面都有自引用规范吗?网站上是否有其他东西的规范意外指向这些URL?

XML站点地图问题

你的站点地图应仅列出你主动想要索引的URL。这听起来很明显。实际上,Yoast、Rank Math和大多数其他SEO插件如果你不小心,会愉快地在你的站点地图中包含noindex页面、分页URL和标签存档。Google看到你的站点地图中有一个URL,爬取它,找到noindex或薄内容,那是一次浪费的爬取配额,加上一个信号,表明你对自己网站的运营不太了解。

我用简单流程审计站点地图:

  1. 下载站点地图XML
  2. 将每个URL导入电子表格
  3. 通过Screaming Frog运行每个URL(或使用批量导出)
  4. 标记任何noindex、重定向或返回非200状态的URL
  5. 从站点地图中删除这些URL

仅这一项就为去年三个客户清除了"已爬取,当前未被索引"状态。完全没有触及内容。

内部链接缺口

PageRank(是的,仍然相关,是的,即使在2024年)通过内链传递。一个没有任何内链指向它的页面在权威性方面对Googlebot来说实际上是不可见的。Google可能会通过网站地图抓取它,然后决定它的重要性不足以被索引,因为网站上没有任何页面指向它。

孤立页面很常见。我使用Screaming Frog的"Orphan URLs"报告(在Site Structure下)来找到它们。为每个处于"未被索引"状态的页面添加三到五个相关的内链,通常会在四到六周内看到流量变化。

---

抓取预算:何时真正是容量问题

对于较小的网站(少于1000个页面),抓取预算几乎从不是真正的问题。我知道很多人都会这样解释。但对于大型电商网站(我们在Seahawk有一个拥有80,000个SKU的时尚零售商),它确实很重要。

如果Googlebot将访问时间花在抓取你的无限分面导航、会话ID参数或内部搜索结果页面上,它就无法到达真正重要的产品页面。关于抓取预算的Google文档是为数不多的我真正建议从头到尾阅读的官方SEO指南之一。

解决方案:通过URL Parameters工具(如果你仍在使用旧版Search Console)或通过robots.txt为Googlebot阻止会生成近似重复页面的URL参数,并确保你的内部搜索页面被noindex。这为重要的页面释放了抓取容量。

---

请求索引:何时使用及何时不使用

Search Console中的"Request Indexing"按钮对于你进行更改后的高优先级个别URL很有用。它不能替代修复根本原因。我看到自由职业者在他们没有触及的页面上强行点击那个按钮。它本身什么都做不了。

我的规则:先修复,再请求。在你对内容、规范标签或内链进行了实质性更改后,通过URL Inspection工具提交URL。等待两到四周。如果在那之后仍未被索引,说明根本问题还未解决。

还有一点:请求索引的配额是有限的。不要在仍然内容稀薄或规范设置破损的页面上浪费它。你只是在要求Google确认它自己的决定。

---

需要多长时间才能清除?

说实话,这比大多数SEO指南承认的变化更大。我见过页面在内容更新后五天内从"Crawled, currently not indexed"变为已索引。我也见过需要十二周的。似乎最重要的因素是:

  • 域名整体权威性有多高(更老、被链接到的域名会看到更快的重新考虑)
  • 修复是否与内容相关(较慢)或技术性(较快)
  • Googlebot访问该网站的频率(在Search Console的Crawl Stats报告中检查)

建立一个跟踪电子表格。记下你进行更改的日期。每两周在Search Console中检查一次。不要在第一周没有任何变化时惊慌失措。

---

FAQ

Google为什么抓取一个页面但随后不索引它?

抓取和索引是Google流程中的独立步骤。抓取只是意味着Googlebot下载了该页面。索引意味着Google认为它值得在搜索结果中显示。当Google的质量评估确定该页面没有增加足够的价值、在索引中重复现有内容或包含冲突信号(如链中某处的noindex标签)时,就会出现这种差距。

在Search Console中提交URL能保证被索引吗?

不能。它将URL放在审查的优先队列中,但Google仍然会做出自己的质量决定。如果该页面内容稀薄或存在技术问题,提交它只会加快Google确认它不会索引它的速度。

一个页面在保持这个状态很长时间后能被索引吗?

能,绝对可以。我清除过在"Crawled, currently not indexed"状态下停留了一年多的URL,一旦内容得到适当改进。Google会重新评估。这不是永久性的黑名单。也就是说,如果一个页面在这个状态下已经超过六个月,值得诚实地问问自己它是否应该被索引。

这个状态与"Discovered, currently not indexed"相同吗?

不同,而且这个区别很重要。"Discovered, currently not indexed"意味着Google知道该URL存在但还没有抓取它。这通常是抓取预算或内链问题。"Crawled, currently not indexed"意味着它已经被评估并被搁置了。两者都需要关注,但修复方式略有不同。

---

对于"已抓取,当前未编入索引"这个问题,没有单一的神奇解决方案。根据我的经验,这几乎总是内容质量问题或技术信号问题,通常两者兼有。从数据开始,修复你发现的问题,然后给它时间。Google 不是在试图惩罚你。它只是需要一个理由来关注这个页面。给它一个。

← 返回