上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终展示的地址是唯一且正确的。时间和人手有限时,先处理阻止抓取、阻止索引、重复地址这三类问题,因为它们会直接导致页面无法进入索引,其他优化可以往后排。
这是最容易造成全站不收录的原因。打开浏览器访问你的域名加 /robots.txt,检查是否存在针对 User-agent: * 的 Disallow: /。如果测试环境留下的这条规则没删,搜索引擎会停止抓取全站。
注意 robots.txt 只控制抓取,不控制索引。一个页面被禁止抓取,仍可能因为外部链接被索引,所以它不能替代下面的 meta 标签检查。
在浏览器里查看页面源代码,搜索 noindex。如果模板或插件给全站页面统一输出了 <meta name="robots" content="noindex">,页面即使被抓取也不会进入索引。这种情况在上线初期很常见,属于必须最先排除的问题。
同时检查 canonical 标签指向的地址。判断依据是:canonical 应指向该内容的首选地址,且与页面实际访问地址一致。如果每个页面都指向首页,或者测试域名没有替换成正式域名,搜索引擎会把这些页面视为首页的重复版本,从而不单独索引。
处理顺序建议:先确认 noindex 是否被误加,再确认 canonical 是否指向正确地址。两项都改完后,用搜索引擎官方提供的网址检查工具提交单个页面,观察抓取结果中显示的 robots 状态和 canonical 选择。
抓取的前提是服务器返回正常状态码。逐个检查关键页面时,重点看两类现象:
如果确认是 JavaScript 渲染问题,且时间和人手有限,优先给核心内容页做服务端渲染或预渲染,而不是等整站重构。适用条件是这些页面承担主要流量和转化;如果只是少数交互页,可以暂时不处理。
站点地图的作用是告诉搜索引擎有哪些地址可抓,但它不保证收录。核对时做两件事:
Sitemap: 行指向它。同时检查重要页面是否能通过站内链接到达。一个只存在于站点地图、没有任何内链指向的页面,被抓取的概率会降低。判断标准是:从首页出发,用普通链接点击能否在少数几次跳转内到达该页面。
人手有限时,按影响面从大到小执行:
每改完一项,用网址检查工具重新抓取一个样本页面,对比修改前后的 robots 状态、canonical 选择和抓取到的 HTML。确认样本正常后,再批量应用到同类页面。这样可以用最小工作量先排除致命配置问题,把剩余时间留给内容层面的检查。