上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引入口(站点地图与内链)能到达重要页面。时间有限时,按“robots.txt → 页面级 meta 指令 → 站点地图与内链”的顺序检查,前一项出错会让后一项全部失效,因此不要跳步。
在浏览器地址栏输入域名加 /robots.txt,逐行看 Disallow 规则。常见问题是测试阶段写了 Disallow: /,上线后忘记删除,导致整站不可抓取。判断方法:把规则与网站实际目录结构对照,确认没有把 /、/css/、/js/ 这类必要路径整体屏蔽。
如果使用 Disallow 屏蔽后台或搜索结果页,要确认这些路径确实不需要收录。处理完成后,用搜索引擎官方提供的 robots.txt 测试工具验证某条 URL 是否被允许抓取;不同搜索引擎的测试入口不同,以各自站长平台为准。
页面能否被索引,取决于 HTML <head> 中的 meta 指令。重点看两类:
<meta name="robots" content="noindex">:明确要求不索引,测试环境残留最常见。<meta name="robots" content="nofollow">:不追踪链接,通常不影响本页索引,但会削弱内链传递。检查方法:打开目标页面的源代码,搜索 noindex。如果站点是模板批量生成的,要抽查首页、栏目页、详情页各一个,因为不同模板可能引用不同的头部文件。发现 noindex 后,先判断是全局模板问题还是单页问题:全局问题改模板,单页问题改该页配置。
抓取配置正常,不代表重要页面会被发现。上线前应确认:
一个可执行的抽查例子:假设站点有 20 个产品页,从首页出发点击三次以内能否到达其中任意一个?如果不能,说明链接层级过深,抓取预算可能被消耗在低价值页面上。此时优先把重要页面放进主导航或首页入口,而不是先做其他优化。
完成上述修改后,用搜索引擎站长平台的“抓取测试”或“网址检查”功能提交一个代表性 URL,观察返回的 HTML 中是否仍含 noindex,以及渲染后的内容是否完整。这一步的作用是验证修改已生效,而不是提交后立即期待收录。
如果测试结果显示“已抓取,未索引”,可能原因包括内容质量、重复页面、服务器响应慢等,与抓取配置是两回事。此时应先确认抓取和索引指令没有冲突,再排查内容与性能问题,不要反复修改 robots.txt。
按影响面排序:先处理全站级 Disallow: / 和全局 noindex,这两项会让所有后续工作失效;再处理栏目级模板问题;最后补充站点地图和内链。每改一项,用一次抓取测试复查,确认无误后再进入下一项。上线前预留一次完整走查,比上线后被动排查更省时间。
下一步:打开你网站的 /robots.txt 和首页源代码,分别搜索 Disallow: / 与 noindex,把结果记录下来,再决定先改哪一项。