判断采集是否遗漏,不能只看第三方工具显示的收录数。更可靠的做法是把“服务器日志中搜索引擎爬虫实际抓取的URL”“站内统计中可访问的URL”和“搜索引擎返回的已索引结果”分开对比。如果日志里从未出现某个URL,说明可能没被抓取;如果日志有抓取但搜索结果显示未索引,说明问题在抓取之后。两种情况的处理方案完全不同。
seo监控中常说的遗漏,至少有三层含义:
第三方估算流量、搜索引擎报告与站内统计口径不同。第三方工具通常基于抽样、点击流或历史模型估算,不能直接当作抓取记录;搜索引擎的站点查询结果反映的是其自身索引状态;服务器日志才是你能够核对的真实请求记录。判断遗漏时,优先以日志和站点可访问清单为证据链起点。
适用条件:你拥有服务器或CDN日志访问权限,且能按User-Agent筛选爬虫请求。
执行步骤:
判断结果:如果大量重要页面从未被请求,优先检查内链是否可达、站点地图是否包含、robots.txt是否误屏蔽、页面是否需要登录或依赖复杂脚本才能呈现内容。如果日志有请求但返回异常状态码,问题在服务器响应或URL配置,而不是爬虫没有发现。
代价:日志分析需要一定技术处理能力,日志量大时还要考虑存储和解析成本。优点是证据直接,能区分“没抓”和“抓了但失败”。
适用条件:你没有完整日志权限,或只想快速判断页面是否进入索引。
执行步骤:
判断结果:如果页面可访问、无noindex、内容独立,但仍然长期未索引,可能是站点整体质量或抓取预算问题;如果页面本身返回错误或被指令阻止,应先修复页面再谈索引。
代价:站点查询结果可能滞后,且不同搜索引擎的查询口径不同。它适合做抽样检查,不适合替代日志做全量判断。
如果你要回答“爬虫到底有没有来过”,选日志方案;如果你要回答“用户能不能在搜索结果里看到”,选索引状态方案。两者不是互斥关系,推荐顺序是:
检查项清单:基准URL是否完整、日志时间范围是否足够、爬虫User-Agent是否识别正确、状态码是否正常、robots与meta指令是否冲突、站点地图是否可访问且格式正确。任何一项缺失,都可能让判断结果偏向错误方向。
假设你有一个商品页/item/1001,站点查询显示未收录。先查日志:如果最近30天没有任何爬虫请求记录,属于抓取遗漏,优先检查该页是否有内链、是否在站点地图中。如果日志显示爬虫请求过但返回302跳转到登录页,属于抓取后被阻断,应修复访问权限。如果日志显示200且内容正常,但搜索结果显示未索引,则属于索引遗漏,需要检查内容独特性和页面指令。这个例子中的判断顺序适用于大多数普通页面,不适用于需要登录或强依赖客户端渲染的页面。
下一步:从你的站点中挑出20个重要URL,建立基准清单,先做一次索引状态核对,再对未收录的URL查服务器日志,把结果分成“未抓取”“抓取失败”“已抓取未索引”三类,分别处理。