判断采集是否遗漏,不能只看“总收录数少了”或“某天流量降了”。更可靠的做法是:先固定一个可复现的对比口径,再检查样本页面是否被搜索引擎发现、抓取、收录和展现,最后把差异归因到采集、索引或展示环节。下面用一个假设例子展开,说明时间和人手有限时应该先做什么。
假设你负责一个内容站,站内统计显示有 1200 个可访问页面,搜索引擎站点地图报告显示提交了 1200 条,但用 site: 查询只看到约 800 条。此时不能直接说“采集遗漏了 400 条”。因为这三类数字口径不同:站内统计是服务器可返回的页面,站点地图报告是提交量,site: 查询是搜索引擎展示的估算结果,三者本来就不应完全相等。正确做法是先抽取样本,而不是追求总数对齐。
从站点地图或站内链接中随机抽取 30 至 50 个 URL,优先包含新发布、近期修改、无外链、有外链四种类型。对每个 URL 依次检查:
site:完整URL 查询,看该页是否出现在结果中;robots.txt 测试工具确认该路径未被禁止抓取;noindex、规范链接指向其他 URL、或需要登录才能看到主体内容;如果某个 URL 从未被抓取,问题更可能在发现和抓取环节;如果被抓取但未收录,问题更可能在内容质量、重复或索引筛选环节;如果已收录但搜索不到,问题可能在查询词、展现位置或结果过滤。每一步只回答一个环节,不要跳步。
最常见的错误是用第三方估算流量反推采集量。第三方工具的数据来自抽样、点击流或模型推算,和搜索引擎自己报告的抓取、索引口径不同,不能用来证明“少了多少页”。另一个错误是只查首页或栏目页,不查深层内容页。采集遗漏往往先发生在链接层级深、内链少、更新频率低的页面上。还有一个错误是看到 site: 结果少就立刻改站点地图,实际上应先确认这些 URL 是否可访问、是否返回 200 状态、是否被规范标签指向别处。
按影响面和可操作性排序:先处理“已提交但从未被抓取”的页面,因为这类问题通常可以通过内链、站点地图和抓取配额调整改善;再处理“被抓取但未收录”的页面,重点检查内容是否与已有页面高度重复、是否缺少独立价值;最后处理“已收录但无展现”的页面,这类更偏向查询需求和标题描述,而不是采集本身。判断依据是:抓取日志和索引报告能直接区分“没来抓”和“抓了没留”,而流量下降不能。
下一步建议:从站点地图中随机抽 30 个 URL,按上面的检查链逐条记录状态,先找出集中在“未抓取”还是“未收录”的样本,再决定是调整内链和提交方式,还是修改页面内容与规范设置。