做死链查询改动前,保存原始状态的核心做法是:先冻结当前可访问性证据,再记录将要改动的规则与页面,最后把两者放进同一个带时间戳的归档目录。不要只截一张图,也不要只记一句“已检查”,否则改动后无法判断某个链接是原本就断,还是被你改断的。
要查的是:当前站内可抓取页面上的所有链接,包括内链和外链。怎么查:用爬虫工具跑一次全站,导出链接明细;如果站点不大,也可以用浏览器开发者工具或命令行抓取页面源码,把 href 值提取出来。结果说明什么:这份清单是改动前的基线,改动后重新跑一次,逐条对比就能定位新增死链。保存时至少保留“来源页面 URL、目标 URL、链接文字、抓取时间”四列,导出为 CSV 或表格文件。
要查的是:与抓取和发现相关的规则文件。怎么查:直接下载当前生效的 robots.txt 和站点地图文件,连同它们的 HTTP 状态码、返回内容、最后修改时间一起记录。结果说明什么:如果改动涉及屏蔽路径或调整站点地图,这份备份能让你随时还原。注意,robots.txt 的抓取限制不等于可靠的索引移除,站点地图也不保证收录,所以备份的目的是保留改动依据,不是承诺效果。
要查的是:服务器或 CDN 上现有的重定向规则,包括 301、302 以及可能的链式跳转。怎么查:导出配置文件,或用命令行对关键 URL 逐个请求,记录响应头和 Location 值。结果说明什么:死链修复常伴随重定向新增或修改,如果没保存原规则,改动后出现循环跳转或错误指向时很难回退。建议把规则原文和测试结果放在同一目录,并标注测试用的 URL 列表。
要查的是:承载链接的模板、导航、页脚和正文区域。怎么查:对代表性页面保存完整 HTML 源码,同时记录模板文件版本或数据库内容快照。结果说明什么:如果死链来自模板里的统一链接,只改数据库或只改模板都可能遗漏。保存 HTML 源码能让你在改动后核对渲染结果是否一致。
假设你准备把旧文章里的三个失效外链替换成新链接。改动前按上述清单保存链接明细和页面源码;改动后重新爬取,如果新增死链出现在同一来源页面,就能判断是替换操作引入的,而不是原有问题。适用条件是你能控制改动范围并保留文件;如果页面由第三方系统动态生成且无法导出源码,至少保存请求响应和截图作为替代证据。
下一步:在动手改任何链接或规则之前,先建立今天的归档目录,把链接清单、robots.txt、站点地图、重定向配置和页面源码各存一份,再开始死链查询与修复。