用死链检查工具检查前后环节的依赖,核心是看一条链接从“被发现”到“被判定为死链”之间,经过了几层来源、几次跳转和哪些过滤规则。做法是把工具的抓取结果、服务器返回状态、页面内链来源和最终落地页放在一起比对,而不是只看一个 404 数字。下面按观察、判断、处理、复查四步说明。
多数死链检查工具会同时给出几类信息:被抓取的 URL、来源页面、HTTP 状态码、跳转链、以及是否被 robots.txt 限制。检查依赖时,要按这个顺序读:
如果只记录“有 404”,就无法判断问题出在链接写错、页面被删、跳转配置错误,还是工具本身被限制。依赖关系恰恰藏在这些层级之间。
所谓前后环节,可以理解为:上游来源(谁指向它)→ 中间跳转(是否重定向)→ 下游目标(最终返回什么)。任何一层变化,都会让死链检查工具的结果不同。
常见的三种依赖断裂:
判断时可以用一个短例子(假设):某文章页链接到 /old-page,该地址 301 到 /new-page,而 /new-page 返回 404。此时只修 /old-page 的链接没有意义,真正要处理的是 /new-page 或调整跳转目标。适用条件是你能拿到完整跳转链;如果工具只给最终状态,就需要手动用 curl -I 逐跳确认。
面对依赖断裂,常见两种处理方案:
选择依据是“来源是否可控”。站内链接可控,优先修上游;外部链接和用户收藏不可控,优先在下游做 301。若目标内容已彻底删除,应让旧地址返回 410 或 404,而不是跳到一个无关页面,否则会把错误依赖转移到新页面。
需要区分:robots.txt 的抓取限制不等于可靠的索引移除,它只阻止抓取,不保证页面从索引消失;站点地图也不保证收录。因此不能因为工具被 robots.txt 挡住,就断定链接是死链。
处理后再跑一次死链检查工具,重点核对四项:
如果复查时 404 消失但页面内容与来源主题不符,说明依赖只是被“跳过去”而非真正修复。此时应回到判断环节,确认目标页面是否真的承接了原链接的意图。
下一步:挑一条已知失效链接,从来源页面开始逐跳记录状态码,画出完整的来源—跳转—目标链,再决定修上游还是修下游。