改版或迁移后想让新页面被快速收录,首先要核对的是“旧地址到新地址的对应关系是否完整、可抓取、可传递信号”。收录速度取决于搜索引擎能否顺利发现、抓取并理解新页面,而不是提交一个入口就能立刻见效。下面这份清单按顺序执行,每项都给出检查方法和结果判断。
查什么:每个旧页面是否都指向内容最接近的新页面,而不是全部跳首页。
怎么查:导出旧站URL列表,用抓取工具或脚本逐条请求,记录返回的状态码和最终落点。重点看三类:返回301且落点相关、返回301但全部落首页、返回404或302。
结果说明什么:301且落点相关,说明信号传递路径正常;全部跳首页会让搜索引擎难以判断新页面主题,可能拖慢收录;404说明旧地址的信号断了,需要补跳转;302是临时跳转,不适合长期迁移。
查什么:robots.txt、页面级meta robots、X-Robots-Tag响应头是否误挡了需要收录的页面。
怎么查:打开域名/robots.txt看Disallow规则;查看页面源码中的<meta name="robots">;用命令行或抓取工具查看响应头里的X-Robots-Tag。
结果说明什么:如果目标页面被Disallow或noindex挡住,搜索引擎不会收录它。注意:robots.txt只能限制抓取,不能可靠地把已收录页面移出索引;反过来,解除限制后也需要时间重新抓取。
查什么:sitemap里列的是新URL还是旧URL;站内导航、面包屑、文章互链是否还指向旧地址。
怎么查:打开sitemap文件抽查URL;在站内搜索旧域名,看还有多少页面引用旧链接;用抓取工具统计内链落点。
结果说明什么:sitemap只帮助发现,不保证收录,但列错地址会浪费抓取预算;内链仍指向旧地址会形成跳转链,增加抓取成本。内链直接指向新地址,发现路径更短。
查什么:新页面的canonical是否指向自己,而不是残留的旧地址或错误页面;带参数、带www与不带www的版本是否统一。
怎么查:抽查新页面源码中的<link rel="canonical">;对比同一内容的不同URL版本;检查协议和主机名是否统一。
结果说明什么:canonical指向旧地址会让搜索引擎把权重算到旧页;指向不存在的地址则可能被忽略。统一版本能减少重复,让收录目标更明确。
如果第一次接触,按下面顺序做一轮,就能判断改版迁移是否具备快速收录的基础:
判断标准:如果多数旧URL返回301且落点相关、新URL可抓取且canonical自指、sitemap和内链都指向新地址,说明基础条件已经具备。若出现大量404、全站跳首页或noindex,应先修复再观察,不要指望提交后立刻收录。
下一步:先完成上面第1步的10条URL抽查,把异常项按“跳转错误、抓取阻挡、信号指向错误”三类归因,再逐类修复。不同搜索引擎的抓取和收录表现需要分别核查,不要用单一入口的结果推断全部。