改动前保存原始状态,核心是先把当前线上可影响搜索引擎爬虫的文件、响应头和配置导出成带时间戳的副本,并确认副本内容与线上一致。时间和人手有限时,最先处理的是会影响抓取和收录判断的入口文件,而不是全站备份。适用前提是你能拿到服务器文件、CDN或反向代理配置的读取权限;如果拿不到,就先向有权限的人索取导出文件,不要凭记忆重写。
搜索引擎爬虫看到的不是后台界面,而是服务器返回的内容。因此优先保存以下对象:
robots.txt:记录当前允许和禁止的路径,以及Sitemap声明。X-Robots-Tag、Content-Type和重定向指向。<meta name="robots">。如果只能做一件事,先导出robots.txt和一份当前可访问URL清单。它们能直接说明改动前后抓取范围是否变化。
按下面顺序执行,每步都留下可核对的证据:
/backup/seo-before-20250101/,目录名带日期,避免覆盖旧副本。/var/www/site,可执行cp /var/www/site/robots.txt /backup/seo-before-20250101/robots.txt。这是示例路径,实际以你的环境为准。curl -I https://你的域名/把输出重定向到文本文件;对重点栏目页和详情页各取一条。curl -s https://你的域名/某页面 > page-before.html,至少覆盖首页、一个栏目页、一个详情页。保存后不要只存不验。打开副本,确认robots.txt不是空文件、响应头里有状态码、HTML快照包含预期正文。副本为空或明显截断,等于没保存。
可以用三个检查项判断:
如果只保存了文件却不知道它对应哪个域名、哪个目录、哪个时间点,回退时容易放错位置。因此副本命名要包含域名或环境标识,例如example.com-robots-20250101.txt。
先处理改动动作本身会碰到的对象。如果这次只改robots.txt,就优先保存它和Sitemap;如果这次要改页面模板里的robots meta,就优先保存模板文件和至少三个代表性页面的HTML快照。不要一开始就全站打包,那会拖慢进度,也不一定覆盖爬虫真正读取的响应头。
需要区分的是:保存原始状态是为了回退和对比,不等于保证收录或排名。robots.txt的抓取限制不等于可靠的索引移除;站点地图不保证收录;HTTPS不保证安全无漏洞或排名。不同搜索引擎对同一份robots.txt和响应头的处理可能不同,改动后应分别核查。
现在先列出本次改动会触及的文件和配置,按上面的顺序各导出一份带时间戳的副本,然后打开副本确认内容完整。副本验证通过后,再开始改线上配置。