上线前核对抓取与索引配置,核心是确认三件事:页面能被正常抓取、允许被索引、且不会把测试环境或重复内容暴露给搜索引擎。最有效的一步是在真实上线域名下,用搜索引擎的抓取测试工具查看一个具体URL返回的HTML源码,检查其中是否存在阻止索引的标签或响应头。
打开项目代码和服务器配置,先确认下面三类信号的实际取值,而不是只看配置文件写了什么。
Disallow: /,或屏蔽了 CSS、JS 所在目录。<head> 中是否有 <meta name="robots" content="noindex">,响应头是否有 X-Robots-Tag: noindex。<link rel="canonical">,指向正式域名而非测试域名、IP 或带参数的临时地址。这三类信号来自不同位置:robots.txt 在站点根目录,noindex 可能写在模板或响应头,canonical 通常由页面模板或CMS输出。核对时必须逐层验证,不能因为模板里没写就认定线上没有。
在搜索引擎的抓取测试或网址检查工具中,输入一个正式上线的URL,选择“抓取并渲染”或等效功能,然后查看返回的HTML。判断顺序如下:
noindex,确认没有出现在 <meta name="robots"> 或响应头里。如果返回结果里出现 noindex,但代码模板里没有,优先检查服务器或CDN是否附加了 X-Robots-Tag 响应头;如果 canonical 指向测试域名,检查环境变量或数据库中的站点地址配置是否在部署时被正确替换。
单页通过后,再验证站点级配置。访问 https://正式域名/robots.txt,确认其中没有误屏蔽整站,并检查是否声明了 sitemap 地址。接着访问 sitemap 中列出的若干URL,确认它们返回200且不含 noindex。对于电商、内容站等页面量大的项目,至少抽取首页、栏目页、详情页、分页各一个样本,覆盖不同模板。
常见问题与对应判断:
上线不是终点。部署后一周内,通过搜索引擎的站点管理工具查看抓取统计和索引覆盖报告,确认没有出现“已发现但未索引”或“被robots.txt屏蔽”的异常增长。每次修改模板、调整服务器响应头或更换CDN后,重复一次单页抓取测试。把 robots.txt、sitemap 和 canonical 规则纳入发布检查清单,避免后续迭代重新引入 noindex 或错误域名。
下一步:选一个已上线的代表页面,用抓取测试工具完整走一遍上述检查,记录状态码、noindex、canonical 三项结果,再决定是否需要修改配置。