企业建站流程走到上线前,核对抓取与索引配置的目标只有一个:确认搜索引擎能顺利抓到页面,并且愿意把有价值的页面放进索引。抓取和索引是两道独立关卡,能打开网页不等于能被抓取,能被抓取也不等于会被索引。核对时按“可访问—可抓取—可索引—可呈现”的顺序逐层检查,任何一层被挡住,后面的优化都没有意义。
抓取的前提是服务器返回正常内容。用浏览器无痕模式逐个打开核心页面,同时查看服务器返回状态码。首页、栏目页、产品页、文章页各抽几个样本,重点确认返回的是 200,而不是 404、500 或长时间无响应。如果页面依赖登录、验证码或地区限制才能看到内容,搜索引擎同样可能拿不到。
还要检查服务器是否误伤了搜索引擎的抓取程序。有些站点为了防采集,在防火墙或安全插件里拦截了非浏览器请求,这会连带挡住正常抓取。判断方法是查看服务器访问日志中是否有抓取程序的请求记录:如果完全没有记录,说明请求可能在到达页面前就被拦下了;如果记录存在但状态码异常,问题则出在页面或程序层。
robots.txt 决定哪些路径允许抓取,页面内的 <meta name="robots"> 决定单个页面是否允许被抓取或索引。两者冲突时,限制更严的一方生效。核对时打开站点根目录下的 robots.txt,确认没有用 Disallow: / 屏蔽整站,也没有误伤 CSS、JS 和图片所在目录——这些资源被抓取程序读取不到,页面渲染效果就可能失真。
随后抽查页面源代码,确认没有把 noindex 留在正式页面上。测试环境常用 noindex 防止被收录,上线时忘记删除是最常见的事故之一。核对清单可以这样列:
X-Robots-Tag 响应头,其值是否误设为 noindex;canonical 标签用于告诉搜索引擎哪个 URL 是同一内容的首选版本。企业站常见重复来源包括:带与不带 www、http 与 https、带与不带结尾斜杠、列表页的排序参数。核对时确认每个页面的 canonical 指向自己,而不是全部指向首页;多域名或协议并存时,选定一个主版本并让其余版本通过 301 跳转过去。
如果 canonical 指向了错误地址,页面仍可能被抓取,但索引会归到别的 URL 上,导致目标页面迟迟不出现。判断方法是搜索该页面的标题或一段独特文字,看返回结果里的 URL 是不是你希望被收录的那个。若显示的是另一个版本,说明规范化配置需要调整。
把上面的检查串成一条可重复执行的流程,适合第一次接触这个问题的团队直接照做:
这套步骤的代价是需要人工抽查,无法一次覆盖全站;收益是能在上线早期发现结构性错误。适用条件是站点规模不大、页面类型相对固定。如果站点有几十万 URL,人工抽查只能作为抽样,还需要结合日志分析和批量检测工具。判断结果的标准不是“提交后立刻收录”,而是抓取记录正常、状态码正常、索引量随内容更新逐步变化;出现长期零抓取或索引量持续下降,才需要回头排查服务器、robots 或规范化配置。
下一步:选定一个必须被收录的代表性页面,从访问状态码开始完整走一遍上面的流程,把每一步的实际结果记录下来,再决定是修复配置还是继续观察。