上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终展示的地址是唯一且正确的。对四平网站建设这类交付项目,建议在正式切换域名前完成一轮“准备—实施—验证—维护”的检查,并把结果写进交付清单,避免上线后才发现整站被屏蔽或大量重复页面。
多人协作时,返工往往来自“没人说得清哪些页面重要”。上线前先由内容或运营方给出核心页面清单,通常包括首页、栏目页、产品/服务详情页、文章详情页和联系方式页。把每类页面的正式地址写成一张表,标注是否允许收录、是否需要跳转、是否有参数版本。
www、带与不带结尾斜杠只能保留一种。这一步的判断结果很直接:如果同一内容对应多个地址,且没有指定首选版本,索引配置就没有完成。
抓取与索引配置主要落在几个可核对的位置。下面按检查项说明做法和判断标准。
在浏览器打开 https://正式域名/robots.txt,确认没有误写 Disallow: / 这类屏蔽全站的规则。若确实需要屏蔽后台、搜索结果页等路径,逐条核对是否写错目录。robots.txt 只影响抓取,不等于禁止索引,所以被屏蔽的地址如果仍可能被外部链接指向,需要另行处理。
在每个正式页面的源码中查找 <link rel="canonical">,确认它指向该页自己的正式地址,而不是统一指向首页。分页的第二页、第三页应指向自身,不要全部指向第一页。若页面由模板批量生成,抽查首页、栏目页、详情页各一个,确认变量替换正确。
打开 https://正式域名/sitemap.xml,确认只包含允许收录的正式地址,不含测试页、404 页和已下线页面。页面级 <meta name="robots"> 不能出现 noindex,除非该页确实不打算被收录。上线前最容易漏掉的是模板里残留的测试用 noindex。
配置写完不等于生效,必须实际验证。推荐按下面顺序操作,任何一步不通过都先修复再继续。
site:正式域名 观察已收录地址是否以正式版本为主。此项只作参考,不同搜索引擎结果会有差异,不能作为唯一依据。假设某详情页源码写的是 <meta name="robots" content="noindex">,抓取测试会显示该页可访问但被标记为不索引,此时应删除该指令后重新验证。这里要区分“可能原因”和“已定位原因”:抓取失败可能是服务器返回异常、robots 屏蔽或网络问题,需要看具体返回码和抓取日志才能确定,不能凭一个现象下结论。
上线不是终点。域名解析、CDN、伪静态规则、模板缓存都可能在切换后改变页面返回结果。建议上线后一周内每天抽查一次核心页面的状态码、canonical 和 robots 指令,之后改为每周一次,稳定后按月复查。
把每次检查结果记录在交付文档中,注明检查时间、页面地址、返回状态和结论。这样多人协作时,接手的人能直接看到哪些项已确认、哪些项待处理,减少重复沟通。
下一步:把上面各检查项整理成一张上线核对表,指定一人负责执行、一人负责复核,在域名正式切换前完成全部验证并留存截图或日志。