新手做网站 - 上线前核对抓取与索引配置:先查这三处

📍 WDQWDWQD987AAAAA:216.73.217.60
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /ff3f975c46fb.html
📄

新手做网站 - 上线前核对抓取与索引配置:先查这三处

上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能访问你的页面、页面没有被意外设置为“不要收录”、站点能通过一个规范地址被稳定访问。对新站来说,最优先处理的是robots.txt 与页面级 noindex 是否误拦截,因为它们会直接导致页面不进索引,而且排查成本低、修复后见效路径清晰。

准备:先列一份最小核对清单

时间和人手有限时,不要一上来就研究复杂日志。先准备以下信息,能覆盖大多数抓取与索引问题:

这些信息不需要额外工具,手动就能整理。样本 URL 选页面结构不同的,比只查首页更容易发现问题。

实施:上线前必须改掉的三类配置

1. robots.txt 是否误封目录

打开 https://你的域名/robots.txt,检查有没有 Disallow: / 这类整站禁止规则。开发阶段为了不让测试内容被收录,常会加上整站屏蔽,上线时忘记删除,结果搜索引擎无法抓取任何页面。如果只想屏蔽后台或搜索结果页,应写具体路径,而不是根目录。

2. 页面 head 里是否有 noindex

查看页面源代码,确认没有 <meta name="robots" content="noindex">。这类标签常出现在模板、测试环境配置或某些 SEO 插件的默认设置里。它比 robots.txt 更隐蔽,因为 robots.txt 禁止抓取后,搜索引擎可能连 noindex 都读不到,反而无法正确移除页面。

3. 是否存在多个可访问地址

同一页面如果 http 和 https、带 www 和不带 www 都能打开,会分散抓取和权重判断。应选定一个主地址,把其余地址做 301 跳转到主地址。判断方法:分别访问几种组合,看是否都最终落到同一个 URL,且状态码为 301 或 308,而不是 200。

验证:用可执行步骤确认配置生效

改完后不要凭感觉判断,按下面顺序验证:

  1. 用浏览器无痕模式访问样本页面,查看源代码,确认 noindex 已移除、canonical 指向自身主地址。
  2. 访问 robots.txt,确认没有误封需要收录的路径。
  3. 查看服务器日志中搜索引擎爬虫的请求记录,确认返回状态码是 200,而不是 403、404 或 5xx。若爬虫根本没来,可能是新站尚未被发现,也可能是服务器防火墙拦截,需要分别排查。
  4. 在搜索引擎的站长平台提交主域名和站点地图。站点地图只放需要收录的规范 URL,不要混入被屏蔽页面。

这里要区分“可能原因”和“已定位原因”:日志里出现 403,可能是防火墙、CDN 或权限配置,不能直接断定是某一项;只有逐项关闭或调整后复测,才能确认。

维护:上线后一周内重点看什么

上线不是终点。新站上线后一周内,重点观察两件事:一是日志中爬虫访问量是否从零星变为持续,二是站长平台是否报告抓取异常或索引覆盖问题。如果发现大量页面被标记为“已发现但未收录”,先回到抓取配置检查,而不是急着改内容。

维护阶段保持一个习惯:每次改模板、换域名或调整 CDN 后,重新检查 robots.txt、noindex 和 301 跳转。这三处最容易在变动中被误改。

下一步建议:现在就打开你的 robots.txt 和任意一个页面源代码,对照本文清单逐项打勾,把发现的问题按“影响收录范围”排序,先修整站屏蔽,再修单页设置。

图1 图2

nginx