核对抓取限制,核心是确认搜索引擎的抓取程序能不能正常访问你想被收录的页面。最直接的做法是:先在浏览器中打开目标页确认可访问,再检查 robots.txt 是否误屏蔽,然后查看页面源码中的 robots meta 与 X-Robots-Tag,最后用服务器日志或抓取工具验证真实抓取行为。四步都通过,才能判断限制不在抓取侧。
不要全站泛泛地看。从企业网站SEO方法的实际执行角度,先列出三类URL:首页与栏目页、近期重点推广的产品或文章页、以及最近改版或迁移过的页面。把它们的完整地址、期望状态(可抓取、可索引)列成一张表。
准备阶段还要确认一件事:你检查的是搜索引擎的抓取,而不是用户访问。用户能打开不等于抓取程序能打开。有些限制只针对特定 user-agent,用普通浏览器看不出来。
最关键的一步是 robots.txt 检查,因为它一次屏蔽可能影响整站或整个目录,且优先级高于页面内标签。
Disallow: / 或针对目标目录的屏蔽规则。注意规则是前缀匹配,Disallow: /product 会同时挡住 /product 和 /products,容易误伤。<head> 区域,是否出现 <meta name="robots" content="noindex"> 或 nofollow。noindex 影响的是索引而非抓取,但常与抓取问题一起排查。X-Robots-Tag: noindex。这类限制写在服务器或CDN配置里,页面源码中看不到,容易漏查。假设某企业站把 Disallow: /news/ 写进 robots.txt,同时又在 sitemap 中提交了新闻页。此时抓取程序不会抓取这些页面,sitemap 提交也不会改变结果。判断依据是:robots.txt 的屏蔽对常规抓取生效,页面内标签无法覆盖它。适用条件是确认屏蔽规则确实命中了目标路径,而不是你以为的“部分放行”。
配置检查通过后,还要验证真实抓取。可执行的方式有两种:
如果日志中完全没有该 user-agent 的访问记录,可能是抓取限制,也可能是网站整体权重低、外链少、未被发现。这两种解释不能混为一谈,需要结合 sitemap 提交记录和内链情况进一步区分。
每次调整 robots.txt、服务器响应头或页面模板后,都要重新走一遍上面的检查。企业网站SEO方法中,抓取限制往往不是一次性问题,而是改版、上新、CDN配置变更时反复出现的隐患。
比较改动前后数据时要注意:搜索需求本身有季节波动,数据采集口径也可能不同。不要因为某天抓取量下降就断定是新加的规则导致,先确认日志中的状态码和 user-agent 是否变化。
下一步建议:从你列出的URL表中挑一个最重要的页面,按 robots.txt、页面标签、响应头、状态码的顺序完整走一遍,把每步结果记录下来,再决定是否需要修改配置。