核对抓取限制,核心是确认Googlebot在抓取你网站时是否被robots.txt、页面级noindex、登录墙或服务器响应挡住了。起点不是改代码,而是先用Google Search Console的“网址检查”和robots.txt测试工具观察实际抓取状态,再判断限制来自哪一层,最后处理并复查。
打开Google Search Console,用“网址检查”输入一个具体URL,看“抓取”和“已编入索引”两栏。如果显示“已抓取,但未编入索引”,说明抓取没被完全挡住,问题可能在内容质量或重复;如果显示“已被robots.txt屏蔽”或“抓取异常”,才进入抓取限制排查。同时查看“设置”里的“抓取统计信息”,对比最近几天的响应码变化。
另一个观察点是服务器日志。筛选User-Agent包含Googlebot的请求,看它请求了哪些URL、返回什么状态码。如果大量返回403、429或503,说明限制来自服务器端,而不是robots.txt。
抓取限制可能出现在四个位置,需要逐层核对:
Disallow: /或针对特定目录的规则挡住了Googlebot。注意规则是前缀匹配,Disallow: /tmp会同时挡住/tmp和/tmpage。<meta name="robots" content="noindex">或noarchive。noindex不阻止抓取,但会阻止收录,容易和抓取限制混淆。curl -I查看是否返回X-Robots-Tag: noindex或nofollow。响应头优先级高于页面meta,两者冲突时以响应头为准。判断方法:如果robots.txt测试工具显示“已屏蔽”,问题在robots.txt;如果测试工具显示“允许”,但网址检查显示抓取异常,问题在服务器或响应头。两者都正常但页面没收录,则不属于抓取限制,应转向内容与索引质量排查。
确认限制层后,只改对应位置。robots.txt问题就修改规则并重新用测试工具验证;响应头问题就在服务器或CDN配置中移除X-Robots-Tag;服务器限流就调整防火墙或CDN的Googlebot放行策略。
修改前先记录原始状态,包括修改时间、修改内容和修改前的抓取统计截图。一次只改一个变量,避免多个改动叠加后无法判断哪个生效。如果同时改了robots.txt和响应头,复查时无法区分是哪一项解除了限制。
修改后不要立刻下结论。Google重新抓取需要时间,且抓取频率受网站权重、更新频率和服务器响应速度影响。复查时对比“抓取统计信息”中Googlebot的请求次数和响应码分布,同时用网址检查重新请求抓取。
比较时要注意:搜索需求本身有季节性波动,数据采集也可能因日志采样方式不同而有差异。如果改动前后正好跨过节假日或行业淡旺季,抓取量变化不能全部归因于你的修改。判断标准是响应码中403、429、503的比例是否下降,以及目标URL是否从“已屏蔽”变为“已抓取”。
下一步:选一个当前被限制的具体URL,用网址检查确认限制类型,再按上面四层逐一核对,只改真正挡住Googlebot的那一层。