robots.txt 本身不区分移动端与桌面端,绝大多数主流搜索引擎抓取时也使用同一份 robots.txt。因此,检查差异的重点不是找“移动版 robots.txt”,而是确认同一份规则在移动优先抓取背景下是否误伤了移动端资源,以及是否错误地用移动端表现推断桌面端。判断方法是:先对比两端实际加载的资源与路径,再检查规则是否对这些路径生效,最后用抓取测试工具复查。
移动端和桌面端访问同一页面时,可能请求不同的 URL、CSS、JS 或图片路径。常见情况包括:
m.example.com,而 robots.txt 只写在主域。Disallow 拦截的静态资源目录。这些差异属于“可能原因”,不是已经定位的结论。需要先观察两端实际请求了哪些路径,再判断是否被规则拦截。
在搜索平台的抓取测试工具中分别以移动端和桌面端用户代理测试同一 URL,记录返回的 HTML 与资源列表。对比时重点看三类信息:
User-agent 分组是否覆盖了对应爬虫。如果移动端测试显示某些 CSS 或 JS 被 robots.txt 阻止,而桌面端正常,说明规则可能对移动端资源路径生效。此时不要直接删除规则,先确认这些资源是否确实需要被抓取。若资源仅用于交互增强,阻止抓取可能不影响索引;若影响内容渲染,则需要调整。
常见误伤来自过度宽泛的 Disallow。例如:
Disallow: / 会阻止所有路径,移动端和桌面端都无法抓取。若只想阻止某个目录,应写成 Disallow: /private/,并确认移动端没有把必要资源放在该目录下。
另一个检查项是 User-agent 分组。如果只写了 User-agent: Googlebot,而移动端抓取使用 Googlebot Smartphone,需要确认该分组是否同样适用。不同搜索引擎对移动端爬虫的命名和支持情况不同,应分别核查,不能假设所有引擎行为一致。
完成规则调整后,按以下步骤复查:
需要记住:robots.txt 的抓取限制不等于可靠的索引移除。即使移动端资源被阻止,页面仍可能因外部链接或历史索引出现在结果中。若目标是移除索引,应使用相应的移除工具或 noindex,而不是只依赖 robots.txt。
选取一个移动端与桌面端资源路径不同的页面,分别用两端用户代理运行抓取测试,记录被拦截的路径。若发现必要资源被阻止,再针对该路径调整规则并复查。