robots.txt 只有几行,写错一行可能整站失联:要么放行了后台,要么屏蔽了全站。新站上线前花 1 分钟对着这篇检查。
核心就三条指令:User-agent、Allow/Disallow、Sitemap。
核心结论
- ✓默认放行,只屏蔽确定的后台和参数页
- ✓Sitemap 一定写,帮爬虫一次找全
- ✓改完去 GSC 验证,别靠想象
- ✓多域名/多语言要分开写
最小可用模板
User-agent: *
Disallow: /admin/
Disallow: /api/
Allow: /
Sitemap: https://example.com/sitemap.xml常见 CMS 追加
- ·WordPress:Disallow /wp-admin/,放行 /wp-content/uploads/
- ·Next.js:一般无需特殊屏蔽,注意_preview 参数页
- ·电商:屏蔽 /cart /checkout /search?q=* 这类动态页
三个作死案例
- ·Disallow: / 写全站,收录一夜清零
- ·屏蔽了 CSS/JS,渲染后页面判为低质
- ·把测试站和正式站用同一份 robots,上线忘改
验证
GSC 的 robots 测试工具跑一次,再看覆盖率报告里“被 robots 屏蔽”的 URL 是否符合预期。
上线前检查清单
- 01后台/API 是否屏蔽
- 02Sitemap 是否声明
- 03CSS/JS 是否放行
- 04动态参数页是否处理
- 05GSC 是否验证通过
常见问题
robots 能保密后台吗?
不能。它是君子协议,敏感路径靠鉴权,不靠 robots。
noindex 写 robots 里吗?
不。noindex 放 meta 或响应头,robots 只管抓不抓。
改完多久生效?
抓取端缓存视站点而定,重要变更去 GSC 手动提交。