Robots.txt 是网站根目录中的一个文本文件,用于告诉搜索引擎哪些页面允许抓取、哪些页面不建议抓取。它是 Technical SEO 中最基础也是最重要的配置之一。如果 Robots.txt 配置错误,可能导致网站页面无法被 Google 抓取,甚至整站无法收录。
文章目录
什么是 Robots.txt?
Robots.txt 是一个遵循 Robots Exclusion Protocol(机器人排除协议) 的文本文件,专门用于指导搜索引擎爬虫(Crawler)访问网站内容。
它并不会影响用户访问网站,而是告诉搜索引擎:
- 哪些页面可以抓取
- 哪些页面不要抓取
- 网站 Sitemap 的位置
对于新网站来说,正确配置 Robots.txt 可以帮助 Google 更快发现重要页面,提高抓取效率。
如果想进一步了解 Robots.txt 的工作原理,可以参考 Google Search Central 官方文档(Robots.txt Introduction)。

Robots.txt 在哪里?
Robots.txt 必须放在网站根目录。
例如:
https://example.com/robots.txt
只要浏览器能够访问这个地址,搜索引擎也可以读取它。
如果网站没有 Robots.txt,并不会影响网站正常访问,但搜索引擎将无法获得抓取规则。
Robots.txt 有什么作用?
很多人认为 Google 会自动抓取所有网页,其实并不是。
Google 为每个网站都分配了一定的 抓取预算(Crawl Budget)。
如果网站存在大量没有价值的页面,例如:
- 登录页面
- 后台页面
- 搜索结果页
- 重复内容
- 测试页面
Google 可能会浪费大量抓取资源。
而 Robots.txt 的作用,就是告诉搜索引擎:
把抓取资源优先放在真正有价值的页面。
Robots.txt 的基本语法
最简单的 Robots.txt 文件如下:
User-agent: *
Disallow:
含义:
User-agent: *:适用于所有搜索引擎Disallow::没有禁止任何目录
也就是说:
允许所有搜索引擎抓取整个网站。
User-agent 是什么意思?
User-agent 表示搜索引擎爬虫。
例如:
User-agent: Googlebot
表示:
这条规则仅对 Google 搜索引擎生效。
常见爬虫包括:
- Googlebot
- Bingbot
- Applebot
- Baiduspider
Disallow 是什么意思?
Disallow 表示禁止抓取。
例如:
User-agent: *
Disallow: /wp-admin/
表示:
所有搜索引擎都不要抓取 WordPress 后台。
需要注意的是:
禁止抓取并不代表页面一定不会出现在搜索结果中。
如果其他网站链接到了该页面,Google 仍然可能知道它的存在。
Allow 是什么意思?
Allow 用来指定:
即使父目录被禁止抓取,某些页面仍然允许抓取。
例如:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
这是很多 WordPress 网站默认采用的配置。
一个完整的 Robots.txt 示例
推荐的新站配置如下:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap.xml
它包含了三个重要部分:
- 屏蔽后台目录
- 保留 Ajax 功能
- 告诉 Google Sitemap 的位置
这是目前比较推荐的配置方式。

WordPress 默认 Robots.txt 配置
如果使用 WordPress,并安装 Rank Math 或 Yoast SEO,通常都会自动生成 Robots.txt。
默认会屏蔽:
- wp-admin
- 后台登录页面
这样做不会影响 SEO。
因为这些页面本身没有任何搜索价值。
Robots.txt 会影响网站收录吗?
会。
如果 Robots.txt 配置错误,Google 可能无法抓取网站页面。
例如:
Disallow: /
这一行代码表示:
整个网站全部禁止抓取。
这是 SEO 新手最容易犯的错误之一。
很多网站上线后一直没有收录,最后发现就是 Robots.txt 配置错误。
我曾遇到过的一个真实案例
很多站长在开发网站时,会先禁止搜索引擎抓取:
Disallow: /
网站上线后,却忘记删除这条规则。
结果:
- Google 无法抓取页面
- Search Console 一直没有新的抓取记录
- 网站几个月都没有收录
删除错误配置并重新提交 Sitemap 后,Google 才逐渐恢复抓取。
因此,每次网站上线前,都建议检查一次 Robots.txt。
Robots.txt 与 Noindex 有什么区别?
很多 SEO 新手都会混淆这两个概念。
| Robots.txt | Noindex |
|---|---|
| 控制是否允许抓取 | 控制是否允许收录 |
| 放在 Robots.txt 文件 | 放在 Meta Robots 标签或 HTTP Header |
| 不能保证页面不会收录 | 可以告诉搜索引擎不要收录 |
简单来说:
- Robots.txt 管理的是 抓取(Crawl)
- Noindex 管理的是 收录(Index)
Robots.txt 可以隐藏页面吗?
不能。
Robots.txt 只是一个建议协议。
如果别人知道页面地址,仍然可以直接访问。
因此:
不要把 Robots.txt 当成网站安全措施。
后台登录页面仍然需要:
- 登录验证
- 权限控制
- 安全防护
如何测试 Robots.txt?
建议使用 Google Search Console 检查网站抓取情况。
如果发现:
- 页面被 Robots.txt 阻止
- Sitemap 无法读取
- Google 无法抓取重要页面
都应该及时修复。

WordPress 如何修改 Robots.txt?
常见方法有三种:
方法一:Rank Math(推荐)
直接在后台即可编辑 Robots.txt。
无需 FTP。
方法二:Yoast SEO
Yoast SEO 同样支持编辑 Robots.txt。
适合大多数 WordPress 网站。
方法三:服务器直接修改
通过 FTP 或主机文件管理器编辑:
robots.txt
适合需要自定义配置的网站。
Google 官方也提供了完整的 robots.txt 编写规范和最佳实践,建议在修改之前阅读官方说明。
Robots.txt 常见错误
下面这些错误非常常见:
❌ 整站禁止抓取
Disallow: /
❌ 屏蔽 CSS、JavaScript
导致 Google 无法正常渲染页面。
❌ 屏蔽文章目录
Google 无法发现内容。
❌ 忘记添加 Sitemap
影响 Google 更快发现新页面。

Robots.txt 最佳实践
建议遵循以下原则:
- 不要随意屏蔽重要页面
- 不要屏蔽 CSS 和 JavaScript
- 保持 Robots.txt 简洁
- 添加 Sitemap 地址
- 网站上线前检查配置是否正确
- 定期通过 Google Search Console 查看抓取状态
常见问题(FAQ)
Robots.txt 删除了会怎样?
网站仍然可以正常访问,但搜索引擎将无法读取抓取规则。
Robots.txt 可以阻止别人访问网站吗?
不能。
它只能告诉搜索引擎如何抓取。
无法限制普通用户访问。
Robots.txt 会影响 SEO 排名吗?
不会直接影响排名。
但如果配置错误,会影响抓取和收录,从而间接影响 SEO 表现。
新网站一定需要 Robots.txt 吗?
建议需要。
虽然不是必须,但它可以帮助搜索引擎更高效地抓取网站。
总结
Robots.txt 是 Technical SEO 中不可忽视的一部分。
它虽然只是一个简单的文本文件,却直接影响搜索引擎如何抓取网站。
对于 WordPress 网站来说,建议:
- 保持默认配置
- 不要随意屏蔽重要页面
- 添加 Sitemap 地址
- 定期检查是否存在配置错误
只要合理使用 Robots.txt,就能够帮助 Google 更高效地抓取网站内容,为后续页面收录和 SEO 优化打下坚实基础。
推荐阅读
为什么文章没有排名?15个常见原因与完整解决方案(2026)
Google为什么不收录我的网站?10个最常见原因及解决方法(2026完整指南)
新网站如何获取第一批Google流量?我的实战经验分享(2026)