Robots.txt 规则详解与网站正确配置方法

📍 WDQWDWQD987AAAAA:216.73.216.191
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /99e1ccbb79e2.html
📄

Robots.txt 是存放在网站根目录下的纯文本文件,用来告诉搜索引擎爬虫哪些目录或文件可以抓取,哪些应该跳过。合理规划这个文件,既能避免服务器资源被无效消耗,也能防止后台、会员中心等敏感区域被搜索引擎收录,对网站 SEO 有直接影响。

1. 理解 Robots.txt 的核心指令

一份完整的 robots.txt 由多个指令块组成,每个指令块针对一个或多个爬虫定义抓取边界。掌握下面几个基础指令,就能覆盖绝大多数配置需求。

需要明确的是,robots.txt 本质上是协商协议而非强制指令。正规搜索引擎会遵守,但恶意采集程序通常无视它,更别提借此隐藏机密数据。

2. 不同场景下的配置思路

具体怎么写,取决于站点的实际情况和目标。以下列举几个常见场景的配置逻辑,供你直接参考和调整。

配置时注意把 User-agent 写在指令块最前,同一个爬虫的所有规则需连续排列。若某条路径同时命中多条规则,以最长匹配的规则为准。

3. 编写过程中的常见错误与规避方法

不少站长在修改 robots.txt 后才发现流量骤降或页面不收录,很多问题都源于细节疏忽。以下几条值得反复检查。

另外,不要用 robots.txt 来阻止搜索引擎抓取带参数的动态页面,这类 URL 数量庞大且难以穷举,应优先借助 canonical 标签或 noindex 来处理。

4. 从抓取预算角度优化配置策略

对中大型站点来说,合理运用 robots.txt 能显著提升抓取效率。搜索引擎每天分配给每个网站的抓取资源有限,屏蔽无价值页面能让爬虫更集中地处理重要内容。

值得重点屏蔽的区域包括:搜索结果页、用户中心、购物车页面、重复的分类筛选链接以及后台管理路径。与此同时,务必确保核心产品页、文章页和分类页不被误伤,否则收录数据会出现明显滑坡。

此外,建议在每个指令块之后补充 Sitemap 声明,尤其是网站页面数量较多时,这能帮助爬虫第一时间获得最新的 URL 列表,缩短新内容的收录周期。

5. 常见问题

5.1 修改 robots.txt 后搜索引擎多久才生效

爬虫通常会在下一次重新抓取该文件时读取新规则,一般需要数小时到数天不等。如果想加速,可以在站长平台主动提交更新或触发抓取。

5.2 Disallow 和 Allow 同时出现时哪条生效

规则采用最长匹配原则。举例来说,如果 Disallow 了 /api/ 但 Allow 了 /api/public/,那么爬虫会抓取后者而屏蔽其他 api 路径。优先级取决于路径长度而非书写顺序。

5.3 robots.txt 能防止别人复制我的文章吗

不能。robots.txt 只影响善意爬虫的访问行为,恶意脚本或手动复制并不受约束。保护内容版权应依靠法律手段和正规的版权声明。

6. 总结

写好 robots.txt 的关键在于明确网站的抓取边界,既要保护好后台和重复内容,又不能误伤核心页面。建议每月检查一次该文件,配合站点日志观察爬虫的实际抓取路径,及时把新增的无价值目录加入屏蔽列表。初次配置时,可以先在测试环境模拟,确认无误后再上线,避免因规则冲突而导致搜索引擎收录异常。

图1 图2

nginx