Robots.txt是一个位于网站根目录的纯文本文件,它的作用是向搜索引擎爬虫明确站内哪些路径可以访问、哪些路径应当被忽略。正确设置它,能有效保护后台、草稿等私密内容不被收录,同时让爬虫抓取资源更聚焦于高价值页面。然而,一旦规则书写不当,可能导致新内容长期不被索引,甚至整个网站从搜索结果中消失。本文将围绕文件放置、规则语法、典型场景写法以及高频错误展开,并提供实用的配置模板供你参考。
文件名称必须为小写的robots.txt,并置于域名根目录下,通过访问 https://你的域名/robots.txt 即可验证其是否生效。该文件以纯文本形式存在,每一行由“字段名: 值”构成,规范写法是在英文冒号后添加一个空格。
核心字段主要包括四个:User-agent(设定该规则针对的爬虫,星号*代表所有爬虫)、Disallow(声明禁止抓取的路径)、Allow(声明允许抓取的路径)以及Sitemap(指明网站地图的网址)。一个最基本的全站开放配置如下:
User-agent: *
Disallow:
此配置意味着所有搜索引擎爬虫均可自由抓取整站内容。编写时需留意:字段名区分大小写,路径必须以根斜杠/作为起始。文件保存时建议采用UTF-8编码且不携带BOM,因为部分严格解析的爬虫遇到BOM标记可能会忽略整份规则。尽管井号#可用于添加注释,但不同爬虫对注释的接受度不一,切勿将关键逻辑寄托于注释内容之上,以免规则失效。
动手编写前,建议先梳理网站目录结构,明确哪些部分需要被搜索引擎收录,哪些部分必须屏蔽。以下列举几种常见场景的配置方法。
不同组规则之间建议留一个空行,以便于阅读和后续维护。若对注释兼容性无把握,尽量避免在规则行附近添加注释。
以下错误在实战中反复出现,且其负面影响往往在数周后才逐渐显现,需要特别留意。
建议每次修改后,使用主流搜索引擎的“robots.txt测试”工具进行一次模拟检查,重点关注规则是否按预期匹配目标路径,再等待生效。
下面提供一份较为完整的配置模板,兼顾了常用目录的屏蔽与地图提交,可根据自身站点结构调整。
User-agent: *
Disallow: /admin/
Disallow: /tmp/
Disallow: /logs/
Disallow: /includes/
# 允许抓取公共静态资源目录
Allow: /public/
Sitemap: https://example.com/sitemap.xml
此模板屏蔽了后台与临时文件目录,同时放行公共资源,适合多数内容型网站直接修改使用。若不需要开放/public/,可删除对应的Allow行。
修复规则并重新提交后,搜索引擎需要重新抓取该文件并处理新规则。通常在一周内会逐步恢复,但已误删的索引需要更长时间重新收录,视引擎抓取频率而定。
可以。每条规则仅对其上方指定的User-agent生效。若需对不同爬虫(如Googlebot与Bingbot)设置不同策略,需分组书写,每组间留空行分隔,且具体的爬虫指令优先级高于星号规则。
不够。robots.txt只是提醒守规矩的爬虫,并非访问权限控制层。真正敏感的数据应通过登录验证或服务器端权限设置来保护,绝不能依赖robots.txt作为唯一防线。
有效的robots.txt配置有助于精准控制搜索引擎抓取范围,提升收录效率。重点在于:文件位置与命名正确、路径书写严谨(尤其注意斜杠与大小写)、规则保持精简并做定期校验。同时应认识到,它仅适用于管理公开抓取行为,敏感信息的保护需借助访问控制手段。建议每季度复查一次文件内容,结合站点结构调整规则,并利用搜索引擎工具验证实际效果,确保规则始终在线。