网站robots.txt怎么写?正确配置搜索引擎抓取权限的方法与常见错误

网站robots.txt怎么写才正确?本文详解robots.txt的User-agent、Disallow、Allow、Sitemap语法规则,讲清该屏蔽后台路径、搜索参数页和重复页面,以及千万别误封资源文件的注意事项,

你好,我是家禾。

有个客户网站上线两个月,百度就是不收录内页。排查半天发现,robots.txt 把后台路径和带参数的页面全屏蔽了,连正常内容页也误伤。robots.txt 这文件看着小,配错了能直接把搜索引擎拒之门外。今天讲清楚该怎么写。

robots.txt 是干什么的

它是放在网站根目录的一个纯文本文件,搜索引擎蜘蛛来爬你网站时,第一个访问的就是它。你用它告诉蜘蛛:哪些页面可以抓,哪些别碰。

要注意:robots.txt 是“君子协定”,正规蜘蛛(百度、谷歌)会遵守,但它不是防火墙,不能真正阻止访问。真正敏感的内容,别只靠它屏蔽。

基本语法规则

文件里最常用的就几条指令:

  • User-agent:对谁生效,* 代表所有蜘蛛,Baiduspider 特指百度
  • Disallow:不允许抓取的路径
  • Allow:允许抓取的路径,用来放开某个子路径
  • Sitemap:声明网站地图地址

举个常见写法的例子:

User-agent: *
Disallow: /admin/
Disallow: /*?*
Allow: /admin/upload/
Sitemap: https://www.你的域名.com/sitemap.xml

该屏蔽什么,千万别屏蔽什么

建议屏蔽的:后台管理路径、搜索结果页(带问号参数)、筛选排序页、购物车结账页、重复的分页。

千万别屏蔽的:CSS、JS、图片资源目录(蜘蛛要靠它们渲染页面),还有你的内容页、产品页。很多人图省事写一句 Disallow: / ,等于关门谢客,整站都不会被收录。

配置完一定要验证

别写完就不管,按这三步验证:

  1. 浏览器直接访问 域名/robots.txt,确认能打开、内容正确
  2. 用百度搜索资源平台的“robots检测”工具,输入页面路径看是否被误封
  3. 检查 Sitemap 声明的地址能不能正常打开

改完 robots.txt 后,蜘蛛下次抓取就会按新规则来,一般几天内生效。

如果你的网站是交给 cv98.cn(北遇建站)搭的,这些技术配置我们在建站时就处理好了——robots.txt、sitemap、伪静态、404页面一次性配好,不用你自己对着代码发愁,网站上线后的抓取和收录基础从一开始就是顺的。

记住一句话:robots.txt 的原则是“该挡的挡住,该放的敞开”,宁可少屏蔽,也别误杀内容页。

原创文章,作者:家禾,如若转载,请注明出处:https://www.duanjiahe.com/2784.html

(0)
SEO和SEM有什么区别?企业搜索营销预算怎么在自然排名和竞价间分配
上一篇 2026年8月29日 上午1:16
SEO文章开头怎么写?文章前100字决定排名和跳出率的写作技巧
下一篇 2026年8月29日 上午1:17

相关推荐