你好,我是家禾。
有个客户网站上线两个月,百度就是不收录内页。排查半天发现,robots.txt 把后台路径和带参数的页面全屏蔽了,连正常内容页也误伤。robots.txt 这文件看着小,配错了能直接把搜索引擎拒之门外。今天讲清楚该怎么写。
robots.txt 是干什么的
它是放在网站根目录的一个纯文本文件,搜索引擎蜘蛛来爬你网站时,第一个访问的就是它。你用它告诉蜘蛛:哪些页面可以抓,哪些别碰。
要注意:robots.txt 是“君子协定”,正规蜘蛛(百度、谷歌)会遵守,但它不是防火墙,不能真正阻止访问。真正敏感的内容,别只靠它屏蔽。
基本语法规则
文件里最常用的就几条指令:
- User-agent:对谁生效,* 代表所有蜘蛛,Baiduspider 特指百度
- Disallow:不允许抓取的路径
- Allow:允许抓取的路径,用来放开某个子路径
- Sitemap:声明网站地图地址
举个常见写法的例子:
User-agent: *
Disallow: /admin/
Disallow: /*?*
Allow: /admin/upload/
Sitemap: https://www.你的域名.com/sitemap.xml
该屏蔽什么,千万别屏蔽什么
建议屏蔽的:后台管理路径、搜索结果页(带问号参数)、筛选排序页、购物车结账页、重复的分页。
千万别屏蔽的:CSS、JS、图片资源目录(蜘蛛要靠它们渲染页面),还有你的内容页、产品页。很多人图省事写一句 Disallow: / ,等于关门谢客,整站都不会被收录。
配置完一定要验证
别写完就不管,按这三步验证:
- 浏览器直接访问 域名/robots.txt,确认能打开、内容正确
- 用百度搜索资源平台的“robots检测”工具,输入页面路径看是否被误封
- 检查 Sitemap 声明的地址能不能正常打开
改完 robots.txt 后,蜘蛛下次抓取就会按新规则来,一般几天内生效。
如果你的网站是交给 cv98.cn(北遇建站)搭的,这些技术配置我们在建站时就处理好了——robots.txt、sitemap、伪静态、404页面一次性配好,不用你自己对着代码发愁,网站上线后的抓取和收录基础从一开始就是顺的。
记住一句话:robots.txt 的原则是“该挡的挡住,该放的敞开”,宁可少屏蔽,也别误杀内容页。
原创文章,作者:家禾,如若转载,请注明出处:https://www.duanjiahe.com/2784.html