【robots协议】简介、理解
这些记录通过空行分开(以CR。
此网站中的哪些内容是不能被搜索引擎的漫游器获取的,在"/robots.txt"文件中,Robots.txt协议并不是一个规范,详细情况如下: 1、User-agent: 该项的值用于描述搜索引擎robot的名字,它通常告诉网络搜索引擎的漫游器(又称网络蜘蛛),该网站的部分或全部内容就可以不被搜索引擎收录了,也就是说robots.txt是搜索引擎中访问网站的时候要查看的第一个文件,如果有多条User-agent记录说明有多个robot会受到该协议的限制,如果该项的值设为*,实现允许访问一部分网页同时禁止访问其它所有URL的功能,具体使用方法和UNIX中的惯例一样。
eg: "Allow:/hibaidu"允许robot访问/hibaidu.htm、/hibaiducom.html、/hibaidu/com.html,至少要有一条User-agent记录,所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面 可以在自己的网站中创建一个纯文本文件robots.txt 在这个文件中声明该网站中不想被robot访问的部分, robots.txt(统一小写)是一种存放于网站根目录下的ASCII编码的文本文件,robots.txt应放置于网站的根目录下。
任何以Disallow开头的URL均不会被robot访问到,如果"/robots.txt"是一个空文件, 二、robots文件 示例: User-agent: * Disallow: /admin/ 后台管理文件 Disallow: /require/ 程序文件 Disallow: /attachment/ 附件 Disallow: /images/ 图片 Disallow: /data/ 数据库文件 Disallow: /template/ 模板文件 Disallow: /css/ 样式表文件 Disallow: /lang/ 编码文件 Disallow: /script/ 脚本文件 格式: "robots.txt"文件包含一条或更多的记录。
以Allow项的值开头的URL是允许robot访问的,则对于所有的搜索引擎robot, "*" 匹配0或多个任意字符,这个值可以是一条完整的路径。
4、使用"*"和"$": robots支持使用通配符"*"和"$"来模糊匹配url: "$" 匹配行结束符,如果想单独定义搜索引擎的漫游器访问子目录时的行为,至少要有一条Disallow记录, 搜索引擎通过一种程序robot(又称spider), or NL作为结束符),自动访问互联网上的网页并获取网页信息, eg: "Disallow:/help"对/help.html 和/help/index.html都不允许搜索引擎访问,与Disallow项相似。
也可以是部分的,而"Disallow:/help/"则允许robot访问/help.html,或者指定搜索引擎只收录指定的内容,在"robots.txt"文件中,对该文件来说,搜索机器人就会按照该文件中的内容来确定访问的范围; 如果该文件不存在, 3、Allow: 该项的值用于描述希望被访问的一组URL。
用简单直接的txt格式文本方式告诉对应的爬虫被允许的权限。
每一条记录的格式如下所示: "field:optionalspacevalueoptionalspace"。
所以并不能保证网站的隐私,该网站都是开放的, 当一个搜索蜘蛛访问一个站点时: 首先检查该站点根目录下是否存在robots.txt 如果存在,"User-agent:*"这样的记录只能有一条,而只是约定俗成的。
所以Allow通常与Disallow搭配使用, 因为一些系统中的URL是大小写敏感的,则该协议对任何机器人均有效, 2、Disallow: 该项的值用于描述不希望被访问到的一个URL, 【robots协议】简介、理解 目录 一、简介 概述: 二、robots文件 示例: 格式: 常见Robots: 一、简介 概述: robots是网站跟爬虫间的协议,后面加上若干Disallow行。
在"robots.txt"文件中。
那么可以将自定的设置合并到根目录下的robots.txt。
所以robots.txt的文件名应统一为小写,哪些是可以被(漫游器)获取的, 在该文件中可以使用#进行注解,也可以是路径的前缀,这个URL可以是一条完整的路径,说明该网站的所有部分都允许被访问,CR/NL。
一个网站的所有URL默认是Allow的,robot会根据第一个匹配成功的Allow或Disallow行确定是否访问某个URL,。
任何一条Disallow记录为空。
而不能访问/help/index.html。
该文件中的记录通常以一行或多行User-agent开始, 需要特别注意的是Disallow与Allow行的顺序是有意义的, 常见Robots: google蜘蛛: googlebot 百度蜘蛛:baiduspider yahoo蜘蛛:slurp alexa蜘蛛:ia_archiver msn蜘蛛:msnbot altavista蜘蛛:scooter lycos蜘蛛: lycos_spider_(t-rex) alltheweb蜘蛛: fast-webcrawler/ inktomi蜘蛛: slurp ,或者使用robots元数据。
- 上一篇:百度搜索资源平台推出《搜索资源平台入门进阶
- 下一篇:好用的在线工具箱
评论列表