robots

  • 时间:
  • 浏览:70次
  • 来源:网站服务商官网 网址:https://www.wzfws.com

robots.txt文件是一个文本文件,是搜索引擎中访问网站的时候要查看的第一个文件。robots.txt文件告诉蜘蛛程序在服务器上什么文件是可以被查看的。


当一个搜索蜘蛛访问一个站点时,它会首先检查该站点根目录下是否存在robots.txt,如果存在,搜索机器人就会按照该文件中的内容来确定访问的范围;如果该文件不存在,所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面。



【原则】

Robots协议是国际互联网界通行的道德规范,基于以下原则建立:

1、搜索技术应服务于人类,同时尊重信息提供者的意愿,并维护其隐私权;

2、网站有义务保护其使用者的个人信息和隐私不被侵犯

[注意]robots.txt必须放置在一个站点的根目录下,而且文件名必须全部小写。



Robots协议的全称是“网络爬虫排除标准”(Robots Exclusion Protocol),它的功能是通过Robots文件告诉搜索引擎哪些页面可以抓取,哪些页面不能抓取,抓取的标准等。它以一个文本文件的形式放在网站的根目录中,用任何一个常见的文本编辑器都可以对其进行修改和编辑。对于站长来说,合理的书写robots.txt文件可以更合理的利用搜索引擎,屏蔽掉一些低质量的页面,提高网站质量和对搜索引擎的友好度。



具体写法如下:(*为通配符)

User-agent: * 代表的所有的搜索引擎种类,

Disallow: /admin/ 这里定义是禁止爬寻admin目录下面的目录

Disallow: /require/ 这里定义是禁止爬寻require目录下面的目录

Disallow: /ABC/ 这里定义是禁止爬寻ABC目录下面的目录

Disallow: /cgi-bin/*.htm 禁止访问/cgi-bin/目录下的所有以”.htm”为后缀的url(包含子目录)。

Disallow: /*?* 禁止访问网站中所有包含问号 (?) 的网址

Disallow: /.jpg$ 禁止抓取网页所有的.jpg格式的图片

Disallow:/ab/adc.html 禁止爬取ab文件夹下面的adc.html文件。

Allow: /cgi-bin/ 这里定义是允许爬寻cgi-bin目录下面的目录

Allow: /tmp 这里定义是允许爬寻tmp的整个目录

Allow: .htm$ 仅允许访问以”.htm”为后缀的URL。

Allow: .gif$ 允许抓取网页和gif格式图片

Sitemap: 网站地图 告诉爬虫这个页面是网站地图


使用误区:

误区一:我的网站上的所有文件都需要蜘蛛抓取,那我就没必要在添加robots.txt文件了。反正如果该文件不存在,所有的搜索蜘蛛将默认能够访问网站上所有没有被口令保护的页面。

每当用户试图访问某个不存在的URL时,服务器都会在日志中记录404错误(无法找到文件)。每当搜索蜘蛛来寻找并不存在的robots.txt文件时,服务器也将在日志中记录一条404错误,所以你应该做网站中添加一个robots.txt。


误区二:在robots.txt文件中设置所有的文件都可以被搜索蜘蛛抓取,这样可以增加网站的收录率。

网站中的程序脚本、样式表等文件即使被蜘蛛收录,也不会增加网站的收录率,还只会浪费服务器资源。因此必须在robots.txt文件里设置不要让搜索蜘蛛索引这些文件。

具体哪些文件需要排除, 在robots.txt使用技巧一文中有详细介绍。


误区三:搜索蜘蛛抓取网页太浪费服务器资源,在robots.txt文件设置所有的搜索蜘蛛都不能抓取全部的网页。

如果这样的话,会导致整个网站不能被搜索引擎收录。                                                    


robots.txt参考:

网站服务商官方robots.txt:https://www.wzfws.com/robots.txt

User-agent: *

Disallow:

Sitemap: https://www.wzfws.com/sitemap.xml

本文地址:https://www.wzfws.com/robots.html


网站服务商经典语录
欢迎关注我的微信和微信公众号

猜你喜欢

视频教程:在自己的电脑上安装phpstudy软件,创建本地网站环境,搭建各种网站

我们做网站的人经常要安装各种网站程序,看看这个网站程序适合不适合自己的要求,这个网站源码到底是否可用等,本地安装测试,要比上传到虚拟主机或者服务器上面修改要方便得多。php中文

2019-07-24  分类:基础知识  浏览:70次


免费在线智能AI文章伪原创工具源码

免费在线智能AI文章伪原创工具源码出售本工具源码不写入数据库,上传到任意支持php的网站空间即可,部分空间需要开启相关的参数,才能正确使用。伪原创工具的工作原理是:使用谷歌翻译

2019-07-19  分类:小工具  浏览:107次


网站服务商diy模板更新

更新的地方有:1、6月19日增加了两个栏目单页面模板。2、6月22日修改了文章详情页的字体大小和间距。3、6月23日调整了上一篇、下一篇和猜你喜欢的位置。4、6月24日,在上一篇、下一篇的上方,增加一个回到目录的提示与地址。

2019-07-01  分类:本站公告  浏览:100次


杨泽业:mipjz网站的MIP数据提交到神马搜索的实现方法

今天早上研究了一下,怎么把mipjz程序的文章链接和标签链接推送到神马搜索里面。我们的程序是mip的,神马搜索页也支持MIP数据提交。神马搜索里面只是提供了api,没有提交的入

2019-07-01  分类:mipcms  浏览:184次


工信部批复设立中国自己的域名根服务器

6月26日,工信部发布通告《工业和信息化部关于同意中国互联网络信息中心设立域名根服务器(F、I、K、L根镜像服务器)及域名根服务器运行机构的批复》及《工业和信息化部关于同意互联

2019-06-28  分类:行业资讯  浏览:96次


给你的网站添加百度商桥的在线沟通的功能

今天我访问我的一个买了我的mip网站模板的客户的网站,发现了他的网站添加了百度商桥的在线沟通的功能。我认为添加了商桥的代码,肯定就不能通过百度mip的验证了。但是,我错了。我经

2019-06-21  分类:基础知识  浏览:201次


景安虚拟主机免费一键开启https安全访问的方法

今天在杨泽业网站建设交流群(群号:187388018)群友普密斯精密仪器问我:“群主,你网站上有把mipcms加上https的教程吗?”我回答说:“没有,你遇到什么问题了,直接

2019-06-20  分类:基础知识  浏览:143次


网站服务商diy模板618更新:全站删除文章缩略图,让网站访问更加快速

网站服务商讯:网站服务商站长杨泽业基于mipjz官方模版制作的diy模板,在2019年6月18日进行更新:全站删除文章缩略图,让网站访问更加快速。本次删除的缩略图的地方有首页列

2019-06-17  分类:本站公告  浏览:108次


给网站添加网站地图

网站地图,又称站点地图,它就是一个引导页面,让用户或者搜索引擎更加方便的找到自己需要的内容,搜索引擎蜘蛛非常喜欢网站地图。网站地图分为html地图和xml地图。html地图给用

2019-06-10  分类:基础知识  浏览:142次


网站地图

网站地图,又称站点地图,它就是一个引导页面,让用户或者搜索引擎更加方便的找到自己需要的内容,搜索引擎蜘蛛非常喜欢网站地图。网站地图分为html地图和xml地图。html地图给用

2019-06-10  分类:建站百科  浏览:89次