如何利用robots.txt对wordpress博客进行优化

 我来答

3个回答

#热议# 在购买新能源车时，要注意哪些？

一诺千金丨
2016-01-15 · 知道合伙人数码行家

一诺千金丨
知道合伙人数码行家

采纳数：8766 获赞数：32842

1、专业生产电力检测设备，若要咨询相关直接向我咨询关于电力检测设备的问题吧。 2、武高电测最佳员工。

向TA提问私信TA

关注

展开全部

一、先来普及下robots.txt的概念：

　　robots.txt(统一小写)是一种存放于网站根目录下的ASCII编码的文本文件，它通常告诉网络搜索引擎的漫游器(又称网络蜘蛛)，此网站中的哪些内容是不能被搜索引擎的漫游器获取的，哪些是可以被(漫游器)获取的。这个文件用于指定spider在您网站上的抓取范围，一定程度上保护站点的安全和隐私。同时也是网站优化利器，例如屏蔽捉取站点的重复内容页面。

　　robots.txt目前并不是一种标准，只是一种协议!所以现在很多搜索引擎对robots.txt里的指令参数都有不同的看待。

　　二、使用robots.txt需要注意的几点地方：

　　1、指令区分大小写，忽略未知指令，下图是本博客的robots.txt文件在Google管理员工具里的测试结果;

　　2、每一行代表一个指令，空白和隔行会被忽略;

　　3、“#”号后的字符参数会被忽略;

　　4、有独立User-agent的规则，会排除在通配“*”User agent的规则之外;

　　5、可以写入sitemap文件的链接，方便搜索引擎蜘蛛爬行整站内容。

　　6、尽量少用Allow指令，因为不同的搜索引擎对不同位置的Allow指令会有不同看待。

　　三、Wordpress的robots.txt优化设置

　　1、User-agent： *

　　一般博客的robots.txt指令设置都是面对所有spider程序，用通配符“*”即可。如果有独立User-agent的指令规则，尽量放在通配“*”User agent规则的上方。

　　2、Disallow： /wp-admin/
　　Disallow： /wp-content/
　　Disallow： /wp-includes/

　　屏蔽spider捉取程序文件，同时也节约了搜索引擎蜘蛛资源。

　　3、Disallow： /*/trackback

　　每个默认的文章页面代码里，都有一段trackback的链接，如果不屏蔽让蜘蛛去捉取，网站会出现重复页面内容问题。

　　4、Disallow： /feed
　　Disallow： /*/feed
　　Disallow： /comments/feed

　　头部代码里的feed链接主要是提示浏览器用户可以订阅本站，而一般的站点都有RSS输出和网站地图，故屏蔽搜索引擎捉取这些链接，节约蜘蛛资源。

　　5、Disallow： /?s=*
　　Disallow： /*/?s=*

　　这个就不用解释了，屏蔽捉取站内搜索结果。站内没出现这些链接不代表站外没有，如果收录了会造成和TAG等页面的内容相近。

　　6、Disallow： /?r=*

　　屏蔽留言链接插件留下的变形留言链接。(没安装相关插件当然不用这条指令)

　　7、Disallow： /*.jpg$
　　Disallow： /*.jpeg$
　　Disallow： /*.gif$
　　Disallow： /*.png$
　　Disallow： /*.bmp$

　　屏蔽捉取任何图片文件，在这里主要是想节约点宽带，不同的网站管理员可以按照喜好和需要设置这几条指令。

　　8、Disallow： /?p=*

　　屏蔽捉取短链接。默认头部里的短链接，百度等搜索引擎蜘蛛会试图捉取，虽然最终短链接会301重定向到固定链接，但这样依然造成蜘蛛资源的浪费。

　　9、Disallow： /*/comment-page-*
　　Disallow： /*?replytocom*

　　屏蔽捉取留言信息链接。一般不会收录到这样的链接，但为了节约蜘蛛资源，也屏蔽之。

　　10、Disallow： /a/date/
　　Disallow： /a/author/
　　Disallow： /a/category/
　　Disallow： /?p=*&preview=true
　　Disallow： /?page_id=*&preview=true
　　Disallow： /wp-login.php

　　屏蔽其他的一些形形色色的链接，避免造成重复内容和隐私问题。

　　10、Sitemap:http://***.com/sitemap.txt

　　网站地图地址指令，主流是txt和xml格式。告诉搜索引擎网站地图地址，方便搜索引擎捉取全站内容，当然你可以设置多个地图地址。要注意的就是Sitemap的S要用大写，地图地址也要用绝对地址。

本回答由电脑网络分类达人孟男男推荐

已赞过 已踩过<

评论收起

枫叶lvp
2016-01-14

知道答主

回答量：34

采纳率：0%

帮助的人：11万

我也去答题访问个人页

关注

展开全部

User-agent: *-----------------------------对所有的搜索引擎开放
Disallow: /wp-admin/-------------------不允许抓取WordPress的后台登陆管理页面
利用好allow和disallow条件，如网站改版时，就要暂时屏蔽一些页面了
另：在有多个条件命令下，上面的命令是大范围的，下面的命令是小范围细节方面的，如果针对小范围有命令，则以区域命令条件为准，如果没有，就以大范围条件为准

已赞过 已踩过<

评论收起

创业小柯
2016-01-12 · 关注网上创业，分享经验心得

创业小柯

采纳数：48 获赞数：68

向TA提问私信TA

关注

展开全部

可以屏蔽抓取你后台的地址，你不想抓取的页面

已赞过 已踩过<

评论收起

更多回答（1）

推荐律师服务：若未解决您的问题，请您详细描述您的问题，通过百度律临进行免费专业咨询

如何利用robots.txt对wordpress博客进行优化

其他类似问题

为你推荐：