首页 >> 大全

百度蜘蛛抓取和收录的关系

2022-05-30 大全 208 作者:考证青年

相信大家对百度蜘蛛这个词都不陌生吧,记得我在第一次听到百度蜘蛛这个词的时候,是在11年初,那时候百度蜘蛛并没有如今的人性化,那时候的百度蜘蛛抓取释放几乎么有任何规则。但对现在的百度蜘蛛而言,那时候等于是个幼蜘,现在的百度蜘蛛已经兵强马壮,下面我们来了解一下百度蜘蛛的规则吧。

聪明的蜘蛛

百度蜘蛛是什么

百度蜘蛛是百度搜索引擎的一个自动程序,它通过网络来搜集网络上网站的内容,其中包括:文字、图片、视频等,然后进行分析整理出数据库,最终能够在百度搜索引擎中展现您的文字、图片、视频等,之所以取名叫做百度蜘蛛,是因为此程序有类似于蜘蛛的功能,补下天罗地网,能够搜集到许多网络上的信息。

常见的百度蜘蛛IP

当你网站有人访问或者有机器访问,那就一定会出现一个IP,通常情况下,我们的服务器都会记录这些IP信息,下面是网友提供的常见的百度蜘蛛IP。

123.125.68.*这个蜘蛛经常来,别的来的少,表示网站可能要进入沙盒了,或被者降权。

220.181.68.*每天这个IP段只增不减很有可能进沙盒或K站。

220.181.7.*、123.125.66.*代表百度蜘蛛IP造访,准备抓取你东西。

121.14.89.*这个ip段作为度过新站考察期。

203.208.60.*这个ip段出现在新站及站点有不正常现象后。

210.72.225.*这个ip段不间断巡逻各站。

125.90.88.*广东茂名市电信也属于百度蜘蛛IP主要造成成分,是新上线站较多,还有使用过站长工具,或SEO综合检测造成的。

220.181.108.95这个是百度抓取首页的专用IP,如是220.181.108段的话,基本来说你的网站会天天隔夜快照,绝对错不了的,我保证。

220.181.108.92同上98%抓取首页,可能还会抓取其他(不是指内页)220.181段属于权重IP段此段爬过的文章或首页基本24小时放出来。

123.125.71.106抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。

220.181.108.91属于综合的,主要抓取首页和内页或其他,属于权重IP段,爬过的文章或首页基本24小时放出来。

220.181.108.75重点抓取更新文章的内页达到90%,8%抓取首页,2%其他。权重IP段,爬过的文章或首页基本24小时放出来。

220.181.108.86专用抓取首页IP权重段,一般返回代码是30400代表未更新。

123.125.71.95抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。

123.125.71.97抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。

220.181.108.89专用抓取首页IP权重段,一般返回代码是30400代表未更新。

220.181.108.94专用抓取首页IP权重段,一般返回代码是30400代表未更新。

220.181.108.97专用抓取首页IP权重段,一般返回代码是30400代表未更新。

220.181.108.80专用抓取首页IP权重段,一般返回代码是30400代表未更新。

220.181.108.77专用抓首页IP权重段,一般返回代码是30400代表未更新。

123.125.71.117抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。

220.181.108.83专用抓取首页IP权重段,一般返回代码是30400代表未更新。

百度蜘蛛抓取规则

前面说到,百度蜘蛛的人性化,那么百度蜘蛛就一定有自己的抓取规章,当遇到一些不适合抓取或空白页面,那么百度搜索引擎将会直接取消抓取,下面来看看百度是如何抓取我们的页面的。

1、访问

当蜘蛛来到你的网站第一眼不看别的,只看文件,如果你的文件禁止了百度蜘蛛抓取,那么百度蜘蛛会直接离开你的网站,不会对你网站进行抓取。当然如果你的robos文件有网站地图,那么搜索引擎会直接通过来抓取你的网站地图文件,更便捷的让蜘蛛知道你的所有需要抓取收录的页面。

关于我们

最火推荐

小编推荐

联系我们


版权声明:本站内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 88@qq.com 举报,一经查实,本站将立刻删除。备案号:桂ICP备2021009421号
Powered By Z-BlogPHP.
复制成功
微信号:
我知道了