Baiduspider

Baiduspider蜘蛛/爬虫属于搜索引擎类型,由Baidu, Inc.开发运行。您可以继续阅读下方信息,以深入了解Baiduspider基本信息,用户代理和访问控制等。

基本信息

Baiduspider的基本信息如下表。但部分不是很规范的蜘蛛和爬虫,可能存在信息不明的情况。
蜘蛛/爬虫名称
Baiduspider
类型
搜索引擎
开发商
Baidu, Inc.
当前状态
活动

用户代理

关于Baiduspider蜘蛛或者爬虫的用户代理字符串,IP地址和服务器,所在地等信息如下表格所示:
Baiduspider-render/2.0 mobile
用户代理字符串
Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)
首次出现
2017-12-11 08:10:15
最后出现
2025-01-10 07:19:17
遵循robots.txt
未知
来源
IP地址(256) 服务器名称 所属国家
116.179.37.230 baiduspider-116-179-37-230.crawl.baidu.com CN
116.179.37.97 baiduspider-116-179-37-97.crawl.baidu.com CN
116.179.37.21 baiduspider-116-179-37-21.crawl.baidu.com CN
116.179.37.146 baiduspider-116-179-37-146.crawl.baidu.com CN
116.179.37.207 baiduspider-116-179-37-207.crawl.baidu.com CN
用户代理字符串
Mozilla/5.0 (Linux;u;Android 4.2.2;zh-cn;) AppleWebKit/534.46 (KHTML,like Gecko) Version/5.1 Mobile Safari/10600.6.3 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)
首次出现
2017-06-21 11:26:33
最后出现
2025-01-10 06:22:12
遵循robots.txt
未知
来源
IP地址(219) 服务器名称 所属国家
116.179.32.133 baiduspider-116-179-32-133.crawl.baidu.com CN
116.179.32.86 baiduspider-116-179-32-86.crawl.baidu.com CN
220.181.108.104 baiduspider-220-181-108-104.crawl.baidu.com CN
220.181.108.178 baiduspider-220-181-108-178.crawl.baidu.com CN
116.179.32.107 baiduspider-116-179-32-107.crawl.baidu.com CN
用户代理字符串
Mozilla/5.0 (iPhone; CPU iPhone OS 9_1 like Mac OS X) AppleWebKit/601.1.46 (KHTML, like Gecko) Version/9.0 Mobile/13B143 Safari/601.1 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)
首次出现
2017-12-19 09:02:12
最后出现
2025-01-08 14:51:36
遵循robots.txt
未知
来源
IP地址(236) 服务器名称 所属国家
116.179.37.17 baiduspider-116-179-37-17.crawl.baidu.com CN
116.179.37.180 baiduspider-116-179-37-180.crawl.baidu.com CN
116.179.37.45 baiduspider-116-179-37-45.crawl.baidu.com CN
116.179.37.91 baiduspider-116-179-37-91.crawl.baidu.com CN
116.179.37.104 baiduspider-116-179-37-104.crawl.baidu.com CN
用户代理字符串
Baiduspider+(+http://www.baidu.com/search/spider.htm)
首次出现
2009-05-11 05:50:00
最后出现
2024-04-16 05:34:33
遵循robots.txt
未知
来源
IP地址(12) 服务器名称 所属国家
220.181.108.160 baiduspider-220-181-108-160.crawl.baidu.com CN
220.181.108.180 baiduspider-220-181-108-180.crawl.baidu.com CN
220.181.108.158 baiduspider-220-181-108-158.crawl.baidu.com CN
220.181.108.145 baiduspider-220-181-108-145.crawl.baidu.com CN
220.181.108.80 baiduspider-220-181-108-80.crawl.baidu.com CN
用户代理字符串
bcebos-spider-1.0
首次出现
2022-08-07 05:46:23
最后出现
2022-09-13 13:27:18
遵循robots.txt
未知
来源
IP地址(16) 服务器名称 所属国家
180.76.26.165 180.76.26.165 CN
180.76.26.160 180.76.26.160 CN
180.76.26.158 180.76.26.158 CN
180.76.26.172 180.76.26.172 CN
180.76.26.167 180.76.26.167 CN
用户代理字符串
Mozilla/5.0 (X11; Ubuntu; Linux x86_64; rv:17.0; Baiduspider-ads) Gecko/17.0 Firefox/17.0
首次出现
2019-09-10 10:31:19
最后出现
2021-03-18 03:56:08
遵循robots.txt
未知
来源
IP地址(23) 服务器名称 所属国家
14.215.176.6 14.215.176.6 CN
14.215.176.5 14.215.176.5 CN
14.215.176.136 14.215.176.136 CN
14.215.176.206 14.215.176.206 CN
14.215.176.146 14.215.176.146 CN
用户代理字符串
Mozilla/5.0 (X11; Ubuntu; Linux x86_64; rv:17.0; Baiduspider-ads) Gecko/17.0 Firefox/17.0
首次出现
2019-09-10 10:31:19
最后出现
2021-03-18 03:56:08
遵循robots.txt
未知
来源
IP地址(6) 服务器名称 所属国家
39.156.65.121 39.156.65.121 CN
14.215.176.83 14.215.176.83 CN
14.215.176.16 14.215.176.16 CN
14.215.176.15 14.215.176.15 CN
14.215.176.7 14.215.176.7 CN
用户代理字符串
Mozilla/5.0 (Macintosh; Intel Mac OS X 10_14_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36 Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html
首次出现
2019-02-16 07:04:11
最后出现
2019-02-16 07:04:11
遵循robots.txt
来源
IP地址(233) 服务器名称 所属国家
116.179.32.50 baiduspider-116-179-32-50.crawl.baidu.com CN
116.179.32.214 baiduspider-116-179-32-214.crawl.baidu.com CN
220.181.108.103 baiduspider-220-181-108-103.crawl.baidu.com CN
116.179.32.98 baiduspider-116-179-32-98.crawl.baidu.com CN
116.179.32.93 baiduspider-116-179-32-93.crawl.baidu.com CN
用户代理字符串
Mozilla/5.0 (Macintosh; Intel Mac OS X 10_14_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36 Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html
首次出现
2019-02-16 07:04:11
最后出现
2019-02-16 07:04:11
遵循robots.txt
未知
来源
IP地址(3) 服务器名称 所属国家
45.115.236.2 45.115.236.2 CN
124.160.26.186 124.160.26.186 CN
60.190.226.179 60.190.226.179 CN
用户代理字符串
Mozilla/5.0 (compatible; Baiduspider-cpro; +http://www.baidu.com/search/spider.html)
首次出现
2016-05-02 08:50:00
最后出现
2016-04-28 12:51:41
遵循robots.txt
未知
来源
IP地址(3) 服务器名称 所属国家
123.125.71.33 baiduspider-123-125-71-33.crawl.baidu.com CN
123.125.71.58 baiduspider-123-125-71-58.crawl.baidu.com CN
123.125.71.15 baiduspider-123-125-71-15.crawl.baidu.com CN
用户代理字符串
Mozilla/5.0 (Linux;u;Android 2.3.7;zh-cn;) AppleWebKit/533.1 (KHTML,like Gecko) Version/4.0 Mobile Safari/533.1 (compatible; +http://www.baidu.com/search/spider.html)
首次出现
2014-08-17 13:47:25
最后出现
2014-08-18 05:28:26
遵循robots.txt
未知
来源
IP地址(20) 服务器名称 所属国家
61.135.190.72 ? CN
61.135.190.200 ? CN
61.135.190.71 ? CN
61.135.190.69 ? CN
61.135.190.197 ? CN
用户代理字符串
Mozilla/5.0 (Linux;u;Android 2.3.7;zh-cn;) AppleWebKit/533.1 (KHTML,like Gecko) Version/4.0 Mobile Safari/533.1 (compatible; +http://www.baidu.com/search/spider.html)
首次出现
2014-08-17 13:47:25
最后出现
2014-08-18 05:28:26
遵循robots.txt
未知
来源
IP地址(10) 服务器名称 所属国家
123.125.71.49 baiduspider-123-125-71-49.crawl.baidu.com CN
123.125.71.21 baiduspider-123-125-71-21.crawl.baidu.com CN
123.125.71.107 baiduspider-123-125-71-107.crawl.baidu.com CN
123.125.71.106 baiduspider-123-125-71-106.crawl.baidu.com CN
123.125.71.51 baiduspider-123-125-71-51.crawl.baidu.com CN
用户代理字符串
Baiduspider-image+(+http://www.baidu.com/search/spider.htm)\nReferer: http://image.baidu.com/i?ct=503316480&z=0&tn=baiduimagedetail
首次出现
2014-07-14 20:36:58
最后出现
2014-07-14 20:36:58
遵循robots.txt
未知
来源
IP地址(13) 服务器名称 所属国家
220.181.108.145 baiduspider-220-181-108-145.crawl.baidu.com CN
220.181.108.163 baiduspider-220-181-108-163.crawl.baidu.com CN
220.181.108.95 baiduspider-220-181-108-95.crawl.baidu.com CN
220.181.108.96 baiduspider-220-181-108-96.crawl.baidu.com CN
123.125.71.34 baiduspider-123-125-71-34.crawl.baidu.com CN
用户代理字符串
Baiduspider-image+(+http://www.baidu.com/search/spider.htm)\nReferer: http://image.baidu.com/i?ct=503316480&z=0&tn=baiduimagedetail
首次出现
2014-07-14 20:36:58
最后出现
2014-07-14 20:36:58
遵循robots.txt
未知
来源
IP地址(1) 服务器名称 所属国家
119.63.196.122 ? JP
用户代理字符串
Baiduspider+(+http://help.baidu.jp/system/05.html)
首次出现
2010-01-05 19:09:55
最后出现
2010-01-05 19:09:55
遵循robots.txt
未知
来源
IP地址(12) 服务器名称 所属国家
119.63.198.104 baiduspider-119-63-198-104.crawl.baidu.jp JP
119.63.198.69 baiduspider-119-63-198-69.crawl.baidu.jp JP
119.63.198.85 baiduspider-119-63-198-85.crawl.baidu.jp JP
119.63.199.22 119.63.199.22 JP
119.63.193.56 119.63.193.56 JP
用户代理字符串
Baiduspider+(+http://help.baidu.jp/system/05.html)
首次出现
2010-01-05 19:09:55
最后出现
2010-01-05 19:09:55
遵循robots.txt
未知
用户代理字符串
Baiduspider+(+http://www.baidu.com/search/spider_jp.html)
首次出现
2015-12-19 09:53:18
最后出现
2008-03-17 02:37:53
遵循robots.txt
未知
来源
IP地址(1) 服务器名称 所属国家
122.152.129.54 ? JP

访问控制

了解如何控制Baiduspider访问权限,避免Baiduspider抓取行为不当。

是否拦截Baiduspider?

一般不要拦截。搜索引擎爬虫为搜索引擎提供动力,是用户发现您网站的有效途径。事实上,拦截搜索引擎爬虫可能会严重减少网站的自然流量。

通过Robots.txt拦截

您可以通过在网站的 robots.txt 中设置用户代理访问规则来屏蔽 Baiduspider 或限制其访问权限。我们建议安装 Spider Analyser 插件,以检查它是否真正遵循这些规则。

# robots.txt
# 下列代码一般情况可以拦截该代理
User-agent: Baiduspider
Disallow: /

您无需手动执行此操作,可通过我们的 Wordpress 插件 Spider Analyser 来拦截不必要的蜘蛛或者爬虫。

更多信息

Baiduspider是百度搜索引擎的一个自动程序,它的作用是访问互联网上的网页,建立索引数据库,使用户能在百度搜索引擎中搜索到您网站上的网页。

Baiduspider的user-agent是什么?

索引擎百度各个产品使用不同的user-agent:

产品名称 对应user-agent
网页搜索 Baiduspider
移动搜索 Baiduspider
图片搜索 Baiduspider-image
视频搜索 Baiduspider-video
新闻搜索 Baiduspider-news
百度搜藏 Baiduspider-favo
百度联盟 Baiduspider-cpro
商务搜索 Baiduspider-ads

如何区分PC与移动网页搜索的UA

 PC搜索完整UA:Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

移动搜索完整UA:Mozilla/5.0 (Linux;u;Android 4.2.2;zh-cn;) AppleWebKit/534.46 (KHTML,like Gecko) Version/5.1 Mobile Safari/10600.6.3 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

pc ua:通过关键词Baiduspider/2.0来确定是pc ua

移动ua:通过关键词android和mobile确定是来自移动端抓取访问,Baiduspider/2.0 确定为百度爬虫。

Baiduspider对一个网站服务器造成的访问压力如何?

为了达到对目标资源较好的检索效果,Baiduspider需要对您的网站保持一定量的抓取。我们尽量不给网站带来不合理的负担,并会根据服务器承受能力,网站质量,网站更新等综合因素来进行调整。如果您觉得baiduspider的访问行为有任何不合理的情况,您可以反馈至反馈中心

为什么Baiduspider不停的抓取我的网站?

对于您网站上新产生的或者持续更新的页面,Baiduspider会持续抓取。此外,您也可以检查网站访问日志中Baiduspider的访问是否正常,以防止有人恶意冒充Baiduspider来频繁抓取您的网站。 如果您发现Baiduspider非正常抓取您的网站,请通过投诉平台反馈给我们,并请尽量给出Baiduspider对贵站的访问日志,以便于我们跟踪处理。

如何判断是否冒充Baiduspider的抓取?

建议您使用DNS反向查找和DNS正向查找相结合的方式来确定抓取来源的ip是否属于百度,根据平台不同验证方法不同,如linux/windows/os三种平台下的验证方法分别如下:

在linux平台下:

  1. 使用host ip命令反解ip来判断是否来自Baiduspider的抓取。Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即为冒充。
  2. 使用host命令对第一步中的检索到的域名运行DNS正向查找,验证该域名与访问服务器的原始ip地址是否一致。

示例1:

  $ host 123.125.66.120    120.66.125.123.in-addr.arpa domain name pointer baiduspider-123-125-66-120.crawl.baidu.com.

  $ host baiduspider-123-125-66-120.crawl.baidu.com

  baiduspider-123-125-66-120.crawl.baidu.com has address 123.125.66.120

示例2:

  $host 119.63.195.254

  254.195.63.119.in-addr.arpa domain name pointer BaiduMobaider-119-63-195-254.crawl.baidu.jp.

  $host BaiduMobaider-119-63-195-254.crawl.baidu.jp

  BaiduMobaider-119-63-195-254.crawl.baidu.jp has address 119.63.195.254

在windows平台或者IBM OS/2平台下:

  1. 使用nslookup ip命令反解ip来 判断是否来自Baiduspider的抓取。打开命令处理器 输入nslookup xxx.xxx.xxx.xxx(IP地 址)就能解析ip, 来判断是否来自Baiduspider的抓取,Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即为冒充。
  2. 使用 nslookup命令对第一步中检索到的域名进行DNS正向查找,验证该域名与访问服务器的原始ip地址是否一致。

在mac os平台下:

  • 使用dig 命令反解ip来判断是否来自Baiduspider的抓取。打开命令处理器 输入dig xxx.xxx.xxx.xxx(IP地 址)就能解析ip,来判断是否来自Baiduspider的抓取,Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即为冒充;
  • 使用 dig命令对第一步中检索到的域名进行DNS正向查找,验证该域名与访问服务器的原始ip地址是否一致。

我不想我的网站被Baiduspider访问,我该怎么做?

Baiduspider遵守互联网robots协议。您可以利用robots.txt文件完全禁止Baiduspider访问您的网站,或者禁止Baiduspider访问您网站上的部分文件。 注意:禁止Baiduspider访问您的网站,将使您的网站上的网页,在百度搜索引擎以及所有百度提供搜索引擎服务的搜索引擎中无法被搜索到。关于robots.txt的写作方法,请参看我们的介绍:robots.txt写作方法

您可以根据各产品不同的user-agent设置不同的抓取规则,如果您想完全禁止百度所有的产品收录,可以直接对Baiduspider设置禁止抓取。

以下robots实现禁止所有来自百度的抓取: User-agent: Baiduspider Disallow: /

以下robots实现禁止所有来自百度的抓取但允许图片搜索抓取/image/目录: User-agent: Baiduspider Disallow: /

User-agent: Baiduspider-image Allow: /image/

请注意:Baiduspider-cpro抓取的网页并不会建入索引,只是执行与客户约定的操作,所以不遵守robots协议,如果Baiduspider-cpro给您造成了困扰,请联系union1@baidu.com。 Baiduspider-ads抓取的网页并不会建入索引,只是执行与客户约定的操作,所以不遵守robots协议,如果Baiduspider-ads给您造成了困扰,请联系您的客户服务专员。

为什么我的网站已经加了robots.txt,还能在百度搜索出来?

因为搜索引擎索引数据库的更新需要时间。虽然Baiduspider已经停止访问您网站上的网页,但百度搜索引擎数据库中已经建立的网页索引信息,可能需要数月时间才会清除。另外也请检查您的robots配置是否正确。如果您的拒绝被收录需求非常急迫,也可以通过 投诉平台 反馈请求处理。

我希望我的网站内容被百度索引但不被保存快照,我该怎么做?

Baiduspider遵守互联网meta robots协议。您可以利用网页meta的设置,使百度显示只对该网页建索引,但并不在搜索结果中显示该网页的快照。和robots的更新一样,因为搜索引擎索引数据库的更新需要时间,所以虽然您已经在网页中通过meta禁止了百度在搜索结果中显示该网页的快照,但百度搜索引擎数据库中如果已经建立了网页索引信息,可能需要二至四周才会在线上生效。

Baiduspider抓取造成的带宽堵塞?

Baiduspider的正常抓取并不会造成您网站的带宽堵塞,造成此现象可能是由于有人冒充Baiduspider恶意抓取。如果您发现有名为Baiduspider的agent抓取并且造成带宽堵塞,请尽快和百度联系。您可以将信息反馈至百度投诉平台 ,如果能够提供您网站该时段的访问日志将更加有利于我们的分析。

常见蜘蛛/爬虫

Common Spiders

相关文章

Related Articles