DotBot

DotBot蜘蛛/爬虫属于营销类型,由SEOmoz, Inc.开发运行。您可以继续阅读下方信息,以深入了解DotBot基本信息,用户代理和访问控制等。

基本信息

DotBot的基本信息如下表。但部分不是很规范的蜘蛛和爬虫,可能存在信息不明的情况。
蜘蛛/爬虫名称
DotBot
类型
营销
开发商
SEOmoz, Inc.
当前状态
活动

用户代理

关于DotBot蜘蛛或者爬虫的用户代理字符串,IP地址和服务器,所在地等信息如下表格所示:
DotBot/1.2
用户代理字符串
Mozilla/5.0 (compatible; DotBot/1.2; +https://opensiteexplorer.org/dotbot; help@moz.com)
首次出现
2021-03-18 12:51:46
最后出现
2025-01-10 17:47:39
遵循robots.txt
未知
来源
IP地址(16) 服务器名称 所属国家
216.244.66.197 ? US
216.244.66.247 ? US
216.244.66.243 ? US
216.244.66.248 ? US
216.244.66.237 216-244-66-237.reverse.wowrack.com US
用户代理字符串
Mozilla/5.0 (compatible; DotBot/1.1; http://www.dotnetdotcom.org/, crawler@dotnetdotcom.org)
首次出现
2009-05-11 05:50:00
最后出现
2016-12-27 11:15:45
遵循robots.txt
未知
来源
IP地址(128) 服务器名称 所属国家
35.153.133.186 ec2-35-153-133-186.compute-1.amazonaws.com US
54.196.89.197 ec2-54-196-89-197.compute-1.amazonaws.com US
54.196.168.34 ec2-54-196-168-34.compute-1.amazonaws.com US
54.224.84.45 ec2-54-224-84-45.compute-1.amazonaws.com US
54.80.131.215 ec2-54-80-131-215.compute-1.amazonaws.com US
用户代理字符串
Mozilla/5.0 (compatible; DotBot/1.1; http://www.dotnetdotcom.org/, crawler@dotnetdotcom.org)
首次出现
2009-05-11 05:50:00
最后出现
2016-12-27 11:15:45
遵循robots.txt
未知
来源
IP地址(10) 服务器名称 所属国家
208.115.111.243 crawl2.dotnetdotcom.org US
208.115.111.248 crawl7.dotnetdotcom.org US
208.115.111.247 crawl6.dotnetdotcom.org US
208.115.111.249 crawl8.dotnetdotcom.org US
208.115.111.250 crawl9.dotnetdotcom.org US
用户代理字符串
dotbot
首次出现
2013-11-09 11:26:07
最后出现
2014-05-17 20:35:05
遵循robots.txt
未知
来源
IP地址(6) 服务器名称 所属国家
208.184.81.30 ? US
72.44.63.103 ec2-72-44-63-103.compute-1.amazonaws.com US
107.20.88.61 ec2-107-20-88-61.compute-1.amazonaws.com US
184.72.90.45 ec2-184-72-90-45.compute-1.amazonaws.com US
184.73.99.2 ec2-184-73-99-2.compute-1.amazonaws.com US

访问控制

了解如何控制DotBot访问权限,避免DotBot抓取行为不当。

是否拦截DotBot?

一般不需要拦截,尤其是如果你自己也受益于搜索引擎优化服务。不过,如果你担心服务器资源占用等问题,且您都不使用这些工具,当然也可以选择拦截它们。

通过Robots.txt拦截

您可以通过在网站的 robots.txt 中设置用户代理访问规则来屏蔽 DotBot 或限制其访问权限。我们建议安装 Spider Analyser 插件,以检查它是否真正遵循这些规则。

# robots.txt
# 下列代码一般情况可以拦截该代理
User-agent: DotBot
Disallow: /

您无需手动执行此操作,可通过我们的 Wordpress 插件 Spider Analyser 来拦截不必要的蜘蛛或者爬虫。

更多信息

在本页面中,您将了解更多关于我们的爬虫Dotbot的信息,它被用来抓取Moz链接索引,为Moz API、链接浏览器和您的活动中的链接部分提供动力。

Moz链接索引抓取器

Dotbot是Moz的网络爬虫,它为Moz链接指数收集网络数据。我们通过Dotbot收集的这些数据可以在您的Moz Pro广告系列的链接部分、链接浏览器和Moz链接API中找到。Dotbot与Rogerbot不同,Rogerbot是我们为Moz Pro广告系列提供的网站审计爬行器。

为什么Moz会抓取网络?

我们的一些工具,如Link Explorer,需要我们抓取网站。当这种情况发生时,用户代理Dotbot被用来识别我们的爬行器。最好记住,你需要一个Moz专业账户来访问收集到的大部分信息。我们的免费网络营销社区成员的访问权限有限。要看我们收集的数据类型的一个例子,在链接浏览器的搜索框中输入一个URL。

如何阻止Dotbot抓取你的网站

如果您不希望Dotbot抓取您的网站,我们总是尊重标准的Robots排除协议(又称robots.txt)。如果您想阻止Dotbot,您只需将我们的user-agent字符串添加到您的robots.txt文件。

禁止Dotbot进入您网站的某些区域

User-agent: dotbot 
Disallow: /admin/ 
Disallow: /scripts/ Disallow: /images/

完全禁止Dotbot进入您网站

User-agent: dotbot
Disallow: /

减缓Dotbot的速度

User-agent: dotbot
Crawl-delay: 10

Dotbot何时能检测网站robots.txt文件的变化?

Dotbot只在新的索引抓取过程中第一次遇到该网站时查看你的robots.txt文件。这意味着,如果Dotbot看到它被允许进入该网站一次,对该权限的任何改变都不会被查看,直到Dotbot下次定位到你的网站的链接。

常见蜘蛛/爬虫

Common Spiders
RidderBot
RidderBot蜘蛛/爬虫属于营销类型,由Ridder开发运行。您可以继续阅读下方信息,以深入了解RidderBot基本信息,用户代理和访问控制等。
Upsales bot
Upsales bot蜘蛛/爬虫属于营销类型,由Upsales Nordic AB开发运行。您可以继续阅读下方信息,以深入了解Upsales bot基本信息,用户代理和访问控制等。
HealRWorld
HealRWorld蜘蛛/爬虫属于营销类型,由HealRWorld LLC.开发运行。您可以继续阅读下方信息,以深入了解HealRWorld基本信息,用户代理和访问控制等。
Scope3
Scope3蜘蛛/爬虫属于营销类型,由Scope3, PBC.开发运行。您可以继续阅读下方信息,以深入了解Scope3基本信息,用户代理和访问控制等。
MercuryLeads/1.0
MercuryLeads/1.0蜘蛛/爬虫属于营销类型,由Mercury Leads开发运行。您可以继续阅读下方信息,以深入了解MercuryLeads/1.0基本信息,用户代理和访问控制等。
mediaboardbot
mediaboardbot蜘蛛/爬虫属于营销类型,由Mediaboard s.r.o.开发运行。您可以继续阅读下方信息,以深入了解mediaboardbot基本信息,用户代理和访问控制等。
HaloScan bot
HaloScan bot蜘蛛/爬虫属于营销类型,由ARCHI301开发运行。您可以继续阅读下方信息,以深入了解HaloScan bot基本信息,用户代理和访问控制等。
Matchory Bot
Matchory Bot蜘蛛/爬虫属于营销类型,由Matchory GmbH开发运行。您可以继续阅读下方信息,以深入了解Matchory Bot基本信息,用户代理和访问控制等。

相关文章

Related Articles