WellKnownBot

WellKnownBot蜘蛛/爬虫属于工具类型,由Braedon Vickers开发运行。您可以继续阅读下方信息,以深入了解WellKnownBot基本信息,用户代理和访问控制等。

基本信息

WellKnownBot的基本信息如下表。但部分不是很规范的蜘蛛和爬虫,可能存在信息不明的情况。
蜘蛛/爬虫名称
WellKnownBot
类型
工具
开发商
Braedon Vickers
当前状态
活动

用户代理

关于WellKnownBot蜘蛛或者爬虫的用户代理字符串,IP地址和服务器,所在地等信息如下表格所示:
WellKnownBot/0.1
用户代理字符串
WellKnownBot/0.1 (https://well-known.dev)
首次出现
2021-03-12 16:46:55
最后出现
2021-06-17 04:49:49
遵循robots.txt
未知
来源
IP地址(71) 服务器名称 所属国家
104.248.151.24 ? SG
128.199.86.98 ? SG
159.223.88.118 159.223.88.118 SG
139.59.99.248 ? SG
167.71.200.2 ? SG
用户代理字符串
WellKnownBot/0.1 (https://well-known.dev)
首次出现
2021-03-12 16:46:55
最后出现
2021-06-17 04:49:49
遵循robots.txt
未知
来源
IP地址(4) 服务器名称 所属国家
139.59.233.195 ? SG
188.166.219.244 ? SG
188.166.227.253 ? SG
157.230.240.138 ? SG

访问控制

了解如何控制WellKnownBot访问权限,避免WellKnownBot抓取行为不当。

是否拦截WellKnownBot?

可能不需要。工具类型爬虫通常为网站所有者使用此类工具对网站进行相关服务请求才会出现。当然,实际情况需站长判断后再作决定。

通过Robots.txt拦截

您可以通过在网站的 robots.txt 中设置用户代理访问规则来屏蔽 WellKnownBot 或限制其访问权限。我们建议安装 Spider Analyser 插件,以检查它是否真正遵循这些规则。

# robots.txt
# 下列代码一般情况可以拦截该代理
User-agent: WellKnownBot
Disallow: /

您无需手动执行此操作,可通过我们的 Wordpress 插件 Spider Analyser 来拦截不必要的蜘蛛或者爬虫。

更多信息

关于Well-Known

Well-Known是一个免费、开放的知名资源索引。它定期扫描数以百万计的领域,汇编了一个可搜索的结构化知名资源数据数据库。

该搜索引擎支持每种资源类型的特定搜索过滤器,使详细查询能够回答各种问题。

目前支持10种资源

知名资源是由位于特定 “知名 “地点的网站托管的文件。这些资源被用来向开发者、其他网站和服务等传达有关网站和其提供的服务的各种信息。

资源的格式和位置通常是在规范中定义的,尽管有些是在松散的共识中产生的,没有正式的规定。它们通常位于/.known/路径下。

你可以在这里阅读更多关于well-know资源的信息。

关于WellKnownBot

WellKnown扫描是由WellKnownBot执行的。所有请求都包含一个User-Agent头,其中包括字符串WellKnownBot和本页面的URL。

虽然WellKnownBot进行自动请求,但它不是一个网络爬虫/蜘蛛。它只请求少量的特定资源,这些资源旨在供公众、程序性消费。

因为它不是爬虫,所以WellKnownBot不遵循通用的User-Agent。* robots.txt文件中的爬行规则。然而,它确实遵守专门针对它的组中的robots.txt规则。

如果你希望限制WellKnownBot扫描的资源,请在你的组中添加一个User-Agent:WellKnownBot组到你网站的robots.txt。

常见蜘蛛/爬虫

Common Spiders

相关文章

Related Articles