coccocbot

coccocbot蜘蛛/爬虫属于搜索引擎类型,由Coc Coc Company Limited.开发运行。您可以继续阅读下方信息,以深入了解coccocbot基本信息,用户代理和访问控制等。

基本信息

coccocbot的基本信息如下表。但部分不是很规范的蜘蛛和爬虫,可能存在信息不明的情况。
蜘蛛/爬虫名称
coccocbot
类型
搜索引擎
开发商
Coc Coc Company Limited.
当前状态
活动

用户代理

关于coccocbot蜘蛛或者爬虫的用户代理字符串,IP地址和服务器,所在地等信息如下表格所示:
coccocbot-image/1.0
用户代理字符串
Mozilla/5.0 (compatible; coccocbot-image/1.0; +http://help.coccoc.com/searchengine)
首次出现
2016-10-04 14:53:39
最后出现
2025-01-10 14:18:46
遵循robots.txt
未知
来源
IP地址(56) 服务器名称 所属国家
103.131.71.36 ? VN
103.131.71.35 bot-103-131-71-35.coccoc.com VN
103.131.71.39 ? VN
103.131.71.204 bot-103-131-71-204.coccoc.com VN
103.131.71.42 ? VN
用户代理字符串
Mozilla/5.0 (compatible; coccocbot-web/1.0; +http://help.coccoc.com/searchengine)
首次出现
2016-10-05 01:14:37
最后出现
2025-01-10 12:11:30
遵循robots.txt
未知
来源
IP地址(144) 服务器名称 所属国家
103.131.71.84 ? VN
103.131.71.129 ? VN
103.131.71.64 ? VN
103.131.71.126 ? VN
103.131.71.135 ? VN
用户代理字符串
Mozilla/5.0 (compatible; coccoc/1.0; +http://help.coccoc.com/)
首次出现
2013-06-03 09:20:00
最后出现
2016-05-08 17:03:01
遵循robots.txt
未知
来源
IP地址(10) 服务器名称 所属国家
123.30.175.209 static.vdc.vn VN
123.30.175.207 static.vdc.vn VN
123.30.175.175 static.vdc.vn VN
123.30.175.222 static.vdc.vn VN
123.30.175.223 static.vdc.vn VN
用户代理字符串
Mozilla/5.0 (compatible; imagecoccoc/1.0; +http://help.coccoc.com/)
首次出现
2016-04-15 09:46:00
最后出现
2016-05-08 03:02:11
遵循robots.txt
未知
来源
IP地址(4) 服务器名称 所属国家
123.30.175.140 static.vdc.vn VN
123.30.175.141 static.vdc.vn VN
123.30.175.142 static.vdc.vn VN
123.30.175.139 static.vdc.vn VN
用户代理字符串
Mozilla/5.0 (compatible; imagecoccoc/1.0; +http://help.coccoc.com/)
首次出现
2016-04-15 09:46:00
最后出现
2016-05-08 03:02:11
遵循robots.txt
未知
来源
IP地址(4) 服务器名称 所属国家
123.30.175.142 static.vdc.vn VN
123.30.175.140 static.vdc.vn VN
123.30.175.139 static.vdc.vn VN
123.30.175.141 static.vdc.vn VN
用户代理字符串
Mozilla/5.0 (compatible; image.coccoc/1.0; +http://help.coccoc.com/)
首次出现
2015-01-15 02:50:00
最后出现
2015-10-28 11:34:20
遵循robots.txt
未知
来源
IP地址(4) 服务器名称 所属国家
123.30.175.135 static.vdc.vn VN
123.30.175.133 static.vdc.vn VN
123.30.175.134 static.vdc.vn VN
123.30.175.132 static.vdc.vn VN
用户代理字符串
coccoc
首次出现
2012-04-30 04:20:26
最后出现
2013-05-12 20:04:47
遵循robots.txt
未知
来源
IP地址(6) 服务器名称 所属国家
123.30.175.165 static.vdc.vn VN
123.30.175.160 static.vdc.vn VN
123.30.175.158 static.vdc.vn VN
123.30.175.128 static.vdc.vn VN
123.30.175.129 static.vdc.vn VN
用户代理字符串
coccoc/1.0 (http://help.coccoc.com/)
首次出现
2013-02-18 08:15:00
最后出现
2013-04-21 20:02:04
遵循robots.txt
未知
来源
IP地址(8) 服务器名称 所属国家
123.30.175.100 static.vdc.vn VN
123.30.175.86 static.vdc.vn VN
123.30.175.90 static.vdc.vn VN
123.30.175.81 static.vdc.vn VN
123.30.175.87 static.vdc.vn VN
用户代理字符串
coccoc/1.0 (http://help.coccoc.vn/)
首次出现
2012-08-30 10:31:00
最后出现
2013-01-29 02:09:09
遵循robots.txt
未知
来源
IP地址(10) 服务器名称 所属国家
123.30.175.85 static.vdc.vn VN
123.30.175.87 static.vdc.vn VN
123.30.175.98 static.vdc.vn VN
123.30.175.96 static.vdc.vn VN
123.30.175.97 static.vdc.vn VN
用户代理字符串
coccoc/1.0 ()
首次出现
2012-06-19 01:34:28
最后出现
2012-08-23 21:10:20
遵循robots.txt
未知
来源
IP地址(32) 服务器名称 所属国家
123.30.175.181 coccoc.com VN
123.30.175.180 static.vdc.vn VN
123.30.175.217 static.vdc.vn VN
123.30.175.221 static.vdc.vn VN
123.30.175.228 static.vdc.vn VN
用户代理字符串
coccoc/1.0 ()
首次出现
2012-06-19 01:34:28
最后出现
2012-08-23 21:10:20
遵循robots.txt
未知
来源
IP地址(5) 服务器名称 所属国家
123.30.175.83 static.vdc.vn VN
123.30.175.86 static.vdc.vn VN
123.30.175.85 static.vdc.vn VN
123.30.175.84 static.vdc.vn VN
123.30.175.87 static.vdc.vn VN

访问控制

了解如何控制coccocbot访问权限,避免coccocbot抓取行为不当。

是否拦截coccocbot?

一般不要拦截。搜索引擎爬虫为搜索引擎提供动力,是用户发现您网站的有效途径。事实上,拦截搜索引擎爬虫可能会严重减少网站的自然流量。

通过Robots.txt拦截

您可以通过在网站的 robots.txt 中设置用户代理访问规则来屏蔽 coccocbot 或限制其访问权限。我们建议安装 Spider Analyser 插件,以检查它是否真正遵循这些规则。

# robots.txt
# 下列代码一般情况可以拦截该代理
User-agent: coccocbot
Disallow: /

您无需手动执行此操作,可通过我们的 Wordpress 插件 Spider Analyser 来拦截不必要的蜘蛛或者爬虫。

更多信息

coccocbot(bot,爬虫)是由Coc Coc搜索引擎制作的网络爬行机器人。该机器人发现并下载网站/网页,以便将其纳入Coc Coc的搜索引擎索引。通过允许coccocbot抓取您的网站,您可以通过增加能够找到您的内容的用户数量,使您的网站更受欢迎。

下面您可以找到关于coccocbot和搜索的一些常见问题的答案。

1.为什么我的网站/子页面没有出现在 coccoc.com/search 的搜索结果中?

您可以通过使用 “site: “操作符检查coccoc.com是否已将您的网站的任何页面添加到coccoc.com的索引中。进入coccoc.com/search,输入查询 “site:yourwebsite.com yourwebsite.com”。例如。site:coccoc.com coccoc.com。

如果你的查询没有检索到任何结果,有几个潜在的原因,你的网站可能不包括在coccoc.com的索引中。

首先,确保你的网页能被coccoc.com的爬虫找到。机器人是一个通过跟踪链接爬行网络的程序。它通过从发现的网页中提取URL,并从这些新的URL中下载网页,从而下载和索引网页。这个过程在一个循环中重复。因此,为了使你的网站能够被coccocbot发现,你的网站需要被其他网站链接。这些链接必须不标有nofollow指令。此外,由于coccocbot是为互联网的越南部分而设计的,这些链接必须在该地区。coccocbot试图将自己限制在越南语的内容上。为了达到这个目的,它从用越南语编写的网页和一般的.vn域名中提取链接。如果您的网站是全新的,coccocbot也可能需要一些时间来找到链接到它的页面。

如果你的网站有这样的链接,请检查这些URL链接到的内容是coccocbot可以到达的,并且允许被添加到coccoc.com的索引中。检查你的robots.txt文件,确保它没有禁止coccocbot下载你的网页。此外,确保你的网页内容中没有noindex指令。此外,您的网站(或您的互联网服务提供商,ISP)可以通过阻止coccocbot的用户代理字符串或阻止coccocbot的IP地址来阻止coccocbot。请联系您的系统管理员/ISP,检查是否是这个问题。

如果你想手动添加一些页面到coccoc.com的索引,请通过在线表格提交相关的URL。

2.如何将网站/网页从coccoc.com/search的搜索结果中删除

你可以通过几种方式指示coccocbot不将你的网页加入coccoc.com的索引和/或不下载你的网页。

首先,你可以在你的 robots.txt 文件中向coccocbot发出指示。例如,如果你想指示coccocbot不下载任何路径以/cgi-bin/开头的页面,你可以在你的robots.txt中添加以下指示。

User-agent: coccocbot-web
Disallow: /cgi-bin/

在大多数情况下,robots.txt中不允许的URL不会出现在coccoc.com的索引中,因为它们不会被coccoc.com的机器人下载。然而,一些在robots.txt中不允许的URL的页面仍然可能被添加到coccoc.com的索引中,而没有页面的内容。在这些情况下,类似于下面这个例子的片段会出现在coccoc.com的搜索结果中。

example.com
http://example.com

There is no general description due to policy restricting access from the host site

其次,要指示coccocbot从coccoc.com的索引中完全排除一个页面,你可以在该页面上使用noindex指令。如果你使用noindex,确保该页面的URL在你的robots.txt中不被禁止下载。在这种情况下,即使coccocbot能够找到指向你的页面的链接,它也不会将该页面添加到索引中(尽管它仍然会下载该页面,因为它需要下载它来找到noindex指令)。

最后,你也可以对你网站上的一些链接使用nofollow指令。如果你的网站上所有指向某个特定URL的链接都使用这个指令,coccocbot就不会请求这个URL。当然,由于你不能控制其他网站,他们仍然可能包括一个没有nofollow指令的链接到你的网站。如果coccocbot发现这样的链接,它可以请求你的URL,并仍然将其添加到索引中。因此,nofollow指令可以在你的网站内部使用,以排除其某些部分或URL被coccocbot下载和索引。然而,像这样使用nofollow不能完全阻止你的网页被索引。

在你的robots.txt或其他指令的变化在coccoc.com的索引中更新之前,可能需要一些时间。如果你已经对你的网站做了这样的改变,并想强制应用你的改变到coccoc.com的索引中,你可以通过在线表格提交你的网址/网站。

3.coccocbot导致网站/服务器过载

如果你想降低coccocbot访问你的网站的速度,你可以在你的robots.txt中使用爬行延迟指令。

例如,要为coccocbot设置5秒的爬行延迟,请在您的robots.txt中添加以下指令。

User-agent: coccocbot-web
Crawl-delay: 5

请注意:coccocbot不支持超过10秒的抓取延迟。因此,100秒的爬行延迟被视为10秒的爬行延迟。

增加抓取延迟可能会导致您的网站在coccoc.com的索引中更新缓慢。如果您的网站很小,这可能不是一个问题。在这种情况下,即使延迟值很大,coccocbot也能够以足够的频率请求您网站的页面。然而,如果你有数以百万计的页面,一个大的延迟值会影响更新速度。在这种情况下,首先要确保你所有的可索引页面对用户是有用的。例如,一个网站可能使用Faceted搜索。Faceted搜索是一种常见的方式,通过使用过滤器在一个大的数据库中找到一个项目。每个过滤器都由URL中的一个参数表示。不同数值的组合数量可能非常大,尽管只有一小部分实际产生了数据库中的项目。如果你想指示coccocbot不要从你的网站下载某些页面,请阅读上面第2点。

如果您是互联网服务提供商,想降低coccocbot对您的服务器的访问率,请通过页面的问题和投诉表与coccoc.com联系。

常见蜘蛛/爬虫

Common Spiders

相关文章

Related Articles