YisouSpider

YisouSpider蜘蛛/爬虫属于搜索引擎类型,由SM.CN开发运行。您可以继续阅读下方信息,以深入了解YisouSpider基本信息,用户代理和访问控制等。

基本信息

YisouSpider的基本信息如下表。但部分不是很规范的蜘蛛和爬虫,可能存在信息不明的情况。
蜘蛛/爬虫名称
YisouSpider
类型
搜索引擎
开发商
SM.CN
当前状态
活动

用户代理

关于YisouSpider蜘蛛或者爬虫的用户代理字符串,IP地址和服务器,所在地等信息如下表格所示:
YisouSpider
用户代理字符串
YisouSpider
首次出现
2013-04-28 06:08:08
最后出现
2025-01-09 23:38:13
遵循robots.txt
来源
IP地址(742) 服务器名称 所属国家
101.67.29.170 ? CN
101.67.29.152 101.67.29.152 CN
60.188.9.157 60.188.9.157 CN
60.188.10.17 60.188.10.17 CN
39.173.105.169 39.173.105.169 ?
用户代理字符串
Mozilla/5.0 (iPhone; CPU iPhone OS 10_3 like Mac OS X) AppleWebKit/602.1.50 (KHTML, like Gecko) CriOS/56.0.2924.75 Mobile/14E5239e YisouSpider/5.0 Safari/602.1
首次出现
2018-08-28 09:09:56
最后出现
2022-09-02 10:56:59
遵循robots.txt
未知
来源
IP地址(10) 服务器名称 所属国家
39.173.105.167 39.173.105.167 CN
112.13.112.72 112.13.112.72 CN
101.67.50.61 101.67.50.61 CN
101.67.49.66 101.67.49.66 ?
60.188.9.106 60.188.9.106 CN
用户代理字符串
Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 YisouSpider/5.0 Safari/537.36
首次出现
2018-08-06 13:52:18
最后出现
2018-09-09 10:10:44
遵循robots.txt
未知
来源
IP地址(1455) 服务器名称 所属国家
112.13.112.53 112.13.112.53 CN
60.188.11.60 60.188.11.60 CN
60.188.9.177 60.188.9.177 CN
112.13.112.50 112.13.112.50 CN
112.13.112.6 112.13.112.6 CN
用户代理字符串
Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 YisouSpider/5.0 Safari/537.36
首次出现
2018-08-06 13:52:18
最后出现
2018-09-09 10:10:44
遵循robots.txt
未知
来源
IP地址(10) 服务器名称 所属国家
42.156.139.21 shenmaspider-42-156-139-21.crawl.sm.cn CN
42.156.254.2 shenmaspider-42-156-254-2.crawl.sm.cn CN
42.156.136.94 shenmaspider-42-156-136-94.crawl.sm.cn CN
42.156.137.94 shenmaspider-42-156-137-94.crawl.sm.cn CN
42.120.160.94 shenmaspider-42-120-160-94.crawl.sm.cn CN

访问控制

了解如何控制YisouSpider访问权限,避免YisouSpider抓取行为不当。

是否拦截YisouSpider?

一般不要拦截。搜索引擎爬虫为搜索引擎提供动力,是用户发现您网站的有效途径。事实上,拦截搜索引擎爬虫可能会严重减少网站的自然流量。

通过Robots.txt拦截

您可以通过在网站的 robots.txt 中设置用户代理访问规则来屏蔽 YisouSpider 或限制其访问权限。我们建议安装 Spider Analyser 插件,以检查它是否真正遵循这些规则。

# robots.txt
# 下列代码一般情况可以拦截该代理
User-agent: YisouSpider
Disallow: /

您无需手动执行此操作,可通过我们的 Wordpress 插件 Spider Analyser 来拦截不必要的蜘蛛或者爬虫。

更多信息

神马搜索根据网站规模、服务能力、页面质量、更新速度等因素决定对网站的访问频率。通常更新快、质量高的网站Yisouspider访问频率相对较高。如果您发现Yisouspider非正常抓取您的网站,请反馈给神马搜索,并请尽量给出Yisouspider的访问日志便于跟踪处理。

robots协议

robots.txt是搜索引擎访问网站时要访问的第一个文件,以确定哪些网页是允许或禁止抓取的。Yisouspider遵守robots.txt协议。如您希望完全禁止神马访问或对部分目录禁止访问,您可以通过robots.txt文件来设置内容,限定Yisouspider的访问权限。如果您开通了CNZZ云推荐服务,协议中默认支持Yisouspider抓取,会忽略robots.txt文件协议的限制。

协议写法

robots.txt必须放在网站根目录下,且文件名要小写。具体写法:

1) 完全禁止Yisouspider抓取:

User-agent: Yisouspider

Disallow: /

2) 禁止Yisouspider抓取指定目录

User-agent: Yisouspider
Disallow: /update/
Disallow: /history/

上述robots.txt规则则是禁止抓取update、history目录下网页。

常见蜘蛛/爬虫

Common Spiders

相关文章

Related Articles