SeznamBot蜘蛛/爬虫属于搜索引擎类型,由Seznam.cz, a.s.开发运行。您可以继续阅读下方信息,以深入了解SeznamBot基本信息,用户代理和访问控制等。
是否拦截SeznamBot?
一般不要拦截。搜索引擎爬虫为搜索引擎提供动力,是用户发现您网站的有效途径。事实上,拦截搜索引擎爬虫可能会严重减少网站的自然流量。
通过Robots.txt拦截
您可以通过在网站的 robots.txt 中设置用户代理访问规则来屏蔽 SeznamBot 或限制其访问权限。我们建议安装 Spider Analyser
插件,以检查它是否真正遵循这些规则。
# robots.txt
# 下列代码一般情况可以拦截该代理
User-agent: SeznamBot
Disallow: /
您无需手动执行此操作,可通过我们的 Wordpress 插件 Spider Analyser 来拦截不必要的蜘蛛或者爬虫。
Seznam.cz是一家捷克在线公司,除了其他服务外,还经营门户网站Seznam.cz,它是捷克数百万互联网用户的首选之地。这个门户网站与自己的独立网络搜索引擎search.seznam.cz紧密结合在一起,它也很受捷克用户的欢迎。你可以在SeznamBot的英文博客上阅读更多关于公司的信息,在SeznamBot的关于网站上找到详细信息,或者查看维基百科。
在这些网页上,你可以找到关于SeznamBot的网络爬虫的信息,叫做SeznamBot,还有其他由Seznam.cz运行的机器人,以及你可以控制它们行为的方法。SeznamBot的网络爬虫的行为与其他搜索引擎如谷歌或必应的爬虫相似,SeznamBot会尽力使它不会使你的网站超载。尽管如此,如果你发现由于SeznamBot的爬虫引起的流量使你的服务器超载,SeznamBot建议在robots.txt文件中设置一个规则来限制请求率。
尽管您可以不允许SeznamBot抓取和索引您的网站,但SeznamBot恳请您不要这样做,因为我们的用户将无法在搜索结果中看到您的网页。请考虑将SeznamBot的网络爬虫的IP地址列入白名单。
SeznamBot crawler
SeznamBot是一个机器人(也被称为网络爬虫或网络蜘蛛)–一个为我们的搜索引擎检索内容的程序。在你的访问日志中,你可以通过这个字符串识别它。
Mozilla/5.0 (compatible; SeznamBot/3.2; +http://napoveda.seznam.cz/en/seznambot-intro/)
FreshBot是一个快速爬虫,旨在索引包含与许多用户相关的新鲜内容的网页和RSS提要。这类网页大多是在新闻网站上发现的。
偶尔你会在访问日志中发现一个测试版的SeznamBot,你可以通过以下用户代理字符串来识别。
Mozilla/5.0 (compatible; SeznamBot/3.2-test4; +http://napoveda.seznam.cz/en/seznambot-intro/)
IP地址
| SeznamBot |
| IPv4 |
IPv6 |
| 77.75.76.x |
2a02:598:aaaa:2::x |
| 77.75.77.x |
2a02:598:bbbb:2::x |
| 77.75.78.x |
| 77.75.79.x |
|
| FreshBot |
| IPv4 |
IPv6 |
| 77.75.77.31 |
2a02:598:128:8a00::b00:0/104 |
| 77.75.79.31 |
|
| Test version |
| IPv4 |
IPv6 |
| 77.75.73.26 |
2a02:598:64:8a00::f00:0/104 |
| 77.75.72.26 |
我们为IndexNow验证密钥的IP地址:
在命令行中输入 “host fulltextrobot.seznam.cz “命令,你可以在反向DNS查询中看到所有SeznamBot的IP地址。
PTR记录
- SeznamBot – fulltextrobot-77-75-77-xxx.seznam.cz, fulltextrobot-77-75-79-xxx.seznam.cz
- FreshBot – fulltextrobot-fresh-77-75-77-xxx.seznam.cz, fulltextrobot-fresh-77-75-79-xxx.seznam.cz
- Test version – fulltextrobot-test-77-75-73-26.seznam.cz
SeznamReadLaterBot
SeznamReadLaterBot是一项工作,它在我们的Seznam浏览器中为稍后阅读功能生成标题、文本或图片。
爬网控制
SeznamBot完全符合机器人排除标准(或简称为robots.txt),该标准通过 robots.txt 文件规定了机器人的行为规则。 robots.txt 文件包含的指令规定了机器人可以/不允许访问和下载网站的哪些内容。所有访问你的网站的机器人,如果遵循这个标准,在访问网站时首先会阅读这个文件,并根据文件中的指令调整自己的行为。你可以在该标准的官方网站上找到关于其语法的详细描述。
使用 robots.txt 标准,你可以停止SeznamBot对你的网页进行的所有抓取,或者只停止下载确切指定的网页。我们的爬虫通常需要几天时间来重新检查robots.txt文件中的限制,并最终更新索引,不过对于一些不经常访问的网站,这可能需要几周时间。如果你只想停止对某一网页的索引,但又允许SeznamBot下载和探索该网页,请参见索引控制。在这种情况下,你也应该允许SeznamBot在 robots.txt 文件中下载该页面,这样它就能够读取HTML代码中的限制。
如果你想让SeznamBot完全不访问你的网站,在 robots.txt 文件中使用以下指令:
User-agent: SeznamBotDisallow: /
SeznamBot识别的robots.txt语法的非标准扩展
在官方1.0版标准的基础上,SeznamBot承认其他指令和提议的扩展robots.txt标准2.0版的大部分内容(尽管这正在被废弃)。这些扩展在下面的单独章节中列出。
允许指令
Allow指令的语法与标准的Disallow指令相同,只是名称不同。使用该指令可以明确地允许机器人访问一个或多个指定的URL。当你想指示机器人避开整个目录,但仍希望该目录中的一些HTML文档被抓取和索引时,这就很有用。
示例
User-agent: *Disallow: |
所有的机器人都可以访问和下载网络的所有页面。 Disallow/Allow 指令后面的空意味着该指令根本不适用。这是默认情况(空的或不存在的 robots.txt 文件也有同样的效果)。 |
User-agent: *Allow: |
User-agent: *Disallow: / |
没有机器人可以下载任何页面。 |
User-agent: *Disallow: /archive/Disallow: /abc |
没有机器人可以进入网站的/archive/目录。此外,没有机器人可以下载任何名称以 “abc “开头的页面。 |
User-agent: *Disallow: /Allow: /A/Disallow: /A/B/ |
所有机器人只能从/A/目录及其子目录中下载文件,除了子目录B/。这些指令的顺序并不重要。 |
User-agent: SeznamBotDisallow: / |
SeznamBot不能从该网站下载任何东西。其他机器人在默认情况下是允许的。 |
User-agent: SeznamBotDisallow: /discussion/ |
SeznamBot不能下载/discussion/目录。其他机器人在默认情况下是允许的。 |
通配符
你可以在 robots.txt 文件中使用以下通配符。
| * |
任何数量的任何字符(一个任意的字符串)。可以在一个指令中多次使用。 |
| $ |
地址字符串的末尾 |
示例
User-agent: SeznamBotDisallow: *.pdf$ |
不允许下载所有地址以”.pdf “结尾的文件(不管前面有什么字符)。 |
User-agent: SeznamBotDisallow: /*/discussion/$ |
不允许下载任何/discussion/子目录下的默认文件,同时仍允许下载这些子目录下的所有其他文件。 |
User-agent: SeznamBotDisallow: /discussion$ |
禁止/discussion,允许/discussion-01、/discussion/02等。 |
请求率指令
请求速率指令用于告诉机器人在给定时间段内可以从网站下载多少文档。Seznambot完全尊重这一指令,它使您能够以防止服务器过载甚至崩溃的方式设置下载速率。另一方面,如果您希望SeznamBot以更快的速度处理文件,可以将请求速率设置为更高的值。
请求速率指令语法为:Request-rate: <number of documents>/<time>
您还可以指定一天中的一个时间段,在该时间段内机器人将观察指令设置的速率。在一天的其余时间里,它将恢复正常的行为。
本例中的一般语法为: Request-rate: <rate> <time of day>
示例
Request-rate: 1/10s |
机器人被允许每十秒钟下载一份文件。 |
Request-rate: 100/15m |
每15分钟100份文件 |
Request-rate: 400/1h |
每小时400份文件 |
Request-rate: 9000/1d |
每天9000份文件 |
Request-rate: 1/10s 1800-1900 |
在18:00和19:00(UTC)之间,机器人被允许每10秒下载一份文件。在其他时间,对下载速度没有限制。 |
注意事项:SeznamBot的最小下载率是每10秒下载1份文件。如果你指定一个更低的值,SeznamBot将把它解释为这个最小速率。最大速率只受限于SeznamBot的当前速度。
示例(具体和所有其他机器人)
User-agent: *
Disallow: /images/
Request-rate: 30/1m
# all robots except for SeznamBot and Googlebot:
# do not access /images/ directory, rate 30 URLs per minute
User-agent: SeznamBot
Disallow: /cz/chat/
Request-rate: 300/1m
# SeznamBot: do not access /cz/chat/ directory, rate 300 URLs per minute
User-agent: Googlebot
Disallow: /logs/
Request-rate: 10/1m
# Googlebot: do not access /logs/, rate 10 URLs per minute
示例(SeznamBot和所有其他机器人)
User-agent: *
Disallow: /
# all robots except for SeznamBot: do not access anything
User-agent: Seznambot
Request-rate: 300/1m
# Seznambot: access everything, rate 300 URLs per minute
Sitemaps
网站地图允许您微调SeznamBot在web上的移动。通过站点地图,你可以告诉SeznamBot哪些页面经常更改,某个页面上次更新的时间,或者它在站点中的索引优先级是多少。站点地图通过Sitemap协议实现,该协议使用包含所有所需信息的XML文件。你可以在官方网站sitemaps.org上找到更多关于站点地图的信息,包括确切的语法。
sitemap指令语法为: Sitemap: <absolute URL>
Version 2.0 通配符
SeznamBot支持提议的扩展 robots.txt 标准2.0版的大部分内容。然而,请注意,这些功能正在被废弃。2.0版的语法通过允许使用基本的正则表达式来扩展,就像在unix shell中一样。如果你想用SeznamBot使用2.0版本,你需要在 robots.txt 文件中设置。这是通过指令 Robot-version: 2.0 来完成的,该指令放置在 robots.txt 文件相应部分的第二行。
例子
User-agent: *
Robot-version: 2.0
Disallow: /
robots.txt standard version 2.0 allows you to use the following wildcards in the URL pattern of theand Allow: directives:
robots.txt标准2.0版允许你在 Disallow: 和 Allow:指令的URL模式中使用以下通配符。
* |
匹配任何序列的字符(包括0字符)。 |
? |
匹配任何一个字符 |
\ |
转义下一个特殊字符 (e.g. ?, *, …) ,按字面意思理解(例如:模式 /file\? 只匹配路径 /file?,而不是 /files,等等)。 |
[<character set>] |
匹配给定集合中的任何一个字符 |
[!<character set>]or[^<character set>] |
匹配给定集合之外的任何一个字符 |
注意事项:在2.0版本中,与1.0版本相比,机器人会尝试匹配整个URL(而不仅仅是开头)。这意味着,举例来说, Disallow: /helpme 限制机器人只访问URL /helpme 。1.0版的原始效果(限制下载以给定字符串开头的网页)可以通过在URL字符串的末尾添加 * 通配符来实现(例如 Disallow: /helpme*)。
索引控制
你可以通过两种方式停止SeznamBot对你的网页进行索引。
- 停止SeznamBot执行的所有爬网,这也将停止对内容进行索引(有关详细信息,请参阅爬网控制)。尽管如此,如果有一些链接从其他页面指向该页面,则该页面本身的URL仍然可以出现在搜索结果中。
- 让SeznamBot浏览您的网页并下载您的网页,但不要索引特定的网页或遵循特定的链接。在这种情况下,如果不允许对页面进行索引,则该页面根本不会出现在搜索结果中。
本页介绍了后一种选择。您可以逐页控制索引和链接处理,甚至可以控制单个链接的链接处理。然而,请注意,爬虫在你做了修改之后,需要一些时间来重新访问你的页面。只有到那时,它才能注册任何新的限制并应用它们。
封锁整个网页–Robots元标签
如果你想阻止机器人,包括SeznamBot,对你的内容进行索引或跟踪你整个网页的链接,请在网页HTML代码的头部部分放置robots HTML元标签。只需按下文所述指定名称和内容属性。
-
name 属性的值:robots
-
content 属性的有效值。
noindex |
网页的内容将不会被索引。 |
index |
网页的内容将被索引(这是默认的)。 |
nofollow |
这些链接将不会被遵循。 |
follow |
链接将被跟踪(这是默认的)。 |
all |
Allow all (same as index, follow).
允许所有(与 index, follow相同)。 |
注意:你可以使用两个值(index 或 noindex,以及 follow 或 nofollow),用逗号分开。
示例
<html>
<head>
<meta name="robots" content="noindex, nofollow">
<title>Web Page Title</title>
</head>
<body>
...
在以下情况下,您应该使用robots元标记:
- 您不希望您的页面显示为web搜索的结果。
- 您没有对Web服务器的完全访问权限,无法使用
robots.txt 文件来控制机器人通过它访问。
- 你在你的页面上使用付费链接或广告,机器人不应该跟随。
注意事项:如果你想使用robots元标签,由于它直接包含在页面的HTML源代码中,请确保也允许SeznamBot实际下载该页面(见抓取控制)。如果你通过robots元标签限制索引,同时又不允许通过 robots.txt 文件下载,那么SeznamBot就不会下载该页面,从而无法看到并遵守索引限制。
封锁单个链接 – Nofollow属性
您还可以通过HTML标记 <a> 的 rel="nofollow" 属性在更细粒度的级别应用nofollo指令,该属性仅适用于特定链接。在这种情况下,SeznamBot将处理链接的文本(如果不受robots元标记的限制),但不处理链接页面的内容,或仅从其进一步链接的任何页面。爬虫只会停止在受限链接之外的网络上进行搜索。这并不意味着链接的页面根本不会被访问(例如,从没有 nofollow 属性的其他链接),只是单个链接不会被访问。
建议对可能不被信任的链接使用 rel="nofollow" 属性,例如:当。
- 你的网页包含一个有公共评论的博客。
- 你的网页上可能出现你无法完全控制的用户内容(如留言簿、讨论区等)。
- 你想链接到一个你并不完全信任的网页。
示例
The link to the <a href="http://www.example.com" rel="nofollow">example page</a> will not be followed
by any complying robot.