SeznamBot蜘蛛/爬蟲屬於搜尋引擎型別,由Seznam.cz, a.s.開發執行。您可以繼續閱讀下方資訊,以深入瞭解SeznamBot基本資訊,使用者代理和訪問控制等。
是否攔截SeznamBot?
一般不要攔截。搜尋引擎爬蟲為搜尋引擎提供動力,是使用者發現您網站的有效途徑。事實上,攔截搜尋引擎爬蟲可能會嚴重減少網站的自然流量。
通過Robots.txt攔截
您可以通過在網站的 robots.txt 中設定使用者代理訪問規則來遮蔽 SeznamBot 或限制其訪問許可權。我們建議安裝 Spider Analyser
外掛,以檢查它是否真正遵循這些規則。
# robots.txt
# 下列程式碼一般情況可以攔截該代理
User-agent: SeznamBot
Disallow: /
您無需手動執行此操作,可通過我們的 Wordpress 外掛 Spider Analyser 來攔截不必要的蜘蛛或者爬蟲。
Seznam.cz是一家捷克線上公司,除了其他服務外,還經營入口網站Seznam.cz,它是捷克數百萬網際網路使用者的首選之地。這個入口網站與自己的獨立網路搜尋引擎search.seznam.cz緊密結合在一起,它也很受捷克使用者的歡迎。你可以在SeznamBot的英文部落格上閱讀更多關於公司的資訊,在SeznamBot的關於網站上找到詳細資訊,或者檢視維基百科。
在這些網頁上,你可以找到關於SeznamBot的網路爬蟲的資訊,叫做SeznamBot,還有其他由Seznam.cz執行的機器人,以及你可以控制它們行為的方法。SeznamBot的網路爬蟲的行為與其他搜尋引擎如谷歌或必應的爬蟲相似,SeznamBot會盡力使它不會使你的網站超載。儘管如此,如果你發現由於SeznamBot的爬蟲引起的流量使你的伺服器超載,SeznamBot建議在robots.txt檔案中設定一個規則來限制請求率。
儘管您可以不允許SeznamBot抓取和索引您的網站,但SeznamBot懇請您不要這樣做,因為我們的使用者將無法在搜尋結果中看到您的網頁。請考慮將SeznamBot的網路爬蟲的IP地址列入白名單。
SeznamBot crawler
SeznamBot是一個機器人(也被稱為網路爬蟲或網路蜘蛛)–一個為我們的搜尋引擎檢索內容的程式。在你的訪問日誌中,你可以通過這個字串識別它。
Mozilla/5.0 (compatible; SeznamBot/3.2; +http://napoveda.seznam.cz/en/seznambot-intro/)
FreshBot是一個快速爬蟲,旨在索引包含與許多使用者相關的新鮮內容的網頁和RSS提要。這類網頁大多是在新聞網站上發現的。
偶爾你會在訪問日誌中發現一個測試版的SeznamBot,你可以通過以下使用者代理字串來識別。
Mozilla/5.0 (compatible; SeznamBot/3.2-test4; +http://napoveda.seznam.cz/en/seznambot-intro/)
IP地址
| SeznamBot |
| IPv4 |
IPv6 |
| 77.75.76.x |
2a02:598:aaaa:2::x |
| 77.75.77.x |
2a02:598:bbbb:2::x |
| 77.75.78.x |
| 77.75.79.x |
|
| FreshBot |
| IPv4 |
IPv6 |
| 77.75.77.31 |
2a02:598:128:8a00::b00:0/104 |
| 77.75.79.31 |
|
| Test version |
| IPv4 |
IPv6 |
| 77.75.73.26 |
2a02:598:64:8a00::f00:0/104 |
| 77.75.72.26 |
我們為IndexNow驗證金鑰的IP地址:
在命令列中輸入 “host fulltextrobot.seznam.cz “命令,你可以在反向DNS查詢中看到所有SeznamBot的IP地址。
PTR記錄
- SeznamBot – fulltextrobot-77-75-77-xxx.seznam.cz, fulltextrobot-77-75-79-xxx.seznam.cz
- FreshBot – fulltextrobot-fresh-77-75-77-xxx.seznam.cz, fulltextrobot-fresh-77-75-79-xxx.seznam.cz
- Test version – fulltextrobot-test-77-75-73-26.seznam.cz
SeznamReadLaterBot
SeznamReadLaterBot是一項工作,它在我們的Seznam瀏覽器中為稍後閱讀功能生成標題、文字或圖片。
爬網控制
SeznamBot完全符合機器人排除標準(或簡稱為robots.txt),該標準通過 robots.txt 檔案規定了機器人的行為規則。 robots.txt 檔案包含的指令規定了機器人可以/不允許訪問和下載網站的哪些內容。所有訪問你的網站的機器人,如果遵循這個標準,在訪問網站時首先會閱讀這個檔案,並根據檔案中的指令調整自己的行為。你可以在該標準的官方網站上找到關於其語法的詳細描述。
使用 robots.txt 標準,你可以停止SeznamBot對你的網頁進行的所有抓取,或者只停止下載確切指定的網頁。我們的爬蟲通常需要幾天時間來重新檢查robots.txt檔案中的限制,並最終更新索引,不過對於一些不經常訪問的網站,這可能需要幾周時間。如果你只想停止對某一網頁的索引,但又允許SeznamBot下載和探索該網頁,請參見索引控制。在這種情況下,你也應該允許SeznamBot在 robots.txt 檔案中下載該頁面,這樣它就能夠讀取HTML程式碼中的限制。
如果你想讓SeznamBot完全不訪問你的網站,在 robots.txt 檔案中使用以下指令:
User-agent: SeznamBotDisallow: /
SeznamBot識別的robots.txt語法的非標準擴充套件
在官方1.0版標準的基礎上,SeznamBot承認其他指令和提議的擴充套件robots.txt標準2.0版的大部分內容(儘管這正在被廢棄)。這些擴充套件在下面的單獨章節中列出。
允許指令
Allow指令的語法與標準的Disallow指令相同,只是名稱不同。使用該指令可以明確地允許機器人訪問一個或多個指定的URL。當你想指示機器人避開整個目錄,但仍希望該目錄中的一些HTML文件被抓取和索引時,這就很有用。
示例
User-agent: *Disallow: |
所有的機器人都可以訪問和下載網路的所有頁面。 Disallow/Allow 指令後面的空意味著該指令根本不適用。這是預設情況(空的或不存在的 robots.txt 檔案也有同樣的效果)。 |
User-agent: *Allow: |
User-agent: *Disallow: / |
沒有機器人可以下載任何頁面。 |
User-agent: *Disallow: /archive/Disallow: /abc |
沒有機器人可以進入網站的/archive/目錄。此外,沒有機器人可以下載任何名稱以 “abc “開頭的頁面。 |
User-agent: *Disallow: /Allow: /A/Disallow: /A/B/ |
所有機器人只能從/A/目錄及其子目錄中下載檔案,除了子目錄B/。這些指令的順序並不重要。 |
User-agent: SeznamBotDisallow: / |
SeznamBot不能從該網站下載任何東西。其他機器人在預設情況下是允許的。 |
User-agent: SeznamBotDisallow: /discussion/ |
SeznamBot不能下載/discussion/目錄。其他機器人在預設情況下是允許的。 |
萬用字元
你可以在 robots.txt 檔案中使用以下萬用字元。
| * |
任何數量的任何字元(一個任意的字串)。可以在一個指令中多次使用。 |
| $ |
地址字串的末尾 |
示例
User-agent: SeznamBotDisallow: *.pdf$ |
不允許下載所有地址以”.pdf “結尾的檔案(不管前面有什麼字元)。 |
User-agent: SeznamBotDisallow: /*/discussion/$ |
不允許下載任何/discussion/子目錄下的預設檔案,同時仍允許下載這些子目錄下的所有其他檔案。 |
User-agent: SeznamBotDisallow: /discussion$ |
禁止/discussion,允許/discussion-01、/discussion/02等。 |
請求率指令
請求速率指令用於告訴機器人在給定時間段內可以從網站下載多少文件。Seznambot完全尊重這一指令,它使您能夠以防止伺服器過載甚至崩潰的方式設定下載速率。另一方面,如果您希望SeznamBot以更快的速度處理檔案,可以將請求速率設定為更高的值。
請求速率指令語法為:Request-rate: <number of documents>/<time>
您還可以指定一天中的一個時間段,在該時間段內機器人將觀察指令設定的速率。在一天的其餘時間裡,它將恢復正常的行為。
本例中的一般語法為: Request-rate: <rate> <time of day>
示例
Request-rate: 1/10s |
機器人被允許每十秒鐘下載一份檔案。 |
Request-rate: 100/15m |
每15分鐘100份檔案 |
Request-rate: 400/1h |
每小時400份檔案 |
Request-rate: 9000/1d |
每天9000份檔案 |
Request-rate: 1/10s 1800-1900 |
在18:00和19:00(UTC)之間,機器人被允許每10秒下載一份檔案。在其他時間,對下載速度沒有限制。 |
注意事項:SeznamBot的最小下載率是每10秒下載1份檔案。如果你指定一個更低的值,SeznamBot將把它解釋為這個最小速率。最大速率只受限於SeznamBot的當前速度。
示例(具體和所有其他機器人)
User-agent: *
Disallow: /images/
Request-rate: 30/1m
# all robots except for SeznamBot and Googlebot:
# do not access /images/ directory, rate 30 URLs per minute
User-agent: SeznamBot
Disallow: /cz/chat/
Request-rate: 300/1m
# SeznamBot: do not access /cz/chat/ directory, rate 300 URLs per minute
User-agent: Googlebot
Disallow: /logs/
Request-rate: 10/1m
# Googlebot: do not access /logs/, rate 10 URLs per minute
示例(SeznamBot和所有其他機器人)
User-agent: *
Disallow: /
# all robots except for SeznamBot: do not access anything
User-agent: Seznambot
Request-rate: 300/1m
# Seznambot: access everything, rate 300 URLs per minute
Sitemaps
網站地圖允許您微調SeznamBot在web上的移動。通過站點地圖,你可以告訴SeznamBot哪些頁面經常更改,某個頁面上次更新的時間,或者它在站點中的索引優先順序是多少。站點地圖通過Sitemap協議實現,該協議使用包含所有所需資訊的XML檔案。你可以在官方網站sitemaps.org上找到更多關於站點地圖的資訊,包括確切的語法。
sitemap指令語法為: Sitemap: <absolute URL>
Version 2.0 萬用字元
SeznamBot支援提議的擴充套件 robots.txt 標準2.0版的大部分內容。然而,請注意,這些功能正在被廢棄。2.0版的語法通過允許使用基本的正規表示式來擴充套件,就像在unix shell中一樣。如果你想用SeznamBot使用2.0版本,你需要在 robots.txt 檔案中設定。這是通過指令 Robot-version: 2.0 來完成的,該指令放置在 robots.txt 檔案相應部分的第二行。
例子
User-agent: *
Robot-version: 2.0
Disallow: /
robots.txt standard version 2.0 allows you to use the following wildcards in the URL pattern of theand Allow: directives:
robots.txt標準2.0版允許你在 Disallow: 和 Allow:指令的URL模式中使用以下萬用字元。
* |
匹配任何序列的字元(包括0字元)。 |
? |
匹配任何一個字元 |
\ |
轉義下一個特殊字元 (e.g. ?, *, …) ,按字面意思理解(例如:模式 /file\? 只匹配路徑 /file?,而不是 /files,等等)。 |
[<character set>] |
匹配給定集合中的任何一個字元 |
[!<character set>]or[^<character set>] |
匹配給定集合之外的任何一個字元 |
注意事項:在2.0版本中,與1.0版本相比,機器人會嘗試匹配整個URL(而不僅僅是開頭)。這意味著,舉例來說, Disallow: /helpme 限制機器人只訪問URL /helpme 。1.0版的原始效果(限制下載以給定字串開頭的網頁)可以通過在URL字串的末尾新增 * 萬用字元來實現(例如 Disallow: /helpme*)。
索引控制
你可以通過兩種方式停止SeznamBot對你的網頁進行索引。
- 停止SeznamBot執行的所有爬網,這也將停止對內容進行索引(有關詳細資訊,請參閱爬網控制)。儘管如此,如果有一些連結從其他頁面指向該頁面,則該頁面本身的URL仍然可以出現在搜尋結果中。
- 讓SeznamBot瀏覽您的網頁並下載您的網頁,但不要索引特定的網頁或遵循特定的連結。在這種情況下,如果不允許對頁面進行索引,則該頁面根本不會出現在搜尋結果中。
本頁介紹了後一種選擇。您可以逐頁控制索引和連結處理,甚至可以控制單個連結的連結處理。然而,請注意,爬蟲在你做了修改之後,需要一些時間來重新訪問你的頁面。只有到那時,它才能註冊任何新的限制並應用它們。
封鎖整個網頁–Robots元標籤
如果你想阻止機器人,包括SeznamBot,對你的內容進行索引或跟蹤你整個網頁的連結,請在網頁HTML程式碼的頭部部分放置robots HTML元標籤。只需按下文所述指定名稱和內容屬性。
-
name 屬性的值:robots
-
content 屬性的有效值。
noindex |
網頁的內容將不會被索引。 |
index |
網頁的內容將被索引(這是預設的)。 |
nofollow |
這些連結將不會被遵循。 |
follow |
連結將被跟蹤(這是預設的)。 |
all |
Allow all (same as index, follow).
允許所有(與 index, follow相同)。 |
注意:你可以使用兩個值(index 或 noindex,以及 follow 或 nofollow),用逗號分開。
示例
<html>
<head>
<meta name="robots" content="noindex, nofollow">
<title>Web Page Title</title>
</head>
<body>
...
在以下情況下,您應該使用robots元標記:
- 您不希望您的頁面顯示為web搜尋的結果。
- 您沒有對Web伺服器的完全訪問許可權,無法使用
robots.txt 檔案來控制機器人通過它訪問。
- 你在你的頁面上使用付費連結或廣告,機器人不應該跟隨。
注意事項:如果你想使用robots元標籤,由於它直接包含在頁面的HTML原始碼中,請確保也允許SeznamBot實際下載該頁面(見抓取控制)。如果你通過robots元標籤限制索引,同時又不允許通過 robots.txt 檔案下載,那麼SeznamBot就不會下載該頁面,從而無法看到並遵守索引限制。
封鎖單個連結 – Nofollow屬性
您還可以通過HTML標記 <a> 的 rel="nofollow" 屬性在更細粒度的級別應用nofollo指令,該屬性僅適用於特定連結。在這種情況下,SeznamBot將處理連結的文字(如果不受robots元標記的限制),但不處理連結頁面的內容,或僅從其進一步連結的任何頁面。爬蟲只會停止在受限連結之外的網路上進行搜尋。這並不意味著連結的頁面根本不會被訪問(例如,從沒有 nofollow 屬性的其他連結),只是單個連結不會被訪問。
建議對可能不被信任的連結使用 rel="nofollow" 屬性,例如:當。
- 你的網頁包含一個有公共評論的部落格。
- 你的網頁上可能出現你無法完全控制的使用者內容(如留言簿、討論區等)。
- 你想連結到一個你並不完全信任的網頁。
示例
The link to the <a href="http://www.example.com" rel="nofollow">example page</a> will not be followed
by any complying robot.