如何做搜尋引擎蜘蛛日誌分析
搜尋引擎蜘蛛日誌檔案是一種非常強大但未被站長充分利用的檔案,分析它可以獲取有關每個搜尋引擎如何爬取網站內容的相關資訊點,及檢視搜尋引擎蜘蛛在一段時間內的行為。
| IP地址(274) | 伺服器名稱 | 所屬國家 |
|---|---|---|
| 66.102.6.166 | google-proxy-66-102-6-166.google.com | US |
| 64.233.172.199 | google-proxy-64-233-172-199.google.com | US |
| 66.102.6.164 | google-proxy-66-102-6-164.google.com | US |
| 64.233.172.201 | google-proxy-64-233-172-201.google.com | US |
| 66.102.6.168 | google-proxy-66-102-6-168.google.com | US |
| IP地址(10) | 伺服器名稱 | 所屬國家 |
|---|---|---|
| 66.249.92.59 | rate-limited-proxy-66-249-92-59.google.com | US |
| 66.249.92.213 | rate-limited-proxy-66-249-92-213.google.com | US |
| 66.249.92.144 | rate-limited-proxy-66-249-92-144.google.com | US |
| 64.233.172.187 | google-proxy-64-233-172-187.google.com | US |
| 66.249.92.94 | rate-limited-proxy-66-249-92-94.google.com | US |
通常不需要。除非您不希望資訊流網站或者APP對您的網站內容進行抓取,網站也不提供Feed訂閱服務,則可以考慮攔截此型別爬蟲。
您可以通過在網站的 robots.txt 中設定使用者代理訪問規則來遮蔽 FeedBurner 或限制其訪問許可權。我們建議安裝 Spider Analyser 外掛,以檢查它是否真正遵循這些規則。
# robots.txt # 下列程式碼一般情況可以攔截該代理 User-agent: FeedBurner Disallow: /
您無需手動執行此操作,可通過我們的 Wordpress 外掛 Spider Analyser 來攔截不必要的蜘蛛或者爬蟲。
FeedBurner是一個於2004年在美國芝加哥市成立的網站饋送管理供應商。FeedBurner為部落格作者、Podcast與其他基於網路的內容釋出者提供訂製的RSS饋送與管理工具,提供予釋出者的服務包括流量分析以及一個可供選擇的廣告系統。
基本上可以使用Feedburner作為 “代理”。
據我所知,它的主要用途是。建立一個帶有大量URLs的feed(針對一個目標網站)並提交給Google Feedburner。然後Feedburner會嘗試訪問feed中的所有頁面。Feedburner 是一個分散式的服務,所以可以建立很多連線。
一般來說,只是通過使用者代理來阻止。如果不使用 Feedburner,應該不會有合法的 UA 流量。
此外,封鎖IP也沒有什麼壞處(只要對特定的IP進行封鎖)–因為Googlebot(通常是Google唯一 “關心 “的流量)不會來自這些IP。
(它在一定程度上是作為DDOS的放大作用,但它也可以被用於爬蟲。由於feedburner做的是抓取,通常提供一個 “簡明 “的頁面摘要。但最終的Feed將包含所獲取頁面的內容)。