| IP地址(103) | 伺服器名稱 | 所屬國家 |
|---|---|---|
| 66.249.88.3 | google-proxy-66-249-88-3.google.com | US |
| 66.249.84.192 | google-proxy-66-249-84-192.google.com | US |
| 66.249.88.27 | google-proxy-66-249-88-27.google.com | US |
| 66.249.88.31 | google-proxy-66-249-88-31.google.com | US |
| 66.249.89.221 | rate-limited-proxy-66-249-89-221.google.com | US |
| IP地址(10) | 伺服器名稱 | 所屬國家 |
|---|---|---|
| 66.249.83.54 | google-proxy-66-249-83-54.google.com | US |
| 66.249.84.238 | google-proxy-66-249-84-238.google.com | US |
| 66.249.83.47 | google-proxy-66-249-83-47.google.com | US |
| 66.249.83.49 | google-proxy-66-249-83-49.google.com | US |
| 66.249.83.51 | google-proxy-66-249-83-51.google.com | US |
通常不需要。除非您不希望資訊流網站或者APP對您的網站內容進行抓取,網站也不提供Feed訂閱服務,則可以考慮攔截此型別爬蟲。
您可以通過在網站的 robots.txt 中設定使用者代理訪問規則來遮蔽 Feedfetcher-Google 或限制其訪問許可權。我們建議安裝 Spider Analyser 外掛,以檢查它是否真正遵循這些規則。
# robots.txt # 下列程式碼一般情況可以攔截該代理 User-agent: Feedfetcher-Google Disallow: /
您無需手動執行此操作,可通過我們的 Wordpress 外掛 Spider Analyser 來攔截不必要的蜘蛛或者爬蟲。
Google 使用 Feedfetcher 抓取 Google 播客、Google 新聞和 PubSubHubbub 的 RSS 或 Atom Feed。
Feedfetcher 會儲存並定期重新整理由應用或服務的使用者請求的 Feed。只有播客 Feed 才會在 Google 搜尋中編入索引;但是,如果 Feed 不符合 Atom 或 RSS 規範,仍可能被編入索引。對於這款由使用者控制的 Feed 抓取工具的工作原理,下文列出了一些常見問題的解答。
當使用者新增使用 Feedfetcher 資料的服務或應用時,Google 的 Feedfetcher 會嘗試獲取相應 Feed 的內容,以便將其顯示出來。由於 Feedfetcher 請求來自真實使用者的明確操作(而非來自自動抓取工具),因此 Feedfetcher 不會遵循 robots.txt 中的指令。
如果您的 Feed 是公開的,那麼 Google 無法限制使用者訪問該 Feed。一種解決辦法是,將網站配置為向使用者代理 Feedfetcher-Google 傳送 404、410 或其他錯誤狀態訊息。
如果您的 Feed 是由某個部落格或網站託管服務提供商提供的,請直接與相應服務提供商聯絡,限制使用者對您 Feed 的訪問。
對於大多數網站,Feedfetcher 平均每小時最多檢索一次 Feed。 某些經常更新的網站可能會更頻繁地重新整理。但請注意,由於網路延遲,Feedfetcher 在短時間內檢索您 Feed 的頻率可能略高。
Feedfetcher 會根據使用者安裝的服務或應用發出的請求檢索 Feed。所以可能的情況是,使用者請求的 Feed 網址不存在。
Feedfetcher 會根據使用者安裝的服務或應用發出的請求檢索 Feed。所以可能的情況是,發出請求的使用者知道您的“私密”伺服器,或者錯誤地輸入了您的“私密”伺服器。
只有在使用者已明確啟動從 Feed 請求資料的服務或應用後,Feedfetcher 才會檢索這些 Feed。Feedfetcher 會以真實使用者(而不是漫遊器)的身份執行,因此它會忽略 robots.txt 中的指令。由於 Feedfetcher 會充當多位使用者的代理,因此它會代表通過應用或服務請求相應 Feed 的所有使用者,僅針對這個共同的 Feed 提出 1 次請求,從而節省了頻寬。常見的 Feed 包括 RSS 和 Atom。
您可以將伺服器配置為向使用者代理 Feedfetcher-Google 傳送 404、410 或其他錯誤狀態訊息,從而阻止 Feedfetcher 抓取您的網站。
Feedfetcher 分佈在多臺計算機上,以便提升效能,並隨著網路規模的擴大而擴大其作用範圍。為了減少頻寬的使用量,所用的計算機通常位於它們正在網路中檢索的網站附近。
Feedfetcher 使用的 IP 地址會隨時發生變化。識別 Feedfetcher 請求的最佳方法是查詢其使用者代理 Feedfetcher-Google。
一般來說,Feedfetcher 在指定的 Feed 檢索期間只從您的網站下載各檔案的一份副本。但在極少數情況下,計算機會關閉並重新啟動,這可能會導致 Feedfetcher 再次檢索最近訪問過的網頁。
與普通的網頁抓取工具不同,Feedfetcher 並不會跟蹤連結,它只會跟蹤使用 Feedfetcher 的服務或應用的使用者發來的請求。