如何做搜索引擎蜘蛛日志分析
搜索引擎蜘蛛日志文件是一种非常强大但未被站长充分利用的文件,分析它可以获取有关每个搜索引擎如何爬取网站内容的相关信息点,及查看搜索引擎蜘蛛在一段时间内的行为。
| IP地址(12) | 服务器名称 | 所属国家 |
|---|---|---|
| 34.203.239.213 | ec2-34-203-239-213.compute-1.amazonaws.com | US |
| 54.196.247.103 | ec2-54-196-247-103.compute-1.amazonaws.com | US |
| 44.204.29.242 | ec2-44-204-29-242.compute-1.amazonaws.com | US |
| 54.81.136.113 | ec2-54-81-136-113.compute-1.amazonaws.com | US |
| 18.208.137.30 | ec2-18-208-137-30.compute-1.amazonaws.com | US |
| IP地址(6) | 服务器名称 | 所属国家 |
|---|---|---|
| 185.222.58.109 | hosted-by.rootlayer.net | NL |
| 35.226.151.117 | 117.151.226.35.bc.googleusercontent.com | US |
| 20.124.28.120 | 20.124.28.120 | US |
| 2607:ff28:b012::91b8 | 2607:ff28:b012::91b8 | US |
| 185.29.10.118 | 185.29.10.118 | SE |
| IP地址(10) | 服务器名称 | 所属国家 |
|---|---|---|
| 54.91.57.211 | ec2-54-91-57-211.compute-1.amazonaws.com | US |
| 35.175.235.123 | ec2-35-175-235-123.compute-1.amazonaws.com | US |
| 54.224.65.188 | ec2-54-224-65-188.compute-1.amazonaws.com | US |
| 54.198.34.58 | ec2-54-198-34-58.compute-1.amazonaws.com | US |
| 54.164.129.53 | ec2-54-164-129-53.compute-1.amazonaws.com | US |
| IP地址(2) | 服务器名称 | 所属国家 |
|---|---|---|
| 20.124.28.120 | 20.124.28.120 | US |
| 2607:ff28:b012::91b8 | 2607:ff28:b012::91b8 | US |
| IP地址(72) | 服务器名称 | 所属国家 |
|---|---|---|
| 54.82.59.229 | ec2-54-82-59-229.compute-1.amazonaws.com | US |
| 18.208.251.130 | ec2-18-208-251-130.compute-1.amazonaws.com | US |
| 54.227.95.100 | ec2-54-227-95-100.compute-1.amazonaws.com | US |
| 34.207.81.132 | ec2-34-207-81-132.compute-1.amazonaws.com | US |
| 3.89.217.40 | ec2-3-89-217-40.compute-1.amazonaws.com | US |
| IP地址(2) | 服务器名称 | 所属国家 |
|---|---|---|
| 54.196.178.24 | ec2-54-196-178-24.compute-1.amazonaws.com | US |
| 54.167.42.113 | ec2-54-167-42-113.compute-1.amazonaws.com | US |
| IP地址(4) | 服务器名称 | 所属国家 |
|---|---|---|
| 38.98.19.111 | 38.98.19.111 | US |
| 38.98.19.66 | 38.98.19.66 | US |
| 38.98.19.67 | 38.98.19.67 | US |
| 38.98.19.68 | 38.98.19.68 | US |
这取决于你。数字存档通常是为了保存历史记录。如果你出于某种原因不想成为历史记录的一部分,你可以拦截这类型的蜘蛛爬虫。
您可以通过在网站的 robots.txt 中设置用户代理访问规则来屏蔽 SnapBot 或限制其访问权限。我们建议安装 Spider Analyser 插件,以检查它是否真正遵循这些规则。
# robots.txt # 下列代码一般情况可以拦截该代理 User-agent: SnapBot Disallow: /
您无需手动执行此操作,可通过我们的 Wordpress 插件 Spider Analyser 来拦截不必要的蜘蛛或者爬虫。
Snapbot,用于URL预览服务扫描网站的HTML,为Snapchatters提供其朋友在聊天中分享的网站的预览。预览是一张带有标题、副标题和缩略图的卡片,链接到该网站。例如:

URL预览服务优先考虑Open Graph标签(og:title和og:image),但会使用Twitter Card标签(twitter:title和twitter:img:src)来收集预览的信息。URL预览服务以用户代理 “Snap URL Preview Service; bot; https://developer.snapchat.com/robots “进行HTTP请求,它将对URL的响应进行30分钟的缓存,以避免单一URL的过多流量。如果你的链接在Snapchat中的显示方式有问题。