如何做搜索引擎蜘蛛日志分析
搜索引擎蜘蛛日志文件是一种非常强大但未被站长充分利用的文件,分析它可以获取有关每个搜索引擎如何爬取网站内容的相关信息点,及查看搜索引擎蜘蛛在一段时间内的行为。
| IP地址(553) | 服务器名称 | 所属国家 |
|---|---|---|
| 52.230.152.96 | ? | US |
| 52.230.152.26 | ? | US |
| 52.230.152.124 | ? | US |
| 52.230.152.106 | ? | US |
| 52.230.152.198 | ? | US |
| IP地址(506) | 服务器名称 | 所属国家 |
|---|---|---|
| 40.83.2.66 | ? | US |
| 40.83.2.78 | 40.83.2.78 | US |
| 40.83.2.65 | ? | US |
| 40.83.2.76 | ? | US |
| 40.83.2.71 | 40.83.2.71 | US |
这取决于你。AI数据采集器器通常会下载公开可用的互联网内容,这些内容默认情况下可以免费访问。不过,如果你担心归属问题或你的创意作品如何被用于生成的人工智能模型中,你可以拦截它们。
您可以通过在网站的 robots.txt 中设置用户代理访问规则来屏蔽 GPTBot 或限制其访问权限。我们建议安装 Spider Analyser 插件,以检查它是否真正遵循这些规则。
# robots.txt # 下列代码一般情况可以拦截该代理 User-agent: GPTBot Disallow: /
您无需手动执行此操作,可通过我们的 Wordpress 插件 Spider Analyser 来拦截不必要的蜘蛛或者爬虫。
GPTBot 是 OpenAI 的网络爬虫,可以通过以下用户代理和字符串识别。
User agent token: GPTBot Full user-agent string: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)
使用 GPTBot 用户代理抓取的网页可能会用于改进未来的模型,并会进行过滤以删除需要付费墙访问、已知主要汇总个人身份信息 (PII) 或包含违反我们政策的文本的来源。允许 GPTBot 访问您的网站可以帮助 AI 模型变得更加准确,并提高其一般能力和安全性。下面,我们还分享了如何禁止 GPTBot 访问您的网站。
要禁止 GPTBot 访问您的网站,您可以将 GPTBot 添加到您网站的 robots.txt 中:
User-agent: GPTBot Disallow: /
为了允许 GPTBot 仅访问您网站的部分内容,您可以将 GPTBot 令牌添加到您网站的 robots.txt 中,如下所示:
User-agent: GPTBot Allow: /directory-1/ Disallow: /directory-2/
OpenAI 有两个单独的用户代理,分别用于网页抓取和用户浏览,因此您可以知道给定请求适用于哪种用例。我们的退出系统目前对这两个用户代理一视同仁,因此任何针对一个代理的 robots.txt 禁止都将覆盖这两个代理。在此处阅读有关 ChatGPT-User 的更多信息。
对于 OpenAI 的爬虫来说,对网站的调用将从OpenAI 网站上记录的 IP 地址块进行。