GPTBot

GPTBot蜘蛛/爬虫属于AI数据采集类型,由OpenAI OpCo, LLC开发运行。您可以继续阅读下方信息,以深入了解GPTBot基本信息,用户代理和访问控制等。

基本信息

GPTBot的基本信息如下表。但部分不是很规范的蜘蛛和爬虫,可能存在信息不明的情况。
蜘蛛/爬虫名称
GPTBot
类型
AI数据采集
开发商
OpenAI OpCo, LLC
当前状态
活动

用户代理

关于GPTBot蜘蛛或者爬虫的用户代理字符串,IP地址和服务器,所在地等信息如下表格所示:
GPTBot/1.2
用户代理字符串
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.2; +https://openai.com/gptbot)
首次出现
2024-06-18 02:08:30
最后出现
2025-01-10 18:02:56
遵循robots.txt
未知
来源
IP地址(553) 服务器名称 所属国家
52.230.152.96 ? US
52.230.152.26 ? US
52.230.152.124 ? US
52.230.152.106 ? US
52.230.152.198 ? US
用户代理字符串
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)
首次出现
2023-08-04 06:39:04
最后出现
2025-01-09 22:53:15
遵循robots.txt
未知
来源
IP地址(506) 服务器名称 所属国家
40.83.2.66 ? US
40.83.2.78 40.83.2.78 US
40.83.2.65 ? US
40.83.2.76 ? US
40.83.2.71 40.83.2.71 US

访问控制

了解如何控制GPTBot访问权限,避免GPTBot抓取行为不当。

是否拦截GPTBot?

这取决于你。AI数据采集器器通常会下载公开可用的互联网内容,这些内容默认情况下可以免费访问。不过,如果你担心归属问题或你的创意作品如何被用于生成的人工智能模型中,你可以拦截它们。

通过Robots.txt拦截

您可以通过在网站的 robots.txt 中设置用户代理访问规则来屏蔽 GPTBot 或限制其访问权限。我们建议安装 Spider Analyser 插件,以检查它是否真正遵循这些规则。

# robots.txt
# 下列代码一般情况可以拦截该代理
User-agent: GPTBot
Disallow: /

您无需手动执行此操作,可通过我们的 Wordpress 插件 Spider Analyser 来拦截不必要的蜘蛛或者爬虫。

更多信息

GPTBot 是 OpenAI 的网络爬虫,可以通过以下用户代理和字符串识别。

User agent token: GPTBot
Full user-agent string: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)

用法

使用 GPTBot 用户代理抓取的网页可能会用于改进未来的模型,并会进行过滤以删除需要付费墙访问、已知主要汇总个人身份信息 (PII) 或包含违反我们政策的文本的来源。允许 GPTBot 访问您的网站可以帮助 AI 模型变得更加准确,并提高其一般能力和安全性。下面,我们还分享了如何禁止 GPTBot 访问您的网站。

禁止 GPTBot

要禁止 GPTBot 访问您的网站,您可以将 GPTBot 添加到您网站的 robots.txt 中:

User-agent: GPTBot
Disallow: /

自定义 GPTBot 访问

为了允许 GPTBot 仅访问您网站的部分内容,您可以将 GPTBot 令牌添加到您网站的 robots.txt 中,如下所示:

User-agent: GPTBot
Allow: /directory-1/
Disallow: /directory-2/

GPTBot 和 ChatGPT-User

OpenAI 有两个单独的用户代理,分别用于网页抓取和用户浏览,因此您可以知道给定请求适用于哪种用例。我们的退出系统目前对这两个用户代理一视同仁,因此任何针对一个代理的 robots.txt 禁止都将覆盖这两个代理。在此处阅读有关 ChatGPT-User 的更多信息

IP 范围

对于 OpenAI 的爬虫来说,对网站的调用将从OpenAI 网站上记录的 IP 地址块进行。

常见蜘蛛/爬虫

Common Spiders
Databricks crawler
Databricks crawler蜘蛛/爬虫属于AI数据采集类型,由Databricks, Inc.开发运行。您可以继续阅读下方信息,以深入了解Databricks crawler基本信息,用户代理和访问控制等。
Umai-Scanner
Umai-Scanner蜘蛛/爬虫属于AI数据采集类型,由Entelijan Inc开发运行。您可以继续阅读下方信息,以深入了解Umai-Scanner基本信息,用户代理和访问控制等。
Amazing bot
Amazing bot蜘蛛/爬虫属于AI数据采集类型,由Amazing.com Inc.开发运行。您可以继续阅读下方信息,以深入了解Amazing bot基本信息,用户代理和访问控制等。
SaaSBrowserBot
SaaSBrowserBot蜘蛛/爬虫属于AI数据采集类型,由Two Phase, LLC开发运行。您可以继续阅读下方信息,以深入了解SaaSBrowserBot基本信息,用户代理和访问控制等。
Cotoyogi
Cotoyogi蜘蛛/爬虫属于AI数据采集类型,由Center for Research and Development on Data Lake开发运行。您可以继续阅读下方信息,以深入了解Cotoyogi基本信息,用户代理和访问控制等。
PanguBot
PanguBot蜘蛛/爬虫属于AI数据采集类型,由Huawei Technologies Co., Ltd.开发运行。您可以继续阅读下方信息,以深入了解PanguBot基本信息,用户代理和访问控制等。
Hive
Hive蜘蛛/爬虫属于AI数据采集类型,由Castle Global, Inc.开发运行。您可以继续阅读下方信息,以深入了解Hive基本信息,用户代理和访问控制等。
Gemini bot
Gemini bot蜘蛛/爬虫属于AI数据采集类型,由Google Inc.开发运行。您可以继续阅读下方信息,以深入了解Gemini bot基本信息,用户代理和访问控制等。

相关文章

Related Articles