TextRazor crawler

TextRazor crawler蜘蛛/爬虫属于工具类型,由TextRazor Ltd.开发运行。您可以继续阅读下方信息,以深入了解TextRazor crawler基本信息,用户代理和访问控制等。

基本信息

TextRazor crawler的基本信息如下表。但部分不是很规范的蜘蛛和爬虫,可能存在信息不明的情况。
蜘蛛/爬虫名称
TextRazor crawler
类型
工具
开发商
TextRazor Ltd.
当前状态
活动

用户代理

关于TextRazor crawler蜘蛛或者爬虫的用户代理字符串,IP地址和服务器,所在地等信息如下表格所示:
TextRazor Downloader
用户代理字符串
TextRazor Downloader (https://www.textrazor.com)
首次出现
2019-04-24 07:41:27
最后出现
2025-01-08 17:26:52
遵循robots.txt
来源
IP地址(191) 服务器名称 所属国家
174.138.60.61 nyc3.squid.digitalocean.19 ?
165.227.76.204 nyc3.squid.digitalocean.19 US
159.203.77.41 nyc3.squid.digitalocean.109 US
157.245.15.63 nyc3.squid.digitalocean.89 US
167.172.236.188 nyc3.squid.digitalocean.58 US

访问控制

了解如何控制TextRazor crawler访问权限,避免TextRazor crawler抓取行为不当。

是否拦截TextRazor crawler?

可能不需要。工具类型爬虫通常为网站所有者使用此类工具对网站进行相关服务请求才会出现。当然,实际情况需站长判断后再作决定。

通过Robots.txt拦截

您可以通过在网站的 robots.txt 中设置用户代理访问规则来屏蔽 TextRazor crawler 或限制其访问权限。我们建议安装 Spider Analyser 插件,以检查它是否真正遵循这些规则。

# robots.txt
# 下列代码一般情况可以拦截该代理
User-agent: TextRazor crawler
Disallow: /

您无需手动执行此操作,可通过我们的 Wordpress 插件 Spider Analyser 来拦截不必要的蜘蛛或者爬虫。

更多信息

TextRazor总部位于英国伦敦,是一家提供软件的初创公司,帮助开发人员迅速将文本分析纳入其应用程序。他们的工具提供最先进的开箱即用的性能,同时提供定制选项,以帮助优化任何用例。

TextRazor的API正在快速增长,目前每天处理来自一系列垂直领域的数百个应用程序的数百万个请求。主要用例包括社交媒体监测、企业搜索、推荐系统和广告定位。

该公司成立于2011年,自2013年以来,在没有机构投资的情况下,一直在盈利运营。

TextRazor的高性能机器学习堆栈从头开始设计,在不同的写作风格中实现了准确性、速度和稳健性。

在几分钟内整合

TextRazor的API可以很容易地与任何可以发送HTTP请求和解析JSON响应的语言集成,只需几行代码就可以进行强大的文本分析。TextRazor允许你在一个请求中提取任何和所有你需要的信息,将提取的语义元数据连接起来,使识别复杂模式变得容易。

不折不扣的延迟、吞吐量和大可扩展性

只有当你的软件能够跟上它的步伐时,大数据才是有用的。TextRazor从一开始就为性能而设计。TextRazor是用高度优化的C++编写的,每个核心每秒能够处理数千字。我们的分布式后端每天为数以百计的客户处理数千万的文件。

TextRazor的弹性基础设施是建立在亚马逊网络服务云和物理硬件上。TextRazor是为高可用性和性能一致性而设计的,用于分析每天数千、数百万或数十亿的文档。

每日更新

语言总是在变化–我们的模型每天都有新的实体更新,所以你永远不会错过任何重要的东西。我们每个月还会从头开始完全重建我们的模型,以适应语言使用方面的较大变化。

无限的定制

TextRazor允许你添加产品名称、人物、公司、自定义分类规则和高级语言学模式。我们的集成Prolog引擎让你迅速将TextRazor的结果与强大的自定义领域特定逻辑相结合。

你可以在这里阅读更多关于TextRazor的规则引擎。

% Match two companies in a 'buy' relation.
acquisition_rumor(CompanyA, CompanyB, EntailedWord) :-
    entity_type(CompanyA, 'Company'),
    entity_type(CompanyB, 'Company'),
    relation_overlap(BuyRelation, 'SUBJECT', CompanyA, 'OBJECT', CompanyB),
    entailment_overlap(_, BuyRelation, EntailedWord),
    member(EntailedWord, ['buy', 'sell', 'acquire']).

常见蜘蛛/爬虫

Common Spiders

相关文章

Related Articles