“大数据”并不是IT专家每天挂在嘴边的空洞术语,它本身就代表一整个行业。信息遍布网络的每个角落,如果不善加利用这座庞大的数据库,实在可惜。
那么,该如何充分利用这些网络数据呢?不妨从网络爬取开始。耐心读完这篇文章,您很快就能像专业人士一样高效地收集信息,并乐在其中。
什么是网络爬取?
了解网络爬取的方方面面,首先要从定义说起。不必被这个词吓到,尽管听起来很专业,它其实只是指利用软件、脚本及其他工具自动从互联网提取数据。
没错,这可不是让您一页页打开网站、不停复制粘贴。程序会替您完成这一切,您只需喝杯咖啡坐等结果——如果这还不算高效,那什么才算呢。
为什么企业要进行网络爬取?
网络爬取在全球范围内被企业和个人广泛使用。从美国到印度,各类组织都在利用公开数据做出明智的商业决策。以下是几种常见使用场景:
- 获取竞争优势:在许多行业(尤其是电商领域),及时掌握竞争对手的价格和促销信息至关重要。
- 研究和分析市场及最新趋势:大众在想什么?网络爬取技术能帮助企业洞察客户情绪,从而预测需求和偏好。
- 获取销售线索:销售产品首先需要一份潜在客户名单,而许多电话号码和电子邮箱都能在网上轻松获取。
- 优化 SEO 和数字营销策略:在搜索引擎结果页面排名靠前能带来可观收益。网络爬取能帮助企业发现关键词和新的营销方案。
- 分析股市行情:该买入还是卖出某只股票?市场走向如何?这些问题的答案往往就藏在网络数据中。
- 洞察招聘市场:招聘公司一旦掌握了招聘行业的走势,就能为客户提供更好的服务。
- 管理品牌声誉:公司在市场上的口碑如何?抓取评论网站和社交媒体数据能带来大量有价值的信息。
网络爬取会惹上麻烦吗?
收集网络信息时,谁都不想惹上麻烦。网络爬取的合法性处于灰色地带,所以很容易让人觉得只要不被发现就没事。然而,事情并没有这么简单。
设身处地想一想:如果您是一家社交平台的所有者,您当然乐见自己的网站对他人有用,但您也不希望别人滥用您的服务。
进行网络爬取时,应始终秉持合乎道德的原则。请考虑数据收集行为带来的影响:您的操作是否拖慢了平台速度?是否违反了版权和知识产权相关法律?该网站是否明令禁止网络爬取?这些问题应该不难回答。
网络爬取的合法性
先说清楚一点:网络爬取本身是合法的。但如果采用了不当的方式收集数据,就可能惹上麻烦。例如,如果使用脚本加载数千个页面,导致服务器过载、令其他人无法正常访问网站,这就很容易引发法律问题。
另一个决定网络爬取合法性的关键因素是所抓取的数据类型。应避免访问受限或受版权保护的信息,除非已获得所有者的适当授权。
归根结底,只要在网络爬取活动中坚持合乎道德的原则,就能避免招致执法部门的介入。请随时关注相关动态,研究行业最佳实践。如有疑问,咨询法律专业人士总是明智之举。
登上新闻的网络爬取案例
总体而言,网络爬取虽然合法,但这并不代表企业不会因此陷入法律纠纷。接下来看几个知名案例。
- LinkedIn 诉 HiQ Labs 案
2017年至2022年间,这两家公司因后者的网络爬取行为陷入了一场法律纠纷。众所周知,LinkedIn 归 Microsoft 所有。该公司曾发出勒令停止函,试图阻止 HiQ Labs 访问私密数据,即其会员的个人资料。
作为回应,HiQ Labs 提起诉讼,指控 LinkedIn 不公平地限制竞争。第九巡回法院最终裁定 HiQ 胜诉,理由是其抓取的是公开可获取的数据,并未违反联邦法律。
- Craigslist 系列诉讼
<0>Craigslist一直以强硬打击网络爬取者而闻名。2012年,该公司起诉 3Taps,指控其不仅抓取了平台上的信息,还对其进行了转发布。法院最终支持了 Craigslist 一方,认定 3Taps 通过绕过</0>IP 封禁违反了《计算机欺诈与滥用法》(CFAA)。
在另一起案件中,Craigslist 将矛头对准了专注于汽车销售的平台 Instamotor。法院认定,Instamotor 未经 Craigslist 许可抓取了其汽车广告信息,并转发布在自己的平台上。两家公司最终以3100万美元的和解金了结此案,充分体现了 Craigslist 对网络爬取行为的强硬立场。使用Craigslist 专用代理是抓取该平台数据、同时避免触发封禁或法律诉讼的有效方式。
网络爬取在美国合法吗?
LinkedIn、Facebook、Reddit 等公司恨不得让网络爬取彻底成为非法行为,但截至目前,美国并没有一部全面禁止网络爬取的法律。
这对高度依赖大数据的企业来说听起来是个好消息,但如果在收集信息时完全不顾及行为是否正当,仍可能让自己陷入麻烦。
影响网络爬取活动的联邦法律
在美国,网络爬取相关的法律环境相当复杂。简单来说:访问公开数据没有问题,但触碰受版权保护或专有数据则绝对不可取。政府已颁布多项联邦法律,规定了何时以及如何进行网络爬取是被允许的,以下是相关法律一览:
- 《计算机欺诈与滥用法》(CFAA):将未经授权访问网络数据的行为定为犯罪
- 《数字千年版权法》(DMCA):防止未经授权抓取和转发布受版权保护的内容
- 《联邦贸易委员会法》(FTCA):打击不公平和误导性的商业行为
- 《存储通信法》(SCA):保护私密数字通信
- 《儿童在线隐私保护法》(COPPA):规范对儿童个人信息的收集
尽管《加州消费者隐私法》(CCPA)并非联邦法律,但同样影响着网络爬取行为。该法赋予加州居民访问、删除个人数据及选择退出数据出售的权利,并要求企业在数据收集方面保持透明。
合法与非法的网络爬取活动
网络爬取合法与否之间的界线有时确实微妙,但理解起来并不难。以下是一些合法活动的示例:
- 抓取公开数据是合法的,尤其是在无需凭证即可访问的情况下。
- 如果是出于个人用途收集数据,比如查询机票价格,这完全没问题。
- 在抓取网站数据前获得许可,是确保自身行为合法的可靠方式。
- 抓取未受版权保护的数据通常是合法的。
- 出于研究或新闻报道目的获取数据是可以的,除非该数据属于私密或受版权保护的内容。
了解了合法数据抓取的几个示例后,我们再来看看另一面——应避免以下行为:
- 抓取需订阅付费或登录才能访问的数据,可能违反 CFAA。
- 许多网站会采取反爬取措施来对抗机器人程序,规避这些防护机制属于违法行为。
- 如果在抓取个人信息前未获得当事人同意,可能违反数据隐私相关法律。
- 文章、音乐、照片等均属于受版权保护的内容,抓取并转发布此类数据属于违法行为。
- 抓取网站数据很容易导致服务器过载,这种行为可能被视为网络犯罪。
网络爬取在欧洲及其他国家和地区合法吗?
在欧洲,涉及网络爬取(尤其是个人数据抓取)的相关法律往往更为严格;而在印度等其他国家和地区,针对此类问题的专门法规几乎不存在。由于各地法律尺度差异很大,及时了解相关规定至关重要。
总体而言,抓取受保护信息或个人数据时应格外谨慎;而收集公开数据则通常处于安全范围内。
欧洲 GDPR 相关的担忧
网络爬取在欧洲受到严格审查,主要原因在于《通用数据保护条例》(GDPR)。该法律保护一切可识别个人身份的信息,因此在抓取姓名、电子邮箱或 IP 地址之前,必须获得当事人同意。
由于违反 GDPR 的罚款可高达2000万欧元或全球年营业额的4%,企业在这一领域的操作极为谨慎。为确保合法合规,抓取的数据不得包含用户个人资料或任何可关联到具体个人的信息,除非已获得许可。
进行跨国网络爬取前需要了解的重要知识
前面探讨了美国和欧洲的数据抓取合法性问题,但世界远不止这两个地区。那么在其他地方,网络爬取是否合法呢?下面来看看三个国家的具体情况。
英国有自己一套类似于欧盟 GDPR 的法规。与欧盟一样,针对可识别个人身份数据的网络爬取属于禁止行为;但对公开数据的收集,目前尚无明确的法律规定。
接下来看亚洲地区。涉及中国公民个人数据的网络爬取时,切勿轻视中国监管部门的态度。该国的数据保护法规属于全球较为严格的一类,收集中国公民信息可能面临严厉处罚。
印度的网络爬取是否合法?虽然该国并未针对网络爬取制定专门法规,但未经授权滥用或收集数据,可能依据《信息技术法》(Information Technology Act)被追究法律责任。
用于商业用途的网络爬取是否合法?
希望您还没有厌倦“灰色地带”这个说法,因为用于商业目的的数据抓取同样处于这一模糊地带。在开展此类活动之前,您应当先问自己以下几个问题:
- 我要抓取的是什么数据?
- 我要如何抓取这些数据?
- 我将如何以及在何处使用抓取到的数据?
简而言之,在获得同意的前提下,为分析竞争对手、制定定价策略或开展市场研究而进行的网络爬取普遍被接受;但一旦违反数据保护法规,就可能惹上麻烦。
企业抓取竞争对手数据是否合法?
您现在大概已经知道,这个问题没有简单的答案。抓取竞争对手公开发布的数据是合法的,比如抓取 Reddit 上与股市走势相关的帖子,或抓取 LinkedIn 上的招聘信息。
反之,使用网络爬取工具收集用户个人数据,或未经同意抓取付费墙后的产品价格,则属于违法行为;绕过安全防护措施或无视网站有关爬取的服务条款,同样如此。
作为网络爬取者,如果您收集的是公开数据,法律可能站在您这一边,因为 CFAA 并不将此视为未经授权的访问。不过,这并不意味着您不会在与 Amazon、Facebook、LinkedIn 等大型企业的较量中耗费宝贵的时间和资源。如果您的目标是 Amazon,我们关于Amazon 网络爬取的指南涵盖了开始之前您需要了解的技术和法律要点。
B2B 与 B2C 网络爬取的区别
企业可能会抓取竞争对手的网站,以获取定价或行业趋势方面的情报,这就是所谓的 B2B 爬取。但若在此过程中违反了既定的 API 条款,就会面临更高的法律风险。
B2C 爬取是指企业抓取客户数据,通常用于市场调研,这类信息常见于社交媒体和电商网站。尽管 B2C 爬取是一种被普遍接受的做法,但未经同意进行抓取可能违反隐私法规,尤其是涉及个人数据时。
企业如何合法使用抓取到的数据
现在您已经了解如何在不违反法规的前提下进行网络爬取,但合规之路并不止于此:抓取到数据之后,又该如何合法使用呢?
- 通过研究价格、识别趋势、整理客户评价来分析市场
- 了解大众对品牌、产品等的情绪倾向
- 监测热门关键词和搜索引擎结果,以优化 SEO 策略
- 通过联系公开目录中的个人资料来获取销售线索
只要不对外重新分发所获取的信息,就不会有问题;未经许可转发或出售这些数据,必然会违反网络爬取相关法规。
进行网络爬取是否需要获得许可?
法律在网络爬取问题上并没有明确的界定。发现一个信息丰富、值得抓取的网站时,切勿被兴奋冲昏头脑,尤其是当其中包含个人数据时。
如果访问该网站需要登录或付费订阅,明智的做法是事先获得许可;抓取个人数据和受版权保护的内容时也是如此。
不过,如果您对新闻报道、政府公开的统计数据等免费公开内容进行自动化采集,通常无需获得许可,这也意味着您可以抓取公开的产品信息和股票价格。
服务条款如何影响网络爬取的合法性
现在,不妨亲自试一试:打开Craigslist 的使用条款,您会发现其中专门有一节是关于网络爬取的。正是凭借这项条款,Craigslist 才在与 3Taps 等公司的多起诉讼中胜诉。
Craigslist 的案例并不意味着违反网站服务条款就一定会惹上麻烦,但进行自动化数据采集时,仍需做好承担法律后果的准备。在爬取之前先寻求书面许可,始终是明智之举。
向网站所有者申请书面许可
有些网站运营者清楚自己的数据很有价值,甚至会主动提供 API,方便他人获取内容。在这种情况下,就没有必要再进行网络爬取了。
否则又该怎么办呢?伦理考量在网络爬取中至关重要——当服务器承受源源不断的请求时,网站所有者必然会有所反应和抱怨。因此,在收集数据之前,通过邮件或信函申请许可是合理的做法。您的书面申请中应包含以下内容:
- 您需要哪些数据,以及需要这些数据的原因
- 您将如何使用抓取到的数据
- 网站所有者提供所需信息的替代方式
- 保证您将遵循良好的网络爬取规范
如何在不违法的前提下进行网络爬取
上文提到的 GDPR、CFAA 等法规,并没有将网络爬取本身定性为违法行为。尽管如此,您仍应以负责任、合乎道德的方式开展相关工作。遵循以下良好实践,尊重内容所有者,就能避免执法部门找上门来。
- 作为网络爬取者,网站的服务条款是不容忽视的内容,请仔细阅读,了解哪些行为被允许、哪些被禁止。如果网站明确禁止爬取,就发送一封正式邮件申请许可。
- 您听说过 robots.txt 文件吗?网站通过这份文件标明哪些部分允许机器人访问或爬取。只需在网站网址后加上“/robots.txt”,即可找到并查看该文件。
- 未经许可,请勿抓取个人数据,包括电子邮件、姓名、联系电话乃至财务信息。GDPR 等网络爬取相关法规对此类行为严格禁止。
- 让网站服务器不堪重负,必然会带来法律风险。进行网络爬取时,可以设置请求间隔(例如每 3 秒发送一次请求)以减轻服务器压力。
- 如果使用的是爬取机器人,请勿伪装成浏览器,应在 User-Agent 请求头中清楚标明身份并提供联系方式。
- 进行网络爬取时,一股脑抓取所有内容固然诱人,但请只获取真正需要的数据,不要复制受版权保护的内容。
- 如果可以选择使用 API 提取数据,就优先这样做——这是网络爬取之外更可靠的替代方案。
网络爬取会被检测到吗?
在关于网络爬取的各种误解中,最离谱的一种莫过于认为大多数网站运营者根本不会察觉。虽然被检测到确实是个问题,但这并不代表您无法克服这一障碍。
许多网站会专门监控服务器上出现的各种异常情况,并配备相应工具检测各类自动化数据采集行为。接下来,本文介绍几种常见的爬取检测方法。
- robots.txt 文件:网站会在 robots.txt 文件中规定机器人可以访问和不可以访问的内容,违反规则可能导致 IP 被封。
- User-Agent 请求头:各类爬取程序随处可得,数据采集者若直接使用这些脚本而不修改默认请求头,就很容易被识别出来。
- 请求监控:网站能够察觉短时间内出现的大量请求,随之而来的便是 IP 被封。
- CAPTCHA:访问网页时被要求输入一串乱码字符,或在图片中找出包含自行车的部分,这种体验谁都不喜欢,人类厌烦这类操作,而机器人则往往根本无法完成。
- 诱捕机制(honeypot):就像蜜蜂抵挡不住蜂蜜的诱惑,机器人也难以绕过隐藏的链接或隐藏字段。一旦与这些诱捕机制发生交互,网站就会立刻察觉到机器人的存在。
如何合法地避免被检测
许多网络爬取教程会引导您使用不正当的手段绕过反爬虫措施,但本文并非这类内容。信不信由您,其实完全可以在合法合规的前提下避开检测,获取所需数据。
修改机器人的 User-Agent 字符串以模拟浏览器并不违法,这一步甚至可以借助自动化工具完成。
说到自动化工作流程,不妨多了解一下代理服务器。在爬取过程中轮换使用住宅 IP 池,能大幅降低被检测到的风险。
另一种完全合法的规避检测方式是限制请求频率,这能使网络爬取行为更接近真实用户操作,核心在于避免形成可被识别的规律。
在我们看来,较为合理且合乎道德的方式是通过 API 获取数据。如果网站提供这类途径,就没有必要再诉诸网络爬取,无论是抓取个人数据还是其他信息。Twitter、Google 地图和美国政府等机构都提供此类服务。
网络爬取被发现后的后果
企业常试图援引加州刑法典等法规,将网络爬取行为定性为违法,但这类尝试大多未能成功。不过,如果您以超出授权范围的方式采集数据,一旦被网站发现,就必须做好承担后果的准备。
后果轻重不一:最轻的情况是网站封禁您的 IP,使您无法访问其资源,而这已经算是最好的结果了。
更严重的情况下,企业可能指控您导致其服务器崩溃,或发起拒绝服务(DoS)攻击,随之而来的可能是一场法律纠纷,往往从一封勒令停止函(cease-and-desist letter)开始。除非您有足够站得住脚的理由,否则最好不要无视这类通知,不然很可能面临诉讼。
众所周知,诉讼的代价可能相当高昂。如前所述,违反 GDPR 最高可能被处以 2000 万欧元的罚款。如果网站就您采集个人数据的行为对您采取法律行动,这时就应该寻求专业法律意见了。
结语
随着AI 正在改变企业的运营方式,网络爬取相关法律格局发生变化也就不足为奇了。欧洲、英国和印度等国家和地区正在制定新法规或更新现行法律,仅是其中几个例子。由于AI 模型高度依赖数据,这是所有从事网络爬取的人都需要关注的问题。
考虑到网络爬取涉及的法律问题,不妨尝试做遵规守矩的一方。坚持道德规范从不会带来坏处,而及时了解各地区最新法规,能帮您在法律事务上节省数千甚至数百万的开支——这就是我们的一点建议。
准备好合法合规地开始数据抓取了吗?如果您更喜欢使用 Go 而非 Golang 网络爬虫,不妨试试我们的 Scrapy Python指南,这会是一个不错的起点。