被AI爬虫挤爆服务器的维基百科:投降了

说到维基百科,大家都不陌生。

能够这样讲, 维基百科属于普通人弄明白一个概念, 最为便捷且最为权威的方式当中的一种。

那运营维基百科的机构, 是一个名为维基媒体的非盈利组织。该组织旗下, 除了存在维基百科, 还拥有维基共享资源, 以及维基词典。此外, 包括维基教科书等项目。

每一个项目, 都是免费供大家使用的, 这是由于维基媒体的核心理念, 是让知识能够自由自在地被获取, 并且能够毫无阻碍地进行共享。

但最近,维基媒体真的被 AI 公司们闹麻了。

为了训练大模型, 这些公司派出了无数个AI爬虫, 持续不断地爬取维基媒体上面的数据。

然而讲起来你或许难以相信, 维基媒体竟然没有去起诉这些人工智能公司, 反而做出了选择, 那就是------。

主动上交。

"各位大哥,我把资料都整理好了,你们别爬了行不。"

此前一段时间之内, 维基媒体将英语以及法语的维基百科相关内容放置于社区平台之上, 明确告知那些人工智能公司, 所需资源自行获取。

光是给予各类有用资源是不够, 维基就还得向那些居于高位者提供超级优质的服务。那它还特意针对人工智能模型的喜好倾向, 将相关资料进行了全面细致专业化针对性很强的完善优化操作。

为什么这么说呢, 是由于机器跟人类存在差异, 我们所看到的清晰直观的页面, 对于它们而言, 还得再费些脑筋, 去判定每一部分到底是什么。

于是, 维基就把页面弄成了 JSON 格式的那种结构化的内容, 其中那些标题, 摘要, 还有解释, 都依照统一的格式给分好了。

这般一来, AI 在进行查看之际, 会相对更容易去读懂每一段份的内容以及数据, 如此进而降低了 AI 公司的成本。

这一回, 眼下这么个状况, 则是为了保障自家关键根本不会遭受冲击损毁, 所做的一些行动, 维基干了这么件事儿, 就是给那群狼把一大盘味道美妙的肉食制作出来了, 完后放置到另一处地方。

世超觉得,维基这么做真挺无奈的。

4月1号那次, 他们就发过博客吐槽了, 2024年起, 平台用于下载多媒体内容的流量, 增加幅度达50%。

本以为是众人愈发热衷于学习呢, 然而一番查询之后却发觉全都是人工智能公司所派出的爬虫。这些爬虫持续不断地 将资源采集回去, 而后把它们用于训练庞大的模型。

爬虫对维基的影响,还真挺大的。

由于维基媒体于全球存在多个区域数据中心, 涉及欧洲、亚洲、南美等地区, 并且还有一个核心数据中心, 位于美国弗吉尼亚州阿什本。

存放着全部资料的是核心资料中心, 而临时缓存一些热门词条的则为区域数据中心。

这么做好处是啥呢?

举例来说, 最近范围内有着众多的亚洲人, 他们正在进行"Speed"这个词汇的查询操作, 这样子的话, "Speed"这个词汇就会被存储到亚洲区域那些的数据中心当中, 进行缓存处理。

这样一来, 若是后来查看"Speed"的亚洲网友, 这些数据便会经由同城快递, 从亚洲数据中心出发, 不再从美国的数据中心走国际物流了, 而是通过同城快递来传输。

这种让高频词条经由廉价通道, 低频词条通过高价通道的方式, 不但提升了各个区域用户们的加载速度, 还减轻了维基媒体的服务器压力。

然而问题在于, AI 会管这么多有的没的事儿吗? 只要是属于词条范畴的东西, 它都会去进行访问操作, 且这种访问还是批量性质的访问行为。

这就导致不断有流量走高价通道。

前段时间, 维基媒体发现了这样的情况, 即那些走美国数据中心的流量, 成本是比较高的, 而其中竟然有65%, 是被AI爬虫给糟蹋掉的。

须知维基具备免费特质, 然而其服务器并非如此, 存在每年 300 万美元的托管成本哟。

经过几周时间, 考量到单纯吐槽或许起不到什么实质作用, 于是维基媒体作出决定, 将资源细致地整理出来, 然后放置于其他平台之上, 以供AI公司自行取用。

实际上, 不只是维基百科, 在经由内容平台抵达开源项目的范围里, 从个人实施展现并分享观点的播客跨越至媒体对外传播信息所用网站的整个过程中, 大家都碰到过相似情况。

去年夏天的时候, 老板于推特上在吐槽, 有爬虫, 此爬虫情况是, 在一天之中访问了其自家公司的网站有100万次。

瞅见这, 没准你会讲, 难道不是存在一个机器人协议robot.txt吗, 要是不愿让AI爬虫去访问自身的网站, 能不能把它寫至协议里头呀。

嗯没错, 于将爬虫添加至.txt时候, 爬行的确出现了短暂的停顿情况(变为了每三十分钟一次该频率)。

曾经处于互联网时代期间, 协议确实属于一种一劳永逸的技术, 然而也存在一些公司由于不予以遵守从而吃到了官司。

但搁现在,这个君子协议只能算纸老虎。

现在的大模型公司,能爬尽爬。

毕竟, 别家都在进行攀爬的动作, 你却不进行这样的攀爬动作, 那么, 你的语料库就会比不上别人那般强大, 进而, 大模型的起跑线就会比别人低上一等。

那咋办------

为爬虫更换一个名称啦(此种为用户应用代理), 你仅仅表明不允许鲁迅进行爬取, 却并未提及不允许周树人开展爬取呀。

有没有大模型这么无耻?可太多了。

此前, 已然存在, 网友明确于协议之中予以禁止的爬虫, 然而, 对方却将其名称进行了更改, 随后, 依旧持续进行爬取行为。

又比如说, 曾遭到科技媒体WIRED揪出来, 完全对协议予以漠视。

这些年呢,大家也在尝试各种新的办法。

有人研究得出, 在协议当中放置一个坏死的链接, 只要是点进这个链接的, 必然是爬虫, 因为正常的用户是不会去点击这个协议的。

有的人员选择借助Web应用程序防火墙(WAF)去进行综合识别基于IP地址, 请求呈现方式还有行为特征的恶意爬虫。

也有人决定给网站弄一套验证码。

只是大体而言这些举措, 常常是魔高一丈, 道高一尺。你抵制得越是严正, 人工智能公司就会使用更为恶劣的采集途径来取代。

因此, 赛博菩萨, 前段时间推出了一套技术, 该技术监测到存在恶意爬虫, 于是就干脆让爬虫进入。

当然放它进来,不是给它好吃的,而是做了一道"错饭"------

提供一串和被抓取网站无关的网页,让 AI 在里面慢慢看。

的操作还算是收敛着了。

今年 1 月,有网友写了一款更凶狠的工具,叫 猪笼草。

等同于猪笼草致使昆虫被其杀害的情况相似, "猪笼草"把AI爬虫困于不存在出口链接的"无限迷宫"静态文件里头, 使得它们无法抓取到真实的内容。

并非仅仅这样, "猪笼草"持续给爬虫投放"马尔可夫乱语", 以去污染AI的训练数据。听说这个技术当前只有 的爬虫能够逃脱。

好好好,原来 AI 攻防战,在大模型训练源头就已经打响了。

当然了,平台们也可以和 AI 公司达成协议。

举例来说, 推特以及和它类似的存在, 针对AI公司推出了收费套餐, 依据每月使用API的数量多少, 以及访问推文数量的多少, 按照相应标准收取你与之对应的费用。

存在着那些没有谈妥成功, 继而引发诉讼官司的情况。就像《纽约时报》, 在经过商议但没有取得丝毫结果之后, 便提起了诉讼, 起诉的内容是抓取自家所撰写的相关文章。

看到这你可能会好奇:为什么维基百科不告这些 AI 爬虫呢?

世超猜测,这可能和维基百科本身有关。

维基百科的许可协议非常开放。

其多数部分的内容是, 允许任何人士, 其中涵盖AI公司, 在遵循署名且以相同协议进行共享的状况之下, 能够自由地去加以使用, 能够自由地加以复制, 能够自由地予以修改, 并且能够自由地去实施分发。

故而, 从法律层面予以审视, AI公司去抓取, 并且使用维基百科的数据来开展模型训练,很大的可能性依旧是合法的。

而且, 即便将AI公司告至法庭, 然而当下行业内对于AI侵权这一方面, 并未存有能明确界定的法律界限。这种具有大风险、高成本以及长久耗费时间特点的选择, 对于维基媒体来讲, 并不契合自身实际情况。

最重要的是,维基媒体所肩负的使命乃是, 得让地球上的每一个人, 都能够自由自在地获取全部的知识。

AI 爬虫所连带产生的服务器成本算是个问题, 借着法律的法子或者透过商业协议, 去强行约束别人接触资源的行为, 没准与他们原本的使命是冲突违反的呢。

按这样的情形来看, 维基媒体将数据整理妥当, 而后交给AI公司用于训练, 或许是最为合适的, 然而也是最为无奈的一种办法了吧。

相关推荐
带娃的IT创业者4 个月前
Valve 开源 Steam Controller:当硬件设计遇上开源精神,一场游戏外设的革命才刚刚开始
游戏·开源·开源硬件·cad·知识共享·valve·游戏外设
Rubin智造社4 个月前
智读致用|《一人企业》9:执行才是有效货币,知识共享也是商业竞争力
知识变现·知识共享·一人公司·一人企业·保罗贾维斯·执行力·内容创业
程序员王哪跑5 个月前
Python AI爬虫实战:爬取张雪峰微博并进行情感分析与词云可视化
python爬虫·ai爬虫
袁袁袁袁满8 个月前
OpenAI SDK集成亮数据网页解锁器实现自动化爬虫
爬虫·python·ai·网络爬虫·爬虫实战·自动化爬虫·ai爬虫
云雾J视界1 年前
开源革命下的研发突围:Meta Llama系列模型的知识整合实践与启示
meta·开源·llama·知识管理·知识整合·知识迭代·知识共享