训练数据不够用,AI大厂开始下“毒手”

发布时间:

2026-08-18 18:30:08

来源:格隆汇

本文作者 | 哥吉拉

数据支持 | 勾股大数据(www.gogudata.com)

训练数据不够用,AI大厂开始下“毒手”

最近,一则消息在科技圈炸锅

OpenAIAnthropic等头部AI实验室提供数据服务的数据工厂Mercor正大规模寻找倒闭或被收购的初创企业,以高达30万美元的报价收购其内部数据集

不仅包括代码库,更涵盖Slack聊天记录、Google Drive文档、电子邮件、Zoom会议录音等日常办公痕迹。

据数据公司Protege披露,今年以来其处理的数据交易总额已达至少1亿美元,而去年同期仅约3000万美元。

这又是一门因为AI而生的生意。

不过,这门生意背后有令人发凉的地方。


01

无数据,不AI


AI的进化,本质上是“数据的过程。

大语言模型的能力上限,在很大程度上取决于训练数据的质量、规模和多样性。

过去几年,AI产业享受了一场据盛宴互联网上公开可用的网页、书籍、论文、代码、百科、论坛帖子,几乎被各大实验室刮了个遍。

但盛宴终有散场之时。

数据公司Protege CEO鲍比·塞缪尔斯一语道破:AI实验室已经基本刮完了整个互联网,现在需要的是人与人之间的真实互动。

AI从聊天机器人向数字员工演进时,对数据的需求发生了质变。

它不能只知道答案是什么,更需要知道人类到底是怎么完成工作的。

一份最终代码库像一道题的答案,能告诉模型产品最后怎样运行,却未必能解释问题最初从哪里冒出来、工程师为什么先排除一种可能、又为什么在测试失败后换了一条路。

而工单、聊天记录、会议转录和一次次代码修改,留下的正是这段中间过程问题如何被发现、讨论、验证、修复的完整链路。

从技术角度看,这对应着训练数据从Type 2(人工设计任务)向Type 1(真实业务捕获)的范式转移。

代码领域已验证这一点

大模型代码能力进步最快,重要原因之一是GitHub是全球最大的Type 1数据宝库,一条commit记录串起问题描述、修改方案、代码评审和测试结果,完整保留问题从出现到解决的全链路。

其他领域缺的不是需求,而是像GitHub这样现成的数据源。

这也就解释了一个逻辑闭环,AI要变得更智能,就必须不断训练更多、更深入的训练又需要更多数据结果当公开资料被消耗殆尽,AI就必须向更深层、更私密的数据伸手。

如果没有更深入的资料,AI就会面临巧妇难为无米之炊的窘境模型能力的天花板,将被公开数据的天花板死死锁住那还如何进化呢?


02

冲突爆发


AI伸手索取这些深层数据时,问题随之而来。

Slack聊天记录里可能有客户信息,邮件里可能有员工姓名,会议里可能出现商业机密,医疗企业数据甚至涉及患者隐私。

AI实验室的刚需,与个人隐私权、企业商业秘密、劳动权益保护之间,形成了正面冲突。

这种冲突体现在多个维度最核心的是隐私问题

尽管Mercor等公司声称能识别并遮蔽60多类敏感标识符,但业内坦言彻底保护隐私几乎不可能。

更深矛盾在于工作记录最有价值的部分,往往不是一句话本身,而是谁在什么阶段说出,随后触发了什么动作。

姓名可替换,但岗位、时间、项目、客户关系和跨系统关联很难都删干净数据清洗过度就会失去价值,保留这些关系又会带来重新识别和敏感信息泄露的风险。

其次是知情同意问题。

即使员工入职时签过知识产权协议,也不代表公司有权私自售卖内部聊天和工作记录员工从未明确同意自己的工作对话被打包出售给AI公司用于训练。

还有商业机密客户隐私风险算法偏见问题

比如,真实工作数据天然包含人类决策中的偏见和错误模式,当这些数据被用于训练AI智能体时,偏见会被规模化复制和放大。

法律监管也是一个棘手的问题。

全球范围内对于企业内部工作数据能否被第三方收购用于AI训练这一问题,到现在都没有清晰的法律框架。

一些人会认为这是好事,因为监管宽松,可以推动AI能力快速发展并可以产生一些新的业务和工作岗位,但打开了隐私泄露、伦理失范和法律真空的潘多拉魔盒。

当然了,监管是肯定要跟上的,不可能让AI继续裸奔,现在各方正在探索的解决路径包括:

法律层面尽快明确数据权属边界和“知情同意标准;

技术层面发展联邦学习、差分隐私、合成数据等隐私保护技术;

行业层面建立数据溯源和自律标准;

企业层面在出售数据前充分告知员工并征得同意。

但可以预见的事,这场冲突的解决是一个相当漫长过程各方的利益博弈是不会消失的。


03

巨头的原罪


其实,在讨论Mercor收购倒闭公司数据是否侵犯隐私之前,一些巨头的原罪也被再次拿出来讨论。

就拿谷歌Meta来说,这两家全球最大的互联网平台,本身就沉淀了海量个人数据包括数十亿用户的搜索记录、Gmail邮件、Google Docs文档、YouTube视频、Facebook帖子、Instagram照片、WhatsApp消息。

这些数据难道没有被用于AI训练吗?

真相是一直在用。

《纽约时报》就报道过,202374美国独立日假期期间,谷歌发布了更新后的隐私政策,并且特意选择假期以分散公众注意力。

新政策明确写道:“我们使用公开可用的信息来帮助训练谷歌的AI模型。”

2023年,Meta更新了隐私政策,明确声明用户在FacebookInstagram上的公开帖子、照片、评论和Reels,都将被用于训练其AI模型。

20246月,Meta曾宣布暂停使用欧盟用户数据训练大语言模型,原因是爱尔兰数据保护委员会提出了数据保护方面的担忧。

但仅仅一年后,Meta又宣布恢复这一计划。

20262月,Meta正式确认将使用欧盟用户的公开数据训练AI模型,仅给予用户“反对”opt-out)的权利,而非“同意”opt-in)。

20266月,谷歌又悄悄更新了搜索隐私设置,自动将所有用户纳入其扩展的AI训练计划。

这些事实都说明,AI训练对个人隐私的侵犯,并不是从Mercor收购倒闭公司数据才开始的从谷歌、Meta等巨头悄悄修改服务条款的那一刻起,就已经在发生了。

区别只是,巨头们用的是合法手段Mercor做的是灰色交易法律边界更加模糊罢了


04

尾声


Mercor的这门生意,撕开的恰恰是AI进化史中最荒诞的一页——我们一面惊叹于大模型的“智能”,一面又不得不承认,这种智能的底座,是无数打工人一辈子在工作生活中留下的、那些从未被好好安放的“数字遗产”。

事已至此,再去苛责Mercor的灰色交易,多少有些“解决提出问题的人”的意思。

谷歌、Meta的隐私政策静默更新,已经用行动表明了态度——哪怕没有Mercor,AI对深层数据的渴求也绝不会止步。

区别只在于,巨头们走的是堂而皇之的阳关道,Mercor们探的是若明若暗的独木桥。

这场冲突没有简单的善恶之分,只有不可避免的角力。

可以预见,未来的AI监管会为此划出新的红线,数据脱敏技术会走向更成熟的形态,甚至“数字遗产”的概念也会被重新定义。

但在那之前,我们或许只能接受这样一个尴尬的现实,AI的每一次进化,都在拿人类的数字隐私做燃料。

而这场“烧自己照亮AI”的赛跑,远未看到终点。(全文完)

免责声明:所有平台仅提供服务对接功能,资讯信息、数据资料来源于第三方,其中发布的文章、视频、数据仅代表内容发布者个人的观点,并不代表泡财经平台的观点,不构成任何投资建议,仅供参考,用户需独立做出投资决策,自行承担因信赖或使用第三方信息而导致的任何损失。投资有风险,入市需谨慎。

古东管家

请先登录后发表评论

0条评论