训练数据不够用,AI大厂开始下“毒手”
创始人
2026-08-18 18:33:00

本文作者 | 哥吉拉

数据支持 | 勾股大数据(www.gogudata.com)

最近,一则消息在科技圈炸锅

OpenAIAnthropic等头部AI实验室提供数据服务的数据工厂Mercor,正大规模寻找倒闭或被收购的初创企业,以高达30万美元的报价收购其内部数据集

不仅包括代码库,更涵盖Slack聊天记录、Google Drive文档、电子邮件、Zoom会议录音等日常办公痕迹。

据数据公司Protege披露,今年以来其处理的数据交易总额已达至少1亿美元,而去年同期仅约3000万美元。

这又是一门因为AI而生的生意。

不过,这门生意背后有令人发凉的地方。

01无数据,不AI

AI的进化,本质上是“数据的过程。

大语言模型的能力上限,在很大程度上取决于训练数据的质量、规模和多样性。

过去几年,AI产业享受了一场据盛宴互联网上公开可用的网页、书籍、论文、代码、百科、论坛帖子,几乎被各大实验室刮了个遍。

但盛宴终有散场之时。

数据公司Protege CEO鲍比·塞缪尔斯一语道破:AI实验室已经基本刮完了整个互联网,现在需要的是人与人之间的真实互动。

AI从聊天机器人向数字员工演进时,对数据的需求发生了质变。

它不能只知道答案是什么,更需要知道人类到底是怎么完成工作的。

一份最终代码库像一道题的答案,能告诉模型产品最后怎样运行,却未必能解释问题最初从哪里冒出来、工程师为什么先排除一种可能、又为什么在测试失败后换了一条路。

而工单、聊天记录、会议转录和一次次代码修改,留下的正是这段中间过程问题如何被发现、讨论、验证、修复的完整链路。

从技术角度看,这对应着训练数据从Type 2(人工设计任务)向Type 1(真实业务捕获)的范式转移。

代码领域已验证这一点

大模型代码能力进步最快,重要原因之一是GitHub是全球最大的Type 1数据宝库,一条commit记录串起问题描述、修改方案、代码评审和测试结果,完整保留问题从出现到解决的全链路。

其他领域缺的不是需求,而是像GitHub这样现成的数据源。

这也就解释了一个逻辑闭环,AI要变得更智能,就必须不断训练更多、更深入的训练又需要更多数据结果当公开资料被消耗殆尽,AI就必须向更深层、更私密的数据伸手。

如果没有更深入的资料,AI就会面临巧妇难为无米之炊的窘境模型能力的天花板,将被公开数据的天花板死死锁住那还如何进化呢?

02冲突爆发

AI伸手索取这些深层数据时,问题随之而来。

Slack聊天记录里可能有客户信息,邮件里可能有员工姓名,会议里可能出现商业机密,医疗企业数据甚至涉及患者隐私。

AI实验室的刚需,与个人隐私权、企业商业秘密、劳动权益保护之间,形成了正面冲突。

这种冲突体现在多个维度最核心的是隐私问题

尽管Mercor等公司声称能识别并遮蔽60多类敏感标识符,但业内坦言彻底保护隐私几乎不可能。

更深矛盾在于工作记录最有价值的部分,往往不是一句话本身,而是谁在什么阶段说出,随后触发了什么动作。

姓名可替换,但岗位、时间、项目、客户关系和跨系统关联很难都删干净数据清洗过度就会失去价值,保留这些关系又会带来重新识别和敏感信息泄露的风险。

其次是知情同意问题。

即使员工入职时签过知识产权协议,也不代表公司有权私自售卖内部聊天和工作记录员工从未明确同意自己的工作对话被打包出售给AI公司用于训练。

还有商业机密客户隐私风险算法偏见问题

比如,真实工作数据天然包含人类决策中的偏见和错误模式,当这些数据被用于训练AI智能体时,偏见会被规模化复制和放大。

法律监管也是一个棘手的问题。

全球范围内对于企业内部工作数据能否被第三方收购用于AI训练这一问题,到现在都没有清晰的法律框架。

一些人会认为这是好事,因为监管宽松,可以推动AI能力快速发展并可以产生一些新的业务和工作岗位,但打开了隐私泄露、伦理失范和法律真空的潘多拉魔盒。

当然了,监管是肯定要跟上的,不可能让AI继续裸奔,现在各方正在探索的解决路径包括:

法律层面尽快明确数据权属边界和“知情同意标准;

技术层面发展联邦学习、差分隐私、合成数据等隐私保护技术;

行业层面建立数据溯源和自律标准;

企业层面在出售数据前充分告知员工并征得同意。

但可以预见的事,这场冲突的解决是一个相当漫长过程各方的利益博弈是不会消失的。

03巨头的原罪

其实,在讨论Mercor收购倒闭公司数据是否侵犯隐私之前,一些巨头的原罪也被再次拿出来讨论。

就拿谷歌和Meta来说,这两家全球最大的互联网平台,本身就沉淀了海量个人数据包括数十亿用户的搜索记录、Gmail邮件、Google Docs文档、YouTube视频、Facebook帖子、Instagram照片、WhatsApp消息。

这些数据难道没有被用于AI训练吗?

真相是一直在用。

《纽约时报》就报道过,202374日美国独立日假期期间,谷歌发布了更新后的隐私政策,并且特意选择假期以分散公众注意力。

新政策明确写道:“我们使用公开可用的信息来帮助训练谷歌的AI模型。”

2023年,Meta更新了隐私政策,明确声明用户在FacebookInstagram上的公开帖子、照片、评论和Reels,都将被用于训练其AI模型。

20246月,Meta曾宣布暂停使用欧盟用户数据训练大语言模型,原因是爱尔兰数据保护委员会提出了数据保护方面的担忧。

但仅仅一年后,Meta又宣布恢复这一计划。

20262月,Meta正式确认将使用欧盟用户的公开数据训练AI模型,仅给予用户“反对”opt-out)的权利,而非“同意”opt-in)。

20266月,谷歌又悄悄更新了搜索隐私设置,自动将所有用户纳入其扩展的AI训练计划。

这些事实都说明,AI训练对个人隐私的侵犯,并不是从Mercor收购倒闭公司数据才开始的从谷歌、Meta等巨头悄悄修改服务条款的那一刻起,就已经在发生了。

区别只是,巨头们用的是合法手段Mercor做的是灰色交易法律边界更加模糊罢了

04尾声

Mercor的这门生意,撕开的恰恰是AI进化史中最荒诞的一页——我们一面惊叹于大模型的“智能”,一面又不得不承认,这种智能的底座,是无数打工人一辈子在工作生活中留下的、那些从未被好好安放的“数字遗产”。

事已至此,再去苛责Mercor的灰色交易,多少有些“解决提出问题的人”的意思。

谷歌、Meta的隐私政策静默更新,已经用行动表明了态度——哪怕没有Mercor,AI对深层数据的渴求也绝不会止步。

区别只在于,巨头们走的是堂而皇之的阳关道,Mercor们探的是若明若暗的独木桥。

这场冲突没有简单的善恶之分,只有不可避免的角力。

可以预见,未来的AI监管会为此划出新的红线,数据脱敏技术会走向更成熟的形态,甚至“数字遗产”的概念也会被重新定义。

但在那之前,我们或许只能接受这样一个尴尬的现实,AI的每一次进化,都在拿人类的数字隐私做燃料。

⚠️
本网站信息内容及素材来源于网络采集或用户发布,如涉及侵权,请及时联系我们,发送链接至2697952338@QQ.COM,我们将第一时间进行核实与删除处理。

相关内容

热门资讯

湖南金证投顾1980元可靠吗?...   湖南金证投顾1980元可靠吗?屡屡亏损不靠谱,退费流程公开,教你一招挽回!  核心疑问速答:湖南...
讲述:湖南金证投顾顾问收费推荐... 讲述:湖南金证投顾顾问收费推荐股票虚假宣传欺诈客户消费导致亏损!服务费可以退!投资有风险,投资需谨慎...
被骗』巨丰投顾退款多久到账?投...   被骗』巨丰投顾退款多久到账?投顾服务费真的靠谱吗?不靠谱、不正规!违规收费!态度恶劣!已退费  ...
巨丰投顾交了服务费可以退吗?误... 巨丰投顾交了服务费可以退吗?误导性宣传!交费被忽悠,想跟着赚结果却是亏!投顾被騗真相曝光!难友声泪俱...
震惊』钱坤投资靠谱吗?背后圈套...   震惊』钱坤投资靠谱吗?背后圈套细思极恐!股友愤怒不已!已退费!  核心结论先行:四川钱坤证券高额...
讲述: 容维证券公司怎么样?... 讲述: 容维证券公司怎么样? 行业黑幕被揭开!服务费能挽回!  容维证券服务费是可以通过合法途径依...
震惊! 钱坤投资怎么样?误导... 震惊! 钱坤投资怎么样?误导费!投顾服务不尽如人意?依法依规,争取合理退款投资有风险,投资需谨慎!...
必看』黑龙江容维证券服务不靠谱... 必看』黑龙江容维证券服务不靠谱,可以退费!有法可依!误导性宣传欺诱导股民,误导交费已退款  黑龙江容...
警惕:容 维证券 骗了多少... 警惕:容 维证券 骗了多少人?不可信,荐股黑幕曝光,真相令人防不胜防,已退款投资有风险,投资需谨...
神光投顾荐股赚钱吗?误导性宣传... 神光投顾荐股赚钱吗?误导性宣传!交费前后完全不一样!投顾服务费被骗真相曝光!全是套路!已退费!投资有...
要闻!山 东 神光缴费亏损...   要闻!山 东 神光缴费亏损是被骗了吗?被误导交费后亏损皆可退费!退款流程公布及注意事项如下 ...
北京天相财富1980元可靠吗?...  北京天相财富1980元可靠吗?屡屡亏损不靠谱,退费流程公开,教你一招挽回! 北京天相财富公司...
警惕: 北京天相财富怎么样?... 警惕: 北京天相财富怎么样?交的服务费可以退吗?认清真相!荐股背后的垃圾股陷阱,已退费处理。投资有...
浙江同花顺夸大荐股实力!天天发...   浙江同花顺夸大荐股实力!天天发大涨截图!结果交费买进去就完全不一样!退费流程我来告诉你!一分钟就...
震撼!浙江同花顺服务费可以要回... 震撼!浙江同花顺服务费可以要回吗?荐股服务宣传与实际差距大,成功退款经历分享真相!投资有风险,投资需...
震撼!云 南约牛怎么退款?投...  震撼!云 南约牛怎么退款?投顾服务承诺全是谎言!保留聊天记录教你快速拿回钱! 云南约牛软件...
当心! 云南约牛证券服务不靠谱... 当心! 云南约牛证券服务不靠谱,可以退费!有法可依!误导性宣传欺诱导股民,误导交费已退款投资有风险,...
必看』指南针退款成功,投顾骗术...   必看』指南针退款成功,投顾骗术揭秘!,已退费!  指南针股票准不准别再交“智商税”了!投顾公司推...
训练数据不够用,AI大厂开始下... 本文作者 | 哥吉拉 数据支持 | 勾股大数据(www.gogudata.com) 最近,一则消息在...
百度库库AI加速突围:AI办公... “当Agent有能力承接一整条办公任务链,究竟是解放职场人的生产力,还是会带来新的成本与风险难题? ...
高 能智投怎么样?办理会员反亏... 高 能智投怎么样?办理会员反亏钱!交费荐股套路防不胜防!有法可依!成功退费流程公布!  投资有风险,...
港澳资讯选股怎么样?误导性宣传... 港澳资讯选股怎么样?误导性宣传忽悠缴费股友经历教你挽回服务费!  港澳资讯老师不可信!加入内部会员没...
顶点财经交的服务费能退?缴费后... 顶点财经交的服务费能退?缴费后跟上服务依然亏钱,满足条件即可退款!  顶点财经不可信,推荐的股票不靠...
汇阳投顾服务费可以追回吗?营销... 汇阳投顾服务费可以追回吗?营销夸大收益诱导缴费,可实操退费方法分享!  近年来,随着股市行情波动加剧...
财富在线服务费怎么退?背后真相... 财富在线服务费怎么退?背后真相曝光,交费操作亏多赚少!荐股交费后没效果教你退费有法可依! 可以退,告...