产品中心
锦州橡塑胶 训练数据不够用,AI大厂开始下「毒手」
发布日期:2026-09-02 07:40:53 点击次数:54
万能胶生产厂家

  近,则消息在科技圈炸锅。

  为OpenAI、Anthropic等头部AI实验室提供数据服务的数据工厂Mercor,正大规模寻找倒闭或被收购的初创企业,以达30万美元的报价收购其内部数据集。

  不仅包括代码库,涵盖Slack聊天记录、Google Drive文档、电子邮件、Zoom会议录音等日常办公痕迹。

  据数据公司Protege披露,今年以来其处理的数据交易总额已达至少1亿美元,而去年同期仅约3000万美元。

  这又是门因为AI而生的生意。

  不过,这门生意背后,有令人发凉的地。

  数据,不AI AI的进化,本质上是“吃”数据的过程。

  大语言模型的能力上限,在很大程度上取决于训练数据的质量、规模和多样。

  过去几年,AI产业享受了场数据盛宴,互联网上公开可用的网页、书籍、论文、代码、百科、论坛帖子,几乎被各大实验室刮了个遍。

  但盛宴终有散场之时。

  数据公司Protege CEO鲍比·塞缪尔斯语道破:“AI实验室已经基本刮完了整个互联网,现在需要的是人与人之间的真实互动。”

  当AI从聊天机器人向数字员工演进时,对数据的需求发生了质变。

  它不能只知道答案是什么,需要知道人类到底是怎么完成工作的。

  份终代码库像道题的答案,能告诉模型产品后怎样运行,却未能解释问题初从哪里冒出来、工程师为什么先排除种可能、又为什么在测试失败后换了条路。

  而工单、聊天记录、会议转录和次次代码修改,留下的正是这段中间过程,问题如何被发现、讨论、验证、修复的完整链路。

  从技术角度看,这对应着训练数据从Type 2(人工设计任务)向Type 1(真实业务捕获)的范式转移。

  代码域已验证这点。

  大模型代码能力进步快,重要原因之是GitHub是全球*的Type 1数据宝库,条commit记录串起问题描述、修改案、代码评审和测试结果,完整保留问题从出现到解决的全链路。

  其他域缺的不是需求,而是像GitHub这样现成的数据源。

  这也就解释了个逻辑闭环,AI要变得智能,就须不断训练,而多、入的训练又需要多数据,结果当公开资料被消耗殆尽,AI就须向层、私密的数据伸手。

  如果没有入的资料,AI就会面临巧妇难为米之炊的窘境,模型能力的天花板,也将被公开数据的天花板死死锁住,那还如何进化呢?

  冲突爆发锦州橡塑胶

  当AI伸手索取这些层数据时,问题随之而来。

  Slack聊天记录里可能有客户信息,邮件里可能有员工姓名,会议里可能出现商业机密,医疗企业数据甚至涉及患者隐私。

  AI实验室的刚需,与个人隐私权、企业商业秘密、劳动权益保护之间,形成了正面冲突。

  这种冲突体现在多个维度,核心的是隐私问题。

  尽管Mercor等公司声称能识别并遮蔽60多类敏感标识符,但业内坦言保护隐私几乎不可能。

  的矛盾在于,工作记录有价值的部分,往往不是句话本身,而是谁在什么阶段说出,随后触发了什么动作。

  姓名可替换,但岗位、时间、项目、客户关系和跨系统关联很难都删干净,数据清洗过度就会失去价值,保留这些关系又会带来重新识别和敏感信息泄露的风险。

  其次是知情同意问题。

  即使员工入职时签过知识产权协议,也不代表公司有权私自售内部聊天和工作记录,员工从未明确同意自己的工作对话被包出售给AI公司用于训练。

  还有商业机密、客户隐私风险、法偏见等问题。

  比如,真实工作数据,包含人类决策中的偏见和错误模式,当这些数据被用于训练AI智能体时,偏见会被规模化复制和放大。

  法律监管也是个棘手的问题。

  全球范围内,对于企业内部工作数据能否被三收购用于AI训练这问题,到现在都没有清晰的法律框架。

  些人会认为这是好事,pvc管道管件胶因为监管宽松,可以动AI能力快速发展,并可以产生些新的业务和工作岗位,但它也开了隐私泄露、伦理失范和法律真空的潘多拉魔盒。

  当然了,监管是肯定要跟上的,不可能让AI继续裸奔,现在各正在探索的解决路径包括:

  法律层面尽快明确数据权属边界和“知情同意”标准;

  技术层面发展联邦学习、差分隐私、成数据等隐私保护技术;

  行业层面建立数据溯源和自律标准;

  企业层面在出售数据前充分告知员工并征得同意。

  但可以预见的事,这场冲突的解决会是个相当漫长的过程,各的利益博弈是不会消失的。

  巨头的原罪

  其实,在讨论Mercor收购倒闭公司数据是否侵犯隐私之前,些巨头的原罪也被再次拿出来讨论。

  就拿谷歌和Meta来说,这两全球*的互联网平台,本身就沉淀了海量个人数据,包括数十亿用户的搜索记录、Gmail邮件、Google Docs文档、YouTube、Facebook帖子、Instagram照片、WhatsApp消息。

  这些数据难道没有被用于AI训练吗?

  真相是直在用。

  《纽约时报》就报道过,2023年7月4日美国立日假期期间,谷歌发布了新后的隐私政策,并且特意选择假期以分散公众注意力。

  新政策明确写道:“我们使用公开可用的信息来帮助训练谷歌的AI模型。”

  2023年,Meta也新了隐私政策,明确声明用户在Facebook、Instagram上的公开帖子、照片、评论和Reels,都将被用于训练其AI模型。

  2024年6月,Meta曾宣布暂停使用欧盟用户数据训练大语言模型,原因是尔兰数据保护委员会提出了数据保护面的担忧。

  但仅仅年后,Meta又宣布恢复这计划。

  2026年2月,Meta正式确认将使用欧盟用户的公开数据训练AI模型,仅给予用户“反对”(opt-out)的权利,而非“同意”(opt-in)。

  2026年6月,谷歌又悄悄新了搜索隐私设置,自动将所有用户纳入其扩展的AI训练计划。

  这些事实都说明,AI训练对个人隐私的侵犯,并不是从Mercor收购倒闭公司数据才开始的,从谷歌、Meta等巨头悄悄修改服务条款的那刻起,就已经在发生了。

  区别只是,巨头们用的是法手段,而Mercor做的是灰交易,法律边界加模糊罢了。

  尾声

  Mercor的这门生意,撕开的恰恰是AI进化史中荒诞的页——我们面惊叹于大模型的“智能”,面又不得不承认,这种智能的底座,是数工人辈子在工作生活中留下的、那些从未被好好安放的“数字遗产”。

  事已至此,再去苛责Mercor的灰交易,多少有些“解决提出问题的人”的意思。

  谷歌、Meta的隐私政策静默新,已经用行动表明了态度——哪怕没有Mercor,AI对层数据的渴求也不会止步。

  区别只在于,巨头们走的是堂而皇之的阳关道,Mercor们探的是若明若暗的木桥。

  这场冲突没有简单的善恶之分,只有不可避的角力。

  可以预见,未来的AI监管会为此划出新的红线,数据脱敏技术会走向成熟的形态,甚至“数字遗产”的概念也会被重新定义。

  但在那之前,我们或许只能接受这样个尴尬的现实,AI的每次进化,都在拿人类的数字隐私做燃料。

  而这场“自己照亮AI”的赛跑,远未看到终点。 相关词条:铁皮保温    塑料挤出机     钢绞线    玻璃卷毡厂家    保温护角专用胶

奥力斯    万能胶厂家    联系人:王经理    手机:18231788377(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。

友情链接: