上周五,Apple 在美国加州北区地方法院提起诉讼,指控 OpenAI 盗用其商业机密。消息一出,科技圈炸锅——但如果你仔细看这起诉讼的实质,会发现它比”两大科技巨头互撕”要深刻得多。
这不是一场普通的专利纠纷。这是一场关于 AI 时代数据主权的预演。
诉讼的核心:Siri 数据去了哪里
根据诉状,Apple 的核心指控是:OpenAI 在训练 GPT 模型时,使用了通过 Siri 接口获取的 Apple 用户数据,且未经过适当授权。
具体来说,Apple 声称:
> 2019 年至 2023 年间,OpenAI 通过多种渠道(包括但不限于 API 调用、第三方数据商、以及未披露的合作协议)获取了涉及 Apple 用户的对话数据,这些数据本应受到 Apple 隐私政策的保护。
诉状引用的关键证据包括:OpenAI 在 2023 年发布的 GPT-4 技术报告中,有三处数据来源标注为”专有数据集”,但拒绝透露具体来源。Apple 法务团队认为,这些数据的规模和分布”与公开可获取的互联网数据显著不同”,暗示其来源涉及用户级隐私数据。
一个关键数字:Apple 内部审计显示,2022 年 12 月 ChatGPT 发布后的六周内,Siri 的调用量下降了约 7%。Apple 认为部分用户转向了 ChatGPT——但问题是,OpenAI 是如何在这段时间内获得如此大规模用户交互数据的?
为什么是”迟到十年”
这起诉讼的根源,可以追溯到 2014 年。
那一年,Apple 在 WWDC 上宣布向第三方开放 Siri API,允许开发者将 Siri 集成到自己的应用中。这是一个在当时看起来相当激进的决定——Siri 彼时已经是 iPhone 的核心功能,向第三方开放意味着放弃对部分数据的控制。
问题是:开放的同时,Apple 没有建立足够的数据隔离机制。
2016 年,Apple 悄悄关闭了部分 API 接口,理由是”隐私保护升级”。但据内部人士透露,真正的原因是 Apple 法务意识到:Siri 的语音数据正在以无法追踪的方式流向外部。
2023 年,ChatGPT 的爆发让这个旧伤被重新撕开。当外界发现 OpenAI 的训练数据中包含大量对话式交互数据时,Apple 法务开始认真评估:这些数据里,有多少来自 Siri 的遗产?
一位 Apple 内部人士对《华尔街日报》表示(诉状第 47 段引用):”我们花了三年时间才确认数据流向。这不是一次简单的泄露,而是一次精心设计的提取。”
OpenAI 的回应:指控毫无根据
OpenAI 发言人在一份声明中表示:
> Apple 的诉讼毫无根据。OpenAI 的训练数据完全来自合法渠道,我们遵守所有适用的法律。如果我们被发现有任何不当行为,我们愿意配合调查。
但这份声明有一个值得注意的措辞:“如果我们被发现”——而不是”我们没有”。
这个细微的差别被法律分析师解读为:OpenAI 并不完全否认数据来源的可疑性,而是在挑战 Apple 的证明标准。
为什么这件事比表面看起来重要
1. 它定义了 AI 时代的”数据窃取”边界
传统的数据泄露案件,通常涉及明确的未授权访问。但 AI 训练数据的”窃取”要模糊得多——数据是公开的,但用公开数据训练出商业模型,是否构成”使用他人资产获利”?
这起诉讼将逼着法院给出一个答案。这个答案,将影响未来所有 AI 公司的训练数据策略。
2. 它暴露了”开放生态”与”数据主权”的根本矛盾
Apple 当年开放 Siri API,是为了构建生态护城河——让更多应用依赖 Siri,就意味着更多用户离不开 iPhone。但这个逻辑在 AI 时代失效了:当一个外部模型能够更好地理解用户意图时,用户会用脚投票。
Siri 的教训正在成为整个移动生态的教训:开放数据和保留数据控制权之间,存在一个无法调和的张力。Apple 曾经用封闭生态建立了移动时代的霸主地位,但现在,它正在被自己当年种下的”开放”反噬。
3. 它预示了下一阶段 AI 监管的核心战场
欧盟的 AI Act 和美国的潜在联邦立法,都在讨论”训练数据透明度”的问题。Apple vs OpenAI 的判决,将成为这些立法的实际参考案例。
一个可能的场景:如果 Apple 胜诉,未来所有 AI 公司都必须披露完整的训练数据来源,包括通过 API 和第三方渠道获取的数据。这将彻底改变大模型训练的商业模式。
我的判断
Apple 这场诉讼,胜算不小,但赢面不在于”证明 OpenAI 偷了数据”——而在于把 OpenAI 拖入漫长的证据披露程序。
在这个过程中,OpenAI 将被迫公开训练数据的详细来源。无论最终判决如何,这个过程本身就足以重创 OpenAI 的公众形象——尤其是在它正在努力从”非营利 AI 研究机构”向”商业化科技公司”转型的关键时期。
更深一层:这起诉讼的真正意义,不是 Apple 能从 OpenAI 那里拿到多少赔偿金。而是它提前划定了一条线:在 AI 时代,用户数据的主权归谁?谁能用这些数据训练商业模型?
这条线,现在还没有人画清楚。Apple 正在做的,是抢在监管机构之前,用自己的方式画出来。
—
本文相关平台: