David Friedberg 称大模型会窃取用户原创见解
大卫·弗里德伯格:前沿模型正在将你原创的洞见作为“去标识化数据”进行训练。
@杰森:“企业会不会担心自己的专有知识被模型抄袭,用到核心大语言模型里,因此不敢信任任何大语言模型?”
@弗里德伯格:“我有过这样的经历:我们问了一些相当新颖的科学问题,(AI模型)识别出这是一个原创洞见。它就会说,“哦,从没这么想过,很有意思,等等等等。”过了一阵,我用另一个账号问下个版本(的模型),我现在确实遇到过这种情况:它直接说,“哦,你可以这么做”,然后它实际上准确描述了我们在上一版本对话里聊的那个东西。
这只是少数几次个人经历,但我清楚我们工作所在的领域,知道这个领域的细分方向,也知道这些想法的原创性,目前还没有相关论文发表。因此我确定,并没有什么新的信息语料库来训练这个新模型。所以我只能得出结论:我的对话或者我们的分析被用来训练了。”
@大卫·萨克斯:“好,这确实引出了一个很好的问题。允许模型用不可识别的数据训练到底意味着什么?”
弗里德伯格:“嗯,这正是我想表达的。模型不会用到我的任何个人信息,但它可以使用我们对话中得出的洞见,然后它可以把这个说成是无关的训练数据。但事实是,这实际上是我们机构知识产权的一部分,来自我方来回的交流探讨。我们作为用户,和作为服务提供商的模型方之间,没有任何NDA(保密协议)、保密条款或者保护措施。
这就是为什么我非常看重开源,因为我不希望他们拿到我的对话日志,因为他们可以用这些数据训练,获得知识产权优势,然后扩散到整个市场。”
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖