数亿美元!传英伟达已收购合成数据公司Gretel
创始人
2025-03-20 06:46:24
0

智东西(公众号:zhidxcom)

作者 | ZeR0

编辑 | 漠影

智东西3月20日消息,据《连线》报道,两位了解该交易的人士透露,英伟达已以九位数收购了合成数据公司Gretel。

消息人士称,此次收购价格超过了Gretel最新的3.2亿美元(约合人民币23亿元)估值,不过具体的收购条款尚不清楚。Gretel及其约80名员工的团队将被并入英伟达,其技术将作为英伟达生成式AI服务套件的一部分。

此次收购正值英伟达推出合成数据生成工具之际,开发人员可以训练自己的AI模型并针对特定应用进行微调。理论上,合成数据可以创造近乎无限的AI训练数据供应,并帮助解决自2022年ChatGPT成为主流以来一直困扰AI行业的数据稀缺问题。尽管专家表示,在生成式AI中使用合成数据有其自身的风险。

英伟达、Gretel发言人拒绝发表评论。

一、交易将补强英伟达合成数据布局

Gretel成立于2019年,创始人包括Alex Watson、John Myers、Ali Golshan,Golshan担任首席执行官。这家初创公司为想要构建生成式AI模型但无法获得足够训练数据或对使用真实数据存在隐私担忧的开发人员提供合成数据平台和一套API。

Gretel不会构建和授权自己的前沿AI模型,而是对现有的开源模型进行微调以添加差异隐私和安全功能,然后将它们打包在一起出售。Pitchbook显示,该公司在被收购前筹集了超过6700万美元的风险投资资金。

与人类生成的数据或现实世界数据不同,合成数据是由计算机生成的,旨在模仿现实世界的数据。支持者认为,这使得构建AI模型所需的数据生成更具可扩展性、劳动强度更低,并且更易于规模较小或资源较少的AI开发人员使用。

隐私保护是合成数据的另一个关键卖点,使其成为医疗健康提供商、银行和政府机构的有吸引力的选择。

多年来,英伟达一直在为开发人员提供合成数据工具。2022年,该公司推出了Omniverse Replicator,让开发人员能够生成自定义的、物理上准确的合成3D数据来训练神经网络。

去年6月,英伟达开始推出一系列开放式AI模型,这些模型可生成合成训练数据,供开发人员用于构建或微调大语言模型。这些迷你模型被称为Nemotron-4 340B,开发人员可以使用它们为自己的大语言模型收集合成数据,涉及“医疗保健、金融、制造、零售和其他所有行业”。

二、合成数据能补充数据集,增强隐私保护

在昨日主题演讲中,英伟达创始人兼CEO黄仁勋谈到行业在以经济高效的方式快速扩展AI方面所面临的挑战。

“我们重点关注三个问题,”他说。“第一,如何解决数据问题?如何以及在哪里创建训练AI所需的数据?第二,模型架构是什么?第三,Scaling Laws是什么?”黄仁勋继续描述了该公司目前如何在其机器人平台上使用合成数据生成。

瑞士洛桑联邦理工学院研究合成数据隐私的博士后研究员Ana-Maria Cretu说,合成数据至少能以几种不同的方式使用。它可以采用表格数据的形式,例如人口统计或医疗数据,这可以解决数据稀缺问题或创建更多样化的数据集。

Cretu举了一个例子:如果一家医院想要建立一个AI模型来追踪某种类型的癌症,但正在处理的数据集只有1000名患者,那么可以使用合成数据来填充数据集,消除偏见,并匿名化真实人类的数据。

“这还可以提供一些隐私保护,因为您不能向利益相关者或软件合作伙伴披露真实数据。”Cretu说。

但Cretu补充说,在大语言模型领域,合成数据也已成为“我们如何才能随着时间的推移增加大语言模型的数据量?”的一个无所不包的阶段。

三、重复训练可能导致质量显著下降

专家们担心,在不久的将来,AI公司将无法像以前一样自由地获取人类创造的互联网数据来训练他们的AI模型。去年,麻省理工学院数据来源计划的一份报告显示,对开放网络内容的限制正在增加。

理论上,合成数据可以提供一个简单的解决方案。但2024年7月《自然》杂志上的一篇文章强调,当AI语言模型用其他模型生成的数据反复微调时,它们可能会“崩溃”,即质量显著下降。

换句话说,如果你只给机器喂它自己生成的输出,理论上它就会开始自食其力,结果吐出残渣。

AI数据标注公司Scale AI的首席执行官Alexandr Wang分享了《自然》杂志关于X的文章中的发现,他写道:“虽然当今许多研究人员将合成数据视为AI的哲学之石,但天下没有免费的午餐。” 他在后来的发帖中称,这就是他坚信混合数据方法的原因。

Gretel的一位联合创始人反驳了《自然》杂志的这篇论文,他在一篇博客文章中指出,对纯合成数据进行重复训练的“极端场景”并不代表“现实世界的AI开发实践”。

认知科学家兼研究员加里·马库斯(Gary Marcus)大声批评AI炒作,他当时同意Alexandr Wang的“诊断,但不同意他的处方”。他认为,通过开发新的AI模型架构,而不是专注于数据集的特性,该行业将向前发展。

在给《连线》杂志的一封电子邮件中,马库斯谈道,“像(OpenAI的)o1/o3这样的系统似乎在编码和数学等领域表现更好,因为在这些领域,你可以生成和验证大量合成数据。在开放式领域的通用推理方面,它们效率较低。”

Cretu认为,围绕模型崩溃的科学理论是合理的。但她指出,大多数研究人员和计算机科学家都在使用合成数据和真实数据进行训练。“通过在每一轮新训练中使用新数据,你或许能够避免模型崩溃。”她说。

结语:大模型龙头和科技巨头已积极转向合成数据

对模型崩溃的担忧,并没有阻止AI行业加入合成数据潮流,即便他们这样做时非常谨慎。

据报道,在最近的摩根士丹利技术会议上,OpenAI联合创始人兼首席执行官Sam Altman吹捧OpenAI使用现有AI模型创建更多数据的能力。

Anthropic首席执行官Dario Amodei相信可能可以构建“一个无限的数据生成引擎”,通过在训练过程中注入少量新信息来保持其质量。

大型科技公司也开始转向合成数据。

Meta谈到了如何使用合成数据训练其最先进的大语言模型Llama 3,其中一些合成数据来自Meta的上一个模型Llama 2。

亚马逊云科技的Amazon Bedrock平台允许开发人员使用Anthropic Claude来生成合成数据。

微软Phi-3小型语言模型部分是在合成数据上进行训练的,该公司警告称,“预训练过的大语言模型生成的合成数据有时会降低准确性并增加下游任务的偏差。”

谷歌DeepMind也一直在使用合成数据,但这再次凸显了开发用于生成和维护真正私密的合成数据的管道的复杂性。

“我们知道所有大型科技公司都在研究合成数据的某些方面,”音乐授权初创公司Rightsify的创始人Alex Bestall说,该公司还负责生成AI音乐并将其目录授权给AI模型。“但在我们的交易中,人类数据通常是合同要求。他们可能想要一个60%由人类生成、40%由合成的数据集。”

来源:《连线》

相关内容

热门资讯

福成股份:3月20日召开董事会... 福成股份(SH 600965,收盘价:5.02元)3月21日晚间发布公告称,公司第八届第二十四次董事...
证监会:2024年罚没款金额为...   中新经纬3月21日电 据证监会网站21日消息,证监会发布2024年法治政府建设情况,其中提到,2...
佛燃能源2024年营收315.... 3月21日,佛燃能源发布2024年年报。报告显示,公司2024年营业收入为315.89亿元,同比增长...
电工合金2024年营收25.9... 3月21日,电工合金发布2024年年报。报告显示,公司2024年营业收入为25.93亿元,同比增长8...
市场周报·184期|上周股市高... (来源:银河基金).app-kaihu-qr{text-align: left;padding: 2...
资金动向 | 北水继续抛售科技... 3月21日,南下资金净买入港股22.67亿港元。净买入中国移动3.91亿、理想汽车-W 1.36亿。...
毅昌科技:3月20日召开董事会... 毅昌科技(SZ 002420,收盘价:6.45元)3月21日晚间发布公告称,公司第六届第十八次董事会...
重庆银行发布2024年度业绩,... 智通财经APP讯,重庆银行(601963.SH)发布2024年年度报告,该公司营业收入为136.79...
毅昌科技(002420.SZ)... 格隆汇3月21日丨毅昌科技(002420.SZ)公布2024年年度报告,2024年公司实现营业收入2...
深圳控股预计2024财年亏损1... 3月21日,深圳控股(00604)发布公告,预计在2024财年将录得权益股东应占未审核综合亏损介乎约...
视力保卫战:科学防控助力孩子远...   视力保卫战:科学防控助力孩子远离近视儿童近视防控是一场需要系统性策略的“持久战”,而科学的用眼管...
发文道歉!今天突然崩了,很多人... 本文来自微信公众号“大象新闻”3月21日,据网友反馈,长城汽车旗下App今日上午出现服务问题,显示“...
封神演义还更新吗?为什么只有两... 封神演义还更新吗?为什么只有两天更新而且还是更新一集新封神演义如果不更新,我在也不相信湖南卫视了,请...
宋……要三点水的名字?……是女... 宋……要三点水的名字?……是女孩宋漓,宋潇,宋溪,宋漓蔓,宋澈萁,宋溪菀,宋湘芸,宋凌烟,话说给个评...
被无限玩梗的番剧有哪些? 被无限玩梗的番剧有哪些?有哪些被无限玩梗的番剧?就是那种被大家玩坏了的番剧被无限玩儿梗的番剧有海贼王...
锐信控股(01399)发盈警,... 锐信控股(01399)发布公告,初步预计集团于截至2024年12月31日止年度将取得公司拥有人应占综...
内蒙古小伙朱亚明摘得世界田联室... 转自:草原云3月21日,2025南京世界田联室内锦标赛在南京体育训练中心室内田径馆拉开帷幕。在男子三...
华钰矿业:多名股东拟减持股份 格隆汇3月21日丨华钰矿业(601020.SH)公布,董事刘鹏举先生拟减持不超过60,298股,占总...
视频 | 吴晓求最新演讲全文来...   炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!   来源:上证盈视频
男子偷菜成瘾,善良店主发现是老... 转自:上观新闻俗话说勿以恶小而为之,违法行为不可纵容。善良的超市店主发现一老客户顺手牵羊,觉得拿点小...