“喂”给人工智能的真实数据终将耗尽,合成数据能否让AI模型精确可靠?

4个月前 来源:中国科技网 观看:94

人工智能(AI)初创公司xAI创始人埃隆·马斯克近日表示:“在AI训练中,我们现在基本上耗尽了人类知识的累积总和。”之前研究也表明,人类生成的真实数据将在2到8年内消耗殆尽。鉴于真实数据日益稀缺,为满足AI的“胃口”,科技行业正转向使用合成数据。YFs即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚“对话”网站在本月稍早时间报道中指出,合成数据具有诸多优势,但过度依赖合成数据也可能削弱AI的精确性和可靠性。YFs即热新闻——关注每天科技社会生活新变化gihot.com

合成数据应运而生YFs即热新闻——关注每天科技社会生活新变化gihot.com

以往,科技公司主要依赖真实数据来构建、训练和改进AI模型。真实数据是指由人类创建的文本、视频和图像。它们通过调查、实验、观察或挖掘网站和社交媒体等途径被收集而来。YFs即热新闻——关注每天科技社会生活新变化gihot.com

真实数据因蕴含真实事件以及其场景和背景而极具价值,但其并非尽善尽美。它可能掺杂拼写错误、不一致或无关的内容,甚至潜藏严重偏见,导致生成式AI模型在某些情况下创建的图像仅展示男性或白人形象。YFs即热新闻——关注每天科技社会生活新变化gihot.com

但真实数据日益匮乏,因为人类生成数据的速度赶不上AI不断增长的需求。YFs即热新闻——关注每天科技社会生活新变化gihot.com

美国开放人工智能研究中心联合创始人伊利亚·苏茨克维尔在去年12月举行的机器学习会议上声称,AI行业已触及他所称的“数据峰值”,AI的训练数据如同化石燃料一样面临着耗尽的危机。此外,有研究预测,到2026年,ChatGPT等大型语言模型的训练将耗尽互联网上所有可用文本数据,届时将没有新的真实数据可供使用。YFs即热新闻——关注每天科技社会生活新变化gihot.com

为给AI提供充足的“养分”,一种由算法生成的、模仿真实世界情况的数据——合成数据应运而生。合成数据是在数字世界中创造的,而非从现实世界收集或测量而来。它可以作为真实世界数据的替代品,来训练、测试、验证AI模型。YFs即热新闻——关注每天科技社会生活新变化gihot.com

从理论上来说,合成数据为训练AI模型提供了一种经济高效且快捷的解决方案。它有效解决了AI训练使用真实数据时饱受诟病的隐私问题和道德问题,尤其是涉及个人健康数据等敏感信息时。更重要的是,与真实数据不同,合成数据在理论上可以无限供应。YFs即热新闻——关注每天科技社会生活新变化gihot.com

研究机构高德纳公司估计,2024年AI及分析项目使用的数据中,约60%是合成数据。到2030年,AI模型使用的绝大部分数据将是由AI生成的合成数据。YFs即热新闻——关注每天科技社会生活新变化gihot.com

科技公司来者不拒YFs即热新闻——关注每天科技社会生活新变化gihot.com

事实上,微软、元宇宙平台公司,以及Anthropic等众多科技头部企业和初创企业,已经开始广泛使用合成数据来训练其AI模型。YFs即热新闻——关注每天科技社会生活新变化gihot.com

例如,微软在1月8日开源的AI模型“Phi-4”,便是合成数据携手真实数据训练的;谷歌的“Gemma”模型也采用了类似方法。Anthropic公司也利用部分合成数据,开发出其性能最优异的AI系统之一“Claude 3.5 Sonnet”。苹果自研AI系统Apple Intelligence,在预训练阶段,也大量使用了合成数据。YFs即热新闻——关注每天科技社会生活新变化gihot.com

随着科技公司对合成数据的需求与日俱增,生产合成数据的工具也接踵而至。YFs即热新闻——关注每天科技社会生活新变化gihot.com

英伟达公司发布的3D仿真数据生成引擎Omniverse Replicator,能够生成合成数据,用于自动驾驶汽车和机器人训练。去年6月,英伟达开源了Nemotron-4340b系列模型,开发者可使用该模型生成合成数据,用于训练大型语言模型,以应用于医疗保健、金融、制造、零售等行业。在医疗、金融等专业领域,该模型能够根据特定需求生成高质量的合成数据,帮助构建更为精准的行业专属模型。微软推出的开源合成数据工具Synthetic Data Showcase则旨在通过生成合成数据和用户界面,实现隐私保护的数据共享和分析。亚马逊云科技推出的Amazon SageMaker Ground Truth也能为用户生成数十万张自动标记的合成图像。YFs即热新闻——关注每天科技社会生活新变化gihot.com

此外,去年12月,元宇宙平台公司推出开源大模型Llama 3.3,更是大幅降低了生成合成数据的成本。YFs即热新闻——关注每天科技社会生活新变化gihot.com

过度依赖风险难测YFs即热新闻——关注每天科技社会生活新变化gihot.com

尽管合成数据暂时解决了AI训练的燃眉之急,但它也并非尽善尽美。YFs即热新闻——关注每天科技社会生活新变化gihot.com

一个关键问题在于:当AI模型过于依赖合成数据时,它们可能会“崩溃”。它们会产生更多“幻觉”,编造看似合理可信但实际上并不存在的信息。而且,AI模型的质量和性能也会飞速下降,甚至无法使用。例如,某个AI模型生成的数据出现了一些拼写错误,利用这些充满了错误的数据训练其他模型,这些AI模型必定会“以讹传讹”,导致更大的错误。YFs即热新闻——关注每天科技社会生活新变化gihot.com

此外,合成数据也存在过于简单化的风险。它可能缺乏真实数据集蕴含的细节和多样性,这可能导致在其上训练的AI模型的输出也过于简单,缺乏实用性。YFs即热新闻——关注每天科技社会生活新变化gihot.com

为解决这些问题,国际标准化组织需要着手创建强大的系统,来跟踪和验证AI训练数据。此外,AI系统可以配备元数据追踪功能,让用户或系统能对合成数据进行溯源。人类也需要在AI模型的整个训练过程中对合成数据进行监督,以确保其高质量且符合道德标准。YFs即热新闻——关注每天科技社会生活新变化gihot.com

AI的未来在很大程度上取决于数据的质量,合成数据将在克服数据短缺方面发挥越来越重要的作用。对合成数据的使用,人们必须保持谨慎态度,尽量减少错误,确保其作为真实数据的可靠补充,从而保障AI系统的准确性和可信度。YFs即热新闻——关注每天科技社会生活新变化gihot.com

人工智能(AI)初创公司xAI创始人埃隆·马斯克近日表示:“在AI训练中,我们现在基本上耗尽了人类知识的累积总和。”之前研究也表明,人类生成的真实数据将在2到8年内消耗殆尽。鉴于真实数据日益稀缺,为满足AI的“胃口”,科技行业正转向使用合成数据。YFs即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚“对话”网站在本月稍早时间报道中指出,合成数据具有诸多优势,但过度依赖合成数据也可能削弱AI的精确性和可靠性。YFs即热新闻——关注每天科技社会生活新变化gihot.com

合成数据应运而生YFs即热新闻——关注每天科技社会生活新变化gihot.com

以往,科技公司主要依赖真实数据来构建、训练和改进AI模型。真实数据是指由人类创建的文本、视频和图像。它们通过调查、实验、观察或挖掘网站和社交媒体等途径被收集而来。YFs即热新闻——关注每天科技社会生活新变化gihot.com

真实数据因蕴含真实事件以及其场景和背景而极具价值,但其并非尽善尽美。它可能掺杂拼写错误、不一致或无关的内容,甚至潜藏严重偏见,导致生成式AI模型在某些情况下创建的图像仅展示男性或白人形象。YFs即热新闻——关注每天科技社会生活新变化gihot.com

但真实数据日益匮乏,因为人类生成数据的速度赶不上AI不断增长的需求。YFs即热新闻——关注每天科技社会生活新变化gihot.com

美国开放人工智能研究中心联合创始人伊利亚·苏茨克维尔在去年12月举行的机器学习会议上声称,AI行业已触及他所称的“数据峰值”,AI的训练数据如同化石燃料一样面临着耗尽的危机。此外,有研究预测,到2026年,ChatGPT等大型语言模型的训练将耗尽互联网上所有可用文本数据,届时将没有新的真实数据可供使用。YFs即热新闻——关注每天科技社会生活新变化gihot.com

为给AI提供充足的“养分”,一种由算法生成的、模仿真实世界情况的数据——合成数据应运而生。合成数据是在数字世界中创造的,而非从现实世界收集或测量而来。它可以作为真实世界数据的替代品,来训练、测试、验证AI模型。YFs即热新闻——关注每天科技社会生活新变化gihot.com

从理论上来说,合成数据为训练AI模型提供了一种经济高效且快捷的解决方案。它有效解决了AI训练使用真实数据时饱受诟病的隐私问题和道德问题,尤其是涉及个人健康数据等敏感信息时。更重要的是,与真实数据不同,合成数据在理论上可以无限供应。YFs即热新闻——关注每天科技社会生活新变化gihot.com

研究机构高德纳公司估计,2024年AI及分析项目使用的数据中,约60%是合成数据。到2030年,AI模型使用的绝大部分数据将是由AI生成的合成数据。YFs即热新闻——关注每天科技社会生活新变化gihot.com

科技公司来者不拒YFs即热新闻——关注每天科技社会生活新变化gihot.com

事实上,微软、元宇宙平台公司,以及Anthropic等众多科技头部企业和初创企业,已经开始广泛使用合成数据来训练其AI模型。YFs即热新闻——关注每天科技社会生活新变化gihot.com

例如,微软在1月8日开源的AI模型“Phi-4”,便是合成数据携手真实数据训练的;谷歌的“Gemma”模型也采用了类似方法。Anthropic公司也利用部分合成数据,开发出其性能最优异的AI系统之一“Claude 3.5 Sonnet”。苹果自研AI系统Apple Intelligence,在预训练阶段,也大量使用了合成数据。YFs即热新闻——关注每天科技社会生活新变化gihot.com

随着科技公司对合成数据的需求与日俱增,生产合成数据的工具也接踵而至。YFs即热新闻——关注每天科技社会生活新变化gihot.com

英伟达公司发布的3D仿真数据生成引擎Omniverse Replicator,能够生成合成数据,用于自动驾驶汽车和机器人训练。去年6月,英伟达开源了Nemotron-4340b系列模型,开发者可使用该模型生成合成数据,用于训练大型语言模型,以应用于医疗保健、金融、制造、零售等行业。在医疗、金融等专业领域,该模型能够根据特定需求生成高质量的合成数据,帮助构建更为精准的行业专属模型。微软推出的开源合成数据工具Synthetic Data Showcase则旨在通过生成合成数据和用户界面,实现隐私保护的数据共享和分析。亚马逊云科技推出的Amazon SageMaker Ground Truth也能为用户生成数十万张自动标记的合成图像。YFs即热新闻——关注每天科技社会生活新变化gihot.com

此外,去年12月,元宇宙平台公司推出开源大模型Llama 3.3,更是大幅降低了生成合成数据的成本。YFs即热新闻——关注每天科技社会生活新变化gihot.com

过度依赖风险难测YFs即热新闻——关注每天科技社会生活新变化gihot.com

尽管合成数据暂时解决了AI训练的燃眉之急,但它也并非尽善尽美。YFs即热新闻——关注每天科技社会生活新变化gihot.com

一个关键问题在于:当AI模型过于依赖合成数据时,它们可能会“崩溃”。它们会产生更多“幻觉”,编造看似合理可信但实际上并不存在的信息。而且,AI模型的质量和性能也会飞速下降,甚至无法使用。例如,某个AI模型生成的数据出现了一些拼写错误,利用这些充满了错误的数据训练其他模型,这些AI模型必定会“以讹传讹”,导致更大的错误。YFs即热新闻——关注每天科技社会生活新变化gihot.com

此外,合成数据也存在过于简单化的风险。它可能缺乏真实数据集蕴含的细节和多样性,这可能导致在其上训练的AI模型的输出也过于简单,缺乏实用性。YFs即热新闻——关注每天科技社会生活新变化gihot.com

为解决这些问题,国际标准化组织需要着手创建强大的系统,来跟踪和验证AI训练数据。此外,AI系统可以配备元数据追踪功能,让用户或系统能对合成数据进行溯源。人类也需要在AI模型的整个训练过程中对合成数据进行监督,以确保其高质量且符合道德标准。YFs即热新闻——关注每天科技社会生活新变化gihot.com

AI的未来在很大程度上取决于数据的质量,合成数据将在克服数据短缺方面发挥越来越重要的作用。对合成数据的使用,人们必须保持谨慎态度,尽量减少错误,确保其作为真实数据的可靠补充,从而保障AI系统的准确性和可信度。YFs即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-217-0.html“喂”给人工智能的真实数据终将耗尽,合成数据能否让AI模型精确可靠?

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:仿昆虫微型机器人飞行长达15分钟

下一篇:新型光学原子钟比铯钟精度高千倍

为你推荐
1月初,因误信微信群虚假工作招募信息被诈骗团伙骗至缅甸园区的演员王星终于回到国内,网友提着的一颗心终于松口气。与此同时,围绕网...
01-21
半导体行业并购又来了。1月21日,快充芯片龙头南芯科技(688484.SH)发布公告,拟以不超过1.6亿元人民币现金收购珠海昇生微电子有限责任...
01-23
2月11日,记者从沈阳市除雪指挥部获悉,据气象部门预报,沈北新区、辽中、新民、法库、康平有小雪(降雪量0.2至...
02-11
  2月13日,金杯汽车股份有限公司发布晚间公告称,公司董事会收到许晓敏先生的书面辞职报告,因其达到法定...
02-15
过去,北方寒冷地区的“银发族”如候鸟般迁徙至海南岛过冬;而如今,凭借着极高的性价比,西双版纳成为了不少外省人过冬的新选择。据云南...
01-21
1 月 24 日消息,小鹏汽车今日发布《小鹏 MONA 答用户问(第 14 期)》,重点针对哨兵模式相关问题进行了解答。附重点内容如下:哨兵模式在什么情况下会触发?有人碰到车会有报...
01-25
1 月 30 日消息,日本汽车媒体 Mag-X 昨日(1 月 29 日)发布博文,报道称由于 LS 轿车 2024 在日本销量不足 1500 辆,雷克萨斯考虑调整 LS 系列,替代推出三排七座混合动力 SU...
01-31
《难哄》穆承允人设是怎样的?穆承允是男几?《难哄》中穆承允的人设长相俊秀,五官偏柔,有点男生女相,但身材高挑且强壮,整体给人一种清隽明朗的感觉,像个还未长开来...
02-19
《漫城》播出后反响热烈,观众对这部剧集的故事情节赞不绝口。剧情中充满转折与情感纠葛,引人入胜。其中关于布莱克身份暴露的情节尤为引人关注。在第16集中,布...
02-20
这里是《21健讯Daily》,欢迎与21世纪经济报道新健康团队共同关注医药健康行业最新事件!政策动向国家医保局发函回应赴上海调研集采药品质量...
01-21
21世纪经济报道记者季媛媛 上海报道 新一代药王“K药”刚刚宣布拿下294.82亿美元销售额后,“网红”司美格鲁肽随即高调宣称,2024年销售额为2...
02-06
中新社上海1月18日电(记者许婧)记者18日从同济大学获悉,已完成主体建造的同济...
01-21
人民网北京12月13日电 (记者孙竞)记者今天从教育部获悉,教育部日前完成了2024年度《职业教育专业目录》增...
01-21
  1月21日上午10点,贵州亨特房地产开发有限公司(简称“亨特地产”)持有的贵州花溪农村商业银行股...
01-23
  摘要  【纯碱:仍面临供需过剩格局】2024年,纯碱随着大投产逐步兑现,叠加光伏和浮法玻璃进入...
01-24
天秤男是一个追求平衡和和谐的星座,他们善于处理人际关系,注重公正和公平。然而,在与天秤...
01-22
天秤座的男人通常具有温和、善良、浪漫的性格,他们注重平衡和和谐,追求美好的事物。在婚...
01-22
空军皮衣搭配男? 皮衣如何搭配男?一、空军皮衣搭配男?空军皮衣是比较干练的一种服饰,而搭配上牛仔裤或者黑色牛仔以及靴子,能够让你的干练劲又增添一分。也可以搭阔腿裤这是一种...
02-12
领略T台魅力:模特背后的故事与时尚之舞我记得第一次走进一个时尚秀场,那时的我只是个对时尚充满好奇的观众。随着模特们优雅地走过T台,身上闪烁的华美服装在灯光下折射出迷人的...
02-12
2月6日消息,商务部数据显示,今年1月20日至2月1日,已有1470.4万名消费者申请了1886.7万件手机等数码产品购新补贴。春节假期不少消费者也来到京东通过国补下单手机、平板、智能...
02-07
2月18日消息,遥望科技近日与巴西最大直播机构ABLELIVE达成独家战略合作,携手深耕巴西市场,共同打造该国直播电商行业的最大样板,致力推动巴西直播电商生态体系的深度升级。图源: ...
02-18
2月6日消息,及时用车日前宣布,平台自2月3日起,全国统一上线“司机每日提现”权益,以解决司机资金周转难题,提升车辆运维效率,保障车辆资产安全。即日起,无论工作日还是节假日,司机师...
02-07
2月16日消息,爱彼迎发布2024年第四季度及全年财务业绩。四季度,爱彼迎收入约25亿美元,同比增长12%;净利润约4.61亿美元,同比扭亏为盈,净利润率达19%;经调整EBITDA(息税折旧及摊销前...
02-17
扬州无界矩阵科技有限公司(简称“无界矩阵”)近期以亿级估值完成超千万元天使轮融资,本轮融资由力合金融领投。无界矩阵是一家成立于2024年的人工智...
02-07
近日,智能科技领域企业——青岛明邦智能科技有限公司(简称“明邦智能”)宣布,成功完成1000万元人民币的融资。此次融资由广东南方秭方投资集团(简称“...
02-07
开发商 id Software 于 5 年前推出了《毁灭战士:永恒》,并即将推出《毁灭战士:黑暗纪元》。即便这是公司推出的新《毁灭战士》系列的前传,但显然它将比开发商之前...
01-28
《漫威蜘蛛侠2》PC版将于1月31日发售。近日索尼公布了该作PC配置需求,并详细介绍了其光线追踪功能,一起来看看吧! Steam商店地址:点击进入 全新预告: 《漫威蜘蛛...
01-30
极目新闻记者 涂梦蝶非遗三节龙、傩仪舞蹈、广场烟花秀……走进湖北省云梦县祥云湾文旅度假区,仿佛参加一场战国游园会。近日,极目新闻记者了解到,春节期间,云梦县祥云湾文旅度...
02-04
极目新闻记者 柯称 李碗容 张屏 庞正 马鑫人勤春来早对于人形机器人来说也许也是这样大年初八新春开工首日湖北10个型号的“楚才”系列人形机器人在洪山礼堂前集中亮相这是...
02-05
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮