AI医疗进入精准化“深水区” :OpenAI医疗评估基准落地、大模型加速变革|AI医疗浪潮㉑

2天前 来源: 观看:15

21世纪经济报道记者 闫硕 北京报道LQH即热新闻——关注每天科技社会生活新变化gihot.com

近日,OpenAI推出HealthBench开源基准测试,用于衡量大语言模型在医疗健康领域的性能表现与安全可靠性,引发业内广泛讨论。LQH即热新闻——关注每天科技社会生活新变化gihot.com

根据官方信息,HealthBench由262位来自60个国家/地区执业的医生共同参与构建,整合了5000段真实的医疗对话数据。与以前的狭窄基准不同,HealthBench通过48562个独特的医生编写的评分标准进行有意义的开放式评估,涵盖多个健康背景和行为维度。LQH即热新闻——关注每天科技社会生活新变化gihot.com

有研报分析指出,随着OpenAI推出HealthBench等医疗大模型评估基准的建立和完善,AI医疗模型的性能评估将更加科学、全面,有助于加速AI技术在医疗领域的落地应用,为医疗行业的智能化升级提供有力支持,相关企业有望迎来新的发展机遇。LQH即热新闻——关注每天科技社会生活新变化gihot.com

另一方面,大模型本身也在加速变革。事实上,随着大模型竞争的白热化,竞争的焦点也已进入全新阶段:从早先粗放的参数体量堆砌竞赛,转变为模型效率优化与单位算力下的性能提升。LQH即热新闻——关注每天科技社会生活新变化gihot.com

IQVIA艾昆纬战略规划副总监Barrett Li向21世纪经济报道记者表示,随着大模型的不断进化,以及模型优化方法的不断提升,已经为AI在要求更特殊的专业场景中的更广泛应用拓展了可能性,尤其是对于医药行业的AI应用来说,已显现三大趋势:模型即产品、本地与端侧部署、研发端AI应用的快速拓展。LQH即热新闻——关注每天科技社会生活新变化gihot.com

新的评估测试集

改善人类健康将成为通用人工智能(AGI)的决定性影响之一。如果能够得到有效开发和部署,大语言模型有望拓展健康信息的获取渠道,支持临床医生提供高质量医疗服务,并帮助人们维护自身健康。而评估对于理解模型在医疗场景中的表现至关重要。LQH即热新闻——关注每天科技社会生活新变化gihot.com

OpenAI认为,现有评估仍然存在一些问题,首先,未反映真实场景,脱离了实际医疗互动的复杂性,如仅采用标准化测试或有限临床问题。其次,缺乏专家医学验证,评分标准未经过医疗专家严格审核,难以体现专业医疗判断。此外,也并未预留改进空间,最先进模型已接近“天花板”得分,无法激励持续优化。LQH即热新闻——关注每天科技社会生活新变化gihot.com

也因此,在过去的一年里,OpenAI与60个国家的262名医生合作构建了HealthBench,包括5000个真实的医疗对话数据。HealthBench 的测试样本被分为7个主题和5个评估维度。其中,7个主题包括紧急转诊、专业沟通定制、健康数据任务等方面,5个评估纬度则包含准确性、沟通质量、情境理解等方面。LQH即热新闻——关注每天科技社会生活新变化gihot.com

在HealthBench的基础上,OpenAI还推出了两个特别版本:HealthBench Consensus(共识版)和HealthBench Hard(困难版)。前者包含34个经医生共识验证的、对模型行为表现尤为关键的评估维度;后者则设置了更高难度的评估场景,目前最高得分仅为o3模型的32%,主要被用于挑战模型在复杂医疗情境中的极限表现。LQH即热新闻——关注每天科技社会生活新变化gihot.com

对于HealthBench的可信度,OpenAI开展了HealthBench Consensus(共识版)的元评估,即将模型的打分结果与医生人工打分进行对比。结果表明,7个评估领域中的6个领域,模型打分结果与医生评分的中位数水平高度一致。LQH即热新闻——关注每天科技社会生活新变化gihot.com

有券商分析师向21世纪经济报道记者表示,在医疗等垂直领域,准确性和实际场景的相关性比“流畅对话”更为关键,HealthBench不同于过去大多关注通用大语言模型表现的基准,而是聚焦医疗垂直领域,为医疗领域的AI应用提供更为专业的评估工具,同时也将推动大模型领域建立专业的AI评估标准。LQH即热新闻——关注每天科技社会生活新变化gihot.com

值得一提的是,在HealthBench的测评中可以发现,大模型在医疗领域的应用正迅速发展。比如,2023年推出的GPT-3.5Turbo得分为16%,而2024年5月推出的GPT-4o得分已达到32%,2024年12月推出的o3模型得分更是达到60%。另外,较小规模的模型尤其进步显著,GPT-4.1 nano的表现超过GPT-4o,且成本仅为GPT-4o的1/25。LQH即热新闻——关注每天科技社会生活新变化gihot.com

大模型持续优化

根据世界经济论坛发布的《人工智能驱动健康的未来:引领潮流》报告,人工智能是医疗保健的主要变革力量,预计2024年—2032年,AI医疗市场将以每年43%的速度增长,市场规模有望达到4910亿美元。LQH即热新闻——关注每天科技社会生活新变化gihot.com

其中,AI在医疗服务中的应用前景广阔。中信建投证券分析指出,AI可以扩展医疗服务可及性,可应用于诊断前、诊治及诊断后阶段,解决当前医院系统医疗人员短缺和缺乏有效分流等问题,以少量资源实现高效率。此外,AI辅助医生诊疗未来有望降低误诊率的同时,在部分疑难杂症诊疗方面也有望发挥协同作用。LQH即热新闻——关注每天科技社会生活新变化gihot.com

也因此,不仅评估工具在发生变革,大模型本身也在持续优化。当前,AI在医疗领域的应用历经了从规则驱动到数据驱动、从单一任务优化到多模态协同的演变,已进入到多模态融合阶段。LQH即热新闻——关注每天科技社会生活新变化gihot.com

浙商证券分析指出,大模型的多模态能力解决了早期AI医疗存在的信息割裂和数据孤岛等问题,大模型通过“预训练+微调”架构,用统一参数体系处理多模态医疗数据。在临床应用中,借助多模态技术,AI可以实现跨模态数据的理解和动态时序建模,使得AI诊疗与医生的诊疗水平更加接近。LQH即热新闻——关注每天科技社会生活新变化gihot.com

需要指出的是,由于万亿级参数模型高昂的训练成本与当下较低的投资回报比,叠加通用参数的堆砌对专业场景下的模型效率提升遇到了瓶颈,大模型竞争的焦点已从早先粗放的参数体量堆砌竞赛,转向模型效率优化与单位算力下的性能提升。LQH即热新闻——关注每天科技社会生活新变化gihot.com

在应用方面,Barrett Li向记者总结道,随着大模型的不断进化,目前对于医药行业的AI应用来说,几大趋势已经显现:LQH即热新闻——关注每天科技社会生活新变化gihot.com

首先,模型即产品。相比通用大模型在其他行业中相对较低的应用门槛,医药行业高度专业性的场景,对于模型的适配性有着更高的要求。而随着模型训练与针对特定知识库优化的技术与应用逐渐推广,大模型厂商未来预计会逐步关闭对外的API接口,转而将专业化后的模型本身作为产品直接提供给企业用户使用,颠覆现有的套壳应用层。而现有的专业AI软件,也必须逐步增强其底层模型训练的能力以应对这一挑战。在可见的未来,将会有更多直接针对医药行业训练的模型被广泛应用。LQH即热新闻——关注每天科技社会生活新变化gihot.com

其次,本地与端侧部署。针对特定场景而训练优化的专业模型,可以在满足性能要求的前提下,减少对硬件方面提出过高的要求。因此在成本可控性、分析可溯源、数据安全、反馈延迟等要求更高的场景下,专业中小模型的本地部署会提供极大的赋能。LQH即热新闻——关注每天科技社会生活新变化gihot.com

“此外,研发端AI应用也在快速拓展。出于高度专业性、数据安全、隐私合规等因素,相比通用大模型在商业化阶段的快速发展,医药行业企业尚未在研发阶段感受到AI所带来的巨大转变。而随着特定场景专业模型训练的普及,研发阶段AI应用的壁垒未来也有望被逐一消解。”Barrett Li说道。LQH即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-7-17974-0.htmlAI医疗进入精准化“深水区” :OpenAI医疗评估基准落地、大模型加速变革|AI医疗浪潮㉑

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:CXO企业一季报:5家营收破10亿元,8家亏损,国际化与创新赛道或成破局关键

下一篇:交易超10亿美金,石药这款首仿药何以抢滩全球市场?

为你推荐
这里是《21健讯Daily》,欢迎与21世纪经济报道新健康团队共同关注医药健康行业最新事件!政策动向黄果在北京大学肿瘤医院调研优化创新药临床...
02-14
21世纪经济报道记者季媛媛 上海报道 2025年,DeepSeek火爆出圈。借力DeepSeek技术的加持,人工智能(AI)技术正深度重塑医药健康行业格局。当下,...
02-18
  大众网记者 司心鹏 报道  为贯彻落实教育部、山东省《关于加强新时代教育科学研究工作的实施意见》,提高特殊教育教师教科研水平,促进特殊教育教师专业成长,2024年12...
01-21
  大众网记者 张明明 报道  11月11日至14日,由教育部高等教育司指导、中国高等教育学会主办的第四届全国高校教师教学创新大赛产教融合赛道全国赛在重庆邮电大学举行...
01-21
  近日,金融监管总局发布《保险公司监管评级办法》(简称《评级办法》),自2025年3月1日起施行。监...
01-21
    2024年,工业硅供应持续增长,多晶硅需求疲弱,在高供应、高库存的情况下,工业硅价格承压下跌...
02-11
白羊男性格直爽、冲动,喜欢追求刺激和自由。如果你想要折磨一个白羊男,以下是一些方法可...
01-22
双子座的男生天性活泼开朗,善于交际,他们通常是聚会中最引人注目的人物。然而,有时候双子...
01-22
引领潮流的冰冰个性服饰:时尚与个性的完美结合每当我走在街头,总会被一些独特的服饰所吸引。今天,想和大家聊聊一个我最近非常喜欢的品牌――冰冰个性潮流服饰。它不仅仅是一种...
02-07
180男生冬季穿搭? 180男生穿搭冬季?一、180男生冬季穿搭?衬衫+修身长裤+大衣作为身高180甚至180+的男生来说真是要恭喜你了,这样的身高可以说是男神身高了。180的男生也能轻松驾...
02-17
2月6日消息,天眼查官网资料显示,近日,辛选集团关联公司广州辛选网络信息科技有限公司因虚假宣传违法行为,被广州市白云区市场监督管理局罚款175万元。图源:天眼查官网处罚事由显...
02-07
2月17日消息,1688温州选品中心落户温州大象城开工盛典仪式日前举行,标志着温州市电商发展迈入新篇章。图源:1688商人圈公众号活动现场,1688温州选品中心合作链主林景乐表示,1688 ...
02-18
进入2025年,大部分打工人的精神状态都是:人坐在工位上,鼻子却闻到了家中年夜饭的香。在年味不断被稀释,大部分春节习俗已绝迹的今天,对...
02-07
2月27日消息,“渝新同行·渝路美好”中共重庆市委社会工作部与美团合作启动活动日前举行,会上发布三个项目,包括新就业群体社会工作服务项目、“袋鼠宝贝之家”项目、美团乡村...
03-01
2025新年伊始,武汉便迎来了一场星光熠熠的盛大发布仪式。潮宏基一城一非遗的武汉站,携手汉绣非遗传承人王子怡,重构花丝与汉绣新生表达,通过新的博物馆概念空间,展陈出了非遗碰撞...
01-22
近日,智算时代云计算基础软件企业上海云轴科技股份有限公司(以下简称“云轴科技 ZStack”)在当前经济形势与资本市场复杂多变的环境中突围,成功获得北...
02-07
1月24日今天,知名动漫IP《新世纪福音战士》官方宣布,EVANGELION:95服饰新品牌正式诞生,今后粉丝可以更加直接的表达对于EVA系列的喜爱。 ·EVANGELION:95的设计...
01-24
虽然黑曜石希望玩家在《宣誓》的整个游戏过程中都能感受到成长,但该开发商也不希望这款角色扮演游戏“开局就给人糟糕的体验”。因此,其理念是通过游戏界面对攻...
02-02
极目新闻通讯员 李璐“太感谢你们了!这么短的时间,就帮我找回了背包,为我解决了大麻烦!”1月31日上午,张先生来到湖北枣阳市公安局北城派出所领回自己失而复得的背包,紧紧握住民警...
02-02
记者从国家医保局获悉,今年1月,有专家认为某些集采药品可能存在“血压不降、麻药不睡、泻药不泻”质量风险,有关部门派员调研了解情况。日前,参与调研的医保、药监部门接受了记...
02-09
年关将至,A股进入2024业绩预告披露的密集期,半导体行业也不例外。1月15日晚,乐鑫科技(688018.SH)发布业绩预告,公司2024年年度实现营业...
01-21
在冰上飞驰,在雪上起舞……近几年,冰雪运动、冰雪旅游不断升温,冰天雪地的“冷资源”摇身一变成为“热产业”。《中国冰雪旅游发展报告(20...
01-23
  2月6日,大连市政府新闻办召开“坚持需求导向 公开承诺践诺 加快建设近悦远来的营商环境标杆城市”...
02-09
近日,工业和信息化部等十三部门联合公布2024年网络安全技术应用典型案例项目名单,其中7家单位来自辽宁。...
02-18
SQL Error: select * from ***_ecms_news3 where id in(222,) limit 2
1 月 24 日消息,奥迪(Audi)昨日(1 月 23 日)在 Facebook 上发布动态,展示了一款基于 Q6 Sportback e-tron 打造的越野概念车。这款概念车外观炫酷,配备了门式车桥和巨大的...
01-25
  近日,各大车企发布2025年1月销量数据。传统车企中,比亚迪、吉利等增长强劲;新势力车企排名变化...
02-06
  新春佳节,是家人团聚的美好时光,也是新大众文艺的高光舞台。红火喜庆、年味洋溢的节庆活动,大...
02-18
《余烬之上》廖思远最后和谁在一起?廖思远是双重人格吗?在《余烬之上》中,廖思远的官配是荔枝,正常情况下两人最后应该是在一起的。廖思远在经历种种后,与性格耿...
02-21
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮