AI医疗进入精准化“深水区” :OpenAI医疗评估基准落地、大模型加速变革|AI医疗浪潮㉑

2个月前 来源: 观看:130

21世纪经济报道记者 闫硕 北京报道B84即热新闻——关注每天科技社会生活新变化gihot.com

近日,OpenAI推出HealthBench开源基准测试,用于衡量大语言模型在医疗健康领域的性能表现与安全可靠性,引发业内广泛讨论。B84即热新闻——关注每天科技社会生活新变化gihot.com

根据官方信息,HealthBench由262位来自60个国家/地区执业的医生共同参与构建,整合了5000段真实的医疗对话数据。与以前的狭窄基准不同,HealthBench通过48562个独特的医生编写的评分标准进行有意义的开放式评估,涵盖多个健康背景和行为维度。B84即热新闻——关注每天科技社会生活新变化gihot.com

有研报分析指出,随着OpenAI推出HealthBench等医疗大模型评估基准的建立和完善,AI医疗模型的性能评估将更加科学、全面,有助于加速AI技术在医疗领域的落地应用,为医疗行业的智能化升级提供有力支持,相关企业有望迎来新的发展机遇。B84即热新闻——关注每天科技社会生活新变化gihot.com

另一方面,大模型本身也在加速变革。事实上,随着大模型竞争的白热化,竞争的焦点也已进入全新阶段:从早先粗放的参数体量堆砌竞赛,转变为模型效率优化与单位算力下的性能提升。B84即热新闻——关注每天科技社会生活新变化gihot.com

IQVIA艾昆纬战略规划副总监Barrett Li向21世纪经济报道记者表示,随着大模型的不断进化,以及模型优化方法的不断提升,已经为AI在要求更特殊的专业场景中的更广泛应用拓展了可能性,尤其是对于医药行业的AI应用来说,已显现三大趋势:模型即产品、本地与端侧部署、研发端AI应用的快速拓展。B84即热新闻——关注每天科技社会生活新变化gihot.com

新的评估测试集

改善人类健康将成为通用人工智能(AGI)的决定性影响之一。如果能够得到有效开发和部署,大语言模型有望拓展健康信息的获取渠道,支持临床医生提供高质量医疗服务,并帮助人们维护自身健康。而评估对于理解模型在医疗场景中的表现至关重要。B84即热新闻——关注每天科技社会生活新变化gihot.com

OpenAI认为,现有评估仍然存在一些问题,首先,未反映真实场景,脱离了实际医疗互动的复杂性,如仅采用标准化测试或有限临床问题。其次,缺乏专家医学验证,评分标准未经过医疗专家严格审核,难以体现专业医疗判断。此外,也并未预留改进空间,最先进模型已接近“天花板”得分,无法激励持续优化。B84即热新闻——关注每天科技社会生活新变化gihot.com

也因此,在过去的一年里,OpenAI与60个国家的262名医生合作构建了HealthBench,包括5000个真实的医疗对话数据。HealthBench 的测试样本被分为7个主题和5个评估维度。其中,7个主题包括紧急转诊、专业沟通定制、健康数据任务等方面,5个评估纬度则包含准确性、沟通质量、情境理解等方面。B84即热新闻——关注每天科技社会生活新变化gihot.com

在HealthBench的基础上,OpenAI还推出了两个特别版本:HealthBench Consensus(共识版)和HealthBench Hard(困难版)。前者包含34个经医生共识验证的、对模型行为表现尤为关键的评估维度;后者则设置了更高难度的评估场景,目前最高得分仅为o3模型的32%,主要被用于挑战模型在复杂医疗情境中的极限表现。B84即热新闻——关注每天科技社会生活新变化gihot.com

对于HealthBench的可信度,OpenAI开展了HealthBench Consensus(共识版)的元评估,即将模型的打分结果与医生人工打分进行对比。结果表明,7个评估领域中的6个领域,模型打分结果与医生评分的中位数水平高度一致。B84即热新闻——关注每天科技社会生活新变化gihot.com

有券商分析师向21世纪经济报道记者表示,在医疗等垂直领域,准确性和实际场景的相关性比“流畅对话”更为关键,HealthBench不同于过去大多关注通用大语言模型表现的基准,而是聚焦医疗垂直领域,为医疗领域的AI应用提供更为专业的评估工具,同时也将推动大模型领域建立专业的AI评估标准。B84即热新闻——关注每天科技社会生活新变化gihot.com

值得一提的是,在HealthBench的测评中可以发现,大模型在医疗领域的应用正迅速发展。比如,2023年推出的GPT-3.5Turbo得分为16%,而2024年5月推出的GPT-4o得分已达到32%,2024年12月推出的o3模型得分更是达到60%。另外,较小规模的模型尤其进步显著,GPT-4.1 nano的表现超过GPT-4o,且成本仅为GPT-4o的1/25。B84即热新闻——关注每天科技社会生活新变化gihot.com

大模型持续优化

根据世界经济论坛发布的《人工智能驱动健康的未来:引领潮流》报告,人工智能是医疗保健的主要变革力量,预计2024年—2032年,AI医疗市场将以每年43%的速度增长,市场规模有望达到4910亿美元。B84即热新闻——关注每天科技社会生活新变化gihot.com

其中,AI在医疗服务中的应用前景广阔。中信建投证券分析指出,AI可以扩展医疗服务可及性,可应用于诊断前、诊治及诊断后阶段,解决当前医院系统医疗人员短缺和缺乏有效分流等问题,以少量资源实现高效率。此外,AI辅助医生诊疗未来有望降低误诊率的同时,在部分疑难杂症诊疗方面也有望发挥协同作用。B84即热新闻——关注每天科技社会生活新变化gihot.com

也因此,不仅评估工具在发生变革,大模型本身也在持续优化。当前,AI在医疗领域的应用历经了从规则驱动到数据驱动、从单一任务优化到多模态协同的演变,已进入到多模态融合阶段。B84即热新闻——关注每天科技社会生活新变化gihot.com

浙商证券分析指出,大模型的多模态能力解决了早期AI医疗存在的信息割裂和数据孤岛等问题,大模型通过“预训练+微调”架构,用统一参数体系处理多模态医疗数据。在临床应用中,借助多模态技术,AI可以实现跨模态数据的理解和动态时序建模,使得AI诊疗与医生的诊疗水平更加接近。B84即热新闻——关注每天科技社会生活新变化gihot.com

需要指出的是,由于万亿级参数模型高昂的训练成本与当下较低的投资回报比,叠加通用参数的堆砌对专业场景下的模型效率提升遇到了瓶颈,大模型竞争的焦点已从早先粗放的参数体量堆砌竞赛,转向模型效率优化与单位算力下的性能提升。B84即热新闻——关注每天科技社会生活新变化gihot.com

在应用方面,Barrett Li向记者总结道,随着大模型的不断进化,目前对于医药行业的AI应用来说,几大趋势已经显现:B84即热新闻——关注每天科技社会生活新变化gihot.com

首先,模型即产品。相比通用大模型在其他行业中相对较低的应用门槛,医药行业高度专业性的场景,对于模型的适配性有着更高的要求。而随着模型训练与针对特定知识库优化的技术与应用逐渐推广,大模型厂商未来预计会逐步关闭对外的API接口,转而将专业化后的模型本身作为产品直接提供给企业用户使用,颠覆现有的套壳应用层。而现有的专业AI软件,也必须逐步增强其底层模型训练的能力以应对这一挑战。在可见的未来,将会有更多直接针对医药行业训练的模型被广泛应用。B84即热新闻——关注每天科技社会生活新变化gihot.com

其次,本地与端侧部署。针对特定场景而训练优化的专业模型,可以在满足性能要求的前提下,减少对硬件方面提出过高的要求。因此在成本可控性、分析可溯源、数据安全、反馈延迟等要求更高的场景下,专业中小模型的本地部署会提供极大的赋能。B84即热新闻——关注每天科技社会生活新变化gihot.com

“此外,研发端AI应用也在快速拓展。出于高度专业性、数据安全、隐私合规等因素,相比通用大模型在商业化阶段的快速发展,医药行业企业尚未在研发阶段感受到AI所带来的巨大转变。而随着特定场景专业模型训练的普及,研发阶段AI应用的壁垒未来也有望被逐一消解。”Barrett Li说道。B84即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-7-17974-0.htmlAI医疗进入精准化“深水区” :OpenAI医疗评估基准落地、大模型加速变革|AI医疗浪潮㉑

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:CXO企业一季报:5家营收破10亿元,8家亏损,国际化与创新赛道或成破局关键

下一篇:交易超10亿美金,石药这款首仿药何以抢滩全球市场?

为你推荐
  ――医保、药监部门就集采药品问题答记者问  本报记者 孙秀艳  今年1月,有专家认为某些集采药品可能存在“血压不降、麻药不睡、泻药不泻”质量风险,有关部门迅...
02-11
21世纪经济报道记者朱艺艺 李佳英 闫硕 杭州、广州、北京报道“天津老百姓大药房可以订购华为WATCH D2,2988元,医保账号走个人账户”“上海...
02-14
  大众网记者 杨涛报道  近日,在第十六届山东省大学生科技节——山东省大学生消防安全技能大赛中,青岛港湾职业技术学院应急管理学院23级建筑消防技术与应急救援技术专...
01-21
随着全球变暖,野火发生的频率和强度显著增加,近日发生在美国洛杉矶的大火引起...
01-22
  中国证券报记者1月26日获悉,国家金融监督管理总局近日已批复开展第二批保险资金长期股票投资...
02-05
  摘要  【每日龙虎榜】豆油增仓近8万手,烧碱减仓2万余手,日内资金净流入86.15亿元。一文带你...
02-08
天秤座的男生以他们温和、友善和迷人的个性而闻名。他们通常很受欢迎,因为他们擅长与人...
01-22
摩羯座的男生一向以稳重、务实和有责任感而著称。他们通常不会轻易被外界的诱惑所动摇...
01-22
微胖女生穿搭? 女生穿搭技巧?一、微胖女生穿搭?微胖女生穿对了就不显胖,首先排除紧身衣裤,可以配休闲衬衣搭配阔腿裤小白鞋,很时尚,还有就是运动装二、女生穿搭技巧?不成熟的小建议...
02-12
选对尺码,让你的香奈儿鞋子更加完美对于许多香奈儿的爱好者来说,选购鞋子不仅仅是挑选一款时尚的鞋款,尺码的选择同样至关重要。无论是经典的香奈儿平底鞋、优雅的高跟鞋还是休...
02-12
刘强东:无论京东做多大,都将会把最实惠的价格带给用户。1.京东上线竞价购物玩法刘强东认准一件事情,似乎无论发生什么,都会贯彻到底。自从2022年底京东零售内部大会上,刘强东明确...
02-13
2月18日消息,遥望科技近日与巴西最大直播机构ABLELIVE达成独家战略合作,携手深耕巴西市场,共同打造该国直播电商行业的最大样板,致力推动巴西直播电商生态体系的深度升级。图源: ...
02-18
3月7日消息,在“三八妇女节”来临之际,智联招聘撰写并发布《2025中国女性职场现状调查报告》。调研数据显示,当前女性平均月薪为8978元,较去年略有上涨,女性在各个行业中的努力和...
03-09
3月7日消息,去哪儿大数据显示,2024年以来,在旅游淡季,女性预订飞机商务舱的数量同比增加了三成,预订高星酒店的数量也同比2023年增加了四成。平台上50岁以上女性行程预订增幅最高...
03-09
2024年末,一位科技创业者火了。作者 | 王思琪来源 | 投资家(ID:touzijias)2024年末,一位科技创业者火了。2025年初,这位创业者再度爆火。近日,中国科技行业因一位85后年轻人现身《...
01-24
2024年末,一位科技创业者火了。作者 | 王思琪来源 | 投资家(ID:touzijias)2024年末,一位科技创业者火了。2025年初,这位创业者再度爆火。近日,中国科技行业因一位85后年轻人现身《...
01-24
近日武侠电影《笑傲江湖》角色海报发布。天下英雄各展身手,谁能最终问鼎武林?江湖恩怨诸多是非,还请诸君敬请期待! 《笑傲江湖》电影将于1月28日(除夕)在腾讯视频...
01-25
育碧发布了截至2024 年 12 月 31 日的九个月财务报告,这家法国开发商和发行商重点介绍了即将推出的《刺客信条》游戏以及正在进行的成本削减计划,该计划已经导致...
02-15
北京时间2月1日,国际乒联在官网公布了2025澳门单打世界杯的参赛名额选拔办法。48个名额将分别由洲际杯赛和世界排名决定,其中每个大洲的洲际杯赛会产生4个名额(共20个名额),其余2...
02-02
干惊天动地事,做隐姓埋名人。中国共产党优秀党员,中国工程院院士,共和国勋章、国家最高科学技术奖获得者,全国道德模范,中国第一代核潜艇工程总设计师,中国船舶集团有限公司第七一...
02-09
1月14日,记者从中国科学院合肥物质科学研究院等离子体物理研究所(以下简称“等离子体所”)获悉,由该所建设运行的国家重大科技基础设施“聚变堆主机关...
01-21
1月14日,记者从国家市场监管总局获悉,该局近日在国际上率先批准新建微波亮温度国家计量基准,该计量基准有利于解决射电天文、行星探索等领域微波亮温...
01-21
  今明两天(2月7日至8日),寒潮继续影响我国,中东部气温将陆续迎来这轮过程的最低点,并将大面积创今...
02-08
  日前,国家统计局辽宁调查总队发布辽宁工业生产者出厂价格和购进价格变化情况。调查数据显示:1月份,辽...
02-13
  中新经纬1月17日电 题:新兴领域发展为消费内循环提供新支撑  作者 刘春生 中央财经大学副教授  2024年,社会消费品零售总额达到48.8万亿元,比上年增长3.5%,规模稳居全球...
01-21
  中新经纬1月17日电 (万可义)“今年打算继续扩大销售网点,线上线下实体一起打开欧洲其他国家市场。”谈及中国电动出行产品的海外销售,意大利福建侨商联合会会长刘振钢近日...
01-21
1 月 23 日消息,雷丁汽车宣布旗下 2025 款雷丁芒果 Pro 微型车现已经上市,仅提供“220 基础版(实际续航 201 公里)”,指导价为 5.39 万元。该车整体小巧,造型方正,前脸配备...
01-24
1 月 29 日消息,特斯拉公司宣布,其 Cybertruck 车主现在可以在所有 V4 超级充电站享受更快的充电速度。此前,特斯拉于上个月开始逐步推出这一快速充电功能。1 月 28 日...
01-29
《余烬之上》近期热度飙升,成为众多观众热议的话题,在各大手机软件上都能看到相关资讯。第18集的剧情尤其引人关注。逊哥的车被撞翻后,从货车上走下两人,黑衣人...
02-19
  1、《难哄》温以凡在大伯家不仅要忍受大伯母的冷眼和挤兑,还差点被大伯母的弟弟侵犯了。  2、大伯母对温以凡并不好,经常对她说很多刻薄的话,温以凡只能察言观色,小心翼...
02-22
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮