1月13日,百川智能宣布开源其新一代医疗增强大模型Baichuan-M3。该模型在OpenAI主导的权威医疗评测集HealthBench及其困难子集上,取得了全球最高综合成绩,并显著超越了GPT-5.2;在医疗幻觉率的纯模型评估中也达到了当前最低水平;在SCAN-bench评测中,M3在多个核心指标上均居首位,展现出卓越的医疗推理和问诊能力。
值得一提的是,M3首次具备原生的“端到端”严肃问诊能力。它能像医生一样主动追问,逐步逼近关键病史和风险信号,进而进行深度医学推理。评测显示,其问诊能力显著高于真人医生的平均水平。
此次发布的意义不仅在于技术榜单上的超越,更在于Baichuan-M3将医疗大模型推向新的高度:它不再停留于对话和表达,而是具备支撑完整诊疗流程的能力,参与医疗决策本身。因此,它的意义远超其他模型,大模型的技术进步终于转化为医疗健康领域可规模化落地的现实价值。
“为患者提供辅助决策的价值即是有意义的。”百川智能创始人&CEO王小川在发布会上表示。
在医疗这一对安全性和责任要求最高的领域,这样的变化并非偶然。它意味着有人选择了一条更为艰难的道路,将模型能力从展示智能逐步推向承载决策。
为何百川能取得如此成就?为何突破出现在医疗而非其他热门赛道?又为何在此时?这些长期积累的技术选择和工程路线开始同时收敛到清晰的结果上。
自人工智能诞生之初,人们就将医疗视为最有可能且最值得被AI改造的行业。
在HealthBench出现之前,与医疗行业相关的AI能力几乎无法比较。各家模型虽都宣称自己懂医学、能做医疗问答,但缺乏统一的评价坐标系,更谈不上横向对比。
今年5月,OpenAI推出了HealthBench,这套标准汇集了大量基于真实临床场景设计的多轮对话样本,使医疗能力得以量化评估,形成了公共标准。因此,很长一段时间里,它几乎等同于医疗大模型的最高标准,成为各家模型展示医疗能力的共同坐标系。
然而,行业趋势在去年年中发生了变化。国内阿福、小荷医生等医疗助手纷纷上线,OpenAI推出ChatGPT Health,Anthropic推出Claude for Healthcare,医疗不再仅是测试模型聪明程度的benchmark,而成为大模型厂商必须投入的产品方向;模型需直面回答能否成为决策依据的问题。
这不仅是排名问题。
此时,HealthBench的边界开始显现。它依然重要,但已不全面。它能证明模型是否具备医学知识和专业表达能力,却无法回答更核心的问题:模型是否具备进入真实医疗决策流程的资格。
临床决策从高度不完整、混乱的信息开始。患者往往描述不清重点,症状相互叠加,不同风险混杂。真正的难点不在于“如何给答案”,而在于“如何提问”。医生的专业能力体现在对信息优先级的判断上:哪些是高危信号需立即排除,哪些可暂缓;哪些信息缺失就无法下结论,哪些只是补充参考。
正是这一点上,百川选择了与主流路线不同的道路。一方面,它仍在HealthBench体系内竞争,追求在现有权威标准下做到最好;另一方面,它推出了SCAN-bench,试图弥补对完整临床流程本身进行建模和评测的维度。
围绕SCAN原则,百川借鉴医学教育中的OSCE方法,联合150多位一线医生,搭建了SCAN-bench评测体系。该体系以真实临床经验作为“标准答案”,将诊疗过程拆解为病史采集、辅助检查、精准诊断三大阶段,通过动态、多轮方式进行考核,完整模拟医生从接诊到确诊的全过程。相比HealthBench,SCAN-bench是更为全流程的动态评测新范式。
当行业还在比拼谁更会“答”时,百川已将关注点转向更底层的问题:模型能否像医生一样“问”?
这正是M3发布的真正特殊之处:在能力结构上形成闭环,既能推理又不乱编,还知道如何问出该问的信息。推理解决“能否判断”,不乱编解决“能否信”,会问诊解决“有无资格进入决策流程”。
当三者同时成立时,医疗大模型才算从会说话的智能系统走向可被托付部分医疗决策责任的系统。
M3在HealthBench上登顶意味着在OpenAI定义的医疗能力标准体系下完成了全面超越;在HealthBench Hard子集中以44.4分夺冠并系统性超过GPT-5.2。这一成绩不仅证明回答的专业性,还验证了模型在高度不确定、高推理难度场景中的稳定性与可靠性。
同时,M3实现了全球最低幻觉率意味着安全性被内化为模型自身能力而非依赖外部检索、规则约束或工程补丁来弥补。在SCAN-bench评测中M3同样取得第一尤其在核心问诊环节显著超过GPT系列模型和人类医生基线水平这表明模型真正补齐了临床信息获取这一长期被忽视却决定医疗决策上限的核心能力。
过去两年行业更多是让模型“像”医生一样说话而M3的判断是:仅有表达还不够必须具备医生的思维结构。
大量“AI医生”仍停留在角色扮演层面对话流畅、语气专业但提问更多是为让对话显得完整而非为临床决策收集关键信息。结果是看似专业的对话却不足以支撑严肃判断最终只能落在“建议尽快就医”这样的安全性结论上。
这正是“会说话”和“会做临床决策”之间的本质差别也是百川提出“严肃问诊”“SCAN原则”的背景。王小川在发布会上表示:“在医疗行业患者往往无法完整表达自己只知浅显的症状所以要通过问诊把过去的病情发展问清楚。有了足够的数据后才能做好后面的检测、诊断和结论。今天的大模型并不具备这样的能力。”
百川希望将临床医生长期依赖经验的工作方式拆解成可被模型学习、评测、优化的工程目标。
具体到工程上百川没有选择堆砌功能而是集中解决三个最底层的问题。
本文由主机测评网于2026-06-12发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647071.html