当前位置:首页 > 科技资讯 > 正文

百川智能M3引领医疗大模型新时代

1月13日,百川智能宣布开源其新一代医疗增强大模型Baichuan-M3。该模型在OpenAI主导的权威医疗评测集HealthBench及其困难子集上,取得了全球最高综合成绩,并显著超越了GPT-5.2;在医疗幻觉率的纯模型评估中也达到了当前最低水平;在SCAN-bench评测中,M3在多个核心指标上均居首位,展现出卓越的医疗推理和问诊能力。

值得一提的是,M3首次具备原生的“端到端”严肃问诊能力。它能像医生一样主动追问,逐步逼近关键病史和风险信号,进而进行深度医学推理。评测显示,其问诊能力显著高于真人医生的平均水平。

此次发布的意义不仅在于技术榜单上的超越,更在于Baichuan-M3将医疗大模型推向新的高度:它不再停留于对话和表达,而是具备支撑完整诊疗流程的能力,参与医疗决策本身。因此,它的意义远超其他模型,大模型的技术进步终于转化为医疗健康领域可规模化落地的现实价值。

“为患者提供辅助决策的价值即是有意义的。”百川智能创始人&CEO王小川在发布会上表示。

百川智能M3引领医疗大模型新时代 百川智能 医疗大模型 HealthBench SCAN-bench 第1张

在医疗这一对安全性和责任要求最高的领域,这样的变化并非偶然。它意味着有人选择了一条更为艰难的道路,将模型能力从展示智能逐步推向承载决策。

为何百川能取得如此成就?为何突破出现在医疗而非其他热门赛道?又为何在此时?这些长期积累的技术选择和工程路线开始同时收敛到清晰的结果上。

医疗大模型的评价标准正在被重新定义

自人工智能诞生之初,人们就将医疗视为最有可能且最值得被AI改造的行业。

在HealthBench出现之前,与医疗行业相关的AI能力几乎无法比较。各家模型虽都宣称自己懂医学、能做医疗问答,但缺乏统一的评价坐标系,更谈不上横向对比。

今年5月,OpenAI推出了HealthBench,这套标准汇集了大量基于真实临床场景设计的多轮对话样本,使医疗能力得以量化评估,形成了公共标准。因此,很长一段时间里,它几乎等同于医疗大模型的最高标准,成为各家模型展示医疗能力的共同坐标系。

然而,行业趋势在去年年中发生了变化。国内阿福、小荷医生等医疗助手纷纷上线,OpenAI推出ChatGPT Health,Anthropic推出Claude for Healthcare,医疗不再仅是测试模型聪明程度的benchmark,而成为大模型厂商必须投入的产品方向;模型需直面回答能否成为决策依据的问题。

这不仅是排名问题。

此时,HealthBench的边界开始显现。它依然重要,但已不全面。它能证明模型是否具备医学知识和专业表达能力,却无法回答更核心的问题:模型是否具备进入真实医疗决策流程的资格。

临床决策从高度不完整、混乱的信息开始。患者往往描述不清重点,症状相互叠加,不同风险混杂。真正的难点不在于“如何给答案”,而在于“如何提问”。医生的专业能力体现在对信息优先级的判断上:哪些是高危信号需立即排除,哪些可暂缓;哪些信息缺失就无法下结论,哪些只是补充参考。

正是这一点上,百川选择了与主流路线不同的道路。一方面,它仍在HealthBench体系内竞争,追求在现有权威标准下做到最好;另一方面,它推出了SCAN-bench,试图弥补对完整临床流程本身进行建模和评测的维度。

围绕SCAN原则,百川借鉴医学教育中的OSCE方法,联合150多位一线医生,搭建了SCAN-bench评测体系。该体系以真实临床经验作为“标准答案”,将诊疗过程拆解为病史采集、辅助检查、精准诊断三大阶段,通过动态、多轮方式进行考核,完整模拟医生从接诊到确诊的全过程。相比HealthBench,SCAN-bench是更为全流程的动态评测新范式。

当行业还在比拼谁更会“答”时,百川已将关注点转向更底层的问题:模型能否像医生一样“问”?

这正是M3发布的真正特殊之处:在能力结构上形成闭环,既能推理又不乱编,还知道如何问出该问的信息。推理解决“能否判断”,不乱编解决“能否信”,会问诊解决“有无资格进入决策流程”。

当三者同时成立时,医疗大模型才算从会说话的智能系统走向可被托付部分医疗决策责任的系统。

M3在HealthBench上登顶意味着在OpenAI定义的医疗能力标准体系下完成了全面超越;在HealthBench Hard子集中以44.4分夺冠并系统性超过GPT-5.2。这一成绩不仅证明回答的专业性,还验证了模型在高度不确定、高推理难度场景中的稳定性与可靠性。

百川智能M3引领医疗大模型新时代 百川智能 医疗大模型 HealthBench SCAN-bench 第2张

同时,M3实现了全球最低幻觉率意味着安全性被内化为模型自身能力而非依赖外部检索、规则约束或工程补丁来弥补。在SCAN-bench评测中M3同样取得第一尤其在核心问诊环节显著超过GPT系列模型和人类医生基线水平这表明模型真正补齐了临床信息获取这一长期被忽视却决定医疗决策上限的核心能力。

AI医疗的真正分水岭

过去两年行业更多是让模型“像”医生一样说话而M3的判断是:仅有表达还不够必须具备医生的思维结构。

大量“AI医生”仍停留在角色扮演层面对话流畅、语气专业但提问更多是为让对话显得完整而非为临床决策收集关键信息。结果是看似专业的对话却不足以支撑严肃判断最终只能落在“建议尽快就医”这样的安全性结论上。

这正是“会说话”和“会做临床决策”之间的本质差别也是百川提出“严肃问诊”“SCAN原则”的背景。王小川在发布会上表示:“在医疗行业患者往往无法完整表达自己只知浅显的症状所以要通过问诊把过去的病情发展问清楚。有了足够的数据后才能做好后面的检测、诊断和结论。今天的大模型并不具备这样的能力。”

百川希望将临床医生长期依赖经验的工作方式拆解成可被模型学习、评测、优化的工程目标。

具体到工程上百川没有选择堆砌功能而是集中解决三个最底层的问题。

  • 首先是全动态强化学习系统。
  • 其次是SPAR算法。
  • 第三是Fact-aware RL。
  • 全动态强化学习系统:
  • 在M2阶段强化学习依赖静态验证规则但模型能力提升后验证体系成为上限。M3中的Verifier被设计成随模型能力共同进化的系统:模型暴露新错误模式验证器就生成新约束;旧低价值规则被淘汰高价值规则被持续强化。规则与模型共同抬高上限解决了能力后期容易封顶的问题。
  • SPAR算法:
  • 医疗问诊是极长的决策链路如果只看最终诊断对错模型无法知道问题出在哪里:是病史没问清还是检查建议错或是推理路径偏了。SPAR通过分步惩罚和相对基准机制把长链条决策拆解为可追责的局部过程让模型在有限轮次内学会把关键问题问准、问够而不是靠拉长对话轮数。
  • Fact-aware RL:
  • 在医疗场景中推理能力越强模型越容易“肯定自己”。传统做法靠外部检索或规则系统纠偏而M3把低幻觉直接做成强化学习的优化目标让事实一致性成为模型自身能力的一部分。同时通过动态权重调节避免模型为少犯错退化成少说少错的保守状态使强推理与高可靠同时成立。
  • 这三套设计背后指向同一个目标:能力和安全强推理和高可靠不做取舍百川都要并要让二者变成同一套工程体系里的协同指标。
  • 这样一来AI医疗才真正跨过了分水岭。

从健康助手到决策支持

  • 当模型能力完成会推理、不乱编、会问诊这一完整闭环时百川的重心也发生变化:从模型展示转向能力在真实医疗场景中的承载。
  • 这也是为什么近期百小应的产品节奏明显加快多种功能陆续补齐逐步搭建一个可以承接医疗工作流的系统骨架。模型需要的不仅是展示窗口而是一个可以沉淀信息支持长期使用对接真实决策链条的载体。
  • 这样一来百川所坚持的“严肃医疗”与行业中大量“泛健康”产品之间的差异变得格外清晰。
  • 以阿福、小荷医生为代表的产品更接近健康咨询、医学科普、导诊建议和情绪陪伴它们解决的是信息不对称和患者就医前焦虑的问题。
  • 而百川试图进入的是完全不同的一段链路:医生可借助它推演问诊与诊疗思路患者及家属也可通过该应用更系统地理解诊断、治疗、检查与预后背后的医学逻辑。
  • 这是一条高风险、高责任、高价值密度的决策支持路径在这里模型不再只是提供参考信息或情绪安慰它给出的每一次判断都可能影响患者的下一步选择;它提出的每一个问题都在决定关键信息是否被完整收集;它形成的每一个结论都必须具备可复核性能够真正被纳入医疗决策流程之中。
  • 根本区别是当行业里大多数产品仍停留在帮用户搜集健康信息时百川选择的是一条更难、更慢但天花板更高的路。
  • 回顾百川押注医疗的时间线其选择是一种提前布局的判断。
  • 在沟通会上王小川概括了他对医疗行业几个核心痛点的判断:优质医生资源长期紧缺医疗服务在不同地区与人群之间高度不均衡;美国有家庭医生体系而中国患者更集中地涌向三甲医院优质医疗资源被进一步挤压。正是基于这些现实矛盾的长期观察百川从一开始就将目标放在解决医疗本身的问题上。
  • 2023年在大模型产业最火热的阶段百川没有选择优先切入代码、搜索、内容创作等赛道而是明确将医疗作为最核心方向。当时受到行业质疑但如今国际头部模型厂商开始集体进入医疗领域全球范围内所有公司都意识到医疗才是大模型的必争之地。
  • 在这场竞速中作为国内唯一专注医疗的大模企业百川持续突破低幻觉率、端到端问诊和复杂临床推理等核心能力在医疗大模型底座上完成了代际领先从“跟随者”跃迁为行业“引领者”与新范式的“定义者”正以硬核实力扛起中国AI医疗发展的旗帜。