1月13日,谷歌正式发布其新一代开源医疗人工智能模型MedGemma 1.5 4B 及配套的医疗专用语音识别模型 MedASR。这两款模型共同构成了面向临床场景的“AI双剑”,旨在提升医生工作效率、降低医疗记录负担,并推动医疗AI在本地化、多模态和高精度方向的发展。
MedGemma 1.5 4B:轻量、开源、多模态,首次原生支持三维医学影像
MedGemma 1.5 4B 是基于 Gemma 3 架构开发的 40 亿参数轻量化模型,最大亮点在于其可本地部署的特性,使得医院或研究机构无需依赖云端即可运行高性能医疗AI。该模型不仅继承了前代 MedGemma 1 4B 对文本、胸部 X 光片及病理切片图像的处理能力,更首次原生支持 CT、MRI 等三维体积数据以及全切片数字病理图像(whole-slide histopathology),成为目前公开可用的首个能直接处理高维医学影像的开源多模态大模型。
据谷歌官方技术报告,MedGemma 1.5 4B 在多个医疗基准测试中表现优异:
在文本理解与推理任务上,其得分超越了通用模型 Gemma 3 4B 和前代 MedGemma 1 4B;
在部分测试中,甚至优于参数规模更大的 MedGemma 1 27B 模型;
在二维和三维医学影像分析任务中,准确率也显著高于前代版本。

此外,该模型延续了 MedGemma 系列高度可微调的特性。目前社区已衍生出超过 500 款定制化模型,未来有望针对放射科、病理科、急诊等细分场景推出更专业的优化版本。
MedASR:专为医疗听写打造,错误率仅为 Whisper 的不到一半
与 MedGemma 1.5 同步发布的 MedASR ,是一款专为医疗场景训练的语音识别模型。谷歌表示,该模型基于超过 5000 小时的真实医用音频数据进行训练,涵盖放射科口述、门诊对话、专科术语等复杂语境。

在关键性能指标上,MedASR 表现惊艳:
在“胸部 X 光片相关对话”转录任务中,词错误率(WER)仅为 5.2%;
相比之下,OpenAI 的通用语音模型 Whisper large-v3 的错误率高达 12.5%,MedASR 的错误率降低了近 58%;
在多科室、多口音的内部医疗语音测试集中,MedASR 同样显著优于 Whisper 和 Gemini 2.5 Pro 等主流模型。
更重要的是,MedASR 的转录结果可直接作为 MedGemma 系列模型的输入提示(prompt),实现“语音→结构化病历→智能分析”的端到端工作流,极大简化临床文档生成流程。
开源生态加速医疗AI普惠
谷歌已将 MedGemma 1.5 4B 和 MedASR 全部开源,并在 Hugging Face、ModelScope 等平台提供模型权重与推理示例。开发者可通过 Jupyter Notebook 快速上手微调,适配本地医疗系统需求。
这一举措不仅降低了医疗AI的使用门槛,也为全球科研机构和初创企业提供了高质量的基础模型,有望加速医疗AI在资源有限地区的落地应用。
MedGemma 1.5 4B 与 MedASR 的发布,标志着谷歌在垂直领域大模型布局上的重要一步。通过“轻量化+多模态+高精度+强开源”的组合策略,谷歌正试图构建一个开放、可扩展、贴近临床实际的医疗AI生态。随着开发者社区的持续贡献,这套“AI双剑”或将成为未来智慧医疗基础设施的关键组件。