免费POC, 零成本试错
FDE知识库

FDE知识库

学习大模型的前沿技术与行业落地应用


收藏

利用 MedGemma 1.5 与 MedASR 构建下一代医疗应用

发布日期:2026-02-10 18:30:50 浏览次数: 2324
作者:谷歌开发者

微信搜一搜,关注“谷歌开发者”

推荐语

Google最新发布MedGemma 1.5医疗AI模型,助力开发者快速构建下一代医疗应用,已在Hugging Face平台获得百万下载。

核心内容:
1. MedGemma系列医疗AI模型的开发背景与行业影响
2. 新版本MedGemma 1.5在医学影像处理上的突破性改进
3. Kaggle平台MedGemma挑战赛为开发者提供实战机会

杨芳贤
53AI创始人/腾讯云(TVP)最具价值专家

人工智能在医疗保健领域的应用正在急速增长,其行业的 AI 采用率已达到整体经济领域的两倍。为了助力这一变革,Google 于去年通过 Health AI Developer Foundations (HAI-DEF) 计划发布了 MedGemma 系列开放医疗生成式 AI 模型。MedGemma 等 HAI-DEF 模型旨在让开发者以此为基石,评估和调整其医疗应用场景,开发者还可以通过 Vertex AI 在 Google Cloud 平台轻松扩展这类模型。MedGemma 自发布以来持续引发热烈反响,其在 Hugging Face 的下载量已达数百万次,该平台社区中也涌现出了数百个基于该模型的衍生版本

△ MedGemma 作为开发者工具预期用途的流程图。

  • 整体经济领域的两倍

    https://menlovc.com/perspective/2025-the-state-of-ai-in-healthcare/

  • Health AI Developer Foundations

    http://goo.gle/hai-def

  • MedGemma 系列

    https://research.google/blog/medgemma-our-most-capable-open-models-for-health-ai-development/

  • 通过 Vertex AI 在 Google Cloud 平台轻松扩展

    https://console.cloud.google.com/vertex-ai/model-garden?inv=1&invt=Ab2Ldw&pageState=(%22galleryStateKey%22:(%22f%22:(%22g%22:%5B%22goals%22%5D,%22o%22:%5B%22Health+%26+Life+Sciences%22%5D),%22s%22:%22%22))

  • 衍生版本

    https://huggingface.co/models?other=or:base_model:finetune:google/medgemma-4b-it,base_model:finetune:google/medgemma-4b-pt,base_model:finetune:google/medgemma-27b-it,base_model:finetune:google/medgemma-27b-text-it


我们乘势而上,继续发布 MedGemma 1.5 4B,并在 Kaggle 平台启动 MedGemma 挑战赛黑客马拉松。基于开发者社区的直接反馈,本次模型更新让开发者得以更高效地调整 MedGemma,以适配涉及多种医学影像模态的应用场景:

  • 高维医学影像: 计算机断层扫描 (CT)、核磁共振成像 (MRI) 和组织病理学

  • 纵向医学影像: 对胸部 X 光片进行的时间序列对比分析

  • 解剖结构定位: 在胸部 X 光片中定位解剖结构特征

  • 医学文档理解: 从医学实验报告中提取结构化数据


  • MedGemma 1.5 4B

    https://huggingface.co/google/medgemma-1.5-4b-it

  • Kaggle

    https://www.kaggle.com/

  • MedGemma 挑战赛

    https://www.kaggle.com/competitions/med-gemma-impact-challenge


相较于 MedGemma 1 4B,MedGemma 1.5 4B 在文字、医疗记录和 2D 图像等核心功能方面均提高了准确性。我们此次发布的更新版 4B 模型,旨在为开发者提供一个理想的计算高效起点,并且其规模小到足以离线运行。而对于更复杂的文本类应用,开发者可以继续使用我们的 MedGemma 1 27B 参数模型。您可以阅读 MedGemma 1.5 模型卡片,详细了解 MedGemma 1.5 4B 模型及其性能基准。


  • MedGemma 1 27B 参数模型

    https://huggingface.co/google/medgemma-27b-it

  • MedGemma 1.5 模型卡片

    https://developers.google.com/health-ai-developer-foundations/medgemma/model-card


我们还于近期在 Hugging Face 和 Vertex AI 平台同步发布了 MedASR,这是一款全新的自动化语音识别 (ASR) 开放模型,已针对医疗口述场景进行了微调。MedASR 的初始版本让开发者可以将医疗语音转换成文字,并可与 MedGemma 无缝整合以执行高级推理任务。


  • Hugging Face

    https://huggingface.co/google/medasr

  • Vertex AI

    https://console.cloud.google.com/vertex-ai/publishers/google/model-garden/medasr

  • MedASR

    https://developers.google.com/health-ai-developer-foundations/medasr/


MedGemma 1.5、MedASR 和包括 MedSigLIP 图像编码器在内的所有 HAI-DEF 模型仍可免费用于研究和商业用途,您可以通过 Hugging Face 下载,也可以借助 Vertex AI 对其进行训练和调整以满足云端可扩展应用的需求。

△ MedGemma 模型系列及其能力概述。

  • MedSigLIP 图像编码器

    https://developers.google.com/health-ai-developer-foundations/medsiglip

  • Hugging Face

    https://huggingface.co/collections/google/health-ai-developer-foundations-hai-def

  • Vertex AI 

    https://huggingface.co/collections/google/medgemma-release-680aade845f90bec6a3f60c4



MedGemma 挑战赛


我们希望鼓励开发者探索更多富有创意且具影响力的 MedGemma 模型应用场景,以推动医疗保健领域变革。为此,我们启动了由 Kaggle 主办的 MedGemma 挑战赛,这场黑客马拉松奖金高达 100,000 美元,并向所有开发者开放,让他们有机会基于 MedGemma 和 HAI-DEF 进行构建,以展示 AI 在医疗保健和生命科学领域的潜力。我们期待看到大家的构建成果!


  • MedGemma 挑战赛

    https://www.kaggle.com/competitions/med-gemma-impact-challenge/overview



医学影像应用场景的性能改进


MedGemma 的初始定位就是一款多模态模型,旨在应对医学的多模态特性。MedGemma 1 已支持解读二维医学影像,包括胸部 X 光片、皮肤科图像、眼底影像和组织病理学切片。


而目前,我们正在借助 MedGemma 1.5 扩展对更高维医学影像的支持,前期目标便是以三维立体方式展现 CT 图像和 MRI,以及全切片组织病理学影像。开发者在创建应用时,可以将多个切片 (CT 或 MRI) 或多个图块 (病理学) 连同任务指令一并输入模型。


  • CT 图像

    https://en.wikipedia.org/wiki/CT_scan

  • MRI

    https://en.wikipedia.org/wiki/Magnetic_resonance_imaging

  • 病理学影像

    https://en.wikipedia.org/wiki/Digital_pathology


内部基准测试数据表明,相较于 MedGemma 1,MedGemma 1.5 在疾病相关 CT 检查结果分类方面的基准绝对准确率平均提升了 3% (61% vs. 58%),在疾病相关 MRI 检查结果分类方面的基准绝对准确率则平均提升了 14% (65% vs. 51%)。除此之外,在一项涵盖组织病理学切片及相关检查结果的多样化内部基准测试中,根据仅含一份病理学切片的病例得出的 ROUGE-L 分数,MedGemma 1.5 预测结果的保真度较 MedGemma 1 提高了 0.47 (0.49 vs. 0.02),与任务专用 PolyPath 模型取得的分数 (0.498) 旗鼓相当。


  • ROUGE-L

    https://en.wikipedia.org/wiki/ROUGE_(metric)

  • PolyPath 模型

    https://www.modernpathology.org/article/S0893-3952(25)00184-X/fulltext


CT 基础模型则是我们之前用于生成 CT 嵌入向量的 API 工具,此次对高维的支持是其自然演进的产物。据我们所知,MedGemma 1.5 是首个公开发布的开放多模态大语言模型,既能解读高维医疗数据,同时又保留了对通用二维数据和文本的理解能力。虽然这些功能仍处于早期阶段且有待完善,但开发者将能根据自有数据微调 MedGemma 模型,以取得更亮眼的成效,并且我们也将持续改进 MedGemma 模型。我们已经发布了教程 Notebook,用于说明如何将这种高维图像功能用于 CT (Hugging FaceModel Garden) 和组织病理学 (Hugging FaceModel Garden)。

△ 展示了如何使用 MedGemma 1.5 4B 解读 CT 三维数据,以及经认证的胸部放射科医生对输出质量所做的点评。请注意,MedGemma 不能在未经开发者对其具体用例进行适当验证、调整和/或做出实质性修改的情况下直接使用。

  • CT 基础模型

    https://research.google/blog/taking-medical-imaging-embeddings-3d/

  • Hugging Face

    https://github.com/Google-Health/medgemma/blob/main/notebooks/high_dimensional_ct_hugging_face.ipynb

  • Model Garden

    https://github.com/Google-Health/medgemma/blob/main/notebooks/high_dimensional_ct_model_garden.ipynb

  • Hugging Face

    https://github.com/Google-Health/medgemma/blob/main/notebooks/high_dimensional_pathology_hugging_face.ipynb

  • Model Garden

    https://github.com/Google-Health/medgemma/blob/main/notebooks/high_dimensional_pathology_model_garden.ipynb


在其他形式的医学图像解读任务中,MedGemma 1.5 4B 模型的基准性能较 MedGemma 1 4B 也有显著提升:

  • 解剖结构定位: 在胸部 X 光片中定位解剖特征;Chest ImaGenome 基准测试结果表明,交并比提高了 35% (38% vs. 3%)。请参阅我们的解剖结构定位教程 Notebook

  • 纵向医学影像: 对胸部 X 光片进行的时间序列对比分析;MS-CXR-T 基准测试结果表明,整体准确率提高了 5% (66% vs. 61%)。请参阅下方图片示例,以及我们的纵向医学影像教程 Notebook

  • 医学图像解读: 针对胸部 X 光片、皮肤病学、组织病理学和眼科学的内部单幅图像基准测试表明,准确率提升了 3% (62% vs. 59%)。

  • 检验报告提取: 从医学检验报告中提取结构化数据 (检验类型、数值、单位);一项内部检验报告基准测试的结果表明,检索宏观 F1 分数提高了 18% (78% vs. 60%)。

    △ MedGemma 1.5 4B 增强了对医学影像的支持,其在通过胸部 X 光片解读高维图像、定位解剖特征和评估纵向疾病、解读通用医学图像,以及从医学检验报告中提取内容等方面的表现均优于 MedGemma 1 4B。

    △ 展示如何使用 MedGemma 1.5 4B 解读胸部 X 光片纵向成对图像,以及经认证的胸部放射科医生对输出质量所做的点评。请注意,MedGemma 不能在未经开发者对其具体用例进行适当验证、调整和/或做出实质性修改的情况下直接使用。

    • Chest ImaGenome

      https://physionet.org/content/chest-imagenome/1.0.0/

    • 交并比

      https://en.wikipedia.org/wiki/Jaccard_index

    • 解剖结构定位教程 Notebook

      https://github.com/Google-Health/medgemma/blob/main/notebooks/cxr_longitudinal_comparison_with_hugging_face.ipynb

    • MS-CXR-T

      https://physionet.org/content/ms-cxr-t/1.0.0/

    • 纵向医学影像教程 Notebook

      https://github.com/Google-Health/medgemma/blob/main/notebooks/cxr_longitudinal_comparison_with_hugging_face.ipynb


    此外,部署于 Google Cloud 的 MedGemma 应用现已全方位支持 DICOM,这使得调整 MedGemma 以满足医学影像应用之需变得更加容易。


    • Google Cloud

      https://console.cloud.google.com/vertex-ai/publishers/google/model-garden/medgemma

    • 全方位支持 DICOM

      https://cloud.google.com/blog/topics/developers-practitioners/integrating-medgemma-into-clinical-workflows-just-got-easier?e=0



    文本功能改进


    除了改进对医疗图像的支持,我们还努力提升了 MedGemma 的基础医学文本处理能力。在引入全新训练数据集和训练技术后,MedGemma 1.5 4B 在 MedQA 方面的表现较 MedGemma 1 4B 提升了 5% (69% vs. 64%),在针对 EHR 问题 (EHRQA) 方面更是提升了 22% (90% vs. 68%)。

    △ 与 MedGemma 1 4B 相比,MedGemma 1.5 4B 在基于文字的任务领域有所改进,包括在医学推理 (MedQA) 和电子健康档案信息 (EHRQA) 检索方面的表现。

    • MedQA

      https://arxiv.org/abs/2009.13081

    • EHRQA

      https://arxiv.org/abs/2507.05201



    MedASR: 面向医学自动化语音识别的开放模型


    虽然文本目前仍是大语言模型的主要交互方式,但口头交流在医疗保健的多个方面仍然至关重要,其中包括处理医疗口述,以及医患之间的实时对话等。除此之外,语音也提供了一种与语言模型交互的更自然的方式。


    我们研发了用于医疗场景语音转译的 MedASR 语音转文本模型,以支持需要熟悉医疗保健领域专业词汇的应用场景。MedASR 既可用于转录医疗口述,还可作为一种更自然的交互方式,为 MedGemma 生成输入指令。在对比 MedASR 与通用 ASR 模型 Whisper large-v3 的性能后,我们发现 MedASR 在处理胸部 X 光片语音输入内容方面的错误率降低了 58% (单词错误率 (WER): 5.2% vs. 12.5%),在涉及多种专业和多位发言人的内部医疗口述基准测试中,错误率更是减少了 82% (WER: 5.2% vs. 28.2%)。我们发布了一系列教程 Notebook,希望可以帮助开发者创建和适配他们的自有系统,以将 MedASR 的音频理解能力与 MedGemma 1.5 的临床推理能力完美结合。您可以参阅 MedASR 模型卡片了解详情。

      △ MedASR 既可用于转录医疗口述 (上图),也可用于为 MedGemma 生成输入指令 (下图)。

      • MedASR

        https://developers.google.com/health-ai-developer-foundations/medasr

      • Whisper large-v3

        https://huggingface.co/openai/whisper-large-v3

      • 胸部 X 光片语音输入内容

        https://physionet.org/content/egd-cxr/1.0.0/

      • WER

        https://en.wikipedia.org/wiki/Word_error_rate

      • 教程 Notebook

        https://github.com/Google-Health/medasr/tree/main/notebooks

      • MedASR 模型卡片

        https://developers.google.com/health-ai-developer-foundations/medasr/model-card



      开发者如何使用 MedGemma


      我们看到世界各地的医疗健康科技初创公司与开发者正积极利用 MedGemma,以加速推进面向各种用例和应用场景的研究与产品开发进程。


      例如,Qmed Asia 已将 MedGemma 整合至 askCPG,为马来西亚 150 多项临床实践指南提供了一个交互式的对话界面。据马来西亚卫生部称,此对话式界面显著提升了临床指南在日常决策支持中的实用性,并且通过 MedGemma 提供的多模态医学图像扩展程序在试点部署中颇受欢迎。


      • Qmed Asia

        https://qmed.asia/

      • askCPG

        https://cpg.qmed.ai/

      • 马来西亚卫生部

        https://mymahtas.moh.gov.my/


      此外,台湾地区的健康保险署已将 MedGemma 引入肺癌手术的术前评估体系。他们使用 MedGemma 从 30,000 余份病理学报告和非结构化数据中提取关键数据,继而执行统计分析,以评估患者的术前状况。这项工作旨在为政策决策提供参考信息,以优化手术切除的决策流程,从而改善患者预后结果。


      自发布以来,MedGemma 已在医学 AI 研究中被广泛引用,作为理解医学文字协助制定多学科联合会诊解读乳腺 X 光片报告及其他临床应用场景的基础模型,并且性能表现优于其他模型。


      • 广泛引用

        https://scholar.google.com/scholar?cites=15997809831302344826&as_sdt=2005&sciodt=0,5&hl=en

      • 理解医学文字

        https://arxiv.org/abs/2507.03152

      • 协助制定多学科联合会诊

        https://static1.squarespace.com/static/59d5ac1780bd5ef9c396eda6/t/689b83f87336b643e181ecec/1755022328956/97_camera_ready+-+Jaesik+Kim.pdf#page=10.36

      • 解读乳腺 X 光片报告

        https://arxiv.org/abs/2508.09225



      开始使用


      您可以通过 Hugging Face 合集或 Google Cloud 的 Vertex AI 获取 MedGemma 全系列模型。MedASR 当前已在 Hugging Face 和 Vertex AI 平台上线。如果您对构建下一代医疗 AI 应用充满想法,欢迎参与 MedGemma 挑战赛


      • Hugging Face 合集

        https://huggingface.co/collections/google/medgemma-release-680aade845f90bec6a3f60c4

      • Google Cloud 的 Vertex AI

        https://console.cloud.google.com/vertex-ai/publishers/google/model-garden/medgemma

      • Hugging Face

        https://huggingface.co/google/medasr

      • Vertex AI

        https://console.cloud.google.com/vertex-ai/publishers/google/model-garden/medasr

      • MedGemma 挑战赛

        https://www.kaggle.com/competitions/med-gemma-impact-challenge/overview


      欢迎浏览我们的 MedGemma GitHub 代码库,探索扩展系列教程,其中包括有关运行推理和基于 LoRA 的监督式微调的教程,以及有关强化学习的全新教程,这种调整方法对于学习复杂任务尤为有效,并且不会影响现有模型功能。


      • MedGemma GitHub 代码库

        https://github.com/Google-Health/medgemma/tree/main/notebooks

      • 强化学习的全新教程

        https://github.com/Google-Health/medgemma/blob/main/notebooks/reinforcement_learning_with_hugging_face.ipynb


      您可以访问 HAI-DEF 网站,获取有关 MedGemma 1.5 和其他 Health AI Developer Foundations (健康领域的 AI 开发者基础) 模型的资源,也可以订阅我们的简报。欢迎前往 HAI-DEF 论坛获取技术支持。


      • HAI-DEF 网站

        http://goo.gle/hai-def

      • 简报

        https://services.google.com/fb/forms/hai-def-news/

      • HAI-DEF 论坛

        https://discuss.ai.google.dev/c/hai-def


      我们非常期待社区成员能够利用这些新模型构建出精彩应用,并且欢迎大家提供反馈意见

      △ 此表总结了模型功能,有助于您了解哪款模型最适合您的用例。

      • 反馈意见

        https://services.google.com/fb/forms/hai-def-feedback/


      数据集说明


      我们根据多个公开和私有的去标识化数据集对模型进行了训练和评估。Google 及其合作伙伴均采用经过严格匿名化或去识别化的数据集,以保护个人研究参与者和患者的隐私。


      免责声明


      MedGemma 与 MedASR 等 HAI-DEF 系列模型作为一个研发起点,旨在助力开发者高效构建处理医疗文本与影像的下游应用。HAI-DEF 不能在未经开发者对其具体用例进行适当验证、调整和/或做出实质性修改的情况下直接使用。这些模型生成的输出不能直接用于提供临床诊断、患者管理决策、治疗建议,或任何其他临床实践应用。此处报告的性能基准仅用于突出显示基准功能,并不意味着 MedGemma 在任何特定医疗应用中都安全可靠。可能存在此处未有列出的模型输出错误。所有模型输出均应被视作初步结果,并且需要通过成熟的研发方法进行独立验证、临床关联和深入调查。如需了解详细信息,请参阅使用条款禁止使用政策

      53AI,企业落地大模型首选服务商

      产品:场景落地咨询+大模型应用平台+行业解决方案

      承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业

      联系我们

      售前咨询
      186 6662 7370
      预约演示
      185 8882 0121

      微信扫码

      添加专属顾问

      回到顶部

      加载中...

      扫码咨询

      扫码登录
      登录即表示您同意《53AI网站服务协议》
      服务协议

      欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。

      在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。

      一、 定义

      本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。

      会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。

      知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。

      二、 账号注册与登录

      登录方式:本网站支持以下登录方式,您可根据实际情况选择:

      微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。

      手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。

      账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。

      实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。

      未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。

      三、 服务内容与规范

      知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。

      服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。

      禁止行为:您在使用服务时不得实施以下行为:

      利用技术手段批量爬取、下载、转存知识库内容;

      将知识库内容用于商业目的或未经授权地向第三方传播;

      干扰本网站正常运行或侵犯其他用户合法权益;

      发布违法违规信息或从事违反公序良俗的活动。

      四、 知识产权声明

      权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。

      有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。

      侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。

      五、 个人信息保护

      我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。

      您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。

      您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。

      六、 免责声明

      内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。

      不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。

      第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。

      七、 违约责任

      如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。

      如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。

      八、 法律适用与争议解决

      本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。

      因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。

      九、 其他

      本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。

      本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。

      我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。


      已查阅