跳到正文
热点事件持续更新

六种通用大语言模型临床推理能力评估

1 篇报道1 个报道来源12 小时前更新

先了解这件事

AI 综述

2026年10月1日,梅斯医学 MedSci 报道了《协和医学杂志》发表的一项研究,对6种通用大语言模型的临床推理输出在医学教育中的适用性进行评估与比较。该研究基于BMJ“Endgames”专栏的74例临床病例开展基准测试,比较了ChatGPT-4、ChatGPT-4o、DeepSeek-R1、Gemini-2.0、Kimi-k1.5和DeepSeek-V3的临床推理能力。结果显示,6种模型的诊断准确率为62.2%~78.4%,组间差异无统计学意义。

AI 根据报道生成 · 11 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. 梅斯医学 MedSci
    协和医学杂志:6种通用大语言模型临床推理输出在医学教育中的适用性评估与比较

    一项基于BMJ“Endgames”专栏74例临床病例的基准测试比较了ChatGPT-4、ChatGPT-4o、DeepSeek-R1、Gemini-2.0、Kimi-k1.5和DeepSeek-V3的临床推理能力,6种模型诊断准确率为62.2%~78.4%,组间差异无统计学意义。

本事件热度走势

当前热度 7·可比范围峰值 10(10月1日 16:00)·近 24 小时可比范围变化 –

02.557.51010月1日16:0010月1日20:0010月1日23:0010月2日03:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。