梅斯医学 MedSci· 全科医学新前沿·· 13 小时前AI 评分22
协和医学杂志:6种通用大语言模型临床推理输出在医学教育中的适用性评估与比较
【协和医学杂志】通用大语言模型临床推理输出在医学教育中的适用性评估与比较
AI 导读
一项基于BMJ“Endgames”专栏74例临床病例的基准测试比较了ChatGPT-4、ChatGPT-4o、DeepSeek-R1、Gemini-2.0、Kimi-k1.5和DeepSeek-V3的临床推理能力,6种模型诊断准确率为62.2%~78.4%,组间差异无统计学意义。
来源:梅斯医学 MedSci · medsci.cn