medRxiv 预印本· Takata, H., Harada, Y., Inoue, H., Uneda, K., Yoshino, T., Nogami, T. ·· 19 小时前AI 评分22
KampoBench:面向传统汉方医学大语言模型的医师审核咨询基准
From examinations to consultations: a physician-reviewed Japanese benchmark for large language models in traditional Kampo medicine
AI 导读
日本研究者发布KampoBench,包含74个汉方医学咨询场景和310条对话专属评分标准,由汉方专科医师修订,评测3家厂商的10个当前模型。最佳模型得分74.8-86.3%,医师修订参考答案为87.9-92.4%;模型在"建议就医"类标准上最可靠(83.6%),在需将已知生药风险与具体病例关联的标准上最差(17.5%)。
来源:medRxiv 预印本 · medrxiv.org