RadLE 2.0 基准测试:AI 读片模型过度自信,人类放射科医生仍领先
决策简报
Brief- 发生了什么
- RadLE 2.0 基准测试显示,AI 模型在放射诊断中常以高置信度给出错误答案,人类医生综合得分远超最佳 AI。
- 为什么重要
- Claude 相关结果会影响评测基准、技术路线和后续产品判断。
- 影响谁
- Claude · Gemini
- 建议动作
- 升级或复核变更版本
- 地区可用性
- 暂未验证地区可用性差异。
关键事实
- RadLE 2.0 基准测试显示,AI 模型在放射诊断中常以高置信度给出错误答案,人类医生综合得分远超最佳 AI。 [src-decoder]
- 对于开发医疗 AI 的团队,高置信度误诊比直接说“不知道”更危险,这意味着模型校准和不确定性输出比单纯追求准确率更重要。 [src-decoder]
由事件证据自动生成。
RadLE 2.0 由印度 Ashoka 大学 CRASH 实验室开发,测试 AI 模型是否能在不确定时将诊断交给人类。测试包含 200 个病例,要求模型在 0-4 置信度上评分并允许回答“不知道”。人类放射科医生总分 988.7,最佳 AI 模型仅 758。评分机制奖励诚实、惩罚过度自信:高置信度答对得满分,高置信度答错扣分,说“不知道”不得分也不扣分。 Claude Fable 5 在主要指标上表现最佳,Gemini 3 Pro 原始准确率最高,Meta Muse Spark 1.1 最擅长识别何时应转交人类。Grok 4.5 幻觉率显著上升。许多开放权重模型和医学专用模型试图回答每个病例却频繁错误,且置信度很高,拉大了与人类医生的差距。研究人员指出,若模型更多选择沉默而非猜测,得分会更高。 对于开发医学影像 AI 的团队,这项测试意味着模型需要内置不确定性感知能力,不能仅优化准确率。对于使用通用聊天机器人诊断的普通用户,过度自信的错误回答可能带来医疗风险。研究团队计划持续扩展 RadLE 2.0 并发布更全面的科学论文。
摘要依据:已读全文详摘依据上方标注的来源范围整理,内容以原文为准。
来源
- The Decoder:AI News
- The Decoder:AI News
留言
登入后即可留言,和其他 builder 交换实测心得。
还没有留言,抢头香。