回到时间线

7月19日周日15:35Research开源模型机器人与具身研究与论文开源模型指南

RadLE 2.0 基准测试:AI 读片模型过度自信,人类放射科医生仍领先

决策简报

Brief
发生了什么
RadLE 2.0 基准测试显示,AI 模型在放射诊断中常以高置信度给出错误答案,人类医生综合得分远超最佳 AI。
为什么重要
Claude 相关结果会影响评测基准、技术路线和后续产品判断。
影响谁
Claude · Gemini
建议动作
升级或复核变更版本
地区可用性
暂未验证地区可用性差异。

关键事实

  • RadLE 2.0 基准测试显示,AI 模型在放射诊断中常以高置信度给出错误答案,人类医生综合得分远超最佳 AI。 [src-decoder]
  • 对于开发医疗 AI 的团队,高置信度误诊比直接说“不知道”更危险,这意味着模型校准和不确定性输出比单纯追求准确率更重要。 [src-decoder]
高信心100% 主张有证据

由事件证据自动生成。

RadLE 2.0 由印度 Ashoka 大学 CRASH 实验室开发,测试 AI 模型是否能在不确定时将诊断交给人类。测试包含 200 个病例,要求模型在 0-4 置信度上评分并允许回答“不知道”。人类放射科医生总分 988.7,最佳 AI 模型仅 758。评分机制奖励诚实、惩罚过度自信:高置信度答对得满分,高置信度答错扣分,说“不知道”不得分也不扣分。 Claude Fable 5 在主要指标上表现最佳,Gemini 3 Pro 原始准确率最高,Meta Muse Spark 1.1 最擅长识别何时应转交人类。Grok 4.5 幻觉率显著上升。许多开放权重模型和医学专用模型试图回答每个病例却频繁错误,且置信度很高,拉大了与人类医生的差距。研究人员指出,若模型更多选择沉默而非猜测,得分会更高。 对于开发医学影像 AI 的团队,这项测试意味着模型需要内置不确定性感知能力,不能仅优化准确率。对于使用通用聊天机器人诊断的普通用户,过度自信的错误回答可能带来医疗风险。研究团队计划持续扩展 RadLE 2.0 并发布更全面的科学论文。

摘要依据:已读全文详摘依据上方标注的来源范围整理,内容以原文为准。

来源

相关情报

留言

登入后即可留言,和其他 builder 交换实测心得。

还没有留言,抢头香。