回到时间线

7月22日周三00:23ResearchAPI 与价格AgentInfra / 成本API 与价格指南

亚马逊 Nova 模型通过自蒸馏推理提升 SFT 效果并缓解灾难性遗忘

决策简报

Brief
发生了什么
AWS 提出自蒸馏推理(SDR)方法,为缺少推理链的 SFT 数据集用模型自身生成推理轨迹,同时提升目标任务性能和保持通用能力。
为什么重要
GitHub 相关变化会影响地区可用性、合规成本和供应商风险。
影响谁
GitHub
建议动作
升级或复核变更版本
地区可用性
暂未验证地区可用性差异。

关键事实

  • AWS 提出自蒸馏推理(SDR)方法,为缺少推理链的 SFT 数据集用模型自身生成推理轨迹,同时提升目标任务性能和保持通用能力。 [src-aws-ml]
  • 使用 Amazon Nova 进行微调的开发者无需人工标注就能注入推理能力,同时有效缓解灾难性遗忘,是一种成本低、效果优于模型融合的正则化方法。 [src-aws-ml]
高信心100% 主张有证据

由事件证据自动生成。

AWS 在官方博客中介绍了一种名为自蒸馏推理(Self-Distilled Reasoning,SDR)的方法,用于 Amazon Nova 2 模型的监督微调(SFT)。核心问题在于,当 SFT 数据集缺少推理轨迹(chain-of-thought)时,模型在推理模式下会出现推理能力抑制,甚至性能退化。SDR 分三步:首先用基座推理模型(如 Amazon Nova 2 Lite)为每个训练样本生成推理轨迹,然后将这些轨迹附加到原始输出上构成增强数据集,最后在推理模式下对模型进行微调,对推理 token 和输出 token 都施加监督信号。 实验表明,SDR 相比纯粹的 SFT 能显著缓解灾难性遗忘。例如,在数学基准上,纯 SFT 使性能从 70% 下降到 6%,而 SDR 几乎完全恢复到 68%-70%,同时目标任务性能平均提升 6.5% 以上。与模型融合(model merging)相比,SDR 无需后处理插值,也不依赖外部教师模型,且能更有效地保持目标性能和通用能力。对使用 Amazon Nova 定制功能的开发者来说,这意味着无需人工标注就能为现有 SFT 数据集注入推理能力,同时改善模型在工具调用、长文档摘要等任务上的表现。

摘要依据:已读全文详摘依据上方标注的来源范围整理,内容以原文为准。

来源

相关情报

留言

登入后即可留言,和其他 builder 交换实测心得。

还没有留言,抢头香。