回到时间线

7月8日周三20:22Tools模型发布API 与价格MCP 与 Skills模型发布指南

promptfoo 0.121.18 发布:新增 Grok 4.3、Claude Sonnet 5、GPT-5.6 preview 等模型支援

Decision Brief

变化promptfoo 0.121.18 新增多个模型支援、Node.js 20 支援截止活动、per-test 重复选项、以及多项错误修复。
为什么重要使用 promptfoo 进行评估或红队测试的开发者,现在可以直接整合 Grok 4.3、Claude Sonnet 5、GPT-5.6 等最新模型,并获得 YAML 错误位置提示与 WebSocket 子协定支援。
谁该关注AI coding 工具用户、Agent 开发者
受影响技术栈MCPClaudeOpenAIGemini
建议动作升级 MCP 到 0.121.18
来源可信度 · 官方发布 / 官方 blog / 官方 repo

promptfoo 0.121.18 于 2026-07-07 发布,主要新增功能包括:Node.js 20 支援截止活动(#9862)、每个测试的重复选项(#9781)、WebSocket 子协定显示(#9947)、以及 YAML 来源位置提示于 prompt 参考错误(#9940)。在模型提供者方面,新增 Bedrock 对 Grok 4.3、GLM、MiniMax、Kimi、Nemotron、Gemma、Palmyra 的支援(#9788),以及 Claude Sonnet 5 跨 Anthropic、Bedrock、Vertex 和 Azure 的支援(#9924),GPT-5.6 preview 支援(#9893),Moonshot (Kimi) 提供者(#9672),并扩展 Google 模型支援(Nano Banana 2 Lite、GA 影像别名、gemini-pro-latest)(#9923)。 错误修复涵盖多个面向:修正 is-sql 对 SELECT DISTINCT 的误判、is-xml 拒绝非 well-formed XML、is-refusal 在输出缺失时尊重 inverse、CSV 解析保留引号内逗号与零门槛值、以及 Azure 提供者的成本报告与 token 刷新等。此外,也修正了 Mistral、Claude、xAI 等模型定价,并更新多项依赖套件。 使用 promptfoo 进行 LLM 评估的开发者,可直接整合这些新模型进行测试,而红队测试人员则可受益于远端实体化 MCP 工具呼叫、已弃用提示注入 ID 的清理、以及 Sharp 0.35 支援。整体上,此版本提升了评估的准确性与开发体验。

摘要依据:官方/RSS 来源详摘依据上方标注的来源范围整理,内容以原文为准。

来源

  • promptfoo(评测 / 红队)

    LLM eval and red-teaming toolkit — releases covering safety, jailbreak, and guardrail testing.

  • promptfoo(评测 / 红队)

相关情报

留言

登入后即可留言,和其他 builder 交换实测心得。

还没有留言,抢头香。