Back to timeline

Wed, July 820:22ToolsModel releasesAPI & pricingMCP & SkillsModel releases guide

promptfoo 0.121.18 发布:新增 Grok 4.3、Claude Sonnet 5、GPT-5.6 preview 等模型支援

Decision Brief

What changedpromptfoo 0.121.18 新增多个模型支援、Node.js 20 支援截止活动、per-test 重复选项、以及多项错误修复。
Why it matters使用 promptfoo 进行评估或红队测试的开发者,现在可以直接整合 Grok 4.3、Claude Sonnet 5、GPT-5.6 等最新模型,并获得 YAML 错误位置提示与 WebSocket 子协定支援。
Who should careAI coding tool users, Agent builders
Affected stackMCPClaudeOpenAIGemini
Builder actionUpgrade MCP to 0.121.18
Source confidenceHigh · Official release / blog / repo

promptfoo 0.121.18 于 2026-07-07 发布,主要新增功能包括:Node.js 20 支援截止活动(#9862)、每个测试的重复选项(#9781)、WebSocket 子协定显示(#9947)、以及 YAML 来源位置提示于 prompt 参考错误(#9940)。在模型提供者方面,新增 Bedrock 对 Grok 4.3、GLM、MiniMax、Kimi、Nemotron、Gemma、Palmyra 的支援(#9788),以及 Claude Sonnet 5 跨 Anthropic、Bedrock、Vertex 和 Azure 的支援(#9924),GPT-5.6 preview 支援(#9893),Moonshot (Kimi) 提供者(#9672),并扩展 Google 模型支援(Nano Banana 2 Lite、GA 影像别名、gemini-pro-latest)(#9923)。 错误修复涵盖多个面向:修正 is-sql 对 SELECT DISTINCT 的误判、is-xml 拒绝非 well-formed XML、is-refusal 在输出缺失时尊重 inverse、CSV 解析保留引号内逗号与零门槛值、以及 Azure 提供者的成本报告与 token 刷新等。此外,也修正了 Mistral、Claude、xAI 等模型定价,并更新多项依赖套件。 使用 promptfoo 进行 LLM 评估的开发者,可直接整合这些新模型进行测试,而红队测试人员则可受益于远端实体化 MCP 工具呼叫、已弃用提示注入 ID 的清理、以及 Sharp 0.35 支援。整体上,此版本提升了评估的准确性与开发体验。

Summary basis: official / RSS sourceCompiled from the source scope noted above; the original remains authoritative.

Sources

  • promptfoo(评测 / 红队)

    LLM eval and red-teaming toolkit — releases covering safety, jailbreak, and guardrail testing.

  • promptfoo(评测 / 红队)

Related intel

留言

登入后即可留言,和其他 builder 交换实测心得。

还没有留言,抢头香。