promptfoo 0.121.18 发布:新增 Grok 4.3、Claude Sonnet 5、GPT-5.6 preview 等模型支援
Decision Brief
promptfoo 0.121.18 于 2026-07-07 发布,主要新增功能包括:Node.js 20 支援截止活动(#9862)、每个测试的重复选项(#9781)、WebSocket 子协定显示(#9947)、以及 YAML 来源位置提示于 prompt 参考错误(#9940)。在模型提供者方面,新增 Bedrock 对 Grok 4.3、GLM、MiniMax、Kimi、Nemotron、Gemma、Palmyra 的支援(#9788),以及 Claude Sonnet 5 跨 Anthropic、Bedrock、Vertex 和 Azure 的支援(#9924),GPT-5.6 preview 支援(#9893),Moonshot (Kimi) 提供者(#9672),并扩展 Google 模型支援(Nano Banana 2 Lite、GA 影像别名、gemini-pro-latest)(#9923)。 错误修复涵盖多个面向:修正 is-sql 对 SELECT DISTINCT 的误判、is-xml 拒绝非 well-formed XML、is-refusal 在输出缺失时尊重 inverse、CSV 解析保留引号内逗号与零门槛值、以及 Azure 提供者的成本报告与 token 刷新等。此外,也修正了 Mistral、Claude、xAI 等模型定价,并更新多项依赖套件。 使用 promptfoo 进行 LLM 评估的开发者,可直接整合这些新模型进行测试,而红队测试人员则可受益于远端实体化 MCP 工具呼叫、已弃用提示注入 ID 的清理、以及 Sharp 0.35 支援。整体上,此版本提升了评估的准确性与开发体验。
Sources
- promptfoo(评测 / 红队)
LLM eval and red-teaming toolkit — releases covering safety, jailbreak, and guardrail testing.
- promptfoo(评测 / 红队)
留言
登入后即可留言,和其他 builder 交换实测心得。
还没有留言,抢头香。