$ loading_
帮助开发团队实时评估AI回复质量、行为模式与测试结果。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"AI Evaluator MCP Server" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请用这个 MCP 工具对以下 AI 回复进行评估,重点检查事实准确性、指令遵循性和安全性,并输出评分与改进建议:{{AI回复内容}}返回结构化评估结果,包括各项得分、问题说明与优化建议。
基于 Petri 风格行为评估模式,为客服 AI 设计一组测试用例,覆盖拒答、澄清、多轮一致性和风险控制,并说明每项的判定标准。
输出可执行的行为测试用例清单及对应评估标准。
把这个 MCP 工具接入我的 AI 开发流程,对每次模型输出自动执行 Inspect AI 评测,并汇总失败项、波动趋势和需要优先修复的问题。
生成持续评测报告,展示失败样本、趋势变化和修复优先级。
通过标准化 MCP 接口运行大模型评测、实验与自定义评估器。
用于提示词与 RAG 流程评测,支持在 MCP 客户端发起并托管执行评估任务
通过自动化浏览器测试与诊断,验证 AI 生成代码的可用性并收集证据。
自动评估网页应用的功能、性能与可用性,帮助快速发现问题
帮助团队评估 AI 安全分类器在拆分、混淆与多智能体攻击下的鲁棒性。
运行测试与静态检查并汇总错误,帮助开发者高效迭代调试并减少上下文噪音。