$ loading_
通过沙箱执行与大模型评分,自动评估代码功能、质量与结果表现。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"mcp-eval-harness" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请用 mcp-eval-harness 在沙箱中运行这段 Python 代码,使用给定测试用例检查正确性、边界情况和运行结果,并基于代码可读性、鲁棒性与效率给出评分和改进建议。
返回测试结果、通过/失败情况、质量评分,以及具体优化建议。
请用 mcp-eval-harness 分别执行这两个实现相同功能的代码版本,比较它们的输出正确性、异常处理和代码质量,并给出哪一个更适合上线的结论。
输出两版代码的对比评测、评分明细和推荐结论。
请用 mcp-eval-harness 评估这段由大模型生成的代码:先在沙箱中运行,再根据功能完成度、稳定性、安全风险和可维护性打分,并指出潜在问题。
生成可执行验证结果、风险点评和综合质量评分报告。
用于提示词与 RAG 流程评测,支持在 MCP 客户端发起并托管执行评估任务
为AI助手提供安全沙箱命令执行、长任务管理与大文件传输能力
用于验证 MCP 服务响应是否正常,返回唯一标识字符串供开发与测试使用。
运行测试与静态检查并汇总错误,帮助开发者高效迭代调试并减少上下文噪音。
安全执行 Python 代码,并结合 AI 与 MCP 工具完成分析和自动化任务
自动评估网页应用的功能、性能与可用性,帮助快速发现问题