$ loading_
通过标准化 MCP 接口运行大模型评测、实验与自定义评估器。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"Patronus MCP Server" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请通过 Patronus MCP Server 对两个客服提示词版本做大模型评测,比较回答准确性、幻觉率和语气一致性,并输出评分表与结论。
返回对比评测结果,包括各项指标分数、优劣分析和推荐版本。
请通过 Patronus MCP Server 对这组 RAG 问答样本运行批量实验,测试不同检索参数对答案质量的影响,并汇总结果。
输出实验配置、各方案表现对比,以及适合采用的参数建议。
请通过 Patronus MCP Server 创建一个自定义评估器,用来检查招聘助手回复是否存在歧视性表达,并说明评估规则与示例结果。
返回自定义评估器定义、判定标准,以及示例输入的评测结果。
用于提示词与 RAG 流程评测,支持在 MCP 客户端发起并托管执行评估任务
通过多模型与可视化工具,用自然语言完成软件开发、调试与成本管理。
帮助开发团队实时评估AI回复质量、行为模式与测试结果。
在多家大模型与 MCP 服务间智能路由请求,并兼顾本地隐私记忆与嵌入处理。
用于全面测试 MCP 协议能力,帮助开发者构建和验证客户端。
通过 MCP 访问和管理 Langfuse 提示词,提升大模型提示工程效率。