$ loading_
用于提示词与 RAG 流程评测,支持在 MCP 客户端发起并托管执行评估任务
复制安装指令,让 AI 自动完成配置 · 推荐新手
"Eval_MCP" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请使用 Eval_MCP 对两个客服提示词版本做评测,比较它们在准确率、稳定性和回答风格一致性上的表现,并给出推荐版本。
返回评测结果对比、关键指标得分,以及推荐采用的提示词版本。
请使用 Eval_MCP 评估我们的 RAG 问答流程,重点检查检索命中率、答案相关性和幻觉情况,并总结主要问题。
输出 RAG 流程的评测报告,包含检索与生成表现、问题归因和优化建议。
请指导我在 Claude Desktop 或 Cursor 中通过 Eval_MCP 注册、创建 API Key,并批量运行一组提示词评测任务。
给出清晰的操作步骤或调用流程,帮助用户完成配置并启动批量评测。
通过多模型与可视化工具,用自然语言完成软件开发、调试与成本管理。
通过标准化 MCP 接口运行大模型评测、实验与自定义评估器。
提供查询规范化、知识检索与RAG提示构建的生产级MCP工具服务
通过 MCP 为 AI 助手提供可插拔的知识检索与推理能力调用接口
为 AI 客户端提供学习型 MCP 服务,支持工具、资源、提示与本地存储管理。
演示 MCP 工具、资源与提示词,用于计算、查时、记笔记和代码审查。