$ loading_
审计大模型评审结果,发现漂移、偏差并对比人工一致性。
复制安装指令,让 AI 自动完成配置 · 推荐新手
"judge-audit-mcp" 暂无可直接复制的安装信息,请查看页面文档或源码仓库。
请审计这组 LLM-as-judge 评测运行结果,比较不同批次之间的评分变化,指出是否存在 judge drift,并总结最明显的漂移样本。
输出跨运行的评分差异分析,并标出可能存在漂移的样本或批次。
请基于受控探针审计这个评审模型的偏差,分析它是否对特定提示形式、答案长度或表达方式表现出系统性偏向。
输出偏差测量结果,说明可能的系统性偏向及其表现方式。
请将这组 LLM 评审结果与人工标注进行一致性对比,指出高分歧样本,并总结模型评审与人工评审的主要差异。
输出模型与人工评审的一致性对比,以及分歧较大的案例清单。
研究员或开发者在多轮评测中使用它审计 LLM 评审器,检查不同运行之间是否出现评分漂移。这样可以更早发现评测标准不稳定的问题。
当团队担心评审模型对特定回答形式存在偏向时,可以用受控探针测量偏差。它适合用于分析评分是否受非目标因素影响。
在构建自动化评测流程时,团队可以对比 LLM 评审与人工评分的一致性。这样能帮助判断模型评审是否足够接近人工标准。
这是一个用于审计 LLM-as-judge 评测的 MCP 服务器。它可以检测跨运行的 judge drift、通过受控探针衡量偏差,并比较模型评审与人工评审的一致性。
从给定描述看,它主要关注三类问题:评审漂移、评审偏差,以及模型评审和人工评分的一致性。未提供更多细节时,具体指标或方法见源码仓库。
当前素材只说明它是一个 MCP 服务器,没有提供安装步骤、依赖环境或密钥要求。相关细节见源码仓库。
帮助开发者审查代码中的安全、质量与性能问题并给出改进建议
用于审计金融数据质量并评估AI推理表现、偏差与业务指标的MCP工具
在 MCP 客户端中审核应用商店元数据并优化关键词字段。
审查合同责任条款是否符合公司标准,并基于证据给出可信结论或弃权。
审计其他 MCP 服务器的一致性并生成评分与 Markdown 报告
帮助用户对 AI 应用或模型配置进行自检审计,发现风险与改进点。