$ loading_
作为 MCP 服务器与代理压缩提示词和回复,降低大模型令牌成本。
复制安装指令,让 AI 自动完成配置 · 推荐新手
请帮我安装 askskill 上的 "llmtrim" MCP 服务: 执行:claude mcp add 'io-github-fkiene-llmtrim' -- npx -y @llmtrim/cli
开发者在通过 MCP 串联模型与工具时,可用它压缩提示词、工具输出和回复,减少整体 token 消耗。这样更适合多轮、长上下文的工作流。
当团队需要通过代理层转发大模型请求时,它可在中间环节压缩输入与输出内容。这样有助于降低调用成本并减少冗长上下文。
它是一个 MCP server 和 proxy,用来压缩大模型提示词、工具输出以及模型回复,以降低 token 成本。
根据描述,它可压缩 prompts、tool output 和 replies。也就是模型调用前后的主要文本内容都在其覆盖范围内。
给定素材没有提供安装步骤或依赖要求。具体配置方式见源码仓库。
通过测量、压缩、缓存与裁剪 token,显著降低 AI API 成本且无需改提示词。
压缩长文本上下文并按标题标签检索,显著降低大模型 token 消耗。
压缩 MCP 工具 schema,显著降低 token 消耗并保持完整语义与确定性。
将多个 MCP 服务聚合为单一入口,统一供大模型客户端调用。
为多后端 MCP 服务提供代理与按需加载,降低工具定义带来的令牌消耗。
通过 LiteLLM 代理统一调用大模型、向量、绘图与管理能力。