提示词压缩 在线减少Token节省LLM成本
去除提示词中的废话和模板化内容,节省15-40%的Token用量,附压缩前后对比,适合降低LLM API调用成本等场景。
更新于 2026-08-16
相关工具
功能特性
- 四级规则引擎:删除填充词、剥离套话与开场白、清除空洞修饰词、合并重复指令
- js-tiktoken(cl100k_base)实时统计 Token,中文按经验估算,输入即见节省效果
- 三档压缩强度:轻度只删礼貌填充,标准再删套话与修饰词,激进额外合并重复指令
- 被删片段清单支持逐条恢复:取消勾选即可把片段放回输出,或一键全部还原
- 节省统计一目了然:压缩前后 Token 数、节省 Token、节省百分比、字符数与行数
- 中英双语规则库:英文与中文的填充词、套话、修饰词均可识别
- 诚实设计:基于规则的压缩可能丢失细微语气,界面会提示重要提示词请先核对
- 一键复制结果,或把压缩后的提示词保存为 .txt 文件备用
- 支持拖拽或打开本地 .txt/.md 提示词文件直接编辑
使用方法
- 1把提示词粘贴到左侧面板,输入即压缩,无需点击任何按钮。
- 2从顶部选择压缩强度:日常提示词先用标准,轻度适合轻量去水,激进追求最大节省。
- 3查看右侧统计卡:Token 前后对比、节省 Token 数与节省百分比实时更新。
- 4打开「被删片段」列表,取消勾选任何片段即可保留,输出会即时重建。
- 5点击「全部恢复」可还原所有片段;点击复制或保存按钮把压缩结果导出为 .txt 文件。
- 6教学场景:部署前压缩长 system prompt,提示词越短,每次 API 调用的成本越低,成千上万次调用积少成多。
- 7教学场景:调用 API 前先把对话历史过一遍压缩器,把更多上下文塞进模型的窗口。
- 8教学场景:把啰嗦的需求说明压成简洁指令,类似「麻烦你帮我务必确认一下」的句子会变成一句直接的要求。
- 9建议:创意写作或语气敏感的提示词慎用激进模式,轻度和标准能保留更多原文语气。
- 10用于生产环境前务必通读一遍压缩结果,界面上的诚实提示会提醒你原因。
- 11试试输入框下方的示例(啰嗦系统提示词、客服提示词、中文电商客服提示词),直观对比三档强度的效果。
常见问题
压缩会改变提示词的意思吗?
基于规则的压缩只删除冗余:填充词、套话、空洞修饰词和重复指令,从不改写或重排你的文字。但细微的语气和强调可能丢失,激进模式尤其如此。重要提示词请先核对一遍再用。
能省多少 Token?
大多数提示词通常可节省 15-40%,取决于原文有多啰嗦。填充词很多的提示词能省一半以上;本身很简洁的提示词可能几乎省不了。统计卡会实时显示你的精确节省量。
支持中文提示词吗?
支持。引擎内置独立的英文和中文规则库(填充词、套话、修饰词),中英文以及混合提示词都能压缩。中文 Token 估算与本站 Token 计算器一致:每个汉字约 1.5 token,标点单独计算。
它和 ai-answer-compressor 有什么区别?
本工具压缩你发给 AI 的提示词:输入侧,决定输入 Token 成本。回答压缩工具(ai-answer-compressor)压缩 AI 返回的内容:输出侧。调用 API 前用本工具,拿到回答后再用输出压缩器。
Token 是怎么计算的?
英文与拉丁文本用 js-tiktoken 的 cl100k_base 计数:与 GPT-4 和 ChatGPT 同源。中文按本站统一口径估算:每字符约 1.5 token 加标点。其他模型的 tokenizer 不同,结果仅供参考。
激进模式有什么风险?
激进模式会合并语义相近的重复指令并删除更多填充,可能过度删除、改变提示词语气。它适合又长又啰嗦的 system prompt;日常使用建议标准模式,性价比最高。
能压缩提示词里的代码或 JSON 吗?
代码本身不会被改动:引擎只删除周围的填充词和重复指令行。如果提示词里有几行长得像的代码,请避免激进模式,以免近似指令被误合并。
压缩后的提示词能直接用吗?
可以。输出仍是完整可用的提示词,可直接粘贴到 ChatGPT、Claude 或 API 调用中。被删片段列表支持逐条恢复,不会把你锁死在某次删除上。
提示词压缩工具能压缩发给 Claude 或其他模型的提示词吗?
可以。基于规则的压缩引擎与模型无关:不管目标模型是谁,它都只删除填充词和重复指令。Token 计数以 cl100k_base(GPT-4/ChatGPT)为基准,Claude、Gemini 等可能差几个百分点,但任何 tokenizer 下节省都是真实的。压缩后先通读一遍,再用目标模型实测一次。
为什么压缩后还是塞不进上下文窗口?
基于规则的压缩只能删冗余:通常节省 15-40%。如果要把 5 万 token 的文档塞进 8 千 token 的窗口,光靠本工具做不到。这种情况需要分块处理、对中间部分做摘要,或改用更大窗口的模型。先用本工具去掉水分,再做结构性缩减。
压缩提示词到底能省多少 API 费用?
输入 token 按百万计费(视模型约 $0.15-$5/1M)。假设每天发送 100 万输入 token、压缩节省 30%,每天省 30 万 token,按中档价格每天约省 $0.45-$1.50,用贵模型省得更多。用「节省的 token 数 × 你的单价/百万」就能算出精确数字。本工具只动输入侧,不影响输出 token。
为什么我的某句话出现在被删列表里?
引擎把它判定为填充词、套话、修饰词,或与另一条指令语义重复。每个片段都能一键恢复,你可以对比保留与删除的效果再决定。
为什么压缩后的提示词读起来生硬或断断续续?
因为基于规则的压缩是删除词语而不是改写句子。激进模式删得最多,句子可能被删得生硬或断断续续;轻度和标准模式保留更多原文措辞。如果某句读起来不对劲,从「被删片段」列表勾回该片段,或自己重写那句:省 token 和自然度不可兼得,语气敏感的内容建议用轻度或标准模式。
不同模型的 Token 数会不一样吗?
会略有差异:每个模型家族用各自的 tokenizer。这里以 cl100k_base(GPT-4/ChatGPT)为准,Claude、Gemini 等可能差几个百分点。压缩本身与模型无关,任何 tokenizer 下都能省。
压缩后 AI 的回答明显变差了,怎么办?
大概率是压缩强度选错了:激进模式会合并近似指令、删掉更多语气,可能把模型实际在用的上下文也删了。解决办法:改成轻度或标准模式,打开「被删片段」列表,把看着重要的片段勾回来,再用你的模型重测同一份提示词。如果这样之后节省仍然很少,说明提示词本来就够简洁:基于规则的压缩通常 15-40% 就是诚实的上限。