火山方舟 Agent-Plan 计费重大调整|9月1日正式生效,Trae Work 重度编码开发者必读
对于使用 Trae Work、CoPaw 等 Agent 编程工具的开发者来说,火山方舟 Agent-Plan 的 AFP 抵扣规则,将在 2026 年 9 月 1 日迎来重要变更。
📑 本页目录
对于使用 Trae Work、CoPaw 等 Agent 编程工具的开发者来说,火山方舟 Agent-Plan 的 AFP 抵扣规则,将在 2026 年 9 月 1 日迎来重要变更。
取消沿用已久的输入 Token 分段系数,短上下文不再打折,超长上下文不再加价。
同样的开发任务,有的场景成本上涨,有的场景反而省钱。如果你是重度 Agent 编码用户,这篇建议务必看完,提前做好用量预估与配置调整,避免月底额度突然告急。
本文规则与数据均对照火山方舟官方公告《模型抵扣系数调整公告》核实(2026-08-25 查询)。
一、核心变更:取消输入 Token 长度分段系数
旧规则(9月1日前,当前正在执行)
输入抵扣系数 = 模型抵扣系数 × 输入分段系数
| 输入长度 | 输入分段系数 |
|---|---|
| ≤ 32k token | 0.67(短输入享受折扣) |
| 32k < 输入 ≤ 128k | 1 |
| > 128k | 2(超长输入额外加价) |
新规则(2026-09-01 起正式执行)
输入抵扣系数 = 模型本身抵扣系数
| 输入长度 | 输入分段系数 |
|---|---|
| 任意长度 | 1(统一,不再区分上下文长短) |
完整计费公式保持不变:
AFP 消耗 =(输入 token × 输入抵扣系数 + 输出 token × 输出抵扣系数)÷ 10000
重要说明:
- 输出抵扣系数完全不变,本次仅改动输入端
- 图片、视频、语音、数据集模型不受本次调整影响
- Auto 模式限时 0.5 系数折扣活动:2026-06-10 ~ 2026-11-08,不受本次规则变更影响,继续生效
二、成本变化:三类场景分别是涨还是降
1. 短输入 ≤ 32k token:成本上涨 ⚠️
旧规则可以享受 0.67 折扣;新规取消折扣,同等请求 AFP 消耗明显增加。
对应日常场景:修复单个 bug、编写单函数、单元测试、小功能迭代。也是 Trae Work 最频繁发生的请求。
2. 32k ~ 128k token:成本无变化
旧分段系数本身就是 1,新旧规则消耗一致。会话历史逐步累积、读取少量多个代码文件,大多落在这个区间。
3. > 128k 超长输入:成本大幅下降 ✅
旧规则超长输入需要 ×2 加价;新规不再额外加价。
对应场景:项目大规模重构、批量改写多文件、读取整个目录源码,百万级长上下文任务,9 月之后会更划算。
最坑中间场景:同一个会话不断叠加历史,明明只是改小 bug,上下文累积到 40-80k。既拿不到旧版短输入折扣,也享受不到超长输入降价红利,白白消耗额度。
三、新旧规则实际测算举例
以 doubao-seed-2.1-turbo,模型抵扣系数 2.5 举例:
案例1:短输入场景,输入 10k token,输出 1k token
- 旧规则:输入系数 = 2.5 × 0.67 = 1.675 AFP =(10000 × 1.675 + 1000 × 2.5)÷ 10000 = 1.925 AFP
- 9-01 新规则:输入系数直接 2.5 AFP =(10000 × 2.5 + 1000 × 2.5)÷ 10000 = 2.75 AFP
👉 同等任务,消耗上涨约 43%
案例2:超长输入场景,输入 200k token,输出 1k token
- 旧规则:输入系数 = 2.5 × 2 = 5 AFP =(200000 × 5 + 1000 × 2.5)÷ 10000 = 100.25 AFP
- 9-01 新规则:输入系数 2.5 AFP =(200000 × 2.5 + 1000 × 2.5)÷ 10000 = 50.25 AFP
👉 大重构场景,消耗几乎减半
附:官方各模型抵扣系数表(9月1日后生效)
| 模型类别 | 模型 | 输入抵扣系数 | 输出抵扣系数 |
|---|---|---|---|
| 文本生成(极速) | doubao-seed-2.0-mini | 0.25 | 0.25 |
| 文本生成(标准) | doubao-seed-2.0-lite / deepseek-v4-flash | 0.5 | 0.5 |
| 文本生成(pro) | doubao-seed-2.1-turbo / doubao-seed-evolving / minimax-m3 | 2.5 | 2.5 |
| 文本生成(pro) | kimi-k2.7-code | 4.5 | 4.5 |
| 文本生成(pro) | glm-5.2(即将下线)/ glm-5.3(glm-latest) | 4.5 | 4.5 |
| 文本生成(pro) | deepseek-v4-pro | 5.5 | 5.5 |
| 文本生成(pro) | kimi-k3 | 10 | 10 |
| 向量化 | doubao-embedding-vision | 0.5 | 0.5 |
⚠️ GLM-5.2 模型即将下线,尽快迁移至 glm-5.3,避免业务中断。

四、回到我们日常:Trae Work 编程,什么是短 Prompt、什么是长 Prompt
Trae SOLO 模式每次向 API 发起请求,会把:系统提示词 + 全部会话历史 + 读取的全部文件内容 + 工具定义,全部打包作为输入 Token 传给大模型。
✅ 短输入(≤ 32k token,9月后涨价)
典型开发场景:
- 新建会话,仅引用 1-2 个小代码文件,对话轮次 2-5 轮;修复单个函数 bug。 示例指令:帮我修复这个函数空指针,#file utils.py,仅修改这一个方法。输入 Token 一般 8k-25k。
- 代码格式化、写枚举、生成单元测试,不批量读取工程文件。
这是绝大多数日常调试场景,9 月 1 日后,相同操作会消耗更多 AFP 额度。
📜 长输入(> 32k,尤其 > 128k,9月后降价)
哪些行为会把输入 Token 拉到超长:
- 同一个会话无限聊,不新建会话:十几轮对话之后,问答历史、diff、报错日志持续堆积,输入轻松冲到 40k-100k+。明明只是改小 bug,输入却巨大。
- 使用 #folder、#workspace,一次性扫描整个源码目录,灌入大量源码文件。
- 开启自动上下文压缩:压缩只是把历史做摘要,摘要文本依旧大量占用 Token,不会帮你省钱。
- 派生大量子 Agent(sub-agent):子任务会复制完整上下文,Token 爆炸式上涨。
典型场景:模块整体重构,批量改写一批源码文件,输入达到 200k+。9 月新规对这类任务利好。
五、Trae Work 实操适配方案(直接落地)
目标:普通小 bug 尽量控制在 ≤ 32k;大规模重构放开长上下文,用好新规红利。
1. 会话隔离,优先级最高
- 小功能、改 bug:一个业务任务一个会话,任务完成直接新建会话,不要在单一会话堆几十轮历史
- 需要延续上下文:手动写 3-5 句任务摘要粘贴新会话,不要携带完整历史
2. 文件引用按需索取,拒绝全盘扫描
- 修改单个函数,只 #file 引用 1-2 个相关文件;非重构场景,禁止直接 #folder src 读取整个源码目录
- 设置关闭「自动全局索引」,需要哪个文件手动引用,避免工具自动扫描整个项目
3. 约束子 Agent 派生,防止 Token 爆炸
在 Agent 规则增加约束:禁止无必要派生子 Agent,子 Agent 数量最多 1 个;优先单线程完成任务,不要拆分大量子任务。
4. 观察上下文占用
Trae 会话右上角悬停,可以查看当前上下文 Token 数量,快速判断属于短/中/长输入区间:
- < 32k:短区间(9-1 涨价)
- 32-128k:中等区间
-
128k:超长区间(9-1 降价)
5. 模型参数优化
自定义模型高级配置,不要无脑填满 256k 上下文窗口;日常主力开发建议限制输入窗口设置为 120000,避免无限制吞入超大上下文。
6. 模型分层调用
简单调试、小 bug 优先使用 deepseek-v4-flash 这类低系数模型;复杂推理重构再调用 pro/turbo 高阶模型,降低整体消耗。
六、给 Agent 开发者的总结建议
- 日常细碎开发(大量 ≤ 32k 短请求):9 月之后成本上升。做好会话管理,减少无效反复调试,轻量任务优先选择低系数模型。
- 大规模重构、批量多文件修改(输入 > 128k):新规利好,可以放开使用长上下文。
- 警惕“中间态会话”:会话越聊越长,上下文落在 32-128k 区间,既没有旧折扣,也享受不到超长降价,属于纯浪费额度。
- 提前观测用量账单,评估自己现有套餐是否够用;GLM-5.2 模型即将下线,尽快迁移至 glm-5.3,避免业务中断。
你的 Agent 开发日常,一天大概消耗多少 AFP?欢迎评论区交流。
参考资料: 火山方舟官方文档《模型抵扣系数调整公告》docs.volcengine.com/docs/82379/2658332(搜索「Agent-Plan 模型抵扣系数」也可直达)
本文信息截至 2026 年 8 月 25 日,计费规则可能随时调整,请以官方最新公告为准。