Skip to main content

代币经济学概述

更新 2026-08-14 4 分钟阅读 在 GitHub 上编辑 ↗

代币经济学(Token Economics)是 MoAI-ADK v3.0 的三大核心之一。即使代币单价下降,代理式开发仍然大量消耗代币,因此决定成本的不是模型价格而是代币的运用方式。本页概述代币经济学的整体架构,并链接到各子主题的深入页面。

为什么是代币经济学

随着多个代理运行、上下文变长、推理加深,单个会话的代币消耗急剧增加。在代币价格下降无法跟上代币使用量增长的形势下,线束如何计量、路由、节食和防御代币成为成本竞争力的核心所在。

MoAI-ADK 的回答有三点。

  1. 为每个任务分配合适的模型和推理深度 — 规划深、实现省、验证独立。
  2. 节食上下文 — 最小化常驻指令,测量提示缓存命中率。
  3. 系统守护预算 — 追踪代币使用,在超阈值前正常停止。

三大核心叙事

v3.0 的产品差异化由三大核心组成。代币经济学是第一个核心,与其余两个紧密连接。

代币经济学 (本页) — 计量、路由、节食、防御。

自主连续循环 — 何时停止、何时继续。在自主连续循环页面讨论。

代理式线束 — 哪个代理、哪个配置文件、如何进化。在三层架构配置矩阵线束自我进化页面讨论。

四层代币经济学结构

代币经济学由四层组成。每层独立运作并相互补充。

flowchart TD
    A["Layer A — Metering
per-SPEC 代币记账"] B["Layer B — Routing
Tier × Phase 声明式模型/effort"] C["Layer C — Verify-diet
verbatim 证据存文件,上下文存摘要"] D["Layer D — Budget defense
90% hard-limit graceful stop"] A --> B B --> C C --> D

Layer A — 计量 (Metering)

所有代理调用的代币使用量按 per-SPEC 粒度记账。moai spec audit 输出中的代币列和 progress.md 中的代币记账部分是本层的产出。不知道什么消耗了代币,就无法优化。

Layer B — 路由 (Routing)

为每个保留代理声明式地分配模型和推理深度(effort)。活动配置文件(high/medium/low)选择配置矩阵的一列,把每个代理放在其工作所需的推理深度阶梯上,并把 Sonnet 保留给单次完成的机械性行,最大化性价比。详细的配置矩阵见 配置矩阵页面。

Layer C — 验证节食 (Verify-diet)

将验证命令的长输出重定向到磁盘文件,上下文中只保留 exit code 和 bounded tail(最多 50 行)。这个文件重定向契约(file-redirect contract)在保持验证证据完整性的同时减少上下文消耗。这层还关联到提示缓存——Anthropic 的提示缓存对渲染请求的前缀(tools → system → messages)做前缀匹配,首次写入付 1.25 倍成本,此后复用同一前缀的回合以 0.1 倍成本读取。缩短常驻指令、提高缓存命中率,也属于这一层。详细机制见代币预算管理与正常停止页面。

Layer D — 预算防御 (Budget defense)

当代理的代币使用量达到 hard-limit(默认 90%)时,执行正常中止(graceful abort)。进度保存到 progress.md,发出可粘贴的 resume 消息(paste-ready resume),绝不自动 /clear。详细步骤见代币预算管理与正常停止页面。

模型层级路由

将 Layer B 路由具体化的是模型配置文件策略。MoAI-ADK v3.0 将 Haiku 从路由模型集合中排除,以贴合任务性质的三层结构分散工作 — Sonnet 承担单次完成的行,Opus 贯穿整条代理式阶梯,max effort 只用于两个调用频率最低的行。此设计的依据和配置矩阵实现在以下两页讨论。

CG 模式 (成本优化)

moai cg 是结合 Claude 领导者和 GLM 工作进程的混合模式。战略、规划、审计由 Claude 担当,大规模实现工作由 GLM 担当。在实现密集型任务上可实现 60-70% 的成本削减。

GLM-5.3 是 1M 上下文的单一模型,自动应用 z.ai 隐式提示缓存。z.ai 尚未公布其按量单价;上一代 GLM-5.2 为每 1M 代币输入 $2 / 输出 $8。在定额 Coding Plan 下使用时,该单价不会左右账单。Claude Code 报告的 context_window_size 按 Claude 槽位为准,所以 GLM 会话中原始值显示为 ~180K,但 MoAI 把它纠正为 1M、按 50% 阈值运作。请信任 statusline 的 CW% 表盘。CG 模式和 GLM 独立会话(moai glm)的详情请参阅 Multi-LLM 部分。

已验证的事实与路线图

本页内容的实现状态明确区分如下。

已实现 (已发布) — 四层结构(A/B/C/D)全部、三层模型策略(配置矩阵解析器)、CG 模式、验证节食文件重定向契约、正常中止机制。

设计阶段 (路线图) — GLM 后端 effort 叠加的 wire 有效性是需要实时 GLM 会话出站观测的实证课题。在配置矩阵页面中明确标注此区分。

下一步