返回探索
指南VibeFix 编辑部更新于 2026年10月2日

AI 产品的 token 成本账:先算清单个用户毛利,再定价

用户越多亏得越多,是 AI 产品最贵的 bug。手把手算一道单用户毛利的算术题:为什么必须按 P90 用户而不是平均数定价;一个被爆款烧死的修图应用案例;缓存、路由、瘦身三板斧与三条毛利红线。

概念封面:深色背景下发光 token 流经管道汇入仪表盘

AI 产品最贵的 bug,往往不在代码里,而在定价页上。我见过不止一个独立开发者,产品上线、用户增长、口碑都不错,然后在月底收到云账单时傻眼:用户越多,亏得越多。传统 SaaS 的边际成本趋近于零,多一个用户几乎不花钱;AI 产品的边际成本是 token,是实打实的、按使用量线性增长的 COGS(销售成本)。不算清 token 账就定价,等于在不知道成本的情况下开餐馆。

这篇文章不谈宏大叙事,只做三件事:手把手算一道"单用户毛利"的算术题,讲一个被爆款烧死的真实案例,给出省钱的三板斧和定价必须守的毛利红线。如果你正在做(或打算做)任何带 AI 功能的产品,这篇文章可能帮你省下未来几个月的学费。

先算一道算术题:你的"免费用户"到底在烧多少钱

我们用一组示例价格来算(以下数字为举例,实际以你所用模型的官方定价为准):假设主力模型 input(输入)5 美元 / 百万 token,output(输出)20 美元 / 百万 token。再假设你的 AI 写作助手,普通用户每月对话 30 次,平均每次 input 8000 token(含系统提示词和上下文)、output 2000 token。

单次成本 = 8000/1M × 5 + 2000/1M × 20 = 0.04 + 0.04 = 0.08 美元。月成本 = 0.08 × 30 = 2.4 美元 / 用户 / 月。如果你定价 9.9 美元/月,毛利率看起来有 75%,很健康,对吧?

别急着点头。问题出在"平均用户"是个统计幻觉。真实分布永远是长尾的:沉默的大多数一个月用 3 次,而 10% 的重度用户一个月用 300 次——是平均值的 10 倍。重度用户的月 token 成本是 24 美元,倒亏 14 美元。更糟的是,重度用户往往还是你的口碑传播者,你不敢限他,也不敢涨他的价。

所以正确的算账姿势是:永远按 P90 用户(比 90% 用户用量都大的那个分位)算成本,而不是按平均数。按平均数定价,是 AI 产品亏钱的第一大死因。把你的用量分布拉出来,看看 P90、P99 的用户一个月烧多少 token——那个数字,才是你定价的真正起点。

怎么拉出用量分布?不用复杂的 BI:每天把"用户 ID—当日 token 消耗"导出成 CSV,月底用脚本算个分位数就行。关键是从第一天就开始记——很多团队是账单爆了才想起要看分布,那时已经晚了三个月。数据埋点,是 token 账的地基。

还有一笔账很多人漏了:token 之外的隐性 AI 成本。Embedding(向量化)按量计费、向量数据库的存储费、失败重试(网络抖动一次就重试一次,成本直接翻倍)、以及"AI 质检"——用大模型去审核小模型的输出,这笔"质检税"经常占到总成本的 20%。算单用户毛利时,把这些全部折进去,再乘以 1.2 的 buffer。只算 token 的账,是算不平的账。

真实案例:一款 AI 修图应用是怎么被"爆款"烧死的

2026 年初,一款 AI 老照片修复应用(应要求隐去名字)上了某应用商店的推荐位,一周涌入 10 万新用户。创始人发了条庆祝的朋友圈,配文"爆款了"。三周后他删了那条朋友圈——因为当月云账单是 4 万多美元,而当月收入不到 6000 美元。

复盘死因,三条全是 token 账没算清:第一,免费层没有硬上限。为了冲榜,免费用户每天可修复 20 张,"反正大多数人用不了几次"。结果羊毛党用脚本批量刷,单个账号一天跑几百张。第二,全量走旗舰模型。不管是 200KB 的缩略图预览还是 4K 高清输出,全部调用最贵的模型——而实际上,预览图用小模型的效果差异肉眼几乎不可辨。第三,重复计算毫无缓存。同一张老照片被不同用户反复上传修复(家庭群里转发的同一张全家福),每次都全额重新跑一遍推理。

他是怎么救回来的?三招,招招对应 token 账:免费层改成每天 5 张的硬上限(超了就排队或付费,代码层面截断,不是"希望用户自觉");预览图路由到小模型,只有最终高清输出走旗舰模型,单次成本直降约 70%;对上传图片做哈希,相同图片直接返回缓存结果,重复请求零成本。两个月后,单用户月均 token 成本从 3.1 美元降到 0.7 美元,毛利率回到 80% 以上。创始人的总结很扎心:"我们不是被竞争对手打死的,是被自己的免费用户烧死的。"

补一句:怎么识别羊毛党?看三个指标——单账号日调用量超过 P99 的 5 倍、请求间隔呈现机器规律、只用免费功能从不点付费页。命中两条,自动进人工审核。这套规则 50 行代码,值回 4 万美元。

如果时光倒流,给这位创始人三个"上线前必做":第一,压测免费层——找人用脚本模拟羊毛党,看是账单报警先响,还是增长先来;第二,灰度模型路由——先让 10% 流量走小模型,对比留存和投诉,没差别再全量;第三,给账单设熔断——单日 token 支出超过阈值自动降级(比如暂停免费层),而不是等月底看账单时心梗。爆款是运气,账是本事。

省钱三板斧:缓存、路由、瘦身

不管你做什么 AI 产品,省 token 成本永远是这三板斧。按投入产出比排序:

  • 第一板斧:缓存(Prompt Caching)。这是性价比最高的优化,没有之一。原理很简单:每次请求里重复的部分(系统提示词、固定的 few-shot 示例、常用文档片段),让服务商缓存起来,只按缓存价计费。主流服务商的缓存 token 价格通常是正常价的 1 折左右。实操要点:把系统提示词写成"静态前缀 + 动态后缀"的结构,静态部分越长、越固定,缓存命中率越高。一个 RAG 应用把 2 万 token 的系统知识库做成缓存前缀后,input 成本直接掉了 60% 以上。注意:缓存不是银子弹,动态性强的对话缓存命中率会很低,先测再上。
  • 第二板斧:模型路由(Model Routing)。核心思想:不要用大炮打蚊子。把请求按难度分级:分类、摘要初稿、格式转换这类"小模型足够好"的任务,走便宜 10 倍的小模型;只有需要深度推理、复杂代码、最终质量把关的环节,才走旗舰模型。更进一步的做法是"小模型起草 + 大模型终审":先用小模型生成初稿,再用旗舰模型只做校验和修正——终审的 input 虽然包含初稿全文,但 output(最贵的部分)大幅减少。实操建议:先全量走旗舰模型跑两周,抽样 200 条真实请求,用小模型重跑并人工对比质量,找到"质量无损"的分界线,再切路由规则。
  • 第三板斧:输出瘦身。Output token 通常比 input 贵 3 到 4 倍,但最容易被浪费。三个具体动作:用结构化输出(JSON mode)代替自由文本,并给字段设长度上限——"用一句话总结"比"总结一下"能省一半 token;流式输出时设置合理的 max_tokens 截断,防止模型"礼貌性长回复";去掉 system prompt 里的客套话("你是一个乐于助人的…"这类废话每请求都在烧钱)。别小看这些,一款客服机器人仅靠"回答限 150 字以内"这一条,月账单就降了 30%。

三板斧之外,再点三个常见的"烧钱姿势",看看你中了几个:姿势一:system prompt 里塞整本用户手册。几万 token 的静态文档每次请求都重发,还不做缓存——等于把钱往水里扔。姿势二:用旗舰模型做"Hello World"级任务。情感分类、关键词提取、格式转换,小模型的效果差距不到 5%,价格差 10 倍。姿势三:无限重试加无限上下文。失败就重试、上下文只增不减,一个异常用户一小时能烧掉普通用户一个月的量。给重试设上限、给上下文设滑动窗口,是基本功。

定价必须守的三条毛利红线

省钱是防守,定价是进攻。以下三条红线,是我看过太多反面案例后总结的:

  • 红线一:定价至少是边际成本的 3 倍,且在 P90 用量下仍不低于 1.5 倍。为什么是 3 倍?因为 token 成本之外,你还有服务器、支付手续费(约 3-5%)、客服、退款损耗。按平均成本 3 倍定价,在 P90 用户身上大约还剩 1.5 倍毛利——这是"重度用户不倒亏"的安全垫。低于这个倍数,你的商业模式本质上是在赌"用户不会多用",而这是必输的赌局。
  • 红线二:免费层必须有"硬上限",而不是"软善意"。"新用户送 100 次体验"没问题,但必须在代码层面截断:超了就是超了,要么等明天,要么付费。不要用"希望用户自觉"来做成本控制——互联网会用脚本教会你做人。免费层的总成本应该控制在获客预算内:单个免费用户的 token 成本 × 预期免费用户数,就是你的真实获客成本,超过渠道投放价就砍量。
  • 红线三:每月看一次"单用户 token 成本分布",而不是只看总账单。总账单涨 20%,可能是用户涨了(好事),也可能是某个功能 token 效率崩了(坏事)。建立一个简单的看板:按用户分位的月均 token 成本、按功能的单次调用成本、缓存命中率。任何一周单次调用成本环比上涨超过 15%,立刻排查——多半是某次 prompt 改动引入了冗余上下文。

定价实战:三种常见模型的成本对照。

  • 按量付费(credits 制):成本与收入天然同构,最安全。关键是 credits 定价要覆盖 P90 成本的 3 倍,并且把 credits 过期策略算进毛利。
  • 包月分级:最常见,也最危险。必须给每档设"公平使用上限"并在代码层面执行;顶档价格要能覆盖 P99 用户的成本,否则顶档全是来薅羊毛的重度用户。
  • 免费增值:免费层是获客成本,不是福利。算出"免费用户转付费"的转化率,用"单免费用户成本 × 100 / 转化率"得出真实获客成本,超过 50 美元就要重新设计免费层。

最后再提醒一个隐形杀手:汇率与账单周期。美元计费、人民币收入的团队,汇率波动 5% 就能吃掉本来就薄的毛利;按量后付费的账单有 1 到 2 天延迟,等你看到"爆了"已经晚了。做法:给 token 支出设"每日预算告警"(达到 80% 就发通知),并把汇率波动计入定价 buffer。魔鬼都在这种细节里。

我的观点:token 账不是技术问题,是商业模式问题。

很多开发者把 token 成本当成"优化问题":换更便宜的模型、压 prompt、做缓存。这些都对,但都是战术。战略层面的问题是:你的定价模型,是否和你的成本结构同构?按调用量收费的产品,就该按调用量定价(credits 制);包月无限量的产品,就必须有硬上限和分级——"无限量 + 按量成本"在数学上就是无解的。

2026 年最贵的一句话,是"AI 功能免费"。免费可以是获客策略,但必须是"算过账的免费":你知道每个免费用户烧多少钱、转化率要到多少才能打平、总预算的天花板在哪。算不清这三笔账的免费,不是增长策略,是自杀式烧钱。

再说一个判断:当你的单用户 token 成本连续三个月下降,说明工程优化到头了,该去优化"商业模式"了——涨价、分级、做企业版。反之,如果成本还在涨,先别想涨价的事,把三板斧再挥一轮。成本曲线的斜率,决定你该谈工程还是谈商业。

最后给一个今晚就能做的动作:打开你的云账单,算出过去 30 天"单个付费用户的平均 token 成本"和"P90 用户的 token 成本",再除以你的定价。如果第二个数字算出的毛利率低于 50%,你的定价页需要重写了——趁用户还不多的时候改,成本最低。改定价最便宜的时机永远是现在,别等账单教你做人。

浏览项目广场发布你的项目

相关文章

笔记本电脑屏幕上显示网站数据分析图表,象征 vibe 项目的 SEO 与流量增长
指南
以前是被搜索引擎看到,现在是被 Agent 读懂:vibe 项目的 SEO/AEO 实战手册

流量正在从搜索框搬到 AI 答案框里。vibe coder 一周做出产品,却没人发现——这篇指南把 SEO 基本盘(sitemap、JSON-LD、Core Web Vitals)和 AI 发现层新玩法(llms.txt、每页 Markdown 版本、FAQ schema、Agent 可读的定价与 API 文档)拆成可落地的 30 天清单。核心判断:文档化程度决定你的产品在 agent 经济里的上限。

增长与营销产品策略独立开发
一只手拿着信用卡在一台刷卡机上支付的近景照片,象征在线支付接入主题
指南
支付是 vibe 项目里第一个「不能 vibe」的地方:一份手写级接入实战

Zephos 团队在一个 Agent 搭起来的 Next.js + Supabase + Stripe 笔记应用里埋了 16 个上线杀手级问题,其中 2 个和支付有关:webhook 没验签、拿客户端传的 plan 直接开 pro。这篇指南把这两个坑拆成一套可落地的实战方法:webhook 签名三件套、服务端唯一真相源、订阅状态机、测试时钟和沙盒到生产 checklist。核心判断:和钱相关的逻辑必须手写或逐行审计,agent 只能写样板。

StripeSupabaseAI 编程实践
笔记本电脑屏幕上显示着浏览器中的网站注册页面
资讯
ChatGPT Sites 冲上 HN 热榜:提示词建站,到底是玩具还是生产力?

10 月 3 日,Sites in ChatGPT 以约 209 点赞、218 评论冲上 HN 前页。这不是发布,而是一场清算:提示词直达 URL,到底是玩具、原型托管,还是生产力?四个争论焦点、文档实锤的技术事实(D1/R2、登录、自定义域名),以及给 vibe coder 的三个判断。

AI 编程实践产品发布独立开发