Token 生意到底在卖什么:从一张卡到一笔收入
一台服务器买回来,它本身不产生任何收入。真正变成钱,要经过一段很短的链条:
电 + 机器 → 跑模型 → 产出 token → 卖给用的人
所以做算力生意,本质是用机器的折旧去换 token 的销售收入。
token 的价格有三个口径
调用一次大模型 API,通常同时产生三种 token:
- 输入 token —— 你发给模型的内容(提示词、上下文)
- 输出 token —— 模型生成的内容
- 缓存命中 token —— 和上次重复的上下文,命中缓存的部分
三者的价格差得非常远。以官方 API 口径为例(每百万 token):
- 输出约 100 元
- 输入约 20 元
- 缓存命中约 2 元
输出是输入的 5 倍,是缓存命中的 50 倍。
这一条直接决定了生意怎么做:谁能提高输出占比、提高缓存命中率,谁的收入就高。
同样的卡,跑不同的业务、配不同的框架,产出能差好几倍。
同样的卡,跑不同的业务、配不同的框架,产出能差好几倍。
收入公式其实很简单
日收入 ≈ 单卡每秒 token 数 × 86400 × 卡数 × 利用率 × 单价
看上去只有五个变量,但每一个都容易被高估:
- 每秒 token 数 —— 受模型大小、批处理、上下文长度影响,不是一个固定值
- 利用率 —— 机器不可能 24 小时满载,真实的数字通常只有一半上下
- 单价 —— 是按官方牌价算,还是按你实际能卖出去的价格算,差距很大
所以这门生意的关键判断
不是「机器能跑多快」,而是「产出的 token 能不能卖掉、卖什么价」。
一台卡跑得再满,卖不掉就是纯烧电费和折旧。
反过来,有稳定的调用需求,老一代的卡一样能赚钱。
判断一个 token 项目靠不靠谱,先问一句:这些 token 打算卖给谁?
答不上来的,后面所有的回本测算都只是算术题。
答不上来的,后面所有的回本测算都只是算术题。
这篇能拿走什么
读了不算数,拿去用才算。