一套算力平台通常由哪几层组成
「买了几台服务器,装上模型就能卖 token 了」—— 中间其实还有好几层。
分层看
① 硬件与驱动层
GPU、网卡、驱动、CUDA 版本。
看着基础,但版本不匹配是最高频的故障来源 —— 驱动、CUDA、框架三者要成套。
② 资源调度层
决定「哪个任务跑在哪张卡上」。
- 单机 —— 简单,够小规模用
- 集群 —— 需要调度器(K8s + 设备插件,或专用调度系统)
- 关键能力:GPU 切分(一张卡给多个小任务)、抢占与排队、故障重调度
③ 推理服务层
把模型包装成能对外提供服务的接口。
要做的事:模型加载、批处理调度、多副本、限流、超时、灰度。
这一层的效率直接决定每张卡能产出多少 token。
④ 监控与计费层
- 监控 —— GPU 利用率、显存、温度、功耗、请求延迟
- 计费 —— 按 token 还是按卡时,怎么计量、怎么出账
这一层最容易被跳过,但它决定了你能不能算清楚自己赚不赚钱。
没有计量数据,就不知道哪个客户在亏钱。
没有计量数据,就不知道哪个客户在亏钱。
⑤ 对外接口与运维层
API 网关、鉴权、配额管理、告警、日志。
一个务实的建议
不要一开始就把五层都搭齐。
按这个顺序上:
先能跑(①②)→ 再能卖(③⑤)→ 最后能算账(④)
见过太多项目,前三个月都在搭第四层,结果一张卡都没卖出去。
先有收入,再谈精细化。
先有收入,再谈精细化。
这篇能拿走什么
读了不算数,拿去用才算。