自建还是按次买,先算那些空着的卡
先给一句在会议室里最常出现的话:「我们一个月给模型付四万,买一排卡回来是不是便宜一半?」
这句话问得很合理,但它问错了对象。**按次买和自建之间隔着的不是单价差,是三个数:你的调用画像、你一天里有多少小时真的在跑、以及那台机器背后要站几个人。**前两个数在你的账单和监控里,第三个数通常不在任何人的预算里。
这一篇往下就是这三个数怎么取、怎么代进一道算术,以及一道算术算不出来的那几格。
一、两种付法在时间上的形状不一样
**按次买是变动成本。**这个月业务停一停,账单跟着下来;下个月上线一个新功能,账单跟着上去。单价由厂商定,而且一年里能改好几次。
自建是固定成本。那张卡包月也好、那台服务器按三十六个月摊也好,钱是在买的那一刻和每个月初付出去的,跟你当天跑了八千万次还是八万次无关。这一条决定了它的脾气:**上行时它不涨,下行时它不降。**你为它做的每一次"要不要改主意",代价都比按次买那一侧高得多。
管理层在这里最容易踩的空格是:把自建当成"便宜版本的按次买"。它不是。它是你把弹性卖回去、换了一个更低的单位成本的可能性——而这个可能性能不能兑现,全看下面第二到第五节那三道算术。
二、第一道算术:门槛次数,公式只有一行
公开材料里这道题的写法很干净,一份 2026 年 9 月的技术博客把它写成一个式子:临界量 = 自建的月完全成本 ÷ 按次买的单次成本。它给的演示参数是"单次 0.004 元、月完全成本 2800 元,临界约 70 万次",那些数字是它自己标的演示用,不代表任何报价;这个式子本身可以直接抄。
抄的时候有两格别弄错。
**第一格:分母是"一次"的成本,不是"一百万个 token"的成本。**因为输入和输出两个价,而且差好几倍。按上面提到的那份统计(摩根士丹利对国内八家主流厂商,2026 年二季度,经媒体转述),平均输入 4.9 元每百万 token、平均输出 21.9 元每百万 token——输出差不多是输入的四倍半。
所以一次调用值多少钱,取决于你的业务那一次里塞进去多少、吐出来多少。**这一格必须从你自己的账单里取,不能取厂商首页上那个数。**下面是演算用的四格画像,单价用上表那两个均值:
| 一次调用的画像 | 折算 |
|---|---|
| 输入 800、输出 200 | 每次约 0.008 元 |
| 输入 2000、输出 400 | 每次约 0.019 元 |
| 输入 2000、输出 800 | 每次约 0.027 元 |
| 输入 12000、输出 600 | 每次约 0.072 元 |
**最后一行是"长上下文"那一格,它比第一行贵将近九倍。**做知识库问答、把整份合同或者整叠工单塞进去让模型读的团队,账单是最后那一格,不是第二格。拿演示用的均值去算自己的门槛,误差就在这里产生。
第二格:分子里的"完全成本",四个格子里只有一个格子是机器。
一份 2026 年 8 月的公开材料把 8 卡服务器的一次性投入写成 38 万元、月运维写成 9000 元(电费加运维加微调);另一份 2026 年 9 月的材料把同一类配置写成"GPU 总投入 36 万、年运维 60 万(含一个全职)"。**两份同年材料,"运维"那一格差了十几倍。差的不是行情,是里面有没有把人写进去。**这一格留到第五节算,先按不含人那一档往下走。
演算(下面每一个假设都是我为了让机制看清而自造的,你换成自己的数就能重跑):
- 单次成本 0.019 元(输入 2000、输出 400 那一格);
- 一台 8 卡机:36 万按 36 个月摊是每月 1 万,加电费和机架 0.9 万,每月固定 1.9 万,不含人;
- 门槛 = 19000 ÷ 0.019 ≈ 每月 102 万次,一天 3.4 万次。
到这里,很多会议室会停在一个很乐观的结论上:我们一天五万次,比 3.4 万还多,那自建划算。这个结论是错的,错在它只用了三道算术里的第一道。
三、门槛的分母是移动的,而且两个市场现在是反的
上面那道算术里最脆的一格,是那个"每次 0.019 元"。它不是常数。
**海外前沿模型这一路在往下走。**一份 2026 年 10 月的行情转述给出的比值是:前沿档 API 价格较 2023 年 3 月下降约 84%,入门档已经到每百万 token 0.10 美元、中端约 2 美元。这条线的意思是:**你要用的那一档越便宜,门槛那一格的次数就得越高——单价降一半,你要多跑一倍的量才摊得平同一台机器。**很多人以为"API 一直在降价,所以越早自建越亏、晚点自建更亏",方向恰好反了。
国产主流这一路在 2026 年上半年掉头往上。同一段时期,对国内八家主流厂商的那份统计给出:2026 年二季度平均 API 输入 4.9 元、输出 21.9 元每百万 token,较 2025 年一季度分别上涨 48% 与 80%;那半年里几家厂商先后调过价。这条线的意思是:门槛在往下移,你今天算不出来的那笔账,一个季度后可能真的算得出。
这两条不矛盾——它们说的是不同的市场、不同档位、不同时间的动作。**但它们共同指向一件管理层要做的事:门槛公式的分母,每个季度都要重取一次。**你手里那份"去年算过、自建不划算"的结论,作废时间比你以为的早。而自建的固定成本不给你这个灵活性:卡买了就是三十六个月。
再补两条同期的旁证,它们把"分母会动"这件事说得更实在。一条是海外那一路的降幅正在收窄:一份 2026 年 7 月的投行口径转述给出,平均 token 价格环比上涨 7%、同比仍下降 5%,而同比降幅已经从四月的 24%、五月的 21% 收到 5%——同时,GPU 租赁价格在往上走。另一条更常见:单位成本降了,账单反而涨了,因为用量的增长斜率比降价的斜率陡(一份 2026 年 9 月的技术分析就是这么描述这一格的)。这两条对你这道题的意思是同一句话:你在往下走的那一格上算自建,等于在追一个正在加速离开的目标;而按次买那侧的账单不会因为你不动而变小。
所以这道题的第一个真判据不是"哪个便宜",是"我什么时候重算一次"。
四、第二道算术:容量按峰值配,账单按全天付
回到那个"一天五万次,比门槛的三万四还多"。这一句里有两个数被合成了一格,它们必须拆开:
- 总量决定你摊不摊得平;
- 峰值决定你要买几台。
演算:一天 5 万次。如果是全天候均匀的,每小时两千次出头,一台机器的容量大概率够。但办公类、客服类、审批类的流量不长这样——它集中在白班那八到十个小时里,而且里面还有一次早会和一次下班前的堆积。把 5 万次压进 8 小时,峰值就是每小时六千多次,接近每秒两次;再叠一次早会的两小时堆积,你要按每秒四五次持续吞吐去配机器。
这时候固定成本那一格翻了一倍(两台变一台),**而月总量还是 150 万次。门槛从 102 万次变成 204 万次,你的量原地不动。**这就是这一节要说的那件事,它和常见的说法不一样:
**为峰值而加的那些卡,不会把门槛拉低,只会把门槛推高。**你要的产出量跟着机器数一起涨,可你的业务量不会因为多买了机器就变多。
那笔账真正该看的是利用率——公开材料里那一格的说法是:包月那张卡是全天候计费的,而流量有波峰波谷,日均利用率只有 15% 的话,你实际是在为 85% 的空转付费(出自一份 2026 年 8 月的技术材料,是个人的机制说明,不是统计)。这句话可以变成一个可以直接乘的倍数:
- 一天只有 8 小时有流量 → 时间利用率 33% → 你摊在每个 token 上的固定成本是满载那一格的 3 倍;
- 利用率 15% → 6.7 倍;
- 同一批机器,利用率做到 70% 和只有 15%,每个 token 的综合成本差 4.7 倍。
再往回收一格,别把这张表读成"只要加班把利用率提上去就行"。公开材料里把利用率讲清楚的那几个数都不高。2026 年一份公开材料里,一家银行说它靠推理引擎迭代和算力统一调度把 GPU 利用率提到 47%、百万 token 推理成本同比下降 73%(转述,我没看到原始测算)。请注意两件事:这是"专门做了工程之后"的数,不是默认值;而且那 73% 说的是它自己的成本下降,不是相对按次买便宜了多少——这是两个完全不同的句子,前者是很多公司都能做到的,后者不是。
**这一节给管理层的判据:先要一张按小时的流量曲线,再谈要不要买卡。**没有那张曲线,上面所有比值都是猜的。
五、第三道算术:那两个人,它不在机器那一格里
现在把第三节里被绕过去的那格补上——"运维"里面到底有没有人。
一份 2026 年 8 月的公开材料把 8 卡配置的月运维写成 9000 元(电费加运维加微调);另一份同年 9 月的材料写成"年运维 60 万,含一个全职"。按后者的口径,每月固定从 1.9 万变成 6.9 万,门槛从每月 102 万次抬到 372 万次,也就是日 12.4 万次——比你那 5 万次高出两倍半。
这里有一个更该被记住的等式。在门槛那一点上,"自建省下的钱"正好等于零:按次买的账单此时和自建的固定成本相等。而这一格上面的所有故事都是同一种形状——你在门槛以下买卡,那笔差值就是净多付;你在门槛以上买卡,那笔差值才叫省。在上面那格演算里(日 5 万次、每次 0.019 元、含一个全职),自建每月 6.9 万 vs 按次买每月约 2.8 万,一年多付约 49 万。
那为什么两份材料的"运维"能差十几倍?因为这件事的人力不是"运维",是另外三件活:推理框架与显存那一层的调优、按你的业务做的效果评测、以及故障那晚的响应。一份 2026 年 8 月的公开材料把这一格说得很直白:能维护生产级推理服务的那个人,他的成本可能就超过了你省下的按次买费用(个人判断,不是财务数据)。这句话在每个公司成立的时点不一样,但它成立的那一格很硬:**你要么有这个人,要么在买卡之外再招一个。**而"再招一个"这件事,在任何一份报价单上都不出现。
顺带把最容易被忽略的一格说清楚:模型每个月都在换代。你买的这批卡的显存和框架,是为今天这一个型号配的。新模型出来时,按次买那一侧的动作是改一行配置里的模型名;自建这一侧的动作是重新评测、可能重新配机器、并且在这期间你的服务不能停。这不叫成本,这叫升级的节奏从"采购"变成"工程"。
六、三道算术之外,账上不会写的三格
第一格:电费走谁的预算科目。机器的折旧好办,它是采购单上的一行。电费、机柜、空调、扩容时的交换机,这几笔在多数公司的报表里不属于"AI 项目",属于机房、行政或者那条早就存在的基础设施预算。结果不是省钱,是看不见:项目自己那份账显得干净,而公司在为它付另一笔。这一格最容易在第一次季度对账时被问出来,也最容易在那时被解释成"临时情况"。买卡之前把科目定下来,比买卡本身更值得开会。
**第二格:故障那晚谁起来。**按次买的时候,厂商降级你至少还有第二家可以切——那一层是谁在做,隔壁那篇讲模型接入层的话已经说过,这里只提一句:**自建的时候,"切备用"这个动作要在你自己的机房里存在。**你得有第二套能吞下峰值的东西,而它平时是空转的,空转到你在第一节里看到的倍数。这一格不进单价,但它进你第一次事故会议。
**第三格:利用率这件事在报表上长什么样。**上面第二节到第五节把利用率讲了三次,因为它是这三个字在现实里最难守住的一格:**买卡的理由永远是"平均量够大",而卡的钱是按"最忙那一小时"配出来的。**一家有专门团队、有稳定流量的机构,在公开材料里报出的利用率是 47%(转述)。你要买的不是那个 47%,是它前面那句"专门做了工程之后"。
七、什么条件下这笔账真的翻转
把三道算术之外的那三格也算进去,公开材料里的判断和我上面演算的结论是一致的:同时满足才谈自建,缺一条就先别。
- 量是连续的,不是白天那八小时。你的曲线全天铺着,或者你有真正的夜间批次(离线批处理、夜间跑第二遍那种)。
- 中小模型就够用,不需要前沿那一档。这一条最硬:模型规格决定你门槛的高度,需要最大的那个型号,门槛高到你追不上;一个小得多的型号就能顶上业务,门槛可以低很多。
- 那个人已经在公司里,不是准备招。
- 账单已经是真实痛点——按次买那一份在你今年的预算里挤掉了别的东西,而不是"感觉有点贵"。
- 模型版本相对稳定,你换型号的周期是按半年算的,不是按周。
- 你压测过,并且压测是在你的延迟目标下做的,不是"跑得动"。
有一份 2026 年 8 月的公开材料给了一个更好用的口径:先按十八个月的窗口去算回收——把一次性投入摊进这十八个月,再看每月差额什么时候把它填平。这个窗口比"三年折旧"更接近你业务的真相:十八个月里模型会换两代、单价会变好几次方向、那个人可能升或者走。任何一笔在这个窗口里回不来的自建,都不该被"三年就平了"这句话说服。
**中间那一档是很多人真正该停的地方:不是全自建,也不是全按次买。**把最稳定、最高频、画像最窄的那一类活儿单独切出来——比如那一个每天都跑、输入输出长度基本固定的批量任务——按它单独算一次门槛。它撑得起一台机器,就让它自己跑;剩下的全部继续按次买。这一格还有个副作用值得写进方案里:你会拿到一份真实的、按小时的流量曲线,而那份曲线是下一次这道题的判据。
八、给管理层的六个动作,按花的钱排
前五个不花钱。第六个才花钱,而且它必须排在最后。
- **要三个数,一个汇报都不要。**本月按次买的账单总额、每次调用的输入输出长度分布(从账单里取,别让人估)、按小时的调用量曲线。**这三个数齐了,这一篇的所有演算你就能自己重跑一遍。**缺一个都别开会。**还有一格口径要当场定下来:分母用"成功且通过业务验收的调用数",不用"发出去的次数"。**重试、超时、被模型答歪之后人肉重做的那几笔,都在后者里;用后者算出来的门槛,会低到骗你。
- **把"运维"那一格拆成两格写在纸上:机器多少钱、人多少钱。**两份同年公开材料差十几倍的那一格,在你自己公司里同样会被合并写。合并的那一格就是这道题最容易做错的地方。
- **给这道题定一个重算节奏:一个季度一次。**单价那一格在 2026 年上半年两个市场反着走,你去年那份结论的保质期就这么长。这一条不花钱,但它省下的是最贵的那种错——按去年的数字买了今年的卡。
- **先做那一层接入层,再谈买卡。**把计量、失败转移、按任务的模型路由放到服务端那一层,这件事隔壁那篇已经讲过做法。它不花钱,却直接改变你门槛的位置:路由把一部分量挪到便宜那一档,你的自建需求会小一截,甚至归零。
- **拿一类最窄的稳定任务做一次单独测算。**判据是"这一类的月量是否超过它自己那台机器的门槛",不是"整个 AI 项目的总量"。
- **只有前五步都做完,才走到买卡。**这时候你要答得出两句:这台机器按峰值配要几台,以及那几个人从哪里来。答不出第二句的,这一版建议按"不买"处理。
回到会议室里那句「一个月付四万,买一排卡是不是便宜一半」。
现在可以答了:**它跟四万没关系。**它跟"这四万是多少次调用、每次多长、挤在几个小时内"有关系,跟"那台机器背后有没有那个人"有关系,跟"明年第一季度单价往上还是往下"有关系。这三格里,只有第一格在你的账单上,第二格在你的编制表上,第三格谁都不在你手里——所以你要按季度去追它。
留一句判据在最后一页:
任何一次"自建更便宜"的提议,如果给不出按小时的流量曲线、也给不出那个人从哪来,那它不是一道成本题——它只是一张报价单。
本文作者:Aryee 发布时间:2026-10-12 06:23
本文出处:ARYEE.cn 固定链接:https://www.aryee.cn/archives/self-host-model-or-pay-per-call.html
转载或引用请连这一行一起带走;文中的代码与结论按当时环境成立,组件升级后请以官方文档为准。