
自托管大模型不一定省钱:盈亏线先看GPU利用率

自托管大模型没有通用的月度token盈亏线:流量必须足以摊薄持续付费的GPU和运维成本,现有容量还得接得住忙时请求。以Llama 3.3 70B为同模型基准,Together AI的模型报价为输入和输出各每百万token 1.04美元。按量API只对计费用量收费;自托管实例空闲时,租费仍会继续产生。
用双H100连续租用、输入输出各占一半的条件计算,并假设每月投入1500美元运维人力,自托管的账面交点约为每月73.24亿个总token,相当于本文参考输出吞吐的约50%。这个交点只回答平均流量能否摊平支出;若峰值或故障冗余要求再留一组GPU,同一业务量就可能重新变得比API贵。
先把三种方案放在同一计费口径下
同模型的主比较是自托管Llama 3.3 70B与托管的Llama 3.3 70B API:前者买持续可用的容量,后者按输入、输出token付费。两者虽采用同一模型系列,服务框架、量化设置及延迟目标仍可能不同;价格比较不能代替业务质量和响应时间测试。闭源模型API则是第三个预算参照,不能直接当作同等模型能力的报价。
例如,OpenAI的GPT-5 Mini价格列出标准输入每百万token 0.25美元、输出2美元,缓存输入另有0.025美元的单价。输入输出各半时,其混合单价为每百万总token 1.125美元;若输入占80%、输出占20%,则降为0.60美元。托管Llama API在这两种比例下均为1.04美元,说明闭源API与同模型API的账单次序会随请求结构改变。批处理、缓存命中及工具调用费用应按实际账单处理,不能直接套用示例混合价。
成本交点还要接受吞吐检验
设月输入、输出用量分别为I和O,单位是百万token。托管API月费=I×输入单价+O×输出单价。自托管月费=GPU数量×每张每小时租价×计费小时+存储、网络、监控、故障处理和工程人力;为峰值或故障保留的实例也计入GPU数量。若使用已购设备,应将购置、供电、场地和维护成本分摊到相同月份。
本例采用Lambda的双卡H100 SXM实例报价:每张GPU每小时4.19美元,另计适用税费。假设一组双卡连续租用730小时,GPU月费为6117.40美元;再暂列1500美元运维人力,固定月费为7617.40美元。存储、网络及税费未计入,因此这是一条示例成本线,不是采购报价。
当输入输出各半时,托管API的每百万总token价格为1.04美元,自托管账面盈亏量=7617.40÷1.04×100万,约为73.24亿总token。计算容量时则必须换成输出token:NVIDIA的TensorRT-LLM测试在双H100 SXM、Llama 3.3 70B FP8、每请求2048个输入及2048个输出token的满负载条件下,记录了每秒2785.53个输出token。按730小时换算,参考容量约为73.20亿输出token;在输入输出各半的假设下,对应约146.41亿总token,账面交点需持续达到这项参考输出吞吐的约50%。
这里的利用率是实际输出吞吐占同配置参考输出吞吐的比例,不是监控面板上的GPU计算占用率。NVIDIA的数字来自持续送入请求的满负载测试,业务若限制首token等待时间、改变上下文长度或并发形态,可持续吞吐就需要另测。算出成本交点后,还要确认所需月输出量与忙时输出速率都落在实际服务容量以内。
低、中、高流量的月度账单
以下三档均为条件相同的示例:每月计费730小时,输入输出各半,只保留一组双卡,运维人力暂按1500美元计,API不计缓存折扣。月总量取10亿、50亿和100亿token,只用于展示固定支出如何随流量摊薄,并非业务需求预测。
- 低流量,每月10亿总token:同模型托管API约1040美元,GPT-5 Mini约1125美元,自托管约7617美元。所需平均输出吞吐仅为参考值的约6.8%,已经付费的容量大部分时间无法转化为业务用量。
- 中流量,每月50亿总token:两种API分别约5200美元和5625美元,自托管仍约7617美元。平均输出吞吐约为参考值的34.2%;月用量虽明显增加,仍不足以摊平这一组双卡和假设的人力成本。
- 高流量,每月100亿总token:两种API分别约10400美元和11250美元,自托管账面仍约7617美元。平均输出吞吐已达到参考值的约68.3%;这项节省只有在实际延迟目标和忙时负载允许单组实例承载时才成立。
这些金额随输入输出比例、GPU区域报价和运维排班而变化。对中国及亚太团队,还应把可购买地区的合同价、税费与跨境网络条件放进同一预算周期;美元示例不能直接当作本地结算成本。若请求偏向长输入、短输出,闭源API账单可能明显下降,而自托管所需吞吐也不能继续沿用2048输入、2048输出的测试值。
峰值和冗余怎样改写盈亏线
仍看高流量档:假设忙时需求达到月平均速率的两倍,单组双卡就需提供参考输出吞吐的约136.6%,已超出上述测试容量。若为此整月保留第二组双卡,GPU租费约为12235美元;即使运维仍只按1500美元计算,总额也约13735美元,高于该档约10400美元的同模型托管API账单。峰值若只持续短时间,按需启用第二组实例或把溢出请求转给API可能改变结果,但要分别核算启动时间、实际启用小时数和转发用量。
故障冗余也会占用付费容量。若要求一组双卡失效后另一组立刻接管全部请求,备用组即使平时低负载也要计租费;若两组平时共同服务,则应以退出一组后的剩余吞吐核对服务目标。NavyaAI的成本拆解还将监控、升级、事故响应、峰值缓冲和工程人力列入自托管支出。本例的1500美元只是可替换的假设,不能代替团队实际排班及故障成本。
用业务数据重算自己的盈亏量
可复算的输入表应保留月输入token、月输出token及各自API费率,并单列缓存后真正计费的输入量。容量一侧应填入请求长度分布、忙时并发、可接受延迟、同配置实测输出吞吐、每月计费小时及实例数量。最后填入故障冗余要求、工程人员投入、监控与存储网络费用,才能把成本交点和服务容量放在同一张账上。
若月总token量记为Q,输入占比记为a,同模型API的混合单价P=a×输入单价+(1-a)×输出单价;账面盈亏量=自托管月固定成本÷P×100万。容量检验则用月输出量Q×(1-a),对照实测输出吞吐×3600×可服务小时×计划可持续负载比例;忙时还需单独计算,不能拿月平均值代替。只要峰值使实例数量增加,就应以增加后的固定成本重算交点。
基础流量稳定而峰值短促的业务,可以再算一档混合方案:常驻GPU处理基础请求,超出的输入和输出token按API费率付费。它是否便宜,取决于常驻容量的持续负载、溢出持续时间及服务切换成本。月流量跨过账面交点只是开始;实际吞吐和需要长期保留的容量,才决定自托管能否把账面节省变成真实节省。
相关阅读:
相关文章
订阅我们的新闻通讯
将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。




