中等规模 Token / Talk 工厂常见画像是:几十张消费级 GPU、国内开源权重、按 token 计价。下一笔钱往哪花——再买一张卡,还是先把每张卡每秒吐出的 token(tok/s)抠高?
主判断只有一句:已购硬件上,先验证同权重换推理 Runtime 是否过线;过线再谈扩容。 堆卡抬的是容量上限,不自动修单卡 decode(逐 token 生成)效率。
业务账本很粗:收入大致随 tok/s × 卡数 × 单价变动。卡已购入、单价由市场决定时,短期能动的杠杆常常是同卡吞吐——而不是再多一张还没验收的卡。
一、先分叉:换 Runtime,还是再买卡
路径 A · 换推理 Runtime
同一份权重(常见 GGUF)+ 同一张 GPU,相对现网基线(如通用推理栈)做 A/B:比 tok/s、时延分段、质量门禁。不重训。Serving 若 OpenAI 兼容,切流可以低到改 base URL——但「能不能上线」仍取决于客户卡上的实测,不是公开 dashboard。
路径 B · 再买一张卡
扩卡数、抬容量上限。若单卡 decode 路径仍碎、仍空泡,新卡只是把低效乘上更大系数,Capex 与运维面一起上升。
顺序搞反的常见后果:卡越买越多,单卡毛利却看不清;对外只能讲「我们又上了多少卡」,讲不清「同权重换引擎后 tok/s 过了哪条线」。
二、三层正交:别把壳、引擎、模型说成一件事
对外沟通最容易混的,是把平台壳、Runtime、换模型 tag 揉成一句「我们支持某某大模型」。可验收的说法要把栈摊开:
- 1) 平台壳:拉模型、本地 API、运维入口。方便,但通常不是 tok/s 竞赛主战场。
- 2) Runtime / 推理引擎:真正算 token——加载、内核、KV(上下文缓存)、调度、量化路径。Phase-1 主战场在这里。
- 3) 模型版本:名称 + 权重文件 + 量化 tag。换 tag = 换模型版本;公开倍率不能外推。
记忆口诀:换 Runtime ≠ 换模型;换模型或换量化,数字必须重测。边缘设备、机房 Token 工厂、满血大模型多卡集群,是不同故事线——公开示意数字不可串讲。
三、优化主战场往往在 decode
推理至少两段:Prefill(整段提示一次吃进,影响多久开始吐字)与 Decode(逐 token 生成,更绑「卖 token」体感)。MoE(混合专家)还会放大 expert 切换与内核碎片化。
面向消费级 GPU 的专用 Runtime,公开工程讨论里常见着力点包括:路由与 expert 碎片化控制、batch=1 更友好的 decode 算子、调度侧减少启动空泡、Attention / KV 带宽路径等。这些应读作工程方法论,不是未经复测的销售倍率。
任何 tok/s 或加速比,写作「带前提示意 · 以客户环境复测为准」。换卡型必须现场 A/B,不预承诺固定百分比。质量侧要看与参考实现的对齐;只报吞吐、不报 parity,产业方很难签字。
四、换模型时的五问与验收清单
客户一报模型名,建议先过五问,而不是背「我们很快」:
- 1. 格式:是否便于同权对比(如 GGUF 或约定等价物)?
- 2. 结构:MoE、Dense,还是满血集群路线?
- 3. 量化:是否与公开 bench 条件一致?
- 4. 硬件:是否与公开示意 SKU 一致?存量卡以实测为准。
- 5. 负载:上下文、并发、偏 Prefill 还是 Decode?
PoC 可勾选(示意):同 GPU / 同权重;基线写清;decode 与 prefill 分列 KPI;质量门禁;达标再切 staging 流量。诚实收口:公开数是特定条件下的可复现结果;贵司模型与卡现场 A/B,达标再切流,不达标就不切。
五、红线、缺口席位与入口
红线:示意 ≠ SLA;开源参考 ≠ 合同乙方;场景材料不串;未交付能力不当现货;不暗示投资回报。
企业常缺的,是能把「目标模型、量化、基线、KPI、并发与 soak」写进一页验收附件的 LLM / GPU Infra 人才——不是再堆一份「会部署」的简历。班子缺口先诊断,再谈匹配。
- 技术方案 / 试用:#/mrf" rel="noopener noreferrer">https://aipat.dev/#/mrf · #/exclusive" rel="noopener noreferrer">https://aipat.dev/#/exclusive
- 预约团队诊断 / 专家库:https://aipat.dev/
- 联络:contact@aipat.dev
本文为产业方法观察,不构成投资、雇佣或到岗要约;技术示意数字不等于客户 SLA;具体范围以书面 SOW 与客户环境复测为准。