AI 部署成本计算器 | 关于 How Much To Run AI

了解这个 AI 部署成本计算器包含什么、如何阅读假设,以及估算结果的边界。

最近更新: 2026-08-06

本页说明计算器估算什么,以及结果中的模型、显存、部署和成本术语该怎么读。当前实现使用的具体常数和公式见计算器如何工作

这个计算器估算什么

How Much To Run AI 根据当前开放权重模型目录和已覆盖的价格数据,估算在本地硬件或有价格记录的云实例上运行模型的成本。选择模型、精度、部署方式、使用预设和汇率后,可以得到一份规划参考,内容可能包括:

  • 本地硬件或整机的一次性成本区间。
  • 算力、电费、运维人力和本地硬件折旧参考的月度拆分。
  • 当前已发布价格数据中存在匹配档位时的云端租用成本。
  • 本地折旧与云端算力都可用时的自建/租用对比。

这是规划估算,不是云厂商报价、硬件正式报价、容量规划或性能保证。准备比较模型和部署方式时,可以回到首页计算器

模型大小、MoE 与模型身份

模型通常用参数量描述。7B 大约表示 70 亿个参数,14B 和 70B 表示更大的参数规模。参数更多通常意味着更大的权重集合和更高的显存需求,推荐的硬件档位也可能随之变化。

参数量不能单独决定模型质量、速度、许可证或是否适合你的应用。估算器使用模型的总参数量计算显存。对于 Mixture-of-Experts(MoE)模型,active parameters 只是目录元数据,不会替代总参数量进入显存公式,因为当前逻辑假设所有专家权重都要常驻。

模型目录包含模型名称、系列、展示尺寸和 MoE 标记。种子数据中的部分记录还包含 Hugging Face model ID。计算器目前没有完整展示每个 checkpoint 的版本、context window、权重格式或许可证信息。当前目录的许可证摘要请查看独立的模型许可证参考页。模型标签只用于成本模型,不代表法律或兼容性结论。

精度与量化

这里的精度指估算器采用的近似内存表示方式。当前选项对应以下每参数字节假设:

  • FP16:每参数 2 字节。
  • INT8:每参数 1 字节。
  • INT4:每参数 0.5 字节。
  • GGUF Q4:每参数 0.55 字节,作为 Q4 GGUF 变体的简化预留。

这些数值是规划近似,不代表某个具体 checkpoint 文件的实际大小。GPTQ、AWQ、FP8 和不同 GGUF 变体当前没有单独建模。量化可以降低显存占用,但质量、兼容性、未量化层、运行时开销和实际文件大小仍取决于模型及推理栈。

显存与硬件匹配

显存是 GPU 或加速器提供的高速内存。当前公式是简化的权重驻留与基础运行时余量估算

所需显存 ≈ 总参数量(B)× 每参数字节数 × 1.2

固定的 1.2 不是按 context length 或并发量计算的模型。实际部署还可能需要 KV cache、激活值、框架工作区、未量化层、复制或分片开销,以及安全余量。长上下文、高并发和特殊架构都可能让结果偏低或偏保守。

匹配逻辑会先尝试仍有价格记录且显存足够的模型-硬件推荐映射,否则选择当前有价格记录且显存足够的最小硬件档位。云端匹配当前的上限是单个有价格记录的实例中的 640 GB 聚合显存。这是当前目录和匹配数据的边界,不代表市场上不存在更大的裸金属、多节点或其他云端部署。

多张 GPU 的聚合显存不会自动变成一块共享大显存。真实部署还需要兼容的张量或专家并行、分片和互联支持,当前估算器不会验证这些条件。

部署方式

云端租用:使用匹配实例的已发布按量付费价格,按选择的每月运行时长换算。云端电费视为已包含在租金中,当前结果仍会包含运维人力假设。

本地采购:使用已发布的本地硬件价格区间作为预算参考。计算器会应用固定的整机附加系数,再加上电费和运维成本,并给出月度折旧参考。这个系数是在缺少完整 BOM 时使用的规划假设,不是已确认的工作站或服务器报价。

哪种方式更便宜,取决于利用率、地区、库存、账号条件、折扣、互联、支持、电价和团队运维能力。

使用强度

使用强度是用于缩放月度成本的运行时长预设。它只控制成本模型中的计费或通电小时,不用于推断每秒请求数、token 数、吞吐量、延迟、并发量或 GPU 利用率。具体数字和公式见计算器如何工作

成本包含什么

根据部署方式,估算可能包含:

  • 通过当前发布和时效边界的本地硬件或云端算力价格参考。
  • 根据 GPU TDP、运行时长、参考电价和当前 PUE 简化计算的本地电费。
  • 按固定月薪区间和全职等效(FTE)比例计算的运维人力。
  • 按固定周期计算的本地硬件折旧参考。
  • 按所选汇率在 USD 和 CNY 之间换算。
  • 结果中展示的价格来源信息:来源/供应商、资源标识、地区、币种、计费单位、更新时间、条件,以及可用时的来源链接。

不包含什么

结果不会完整计入应用开发、迁移、微调、评测、安全、合规、备份、高可用、监控、商业支持、税费或合同谈判,也不会精确建模上下文长度、KV cache、并发、延迟、吞吐量、batch 大小、驱动或框架兼容性,以及生产压测。

计算器结果目前没有完整提供每个 checkpoint 的许可证摘要或 gated 访问状态。可以先查看独立的模型许可证参考页,再核对具体 repository。当前 UI 也没有把价格来源分类为官方直接价、计算器/API 估算、市场价、零售价、线性推算价或待报价。做采购或部署决定前,请阅读结果中的来源条件,并核对具体 checkpoint。

当前假设都是估算

计算器使用固定的运行时余量、每参数字节数、电价、PUE、人力、折旧、整机成本和汇率假设,用来建立可比较的预算场景。这些不是某个机房或工作负载的实测数据。具体数值、公式和演算示例集中放在计算器如何工作,可以对照当前实现。

常见问题

为什么模型可能能运行,但计算器没有云端结果?

当前结果只使用启用、已发布且未过期的价格记录,以及支持的有价格硬件档位。没有云端结果,表示当前数据集和匹配路径没有可用匹配,不代表不存在优化部署、多设备、裸金属或其他供应商选项。

聚合显存等于一块大 GPU 吗?

不等于。当前匹配会比较记录中的聚合容量。真实部署还必须支持模型分片和所需互联。容量本身不能证明模型一定能加载或达到预期性能。

720 小时是不是代表 GPU 一直满载?

不是。它只是当前成本模型中的重度月运行时长预设,不代表流量、token、利用率或容量目标。

为什么电费可能和实际电费单不同?

当前计算使用 GPU TDP 作为功耗代理,并套用参考电价和 PUE。它没有测量墙上功率,也没有完整建模 CPU、内存、存储、风扇、网卡、电源效率、平均负载或机房合同。

估算更低就代表部署更好吗?

不代表。较低数字可能对应不同的硬件、库存、性能假设、支持方式、可靠性或许可证条件。请把结果用于预算讨论,再验证目标 checkpoint 和工作负载。

快速术语表

  • Parameters(参数):模型中的学习值。参数量是当前简化显存估算的实用输入。
  • Quantization(量化):使用更少的 bit 表示参数以降低显存,通常伴随质量或兼容性取舍。
  • VRAM(显存):GPU 或加速器用于加载模型参数和运行时状态的内存。
  • MoE:混合专家模型;当前计算器即使 active parameters 较低,也按总参数量估算显存。
  • Deployment(部署):运行或提供模型服务的基础设施方式,例如云端租用或本地硬件。
  • Usage preset(使用预设):用于缩放月度成本估算的运行时长假设。
  • Pay-as-you-go(按量付费):云端按照实例时间或用量计费,而不是一次性购买。
  • FTE(全职等效):全职人力的折算单位,本工具用它表示运维岗位的估算占比。