老板问:“要不要自己跑 AI?”不只告诉你要花多少钱,还把钱花在哪里一项项拆出来。

自己运行 AI 要花多少钱?

选择模型、部署方式和用量,估算在自有硬件上运行 Kimi、GLM、DeepSeek、Qwen 等开源模型的成本。

这个估算是怎么算出来的

结果会列出显存、硬件、电费、人力和数据来源等假设,方便你核对这个数字是怎么来的。

显存计算公式

显存需求 ≈ 参数量 × 每参数字节数 × 运行时余量(默认 ×1.2,可调低/标准/高三档情景)。FP16 = 2 字节/参数,INT4 = 0.5 字节/参数。对于 MoE 模型,所有专家权重均需常驻显存,因此按总参数量计算。

硬件匹配逻辑

先从硬件规格库里匹配能装下所需显存的最小 GPU;如果有人工推荐的模型-硬件映射,就优先采用它。

电费计算

月电费 = 功率(kW)× 运行小时数 × 电价 × PUE。功率缺省使用单 GPU TDP 参考;多卡或整机场景请在计算器填写实测墙上功率。默认值已显示,可按所在地区和设施调整。云端租用已经包含电费。

人力成本估算

按 AI 运维工程师月薪区间 × FTE 比例估算。默认值已显示,可按团队和所在地区调整。这是规划估算。

数据来源与更新

GPU 规格来自 NVIDIA,云端价格来自 RunPod 和 Lambda Labs 的公开费率,本地硬件价格参考京东或天猫商品信息。每条价格都会标注更新时间,当前报价请查看来源。

数据来源包括 NVIDIA、Hugging Face、RunPod、Lambda Labs 和京东。价格带有更新时间,当前报价请以来源网站为准。

先算出一个数,再决定怎么跑 AI

把自己运行 AI 的成本变成一个团队可以核对、比较,并拿来讨论自建还是租用的数字。

模型权重可以免费获取,不代表部署不花钱。硬件、电力和日常运维都可能计入账单,具体还取决于模型、容量和部署方式。

用这份估算判断自托管是否值得放进 AI 计划,再把预算讲给团队听。

总价只是起点。结果会列出每个成本项和背后的假设,方便你解释预算花在哪里。

运行 AI 的成本由什么决定?

这份估算主要看四件事:模型、部署方式、用量,以及把系统持续跑起来所需的运维工作。

模型与模型尺寸

模型尺寸决定了所需的显存、算力和硬件配置。

部署方式

云端租用、购买硬件和复用现有基础设施,会带来不同的账单。

预期用量

用量越高,通常需要的容量越大。本版本还没有完整建模吞吐量、并发和延迟目标。

本地运维成本

部署、监控、升级和处理故障都需要人手,具体成本取决于团队和地区。

你可以调整汇率、电价、月薪区间、FTE 比例、PUE、整机系数和折旧周期。

上下文长度、并发量等高级容量输入仍在规划中。

这个估算是怎么算出来的

计算器会把模型的基础设施需求、部署方式、预期用量和运维假设放在一起计算,每一项都会影响最后的数字。

模型与尺寸数据
参数量、架构和模型尺寸来自官方文档与 Hugging Face。
价格数据与时效
GPU、硬件和云价格都是带日期的参考价。结果区会显示各条数据的更新时间;部分数据来自第三方聚合平台。
云价格计费方式
云价格使用按量付费的小时费率,不包含预留容量、协议价和用量折扣。
运行时长
轻度、中度和重度使用,分别对应每月约 120、360 和 720 小时。
运维成本
月度人力按当地月薪乘以 FTE 比例估算,不是固定的供应商运维费。
汇率
默认汇率是 1 USD = 7.2 CNY。如果你的预算使用其他汇率,可以在计算器中修改。
可调整的输入
汇率、电价、人力月薪、FTE 比例、PUE、整机成本系数和折旧周期都可以按你所在地区和设施调整。

价格数据的更新时间会显示在结果旁边,因为市场价格会变化。

这份估算没有算什么

这是规划估算,下面列出计算器还没有完整覆盖的生产成本和容量问题。

  • 这是规划估算,不是供应商报价。
  • 供应商、地区、合同和供货情况都会影响实际价格。
  • 真实容量还取决于吞吐量、并发、上下文长度、量化和延迟目标。
  • 模型质量不在价格估算范围内。
  • 迁移、微调、安全、合规和应用开发都可能增加成本。
  • 冗余、故障响应等生产要求可能改变总成本。

怎么估算自己运行 AI 的成本

选好模型,说明部署方式,得到一个可以拿去讨论预算的可分享数字。

  1. 01

    选择模型

    选一个模型和最接近你计划运行规模的尺寸。

  2. 02

    说明部署方式

    选择云端租用或本地硬件,再设置预期用量,并按所在地区调整成本假设。

  3. 03

    查看并分享估算

    查看总价和每项成本,再把 URL 分享给团队。

要不要自己跑 AI?

计算器先帮你看清自托管这一侧的成本,最终选择还要看你的用量、预算和团队是否能负责运维。

这些情况下,自己跑 AI 可能更合适:

  • 你需要更强的数据和基础设施控制权。
  • 你的用量稳定,能够规划容量。
  • 开源模型能满足质量要求。
  • 团队能够部署和维护系统。
  • 私有部署或定制有明确的价值。

这些情况下,托管 API 可能更合适:

  • 你想快速上线。
  • 用量低、不确定,或波动很大。
  • 团队不想自己运维 GPU 基础设施。
  • 你需要专有的前沿模型。
  • 你更希望按实际用量付费。

两种方式都可能合适。本计算器先估算自己运行模型的成本,API 价格对比正在规划中。

这个计算器会给你什么

How Much To Run AI 先把一次性部署成本和月度运维成本算出来,帮你判断自托管是否值得继续研究。

  • 一次性部署成本区间
  • 月度运维成本估算
  • 算力、电费和运维人力拆分
  • 本次计算使用的模型与部署假设
  • 可调整的假设:汇率、电价、人力成本、PUE、整机系数和折旧周期
  • 可分享的链接:配置会保存在 URL 中,对方打开后能看到相同结果。独立报告导出功能仍在开发中。

当前支持的开源模型

下面是目前已覆盖的开源模型系列,你可以比较不同模型和尺寸下的自托管成本。

常见问题

这里回答的是那些会让估算结果发生变化的实际问题。

路线图

后续更新会把计算器从自托管成本估算,扩展到更完整的自建还是租用对比。

  • 按模型生成部署报告
  • 以更多格式导出报告
  • 对比云端、自购硬件和混合部署
  • 保存并重新查看成本方案