先说明:这里没有给出任何报价数字。算力卡价格、货期受供应链影响大,项目造价又与范围强相关,任何脱离具体需求的“XX 万起”都没有参考价值。更有用的是知道预算由哪几块组成、哪些变量最影响造价。
一、预算由哪几块组成
| 类别 | 包含什么 | 影响大小的主要变量 |
|---|---|---|
| 硬件(本地部署) | 服务器、算力卡、存储与网络 | 模型规模、并发、国产或 NVIDIA 方案;价格与货期波动大 |
| 软件授权 | 知识库、问答与管理后台、行业场景模板 | 用户规模、功能范围、授权方式 |
| 实施服务 | 需求评估、PoC、文档处理、检索调优、部署上线 | 文档总量与格式复杂度(扫描件比例尤其关键) |
| 接口开发 | 与 OA、案件/知产管理、教务等系统对接 | 系统数量,对方是否提供开放接口 |
| 培训 | 管理员、骨干与全员使用培训 | 人数与分层方式 |
| 年度服务 | 模型升级评估、监控、效果回归、知识库增量 | 服务等级与响应要求 |
| 电力与托管 | 机房、电力、散热、运维人力 | 自有机房或托管;设备功耗 |
云端形态没有硬件和电力这两项,换成按调用量计费的模型费,或常驻的专属实例费。
二、云端 API 与本地部署的盈亏平衡
两种方式的成本结构不同:云端是“用多少付多少”,本地是“先付一笔、之后边际成本很低”。比较时用同一时间窗口(例如三年)的总成本:
云端三年成本 ≈ 月均 token 用量 × 36 × 单价本地三年成本 ≈ 硬件 + 软件与实施 + 36 × (电力与托管 + 运维)
两边的数字都用您自己的情况填:
- 月均用量:可以先用 PoC 阶段的实际调用量外推,不要用拍脑袋的估计。一次文档问答往往要把多个片段送进模型,单次消耗的 token 比想象的大。
- 单价:以您选定的已备案模型服务当期公开价为准,价格会变动。
- 硬件折旧:用三到五年摊销,并考虑算力卡价格与货期的波动。
- 隐性成本:本地需要有人运维,云端需要评估数据出境与合规。
一般的规律是:用量小、波动大、数据允许出域时,云端更划算;用量稳定且大,或数据不允许出内网时,本地更合理。这正是我们在评估阶段先做两种方案对比、而不是默认推荐买硬件的原因。
三、不要为这些东西多付钱
- 过大的模型:多数文档问答和文书初稿场景,32B 级已够用,70B 以上成本显著上升而边际收益有限。
- 用不到的并发:按人数 100% 同时在线来配硬件,会让利用率很低。用实测并发配置,高峰时用云端或排队分担。
- 没有评估就开始微调:多数场景通过检索优化就能满足,微调需要标注数据与长期维护。
- 只买设备不买服务:一体机装好不等于业务能用,知识库建设、场景配置和培训的投入往往决定最终效果。
四、怎样得到一份靠谱的预算
- 先用 配置计算器 估算硬件量级。
- 圈定 1~2 个最想解决的场景,不要一次铺开。
- 做一次 PoC,用评估集验证效果,并记录实际并发。
- 要求供应方按上表的类别给出分项估算,而不是一个总价。
- 把验收标准写进合同:评估集跑分和并行期业务比对,而不是“设备已上架”。
常见问题
私有化部署和调用云端 API 哪个更划算?
取决于使用量和数据要求。用量小、波动大、数据敏感度允许时,调用已备案的国产模型 API 通常更划算;数据不能出内网,或长期用量大到云端累计费用超过硬件摊销时,本地部署才成立。可以用本文的盈亏平衡方法按自己的数据算。
预算一般包含哪些部分?
硬件(本地部署时)、软件授权、实施服务、与已有系统的接口开发、历史文档整理入库、培训,以及每年的运维与升级服务。云端形态则以调用费或实例费为主。
想结合您的实际情况算一遍?
文章里的数字是通用参考。是否需要本地硬件、选哪一档、预算怎么构成,需要结合您的使用规模和数据要求评估。
- 用配置计算器先估算硬件量级
- 比较云端、专属云与本地部署的成本
- 给出硬件、软件、实施、培训与服务的分项估算
电话:13716687203 邮箱:info@zzxytech.com