决策依据WHY PRIVATE
私有化部署指把模型权重与推理服务放在自有或租用的服务器上,请求不出内网。是否值得私有化, 取决于三个可判定的要素,按顺序回答:
- 数据不出域:代码、客户数据、商业机密若不允许送第三方 API,私有化是唯一路径;通用问答类请求可先用 API 验证业务。
- 合规要求:面向境内公众提供生成式人工智能服务,需对照《生成式人工智能服务管理暂行办法》 完成备案与安全评估[4];私有化部署配合网关审计与日志留存,是常见的合规基座。
- 长期成本:调用量稳定且高频时,GPU 月租与 API 按量计费存在打平点——经验上稳定高频调用 约 3–6 个月打平(经验值,随模型规模与单价波动),此后私有化的边际成本优势持续放大。
私有化不等于必须上大参数模型。先评估任务难度:检索问答、摘要、客服等场景,7B–14B 级模型 往往已可胜任。从 7B 起步评测、不够再升档,比直接采购 72B 集群务实得多。
推理栈选型INFERENCE STACK
推理栈决定同等硬件下的吞吐与运维成本。三个主流选项的定位差异明显:
| 引擎 | 定位 | 关键能力 | 适用场景 |
|---|---|---|---|
| vLLM | 生产级高吞吐[1] | continuous batching、PagedAttention 显存分页 | 多并发常驻服务、API 网关后端 |
| Ollama | 轻量起步[3] | 单机易用、模型管理简洁 | 验证期、内部工具、低并发 |
| llama.cpp | CPU/边缘量化[2] | GGUF 极致量化,无 GPU 可跑 | 边缘设备、超低预算、兜底环境 |
表 1 · 推理栈选型对比(按并发量、上下文长度与运维能力三口径选择)
选型按序确认:并发量——超过十级并发优先 vLLM,其连续批处理在高并发下吞吐优势显著; 上下文长度——长上下文场景 KV Cache 占用大,PagedAttention 的分页管理能显著缓解显存压力; 运维能力——无专职运维时从 Ollama 起步,验证闭环后再迁 vLLM,模型权重与业务代码均可复用, 迁移成本主要在推理端点与并发配置。
量化与显存规划QUANTIZATION & SIZING
显存规划用两条式子起步:权重显存 ≈ 参数量 × 精度字节数 × 1.2 冗余(冗余覆盖激活值与 框架开销),再加 KV Cache——随并发数 × 上下文长度线性增长,长上下文高并发时可能超过 权重本身。精度档位的取舍:
| 精度 | 显存占用 | 质量影响 | 适用场景 |
|---|---|---|---|
| FP16 / BF16 | 最高(基线) | 质量基线 | 复杂推理、代码生成、最终验收 |
| INT8 | 约减半 | 多数场景损失可忽略 | 兼顾质量与成本的常规定位 |
| INT4 | 减半以上 | 检索/客服类无感;复杂推理需评测 | 显存受限、大批量检索类任务 |
表 2 · 精度档位权衡(量化后建议用业务评测集回归验证再定档)
常见规模的显存经验档位如下(不含长上下文 KV Cache 扩展,选型应留 20% 以上余量):
| 模型规模 | FP16 显存(约) | INT4 量化显存(约) | 参考硬件 |
|---|---|---|---|
| 7B | ≈ 17 GB | ≈ 5 GB | 单卡 24G |
| 14B | ≈ 34 GB | ≈ 10 GB | 单卡 24G(INT4)/ 48G(FP16) |
| 32B | ≈ 77 GB | ≈ 22 GB | 单卡 48G(INT4)/ 双卡(FP16) |
| 72B | ≈ 173 GB | ≈ 48 GB | 多卡 48G 组合 / 80G 级 |
表 3 · 模型规模与显存经验档位(经验值/量级参考,以真机压测为准)
高可用与运维HA & OPERATIONS
私有化不是"一台机器跑起来"就结束,生产服务的连续性靠四件事支撑:
- 多实例与负载均衡:至少双实例前置负载均衡与健康检查,单实例故障自动摘除;架构细节 见高可用架构方案。
- 权重存储共享:多实例挂载同一份模型权重(共享存储或本地缓存校验),避免每台重复占盘、重复下载。
- 灰度升级与版本绑定:模型权重、量化方案、推理框架三者版本绑定发布;新版本先接小流量 验证 TPS 与回答质量,再全量切换。
- 监控指标:TPS、TTFT、显存峰值、队列深度四项为核心观测点;显存峰值贴近上限即触发 扩容评估,队列深度持续上涨先扩容再排查。
GPU 推理服务对显存溢出敏感:并发超限的典型表现不是报错而是整体变慢(KV Cache 挤压)。 最大并发数与限流必须在网关层配置,而不是依赖推理端自律。
实施清单CHECKLIST
- 目标模型定档:先用自己的业务评测集对比候选模型与量化档位,评测达标后再采购硬件,顺序不可倒置。
- 基线压测:按目标并发跑 15 分钟取稳态 TPS 与 TTFT(方法可参考 MLPerf Inference 的基准思路 [5]),不看峰值看稳态;数据作为扩容基线存档。
- 数据边界与审计:明确哪些请求允许出域(如有 API 备份),推理服务日志留存并记录调用方,形成审计链。
- 回滚演练:模型与框架升级前完整备份,实际执行一次回滚并记录耗时,不能停留在文档层面。
- 成本看板:按业务线统计 GPU 利用率与 token 成本,利用率长期低于 30% 应合并实例或降档。
采购前用真机压测替代纸面参数:本站 GPU/物理服务器机型支持测试[6], 以目标模型的实测 TPS/TTFT 反推台数,通常比按参数估算更省一台。
小结SUMMARY
大模型私有化部署的决策链是:先判数据边界与合规义务,再按任务难度定模型档位,然后按并发 选推理栈,最后以稳态压测数据定硬件。INT4 量化可覆盖大多数检索与客服类任务,复杂推理保留 FP16 或 INT8。生产化的重点在多实例高可用、版本绑定回滚与成本看板三件事——它们决定私有化 能否长期稳态运行,而不只是跑通一次演示。