先这样答
私有化选型我按决策顺序讲四步。
第一步:明确业务需求档位。要做什么任务(问答、文档处理、代码)、多语需求、上下文长度要求、QPS 和延迟要求。这一步产出的是「能力清单」,后面的模型选择全对着它来。很多私有化项目失败在起点:没想清楚要什么,抱着「越大越好」买硬件。
第二步:选模型规格。核心约束是显存:模型参数量 × 精度(FP16 约 2 字节/参数,INT8 约 1 字节,INT4 约 0.5 字节)加上 KV Cache 的开销,决定一张卡够不够、要几张卡。举例的量级感:70B 模型 FP16 要 140GB 以上显存,单卡放不下,两张起;14B 到 32B 档 INT4 量化后单卡能跑,能力对多数企业任务够用。所以务实的路线是:先用 7B 到 32B 的开源模型(Qwen、DeepSeek 蒸馏版这类)在业务评测集上测,能力真不够再上更大规格。量化能用 INT4 就先 INT4,实测质量损失可接受就用下去。
第三步:选推理引擎和硬件。推理引擎主流是 vLLM、SGLang 这类,吞吐优化(continuous batching、PagedAttention)都是标配,选型看你的场景:高并发选吞吐优先的配置,低延迟交互选调度优先。硬件看预算和国产化要求:NVIDIA 卡生态最省心,国产卡(昇腾、寒武纪等)在合规要求下是必选项,注意推理引擎的兼容矩阵。
第四步:补外围设施。模型只是个起点,生产还需要:API 网关(鉴权、限流、计费)、监控(吞吐、延迟、显存、异常请求)、版本管理(模型文件大,灰度和回滚要想清楚)、微调链路(后续要用业务数据调模型,训练环境和数据管道提前规划)。
最后一句成本提醒:私有化的总成本 = 硬件折旧 + 电力机房 + 运维人力,调用量不大的场景,私有化通常比 API 贵得多——私有化的理由应该是数据合规和可控性,成本往往是它的短板。
面试官会怎么追问
- KV Cache 显存怎么估? 和上下文长度、并发数成正比:长上下文高并发场景,KV Cache 能吃掉大块显存,容量规划时不能只算权重,要按目标并发 × 最大上下文压测。
- 私有化模型能力不够怎么办? 三条路:领域微调补专业能力;小模型 + RAG 的组合拳补知识;个别复杂请求溢出到 API(混合部署,注意数据边界——出内网的流量要脱敏审批)。
- 怎么验证选型对不对? 业务评测集 + 压测:评测集定能力达标线,压测定并发和延迟达标线,两样都过才签约采购,别信 demo。
回答的坑
- 只聊模型名字不聊显存账。参数量、量化、显存、并发这组数字关系说不清,选型就是空谈。
- 不算总账。硬件之外的运维人力和电力机房成本不提,容易被追问翻车。
同系列的题