多模态生成产品(文本、图像、语音、视频)的成本结构差多少?怎么设计定价和成本控制?
先这样答
量级差异先摆出来。文本对话一次几毫到几分钱;图像生成一次几毛钱量级;语音合成的单位时长成本比图像低;视频生成按秒计费,一次几十秒的视频成本可以是图像的几十到几百倍。同一个「生成」动作,跨模态成本差三到六个数量级,产品的定价、免费额度、功能入口设计全部被这个差异塑造。
成本控制的手段分四类。任务分级:先便宜后昂贵,图像产品先出低分辨率草图确认再出高清,视频先出分镜预览再出成片,把昂贵算力花在用户确认过的意图上。缓存复用:相同或相似请求的结果缓存,模板化的生成物(固定风格的配图、常用音效)直接命中资产库,生成成本归零。异步队列:昂贵模态全部异步化,用户提交任务后离开,完成后通知,用排队平滑算力峰谷、提高 GPU 利用率。失败预算:重试次数封顶、降级链路(视频失败降级为图文),防止坏案例吃掉无限算力。
定价设计对应成本结构:免费额度给便宜模态,昂贵模态按次或订阅收费,企业侧按量阶梯计价。核心原则是让单位经济模型为正——每个用户的预期收入要覆盖其预期算力成本,营销补贴可以短期打破这个等式,但产品结构不能永久倒挂。
面试官会怎么追问
- 「先预览后成片具体怎么设计?」 预览用低参数量快速模型出低保真结果,用户确认意图后用完整模型出成片。关键是预览和成片的语义要一致,预览确认的是构图和意图,不是细节质量,要在产品文案里管理预期。
- 「缓存怎么处理个性化内容?」 缓存只适合公共部分:风格模板、背景素材、标准音效。个性化主体内容不缓存。架构上把生成物拆成模板层和实例层,模板层进 CDN,实例层实时生成。
- 「怎么发现成本异常?」 按模态、功能、用户分层埋点成本指标,监控单次成本分布,重试率、失败率、排队时长联动告警。某类请求的成本分位数突然抬升,通常是模型版本变更或攻击性滥用。
回答的坑
- 只说「控制成本」没有分层手段。分级、缓存、异步、预算四件套要能展开。
- 定价只抄竞品不推成本。答单位经济模型,展示从算力成本倒推定价的思路。
同系列的题
—— 本题完 ——