1. 测量三个时间段
分别记录排队、模型生成和结果交付时间,因为它们的原因和优化方式不同。
核心公式有效成本 = 单次成本 ÷ 素材通过率
2. 测试高峰与低峰
低峰期中位数无法说明生产可靠性,应在真实流量时段记录 p50 和 p95 延迟。
3. 计入失败任务
超时和重试同时影响延迟与成本,应分别报告成功任务速度和获得可用素材的端到端时间。
适合继续比较的模型
常见问题
什么是 p95 延迟?
表示 95% 的测量请求会在该时间以内完成。
需要测试多少次?
应覆盖多个时段,足以暴露排队波动,而不是只测一个短突发。
下一步怎么做
使用工作负载规划器建立自己的成本方案,然后收藏候选模型进行比较。数据只保存在你的浏览器。
打开工作负载规划器 →