一、引言:效能评估没有固定边界
效能评估本身没有固定边界。它从武器装备领域起步,随后逐步“吃掉”了 IT、金融、工业、AI、医疗、交通、研发管理,最终演变成一套通用的决策建模能力。
如果你只记住一句话,那就是:
性能是局部,效能是系统。
本文把 8 个领域逐一拆开,最后收口到一套跨领域统一套路。
二、武器装备与国防:效能评估的“母领域”
评什么
- 探测 / 通信 / 打击能力
- 任务完成概率
- 可靠性·维修性·保障性(RMS)
- 体系贡献度
用什么方法
- ADC(E = A × D × C)
- SEA(系统效能分析)
- AHP / TOPSIS
- 蒙特卡洛仿真
案例:察打无人机对地攻击效能
这是 ADC + AHP 结合最典型的工程案例。研究团队以 MQ-9、翼龙-2、TB-2 三款察打无人机为对象,针对对地攻击任务重构能力矩阵 C,并用 AHP 赋权:
| 机型 | 对地攻击综合作战效能 |
|---|---|
| MQ-9 | 0.6293 |
| 翼龙-2 | 0.5962 |
| TB-2 | 0.4822 |
结论:不是“谁火力猛谁第一”,而是指出 TB-2、翼龙-2 应在远距作战能力、协同侦察能力等指标上改进。
更贴近实战的是改进 ADC:侦察无人机研究中引入作战人员保障因素 S 和战场环境因素(G/T),得到 E = A·D·C·S·H。算例显示:引入保障和战场环境后,某侦察无人机效能从 0.63 降到 0.46——因为人为因素和环境不再被忽略。
📌 核心启示:可用可信才能谈能力,忽略人和环境会严重高估效能。
三、工业制造与智能制造:评“值不值得改”
评什么
- 设备综合效率 OEE
- 良率、停机损失
- 维护成本、能耗效率
- 产线柔性
用什么方法
- DEA(数据包络分析)
- TOPSIS
- AHP
- 模糊评价
案例:预测性维护要不要上?
| 产线 | 特点 |
|---|---|
| 产线 A | 停机少,但维护贵 |
| 产线 B | 停机多,但人工便宜 |
指标树:
投入(维护成本 / 人工 / 传感器费用) → 产出(良率 / 停机下降 / 交付准时率)
评估流程:
DEA 看谁相对高效 → TOPSIS 综合排序 → AHP 注入管理层风险偏好
结论:往往不是“上不上 AI”,而是先改管理再上 AI。
四、IT / 云平台 / SRE:效能评估的“工程化平民版”
评什么
- 可用率 99.9% / 99.99%
- P95 / P99 延迟
- 单请求成本
- 扩容弹性、RTO / RPO
- SLA 达标率
用什么方法
- 熵权 + TOPSIS
- AHP
- DEA
- SRE 指标体系
案例:云主机选型
| 方案 | 特点 |
|---|---|
| 通用型 | 便宜,高并发掉链 |
| 计算型 | 贵,推理快 |
| 弹性型 | 单价高,峰值自动扩 |
把 ADC 翻译成 IT 语言:
- A = 服务可用率
- D = 容错 / 降级 / 自愈
- C = 吞吐 / 并发 / 业务转化
最终不是选“跑分最高”,而是选业务峰谷最匹配的那个。
五、大模型 / AI 系统:最容易被“跑分骗”的领域
评什么(三层)
| 层级 | 指标 |
|---|---|
| 模型层 | 幻觉率、指令遵从、安全违规 |
| 系统层 | TTFT、端到端延迟、单千 token 成本 |
| 业务层 | 人工转接率、留存、工单解决率、资损率 |
用什么方法
- 基准评测
- MCDM(多准则决策)
- SHAP / LIME
- 线上 A/B + 离线回归 + 红蓝对抗
案例:客服大模型选型
三个候选模型:
- 模型 A:BLEU 高但乱编政策
- 模型 B:稳但保守
- 模型 C:贵但转人工率最低
如果只看 BLEU → 选 A。
若做系统效能评估,加权:
纯文本
幻觉率 0.30 资损率 0.25 转人工率 0.20
TTFT 0.15 单 token 成本 0.10
TOPSIS 一排,模型 C 反杀。
这正是企业级评估强调“全链路成本”而非 API 单价的逻辑:
纯文本
每个成功任务的真实成本 =
(API + 重试 + Prompt 工程 + 后处理 + 人工审核 + 错误修正)
÷ 成功任务数
📌 反直觉但常见的结论:单价最高的模型,往往有最低的全链路成本。
六、金融科技与风控:离线好看,线上亏钱最致命
评什么
- AUC / KS
- 坏账率、欺诈拦截率、误杀率
- 模型公平性、可解释性
- 监管合规
用什么方法
- AHP
- 熵权
- 贝叶斯网络
- SHAP
案例:反欺诈模型上线前评估
| 模型 | 特点 |
|---|---|
| 模型 X | 拦截率高,但误杀 VIP 客户 |
| 模型 Y | 稳,但新型欺诈漏得多 |
| 模型 Z | 中等,但可解释性强,监管爱看 |
金融场景不能只排 AUC,要把 风险 / 收益 / 合规 / 体验 做成指标树:AHP 定业务先验,熵权校正数据,SHAP 解释个案。
七、交通 / 能源 / 城市系统:关键基础设施
评什么
- 供电可靠率、黑启动能力
- 高铁准点率、信号系统安全完整性
- 城市拥堵、事故率、应急响应
用什么方法
- FAHP + DEA
- 模糊评价
- 系统动力学
- 多智能体仿真
案例:综合智慧能源绩效评价
这类系统的指标体系是典型的四维结构:
- 技术效益:供能质量、可靠性
- 环境友好效益:可再生能源利用率、减排率
- 经济社会效益:单位供能成本、投资回收期
- 综合智慧效益:能值评价指标、需求侧互动性、削峰负荷量
📌 朴素结论:数字化与韧性是关键,不是单纯追求供能规模。
八、医疗 / 高价值设备:别只看“机器贵不贵”
评什么
- 设备利用率、开机率
- 检查例数、阳性检出率
- 危急值响应时效
- 成本效益、排程均衡度
用什么方法
- DEA
- TOPSIS
- AHP
- MCDA
案例①:单院大型医疗设备 DEA-TOPSIS 组合评价
对某医院 CT、MRI、PET-CT、SPECT、LA、DSA、B 超的利用效率做 DEA:
- CT 和 B 超的综合 / 纯技术 / 规模效率均为 1(相对有效)
- SPECT 相对效率最低
再用 TOPSIS 排序,结果一致。松弛分析进一步指出:DEA 无效的根源在科研项目和论文产出不足——从社会效益看未充分利用。
案例②:省级资源配置效率
广西 18 家区属医院大型医用设备:
- 综合 / 技术 / 规模效率均值:0.594 / 0.711 / 0.831
- 仅 3 家(16.67%)DEA 有效
- 12 家(66.66%)DEA 无效
- 规模报酬:12 家递增、3 家递减
📌 核心启示:排班比换机器重要。
九、软件研发 / 组织效能:老板最关心却最被忽略
评什么
- 需求交付周期
- 变更失败率(CFR)
- 部署频率
- MTTR、线上故障数
- 告警疲劳度
用什么方法
- DORA 指标(业界标准)
- PCA
- 熵权
- 动态权重
案例:两个研发团队谁更高效?
| 团队 | 特点 |
|---|---|
| 团队 A | 发版多,但线上故障爆炸 |
| 团队 B | 发版慢,但变更失败率低、回滚快 |
只看“交付速度” → 选 A。
用 DORA 四指标评估(2024 报告基准):
| 层级 | 变更前置时间 | 部署频率 | 变更失败率 | 恢复时间 |
|---|---|---|---|---|
| Elite | <1h | 按需(每天多次) | 0–5% | <1h |
| High | 1天~1周 | 每天~每周 | ~20% | <1天 |
| Medium | 1周~1月 | 每周~每月 | ~10% | <1天 |
| Low | 1~6月 | 每月~半年 | ~40% | 1周~1月 |
DORA 核心反直觉结论:速度与稳定性不矛盾——2024 年 Elite 相对 Low 的差距是:
- 前置时间快 127×
- 年部署多 182×
- 失败率低 8×
- 恢复快 2293×
📌 度量陷阱:DORA 团队反复强调—— “你度量什么,团队就优化什么” 。
若用“代码行数”衡量生产力,开发者就写冗余代码;用“Bug 数”衡量质量,测试就少报 Bug。指标必须覆盖效率、质量、健康度三个维度,缺一不可。
十、一张表收口
| 领域 | 评什么 | 常用方法 | 典型结论 |
|---|---|---|---|
| 装备 | 任务完成概率 | ADC / SEA / 仿真 | 可用可信才能谈能力 |
| 工业 | OEE / 良率 / 停机 | DEA / TOPSIS / AHP | 先改管理再上 AI |
| IT云 | 可用率 / 延迟 / 成本 | 熵权+TOPSIS / SRE | 选业务匹配方案 |
| 大模型 | 幻觉 / TTFT / 业务转化 | 基准+MCDM+SHAP | 跑分高 ≠ 系统好 |
| 金融 | 坏账 / 欺诈 / 合规 | AHP / 贝叶斯 / SHAP | 人机协同分层风控 |
| 交通能源 | 可靠率 / 安全 / 应急 | FAHP+DEA / 仿真 | 数字化与韧性是关键 |
| 医疗 | 设备效率 / 成本效益 | DEA+TOPSIS / AHP | 排班比换机器重要 |
| 研发 | 交付 / 故障 / 价值流 | DORA / 动态权重 | 别用代码行数衡量人 |
十一、跨领域的统一套路
纯文本
业务目标
→ 任务剖面
→ 指标树(业务 / 系统 / 模型)
→ 数据采集(日志 / 试验 / 仿真 / 专家)
→ 评估模型(ADC / AHP / TOPSIS / DEA / 模糊 / 仿真)
→ 敏感性分析
→ 决策输出(选型 / 改进 / 验收 / 下线)
你学的不是“装备评估”,而是一套通用决策建模能力。
十二、小结
效能评估的应用边界可以记成 8 个字:
跨域通用,决策驱动
再浓缩成三句话:
- 性能是局部,效能是系统。
- 模型可以简单,逻辑必须完整。
- 评估的终点不是分数,是决策。