本文要点(TL;DR)
- 直接答案:没有预防性维护的工厂,真实代价不是维修费,而是计划外停机。公开研究普遍把工厂因非计划停机损失的产能量级放在年产能的 5%–20% 区间(ARC Advisory Group 长期研究结论,被制造业界广泛引用)。这笔钱不进任何一张费用报表,它直接从毛利里扣。
- 德勤《Predictive Maintenance and the Smart Factory》(2017)给出的典型收益区间是:维护成本下降 5%–10%,设备停机时间减少 5%–15%,设备可用率提升 10%–20%。
- 「坏了再修」之所以看起来便宜,是因为它的成本被拆散到了加班费、外协费、客户索赔、急件空运里,没有一个科目叫「没做保养」。
- 从事后维修走到预防性维护,需要的不是更贵的设备,而是三件基础工作:设备台账、保养计划与触发规则、停机与故障的结构化记录。
- 预防性维护也有反面:过度保养。判断标准不是「保养做得多不多」,而是OEE 是否在涨、突发停机次数是否在降。
一、一台设备停两个小时,损失的从来不是两个小时的产量
先说一个大多数工厂老板都经历过的场景。
周三下午,总装线上一台设备突然报警停机。维修班十分钟内到场,判断是某个传动部件磨损断裂。备件仓库没有,供应商说明天到货。于是这条线停了大约一天半。
如果按「停机损失 = 停机时长 × 单位时间产量」来算,账面上损失的是一天半的产出。但真实发生的事情通常是这样一串:
- 这条线上在制的半成品卡在工位上,后道跟着空转,前道继续堆料,在制品(WIP)当天翻倍;
- 为了追回进度,周末安排两个班加班,加班工资和能耗都是额外的;
- 赶工阶段的品质波动上升,返修和挑选的工时随之增加;
- 其中一个客户的订单还是赶不上船期,改走空运,运费由工厂承担;
- 采购为了紧急备件付了加急价,比常规采购价高出一截;
- 销售那边挨了一顿投诉,下一轮报价时议价空间被压缩。
把这串账加起来,几乎没有一项会被记到「设备维修费」这个科目下。它们分散在人工、运费、采购、质量损失、客户关系里。这正是「坏了再修」最危险的地方:它的代价是真实的,但在财务报表上是隐形的,于是每年做预算时,维护永远是那个「可以再砍一刀」的科目。
一句话结论:事后维修省下的是可见的维护预算,付出的是不可见的毛利。两者不在同一张表上,所以感觉不到疼——直到某次停机大到瞒不住。
二、计划外停机到底吃掉了多少钱?
这是个可以量化的问题,公开研究已经给出了几个可参考的量级。
| 来源 | 结论 | 怎么读这个数字 |
|---|---|---|
| ARC Advisory Group(工业自动化咨询机构,长期研究结论) | 工厂因计划外停机造成的产能损失,量级在年产能的 5%–20% | 这是产能损失不是费用损失。对满产的工厂,损失的产能约等于损失的订单 |
| Senseye(现为西门子旗下)《The True Cost of Downtime 2022》 | 受访的《财富》世界 500 强工业企业,因非计划停机造成的年损失约相当于其营业额的 11%;汽车行业单条产线停机成本可达每小时约 200 万美元量级 | 汽车的数字对中小工厂没有直接可比性,但「按小时计价」这个思路可以直接照搬 |
| 德勤《Predictive Maintenance and the Smart Factory》(2017) | 实施预测性维护的典型收益:维护成本降低 5%–10%、设备停机时间减少 5%–15%、设备可用率提升 10%–20%、维护计划编制时间减少 20%–50% | 这是做到位之后的收益区间,可作为立项时的收益假设上下限 |
这些数字的用法不是拿去做 PPT,而是换算成你自己工厂的一个数。方法很简单:
- 取上个完整年度的产线小时贡献毛利:(全年销售毛利 ÷ 全年计划开动小时数)。
- 统计瓶颈工序去年的计划外停机总小时数。多数工厂没有这个数,只有维修工单和班组交接本——先把它们统计出来,本身就是这件事的第一步收益。
- 两者相乘,就是你去年为「坏了再修」支付的最低价格。之所以说是最低价,因为它还没算返修、空运、加班和客户流失。
在我们经手的项目里,很多工厂第一次算出这个数时的反应是一致的:这个数比全年的设备维护预算大一个数量级。这就是决策转折点——预防性维护从一件「设备科的事」,变成一件老板要管的事。
三、我的工厂算不算「事后维修型」?六条自检
不用问设备科长,问这六个问题就够了。命中三条以上,基本可以判定还停留在事后维修阶段。
- 问不出设备总数:问「厂里现在有多少台在用设备、多少台闲置、多少台待报废」,要等一天才能给出一份 Excel,而且和实际盘点对不上。
- 保养靠人记:保养周期写在某个老师傅的笔记本上,或者写在设备旁边一张已经泛黄的表格上,没人到期提醒。
- 保养记录不可追:上个月这台设备做没做保养、谁做的、换了什么件,只能靠回忆。
- 故障没有分类:所有停机在系统或台账里都叫「设备故障」,无法回答「过去半年哪类故障最多、集中在哪几台设备」。
- 备件靠经验:关键备件的安全库存是老采购拍的,从没根据实际更换频次调整过。
- OEE 说不清:如果有人问 OEE 是多少,回答是一个拍出来的百分比,说不清时间稼动率、性能稼动率、良品率各是多少。
最后一条尤其关键。OEE(设备综合效率)在半导体设备领域有明确的国际标准定义(SEMI E79),其结构是时间稼动率 × 性能稼动率 × 良品率三项相乘。三项拆不开,就意味着你知道设备「效率不高」,但不知道钱漏在停机、慢速还是废品上,也就无从下手。
四、从「坏了再修」到「到期就保养」,要做哪三件事
很多工厂一提设备管理,第一反应是上传感器、做预测性维护、上 AI 算法。这个顺序是反的。
预测性维护(基于振动、温度、电流等实时数据预测故障)确实是终点,但它的前提是你已经有足够长、足够干净的故障与维护历史数据可供建模。绝大多数工厂缺的不是算法,是台账。务实的路径只有三步,而且这三步不需要买昂贵的硬件。
第一件:把设备台账建成一份「活」的档案
台账不是一张设备清单,而是每台设备的完整履历:位置、所属产线与工序、启用日期、技术参数、关键备件清单、供应商与保修期、历次维修与保养记录、当前状态(在用 / 停用 / 维修中 / 待报废)。
判断台账是否「活」的标准只有一条:设备状态变化时,档案是被动被改还是自动跟着变。如果需要有人事后想起来去补录,那它迟早会失真。这也是设备管理必须长在生产系统里、而不是独立做一个台账表的原因——设备一报修,产线的排产、报工、质量数据都得跟着知道。
第二件:让保养计划自己找上门
预防性维护的核心机制其实很朴素:为每台关键设备定义保养项目和触发规则,到期由系统自动生成工单派给责任人,完成后回写记录。触发规则常见两类:
- 按时间:每 30 天一次日常点检、每 180 天一次深度保养。适用于老化型损耗。
- 按用量:累计运行 500 小时、累计加工 10 万模次后更换某个易损件。适用于磨损型损耗,前提是设备的运行时长或产量能被系统采到。
这里有一个常被忽略的实施细节:保养工单必须和排产协同。如果保养计划不看排产,系统在订单最紧的那一周弹出一堆保养工单,现场只会集体点「延期」,制度就此死掉。可行的做法是把保养窗口安排到换型间隙、计划性停机或非生产班次,让保养不和产出抢时间。
第三件:把每一次停机都记成结构化数据
这是三件事里最不起眼、但决定天花板的一件。
每次停机至少要留下五个字段:设备、开始与结束时间、故障分类、根本原因、处置措施与更换备件。故障分类必须是预定义的下拉选项,不能是自由文本——自由文本的结果是同一个故障有十种写法,事后没法统计。
积累半年之后,这批数据会开始回报你:哪几台设备贡献了大部分停机时长(通常高度集中在少数设备上)、哪类故障反复出现、哪个备件的实际更换周期与手册标称差距最大。到这一步,保养周期才有依据被调整,安全库存才有依据被重设,也才具备了往预测性维护走的数据基础。
顺序不能颠倒:先有台账,才谈得上计划;先有结构化的停机记录,才谈得上优化周期;先有足够长的历史数据,才谈得上预测。跳步的项目,最后大多停在「传感器装了,报表没人看」。
五、别走到另一个极端:预防性维护不等于过度保养
把保养频次一律加倍,停机确实会少,但成本会失控——备件消耗、维护工时、以及保养本身占用的产能,都是真金白银。更麻烦的是,频繁拆装本身也会引入新的故障,这在精密设备上尤其明显。
所以预防性维护做得好不好,不能用「保养做了多少次」来衡量。合理的指标只有三个方向:
| 指标 | 看什么 | 健康的走向 |
|---|---|---|
| 计划外停机时长占比 | 非计划停机小时 ÷ 计划开动小时 | 持续下降,且下降幅度大于保养工时的增加 |
| 计划内 / 计划外停机比例 | 两类停机时长之比 | 逐步向计划内倾斜——停机不可能归零,但可以变得「可预测」 |
| OEE(时间 / 性能 / 良品三项分开看) | 时间稼动率是否随保养到位而抬升 | 时间稼动率先涨;若三项都不动,说明保养做在了非瓶颈设备上 |
最后这一条值得展开:保养资源必须向瓶颈设备倾斜。非瓶颈设备停两小时,可能对交付毫无影响;瓶颈设备停十分钟,整厂产出就少十分钟。把有限的维护人力平均分配给所有设备,是设备管理里最常见的浪费。按设备对产出的影响度分级(通常分 A/B/C 三级),A 类做预防性维护甚至上状态监测,C 类维持事后维修,这才是成本最优解。
六、系统在这件事里承担什么
需要说清楚的是:设备管理系统本身不修设备。它解决的是三个人做不到的事——不遗忘、不失真、可追溯。
苏州奥斯坦丁软件(OTD)的 OTDMES 制造执行系统里,设备管理是与生产、质量、物料同层的模块,具体承担:
- 设备档案与状态:一台设备一份履历,状态随报修、维修、验收自动流转,产线看板上能直接看到当前是谁在停机。
- 预防性维护计划:按时间或按累计运行量触发,自动生成保养工单、派工、超期提醒,保养记录回写档案。
- 报修与维修闭环:现场扫码报修、维修响应与完工确认、故障分类与原因归档,形成可统计的故障库。
- 数据采集与 OEE:通过设备集成层对接西门子、基恩士、欧姆龙等主流 PLC 采集运行状态与产量,让稼动率不再靠人工填报,OEE 三项可以分开看。
- 与生产协同:保养计划与排产互相可见,避免保养窗口撞上急单;关键设备异常时可联动拦截,防止用带病设备继续生产出一批需要返工的产品。
有客户在上线一段时间后反馈:变化最明显的不是维修变快了,而是「以前是设备通知我们它坏了,现在是我们通知它该保养了」(据客户反馈)。这句话大致概括了预防性维护的全部价值——把不可控的意外,换成可安排的计划。
七、常见问题(FAQ)
Q1:我们厂设备不多,用 Excel 管保养计划行不行?
设备数量少于二三十台、且都在同一个车间、责任人固定,Excel 可以撑一段时间。真正撑不住的临界点通常有三个:多车间或多厂区(表格开始出现多个版本)、需要按累计运行量触发保养(Excel 拿不到设备的实际运行数据)、需要做故障统计和周期优化(自由文本无法聚合)。命中任何一条,就该考虑系统化。
Q2:要不要一步到位上预测性维护?
不建议。预测性维护依赖两个前提:关键设备已有可靠的实时数据采集,以及足够长的历史故障样本用于建模。这两项都不具备时,直接上算法只会得到一个没人信的预警模型。合理路径是先把预防性维护跑起来、把故障数据结构化沉淀下来,一两年后再对停机损失最大的那几台 A 类设备做状态监测和预测,投入产出比最高。
Q3:推行预防性维护,最大的阻力在哪里?
不在技术,在产量与保养的冲突。车间主任的考核是产量,保养占用的是他的产能。因此推行时必须做两件事:一是把保养窗口预留进排产计划(而不是让它去挤生产时间),二是把「计划外停机时长」纳入车间考核指标,让减少突发停机成为他自己的利益,而不是设备科单方面的要求。制度设计不到位,系统上得再好也会被现场绕过去。
Q4:怎么判断该给哪些设备做预防性维护?
按设备停机对交付的影响度分级,而不是按设备价格。判据可以很简单:这台设备停 4 小时,会不会影响当天出货?会——A 类,做预防性维护并优先考虑数据采集;不会但会影响本周计划——B 类,做基础定期保养;完全不影响、且有备用设备——C 类,维持事后维修即可。有限的维护资源应集中在 A 类上。
Q5:设备管理是放在 MES 里,还是单独上一套系统?
如果工厂已经有或计划上 MES,建议放在一起。原因是设备数据天然要和生产数据打通:保养计划要看排产,OEE 要用产量和良率算,设备异常要能追到当时生产的那批产品。分成两套系统,这些关联就要靠人工对账,而人工对账在现场几乎不会长期坚持下来。
苏州奥斯坦丁软件(OTD)专注离散制造业的智能制造软件,产品线覆盖 OTDMES 制造执行系统、OTDWMS 智能仓储管理系统与 OTDCRM 客户关系管理系统,服务电子制造(PCBA/SMT)、汽车零部件、家电、精密制造等行业。如果你正在评估设备管理与预防性维护的落地方案,欢迎联系我们做一次现场诊断。
作者
OTD 研究组
专注制造业数字化转型实践,深耕 MES、WMS、数字孪生与 IoT 集成领域,帮助工厂从「看不见」走向「可控可优」。