首页 全球FDE实战
GitHub

第4篇 走进行业:不同业务的交付难题 · 第27章

能源与矿业:干预之后,怎样读懂结果

维护系统发出提示,人员检查后更换了有问题的部件,此后没有发生故障。应当把这次提示算成误报,还是算成成功?这个教学情境没有一个仅凭“后来是否故障”就能给出的答案:人员已经改变了设备接下来的状态。

能源与矿业让现场工程同时面对两种变化:建议会促成人的干预,生产又会改变设备和环境。软件必须记得自己曾经根据什么提出建议,也要记得后来的人做了什么。本章先看这种结果解释难题,再追到设备履历、矿山环境和连续生产约束。

美国太平洋煤气电力公司(PG&E)和矿业企业力拓的公开材料能证明平台应用,兴隆庄煤矿记录了客户与技术伙伴联合建设;它们尚不足以确认具体项目的 FDE 职衔。相似工作方式的价值,要在这些生产约束中检验,不能仅凭合作名单确认。

预测成功,为什么未必看得到故障

回到开篇的教学情境。应用发出风险提示,维护团队检查后更换了有问题的部件,此后设备没有故障。如果评价人员只取“发出提示”和“随后是否发生故障”两个字段,就会把这次干预记成误报。反过来,如果每次维修都自动记成一次“避免故障”,又可能把正常检修包装为模型成功。

同一个“未发生故障”,可能来自三条不同的记录:

教学记录 提示后的动作 观察结果 允许写下的结论
E-1 检查并更换了有问题的部件 更换后七天未报故障 发现问题并干预;不能只凭结果判为误报
E-2 完成检查,未发现所查问题,未更换 之后七天未报故障 本次检查未证实提示;保留检查范围,不扩写为设备永远正常
E-3 尚未检查 之后七天未收到故障报告 处置与结果仍不充分,不能等同于检查阴性

这里的七天只是说明记录结构,不是行业统一观察期。若下一周设备已更换、测点移位或生产条件改变,同一数值也可能有新的含义。判断结果时,要同时找到干预记录和当时环境,不能把后来的一张状态表当成完整历史。

三条记录都说明,没有后续故障本身,无法回答“如果不干预会怎样”。能源项目的收益说明因此要比一个分类准确率更谨慎:可以先证明找到了值得复查的异常、减少了无效调查,或让同样的人力覆盖更合理的范围;要声称避免了多少事故,则需要额外的评价依据。

维护也有资源边界。一百条方向正确的建议,如果集中在一个班次交给只有少数人的团队,未必比十条经过排序、能够安排处理的建议更有用。排序不能只按模型置信度,还要结合后果、已有保护、检查条件和维护计划,由客户有权限的人员制定。这些条件决定的是实际行动,不只是页面上的红黄绿颜色。

FDE 在这里的优势,应当表现为能与维护人员一起发现这些差别,并把它们变成可持续维护的规则。它的劣势也很明确:如果项目只能靠少数外部工程师反复解释,每次设备更换都需要他们修补,现场知识就没有真正进入组织的工作方式。模型上线以后,维护记录、标识关系和评价口径仍然需要有人负责。

一份旧档案能活多久

先看一份早于这些平台项目的调查。2010 年 9 月 9 日,美国加利福尼亚州圣布鲁诺发生 PG&E 天然气管道破裂爆炸。美国国家运输安全委员会在 2011 年通过的报告中发现,公司的地理信息系统将事故管段记录为无缝管,实际管段却有焊缝。追溯这项信息,调查人员发现其历史资料链中采用了错误的会计凭证描述;部分现场检查信息也没有进入系统。报告讨论的是工程、质量控制和完整性管理等多方面问题,不能被缩写成一次“数据错误事故”。1

这份调查不是对后来 Foundry 项目的评价。PG&E 与 Palantir 的相关合同始于 2020 年,中间相隔十年。把事故和采购排在同一条时间线上,能够提醒我们问题长期存在,却不能凭时间先后推导后者解决了前者。

它给软件工程留下的问题更具体。某个字段有值,可能只是旧系统要求它不能为空;两个系统里的值相同,可能因为它们抄自同一份错误记录;记录最近被修改,也可能只是格式转换。完整性、一致性和新近程度,都不能单独证明真实性。

因此,工业数据的来历不能只保存“来自哪个数据库”。对会影响工程判断的字段,还应当知道它来自竣工资料、现场测量、维修记录,还是历史推定。记录没有依据时,允许它保持未知,可能比给它补一个看似合理的默认值更有价值。这是本书从调查中提出的工程判断:系统应该帮助组织看见不确定性,而不是在整齐的表格里藏起不确定性。

这种要求会改变 FDE 的工作。为项目搭出统一查询入口,证明的是信息可达;和业务人员一起弄清哪一种证据足以修改资产档案,才开始触及生产责任。两项工作都需要做,但验收不能混在一起。

PG&E:先让同一台设备在系统里相认

PG&E 的 2025 年计划记录了这段建设的几块基础。公司在 2020 年签约使用 Foundry;平台接入了包括 GIS 地理信息系统、SAP 业务系统在内的多种来源。2024 年,它建立了首个用于预测调压设备故障的机器学习模型。调压设备负责稳定燃气压力;模型输入涉及 SCADA,即用于采集、监视现场状态的系统数据,以及作业许可资料和站点地图。同一计划还列出 GIS 与 SAP 的核对工具,以及大量人工修复记录、建立资产关联的工作。2

到了附有 2026 年 3 月 13 日说明信的新版安全计划,核对工作的去向更清楚了。PG&E 将 SAP 与 GIS 的持续对齐,连接到一项资产管理任务:找出地图里存在、业务系统里可能没有的资产,让资产类别负责人识别缺失的维护计划。文件也记录了业务数据管理人员的培训,并说明更换数据管理工具意味着 2026 年需要重新培训。3

这两项细节值得放在一起看。一项说明资料差异为什么值得处理:它可能意味着某件设备没有进入应有的维护安排。另一项说明修好了接口还不算结束:熟悉旧工具的人也需要重新掌握工作方法。若把数据质量当作技术部门的后台指标,就很容易看不见前者的生产含义,也低估后者的持续投入。

PG&E 同一份 2025 年计划还明确,Foundry 不替代原业务记录系统。地图、维修与监测数据的关联,最终要服务于正式资产履历和维护安排。2 同名不一定是同一设备,维修单也可能只更换了一个部件;把这些关系核清以后,才有条件判断提示采用了哪件设备、哪个时期的记录。

平台带来的机会,在于把这种核对从一次性清洗变成日常工作。新维修记录出现时,系统可以发现原来一致的资料开始冲突;业务人员确认后,下游分析获得修正。在这里,系统可以先按规则发现资料差异;物理身份仍有疑问时,应由资产管理人员按业务规则确认所需证明及是否需要现场检查。经过验证的确定性步骤可以自动处理,但不能因此省去对真实设备身份的确认。

这也解释了“不替代原有记录系统”的实际分量。分析应用可以暂时保存一个待核实的关系,不能因此让正式资产档案悄悄换成另一个答案。否则,技术团队在自己的页面上修好了问题,下一班维护人员从原系统读取时,仍会得到旧信息。看板变得准确,组织却没有完成纠错。

沿着一条异常,走到维修结束

下面构造一个维护教学例子,说明这种连接应怎样工作;它不是任何一家公司的项目实录,也不提供设备操作规范。

假设一家公用事业公司有一套监测辅助应用。它发现某站点的数据模式发生变化,拟建议维护人员优先检查。应用从监测系统读取近期变化,从资产档案获取设备身份,从维修系统查找最近一次工作记录。就在生成建议时,三种信息发生冲突:监测通道仍沿用旧设备名称,维修单显示上周更换过部件,地图上却没有变更。

如果直接把这些信息拼成一句“老旧设备存在异常”,语言可能流畅,判断基础却错了。更合适的交付,是把此次建议暂时标记为依据待核实,并生成一项明确的核对任务。这里不是让软件决定设备能否继续运行;现场既有的安全与操作制度照常生效。应用需要解决的是,谁来确认这条分析建议还能不能使用。

一位负责设备档案的人员先核对维修单和验收记录,判断更换的是整件设备还是其中部件。维护负责人确认记录是否反映已完成的工作,而非尚未执行的计划。工程师检查监测通道与资产标识的关联。如果现场证据仍不足,任务就停在“尚未确定”,不能因为某人已点击处理而变成“设备正常”。

把这条过程放进一个小表,就能看出软件究竟在交付什么。

工作节点 需要得到的输入 谁作出判断 留给下一步的结果
发现冲突 监测变化、档案版本、维修单 系统提出,档案人员接收 一项待核实差异,附原始依据
确认对象 完工与验收资料,必要的现场核验 维护负责人和资产责任人 设备身份及生效时间,或仍未知
修正关联 已获确认的对象与时间 工程师实施,业务人员验收 经确认的新关联,以及旧关联历史
重新分析 修正后的记录与相应监测区间 应用重算,维护人员评估 可用建议或需要进一步检查
关闭任务 实际采取的工作及发现 有权限的维护责任人 处置记录、结果及后续跟踪要求

表格中最容易被省掉的是时间。上周换过设备,不意味着上个月的数据也属于新设备。只把当前身份改正确,会把历史监测与维修归给错误的对象。系统需要保存“什么时候起是这件设备”,让过去的判断仍能按照当时的事实复查。

另一个容易省掉的地方是结果的含义。“没有故障”至少可能指检查后未发现问题、维修后未再发生问题,或者观察期内没有收到报告。若都写成一个“否”,模型会学到一种危险的混合答案。现场语言里的差别,必须进入数据结构,而不是留在工程师与老师傅都懂、系统却不知道的口头约定里。

交付的验收也由此变得具体:随机抽取一条被关闭的异常,能否从建议追到原始输入,确认当时是哪件设备,找到谁根据何种证据作了决定,再看后续是否完成?这比统计页面上关闭了多少条任务,更接近生产部门愿意承担的责任。

矿山里的“孪生”,需要跟着现场长大

与地下管网相比,矿山又增加了一项变量:生产活动本身会改变所描述的环境。

2023 年 2 月 22 日,力拓在年度业绩问答中讨论蒙古国奥尤陶勒盖矿山。在回答分析师的问题时,Bold Baatar 介绍与 Palantir 合作的数字孪生及传感器信息,用来帮助了解地下崩落过程。他同时强调矿山当时仍处早期阶段,需要谨慎积累对地下行为的认识。这里的“孪生”,可以理解为根据观测不断更新的数字表示,并不是把地下全部情况拍成一张照片。4

2024 年 11 月 13 日,Palantir 的续约公告进一步称,力拓在该矿配置的 Foundry 整合了数千个传感器的数据,用于理解岩体状态、监测与风险;双方续签四年,并保障力拓继续使用其人工智能平台 AIP。公告说明了已在使用的工作与后续扩展方向,却没有给出可独立核验的安全改善幅度。续约是持续合作的证据,不能代替成效评价。5

这两份相隔约二十一个月的材料,最有价值的连接并非“早期探索终于成功”,而是它们保留了两个不同的认识阶段。前一份记录客户如何面对尚不充分的理解,后一份记录平台在既有工作中的延续。读者如果只摘走后者的“数千个传感器”,就会遗漏前者的谨慎。

由此可以提出一个适用于矿业部署的工程要求:除了观测值,还要记录解释观测值时采用的环境版本。若生产区域、测点位置、作业安排已经变化,历史上有效的关系可能不再适用。模型没有换,输入的现实却换了。此时只监控软件有没有报错,发现不了全部问题。

这并不意味着每次现场变化都要从头训练模型。它意味着项目应当和客户约定哪些变化需要复核、由谁确认、复核期间哪些建议仍可采用。负责现场的专业人员提供变化的含义,工程师负责让它进入系统。对于无法确认的部分,界面必须让使用者看到信息已经过期或依据不足,而不是继续展示一张外观平静的完整地图。

在中国山东,兴隆庄煤矿提供了另一种组织路径。兖矿能源 2026 年 3 月的公开材料回述,山东能源与华为在 2022 年成立联合创新中心,选取兴隆庄与云鼎科技共同建设相关应用。文章记载的管理流程,是从 AI 预警到重点检查、现场核查,再到事后追溯;它也介绍了摄像设备与云边协同架构,也就是现场附近的计算设备与云端相互配合。6 这使“联合建设”有了可讨论的工作内容,而不只是合作签约。

这里的观察对象与奥尤陶勒盖不同:视频中的人员、设备与场景,需要在具体作业语境下理解。一个模型识别出某种画面,并不自动证明违反了哪项规则,更不自动完成了处置。现场核查能够提供被遮挡的信息、工作许可或设备状态;事后追溯则应当帮助区分识别错误、规则不适用和实际风险。后三项是本书对流程的分析,不是对该矿未披露内部细则的补写。

兴隆庄在 2024 年 11 月另一篇材料中,还介绍了通过 GIS 统一图纸和基础数据、随着生产进展更新相关信息的做法。7 它与 PG&E 的问题有一处相通:统一入口只有在变更能持续进入记录时才有意义。矿井里的地图会随生产发展,管网中的设备会随维修更新,两者都要求资料管理跟着物理世界走。

这些联合建设记录说明了应用如何进入检查流程,尚未给出足够的抽样方法、比较期间和变化归因。要判断安全改善多少,需要把实际核查结果、处置与后续变化放回同一个观察范围。

哪些改动值得进入连续生产

接近现场,不等于让每一种新软件直接控制现场。美国国家标准与技术研究院的运营技术(OT)安全指南把这类技术理解为与物理环境交互的系统,并提醒读者:连续过程的可用性要求不同于一般办公系统,重启之类的常见处理可能不可接受。它也单独讨论安全系统与其他控制系统的关系。8

这给部署选择提供了一条实用分界。查询历史、核对记录、辅助安排检查,与直接改变设备运行状态,对时间、故障后果和验证的要求不同。前一类工作可以先在有限范围内比较新旧流程;后一类工作必须进入相应的工业工程与安全验证过程。不能因为一个应用已经获得数据读取权限,就默认它也获得了控制设备的资格。

范围较小不等于价值较小。一个能让维修记录及时回到资产档案的工具,可能解决长期存在的责任断点;一个漂亮的全厂智能助手,如果无法识别哪份记录已过期,可能只是让错误更容易被引用。选择项目时应从可观察的工作损失出发,而不是从模型还能展示哪些能力出发。

项目怎样试验,也取决于建议后面接着什么。在上述教学例子中,可以先让新应用与现有方法并行生成检查建议,由有权限的人员按原流程处理,并单独记录两种方法的差异。这样能比较发现线索的能力,却不能直接宣称新系统已经独立承担生产责任。若后续增加自动派单,试验对象又发生了变化:除了建议是否合理,还要观察重复任务、无人接手和任务挤占。每扩大一步,都要重新说明所验证的是什么。

比较也不能只留下最顺利的设备。一组资料齐全、经常受关注的资产,与一组信息残缺、位置偏远的资产,使用相同模型可能得到很不同的工作结果。项目至少应当把这些差异留在评价中,让读者知道结果适用于哪一类对象。如果只展示已成功接通的数据,难以判断它究竟解决了现场最难的问题,还是绕开了那些问题。

经营者还应把收益拆开看。减少查找资料的时间、减少重复派工、改善维护安排、降低故障风险,彼此相关,却不是同一个指标。前两项可以从任务记录和工时抽样中较快观察;后两项通常需要更长时间,并考虑设备更新、作业负荷与其他措施。把这些收益相加之前,要排除同一次改进被重复计数,也要把现场核查、数据维护和系统运行的持续投入算进去。

如果原有资产管理系统已经能表达对象、版本与维护责任,内部团队又能用稳定规则处理差异,新增一个昂贵的嵌入团队未必值得。若问题跨越多套系统,现场知识尚未形成一致规则,且有人愿意参与持续验证,FDE 式共建才更有机会体现优势。它应当缩短的是组织发现和修正错误的距离,而不是绕过已有的专业判断。

回到开篇那次提示和后来更换的部件。工程师需要展示的不只是“后来未发生故障”,还包括提示针对哪件设备、维护人员发现并改变了什么、观察持续多久,以及当时的生产环境有没有变化。能源与矿业需要的“懂业务”,最终要落在这些可复查的细节上。设备不会因为数据被统一而自动变得可靠;工程的价值,是帮助组织持续检验两者是否仍然相符。

  1. NTSB,Pacific Gas and Electric Company Natural Gas Transmission Pipeline Rupture and Fire, San Bruno, California, September 9, 2010,2011 年 8 月 30 日通过;摘要及印刷页 27、108–110。仅取事故日期、记录来源与更新问题,不把多因事故简化为数据单因。 ↩

  2. PG&E,2025 Gas Safety Plan,印刷页 37–38(PDF 第 42–43 页),Foundry 与表 11。读取的是客户安全计划;平台不替代记录系统、模型输入及人工核对属公开陈述,未据此认定 FDE 编制或独立净收益。 ↩ ↩2

  3. PG&E,2026 Gas Safety Plan,说明信日期 2026 年 3 月 13 日;印刷页 43–45(PDF 第 48–50 页),重点表 13。网页发布日期未知;所述进展主要回顾 2025 年,2026 年培训是需求说明,非已完成结果。 ↩

  4. Rio Tinto,2022 Full Year Results Q&A,2023 年 2 月 22 日,第 3 页 Bold Baatar 回答。合作及早期状态为客户自述,不将口语中的合作表述推定为已核实法律实体。 ↩

  5. Palantir,Palantir and Rio Tinto Renew Enterprise Contract and Extend Access to Palantir’s AI Platform,2024 年 11 月 13 日,续约与 Mongolia 段;未来扩展与已述工作分开。 ↩

  6. 兖矿能源,512 路 AI 场景全覆盖:兴隆庄煤矿筑牢智能安全防线,2026 年 3 月 27 日,“技术筑基”“管理升级”两节。客户报道中的结果百分比缺少公开方法,本章未采作效果结论。 ↩

  7. 兖矿能源,兴隆庄煤矿:“智”领域的超级联盟,2024 年 11 月 12 日,“GIS 平台”一节。生产数据更新为客户自述。 ↩

  8. NIST,Guide to Operational Technology (OT) Security, SP 800-82r3,2023 年 9 月,第 2.3.7、2.4 节。这里只使用第三版的基本区别,不声称它是所有国家或企业的强制规则。 ↩

发现错漏或不同意见,欢迎反馈。可先选中一段原文,再点击“反馈本页”,前往 GitHub 填写 Issue;提交需登录 GitHub。

《全球FDE实战》· 2026年9月版 · 资料截止 2026-09-25。书中区分来源陈述、研究判断与教学示例。
原创内容采用 CC BY-SA 4.0,署名、注明修改,并以相同许可分享;第三方材料权利归原权利人。