一台设备发生故障时,证据很少只存在于一个传感器里。轴承振动开始出现边频,温度缓慢抬升,巡检图像里有轻微渗漏,维修日志又提到上次更换后的异常噪声。这些信息单独看都不够确定,放在一起却能构成完整线索。

这正是工业多模态 AI 值得关注的地方:它不是让模型同时看图和说话,而是让不同来源的数据在时间和设备语义上对齐。

第一难题是对齐,不是融合

振动数据可能以 kHz 采样,温度每分钟一次,图像来自不定期巡检,日志则由人手工填写。若设备 ID、时间戳和工况没有统一,再复杂的融合网络也只是在组合错位的数据。

我会先建立统一事件窗口:以告警或工况切换为中心,收集前后一定时间范围内的波形统计、频谱特征、图像和文本记录。原始数据保留,同时生成可检索的摘要。

模型不必一次完成所有工作

一个稳妥的管线可以分层:专用视觉模型找出缺陷区域,时序模型检测振动异常,规则系统验证阈值与联锁,语言模型负责汇总证据并生成面向维修人员的解释。

这样做虽然不像“端到端大模型”那样简洁,却更容易定位错误。若结论不对,可以判断是图像漏检、时序误报,还是最后的文字归纳出了问题。

缺失模态必须是正常状态

现场数据不会永远齐全。摄像头可能离线,振动传感器可能校准中,日志也可能没有填写。系统应明确标记缺失来源,并降低结论置信度,而不是用默认值伪装成完整输入。

同样重要的是负样本。只收集发生故障前的数据,会让模型把正常的负载波动也理解为异常。正常工况、季节变化、维护前后和不同设备个体都应进入数据集。

解释应该落到可执行动作

“设备可能异常”没有太大价值。更有用的输出应包括证据、影响范围、建议检查项和紧急程度,例如:振动二倍频上升且温度连续 20 分钟偏高,建议在下一次停机窗口检查联轴器对中。

工业多模态系统最好的状态,不是替维修人员作出神秘判断,而是把散落在波形、图像和文字里的证据整理成一条可以复核的路径。

参考资料: