稳定性不只是看官网宣传,要看连接可靠性、消息可靠性、故障容错、长期运行表现、真实项目案例五大块,很多平台演示很好,现场弱网、批量设备、长时间跑就出问题。
一、看官方SLA量化指标(书面要得到)
1. 平台服务可用性
- 工业/农业最低要求 ≥99.9%,全年计划外停机≤8.76小时;99.99%为高可用,年停机≤52分钟。
- 注意:区分「平台服务SLA」和「设备网络」,4G野外信号差不算平台故障。
2. 故障恢复时间MTTR:平台故障恢复尽量≤3060分钟。
3. 消息到达率:上行传感器数据、下行控制指令,正常网络≥99.9%;弱网下看MQTT QoS1机制,不能大量丢指令(比如下发开水泵,平台收不到/下发失败)。
4. 端到端延迟
- 普通监测:≤1s
- 需要远程控制水泵、电磁阀:P99延迟≤500ms,延迟忽高忽低抖动大,平台就不稳定。
5. 并发连接与消息吞吐
不要只看最大理论连接数,要看你项目3倍预估设备数下能否稳定跑;很多平台峰值能连,长时间高负载就掉连接、内存泄漏、消息堆积卡顿。
二、连接与会话可靠性(农业野外4G/LoRa重点)
农业大棚、泵站经常4G信号波动、闪断,这几项最容易踩坑:
1. 心跳保活、僵尸连接清理
设备网络闪断后,平台不能显示“假在线”(设备实际掉线,平台还显示在线),必须正确识别离线状态。
2. 断线重连与会话保持
设备断网恢复后:
- 能不能自动重连;
- 离线期间下发的控制指令,重连后是否补发(设备影子、持久会话);
> 坑:部分平台设备掉线期间下发开关水泵指令,设备上线收不到,造成失控风险。
3. 断网补传能力
网关/RTU本地缓存,网络恢复补传历史数据;平台要支持接收补传时序数据,不能乱序、丢历史记录。野外农业没有这个,断网期间传感器数据直接消失。
三、数据与指令可靠性(工控农业致命点)
1. 上行:传感器数据会不会丢、重复、乱序
长时间7×24小时跑,对比设备本地原始日志和平台数据库,看是否丢点、重复上报、时间戳错乱。
> 农业场景:土壤温湿度、液位数据丢点,报表、统计全部失效。
2. 下行:控制指令可靠性(重中之重)
下发继电器、电磁阀、水泵开关:
- 是否支持QoS确保送达;
- 是否出现:指令发出去,设备没执行;重复执行;平台显示成功,硬件没动作。
> 坑:很多小平台只保证上报,下行控制可靠性差,灌溉、风机控制会出事故。
3. 时序数据库稳定性
大量历史数据存储,不能出现:查询历史曲线超时、部分时间段空白、大量数据写入失败。
四、容错、灾备与平台自我保护
1. 弹性削峰:批量设备同时上线上报(早上大棚传感器集体上报),不能出现消息队列阻塞、全平台卡顿。
2. 多可用区/灾备:公有云大厂一般多AZ;中小型平台问清楚:服务器宕机,数据会不会丢,多久恢复。
3. 限流隔离:一个设备疯狂上报脏数据,不能把整个平台拖垮,租户之间互相隔离。
4. 版本升级影响:平台更新升级,会不会大规模踢掉在线设备、业务中断。
五、自己动手简单实测(选型试用阶段必做)
> 不要光看文档,拿真实RTU/网关跑72小时以上压力测试:
1. 长时间稳定性测试:设备持续上报数据,连续跑37天,观察:掉线频次、丢点、曲线是否完整、下行控制成功率。
2. 模拟弱网闪断:手动断开设备网络几十秒再恢复,检查:
- 离线期间的数据是否补传;
- 离线时下发控制指令,重连后设备是否收到;
- 平台在线状态是否正确更新,不出现假在线。
3. 批量模拟压力:虚拟多台设备同时接入,看会不会连接雪崩。
4. 异常指令测试:频繁下发开关指令,看是否漏执行、重复执行。
六、侧面辅助判断(很有参考价值)
1. 同行业真实案例:优先看有没有大量智慧大棚、泵站、污水处理同类项目,问客户实际反馈:是否频繁掉线、丢数据。
2. 平台故障公开记录:是否频繁出平台服务故障公告。
3. 日志与诊断能力:平台有没有设备连接日志、消息流转日志,出问题能定位是设备网络问题,还是平台问题。差的平台出问题只能笼统说“网络问题”,拿不出诊断数据。
4. 售后响应:出现平台侧故障,多久响应、多久修复。
七、农业物联网快速避坑口诀
> 监测看数据不丢;控制看指令必达;野外看闪断重连补传;长期看7天以上不间断实测。
简单打分清单(可以直接写进方案选型表)
| 检查项 | 合格标准 | 风险后果 |
| 平台SLA可用性 | ≥99.9% | 平台周期性宕机 |
| 消息下行到达率 | ≥99.9% | 水泵/阀门指令失效 |
| 断网重连会话 | 离线指令可补发 | 设备离线,控制失效 |
| 断网补传 | 支持历史数据补传 | 断网期间监测数据全部丢失 |
| 无假在线 | 网络闪断正确更新在线状态 | 运维人员误判设备状态 |
| 72h连续运行 | 无大量丢点、无异常掉线 | 项目现场长期运行故障 |
官方微信
天猫店铺
京东店铺
销售王经理