Midnight 监控代理在一分钟内检测到验证者故障

一个生产监控系统检测到已停止的验证者,通知了负责的运营方,并确认其恢复服务。该演示还概述了涵盖治理活动与硬分叉协调的潜在 Cardano 应用。

By SongMarketCap

Cardano News - Midnight 监控代理在一分钟内检测到验证者故障

Midnight 开发者关系代表 Stevan Lohja 在 9 月 2 日的 Fireside Dev Hang 上演示了该监控基础设施。13 个验证者中有一个被有意停止后,代理在约一分钟内报告了严重事件,并指出该节点已经落后了多少个区块。其恢复在随后的下一分钟内被自动确认。

监控代理将事件与运营方关联

传统遥测可以识别出现故障的验证者或服务器,但仅凭这些信息无法确定其运营方以及应由谁来响应。

该监控架构使用一份名册将验证者映射到其运营方。当满足预定义条件时,它会识别受影响的基础设施,确定事件的严重级别,标记责任人,并附上相关的操作流程。

在现场测试中,代理报告该验证者已不再提供数据,并将事件归类为严重。通知中写明了该节点落后了多少个区块,并引用了包含响应步骤的运行手册。

当验证者重新启动后,第二条消息将该事件标记为已解决。此次演示的平均确认用时约为一分钟。

严重警报不依赖于 AI 模型

该架构将确定性的事件检测与语言模型分离。

监控规则跟踪预定义条件,包括缺失的验证者、终局性问题、链分歧以及连接的对等节点数量不足。时间阈值可防止普通的短暂网络变化立即生成严重警报。

确定性逻辑决定事件是否构成事故,分配其严重级别并选择接收人。因此,即使语言模型不可用或产生无效响应,严重通知也能继续运行。

一个小型的本地托管模型将底层技术数据转换为可读消息。它解释该事件,识别受影响的基础设施,并将通知与相应的响应流程关联。

Lohja 估计该演示配置的基础设施成本约为每月 $56。该模型在本地 CPU 上运行,避免了额外的商业推理费用。使用 Terraform 管理部署,公共基础设施模板计划在后续发布。

潜在的 Cardano 用例涵盖治理与硬分叉

当前的生产部署监控 Midnight 验证者基础设施。会话中讨论的 Cardano 应用仍是提议中的扩展,而非已上线的服务。

一个用例将涉及识别不活跃的 DReps、已退役的质押池,以及仍指向已不再参与网络的运营方的委托。代理可以将这些记录与经验证的联系信息关联,并发起状态核验。

相同的方法可监控治理提案、截止日期与投票阈值。它可以识别尚未投票的活跃质押池并通知其运营方,前提是有可靠的联系记录,并设有防止误触达的保护措施。

硬分叉协调是另一潜在应用。代理可以跟踪软件采用情况,比对旧链与升级链的活动,并识别仍停留在早期版本的对等节点。

将当前部署扩展到 Cardano 需要治理数据、经验证的运营方记录,以及专为 DReps、质押池与网络升级设计的监控规则。