L'agente di monitoraggio di Midnight rileva il guasto di un validatore in un minuto

Un sistema di monitoraggio in produzione ha rilevato un validatore fermo, ha notificato gli operatori responsabili e ne ha confermato il ritorno in servizio. La dimostrazione ha inoltre delineato potenziali applicazioni su Cardano riguardanti l'attività di governance e il coordinamento degli hard fork.

By SongMarketCap

Cardano News - L'agente di monitoraggio di Midnight rileva il guasto di un validatore in un minuto

Il rappresentante per le relazioni con gli sviluppatori di Midnight, Stevan Lohja, ha dimostrato l'infrastruttura di monitoraggio durante il Fireside Dev Hang del 2 settembre. Dopo che uno dei 13 validatori è stato arrestato deliberatamente, l'agente ha segnalato un evento critico entro circa un minuto e ha identificato di quanti blocchi il nodo era rimasto indietro. Il suo ripristino è stato confermato automaticamente nel minuto successivo.

L'agente di monitoraggio collega gli incidenti agli operatori

La telemetria convenzionale può identificare un validatore o un server in errore, ma da sola non determina chi lo gestisce o chi dovrebbe intervenire.

L'architettura di monitoraggio utilizza un elenco che mappa i validatori ai rispettivi operatori. Quando vengono soddisfatte condizioni predefinite, identifica l'infrastruttura interessata, determina la gravità dell'evento, contrassegna le persone responsabili e allega la procedura operativa pertinente.

Durante il test in diretta, l'agente ha riportato che il validatore non forniva più dati e ha classificato l'evento come critico. La notifica indicava di quanti blocchi il nodo era in ritardo e faceva riferimento al runbook contenente i passaggi di risposta.

Una volta riavviato il validatore, un secondo messaggio ha contrassegnato l'incidente come risolto. La dimostrazione ha prodotto un tempo medio di presa in carico di circa un minuto.

Gli avvisi critici non dipendono dal modello di IA

L'architettura separa il rilevamento deterministico degli incidenti dal modello linguistico.

Le regole di monitoraggio tracciano condizioni predefinite, tra cui un validatore mancante, problemi di finalità, divergenza della catena e un numero insufficiente di peer connessi. Soglie temporali impediscono che normali variazioni di rete di breve durata generino immediatamente avvisi critici.

La logica deterministica decide se un evento rientra nella definizione di incidente, ne assegna la gravità e seleziona i destinatari. Le notifiche critiche possono quindi continuare a funzionare se il modello linguistico diventa non disponibile o produce una risposta non valida.

Un piccolo modello ospitato localmente converte i dati tecnici sottostanti in un messaggio leggibile. Spiega l'evento, identifica l'infrastruttura interessata e collega la notifica alla procedura di risposta appropriata.

Lohja ha stimato il costo dell'infrastruttura della configurazione mostrata in circa 56 dollari al mese. Il modello viene eseguito localmente su una CPU, evitando un costo separato per l'inferenza commerciale. Terraform viene utilizzato per gestire il deployment, mentre modelli pubblici di infrastruttura sono previsti per una versione successiva.

Potenziali casi d'uso su Cardano riguardano governance e hard fork

L'implementazione in produzione attualmente monitora l'infrastruttura dei validatori di Midnight. Le applicazioni su Cardano discusse durante la sessione restano estensioni proposte piuttosto che servizi attivi.

Un caso d'uso riguarderebbe l'identificazione di DReps inattivi, stake pool ritirati e deleghe che restano assegnate a operatori che non partecipano più alla rete. Un agente potrebbe collegare tali record a informazioni di contatto verificate e avviare un controllo dello stato.

Lo stesso approccio potrebbe monitorare proposte di governance, scadenze e soglie di voto. Potrebbe identificare stake pool attivi che non hanno votato e notificare i rispettivi operatori, a condizione di disporre di registri di contatto affidabili e di salvaguardie contro il contatto dei destinatari sbagliati.

Il coordinamento degli hard fork rappresenta un'altra potenziale applicazione. Un agente potrebbe monitorare l'adozione del software, confrontare l'attività tra catene vecchie e aggiornate e identificare i peer che restano su una versione precedente.

L'espansione della distribuzione attuale a Cardano richiederebbe dati di governance, registri di operatori verificati e regole di monitoraggio progettate specificamente per DReps, stake pool e aggiornamenti di rete.