Come faccio di solito, apro un po’ di più il problema, quasi una storia divertente su 3-5 punti di fallimento.
Non così divertente dopo 4 ore di indagini intorno a mezzanotte. Alcune di queste parti potrebbero essere tecnicamente errate, ma è una lettura più divertente con possibili errori.
Fatti di base (scusate le spiegazioni): Il mio SSO reindirizza al mio server domestico (dopo che Gandi non è riuscito a risolvere alcune cose alcuni anni fa e sono passato a Dynadot). Funziona anche meglio reindirizzando dopo che Hostpapa ha acquistato l’hosting LFC, molto affidabile, e non si poteva essere sicuri che non stessero aggiornando qualcosa in silenzio, facendo crollare l’intera infrastruttura.
Ora, per i 3 (o potrei persino contarli come un fallimento a 5 punti, sarebbe un nuovo record)
1*) Opera si è aggiornata oggi, di nuovo, aggiungendo apparentemente del codice che non ama affatto (o lo odia) i reindirizzamenti 301/302 e li mette in cache in modo aggressivo (qualcosa di Chromium).
2*) Dynadot aveva apparentemente un ritardo di oltre 30 secondi stasera (che è ciò che serve per scatenare il problema di Chromium, che ora è in cache, uh oh).
3*) Discourse è crollato (il “oops” menzionato sopra) perché non poteva accedere a SSO entro 30 secondi. L’app ha dovuto essere riavviata, ma in realtà non sono sicuro se Discourse fosse giù fino al riavvio o no (ero in modalità panico
). Gemini mi ha fatto girare in loop intorno a sso/rails/redis ecc. in base ai log. Questo è dopo che ho provato a fare un aggiornamento, ma lo menziono sotto questo punto per mantenere la coerenza.
4*) Poiché non riesco a capire cosa stia andando storto, riavvio Linux per sicurezza e inizio ad aggiornare Discourse. Che fallisce a causa del problema di github. E sì, ho dovuto ripulire un po’ i dischi prima, come al solito, ma non ero mai a 0G, che sarebbe potuto essere un’altra possibile causa per i problemi di redis. E sì, II, ora che le cose sembrano stabili, aggiungerò 10G nel cloud e forse un aggiornamento di Arkshine.
5*) In parte è il 1° problema, ma mentre cercavo di risolvere tutto questo, ho continuato a fare hard refresh della pagina per vedere se qualcosa fosse stato risolto da qualche parte. Stimo di essere sempre a sbattere contro il reindirizzamento in cache dal fallimento iniziale, il che significa che non posso nemmeno vedere se il problema è stato risolto, nemmeno dopo il primo riavvio.
- Posso accedere al mio SSO senza problemi.
- Un altro sito con dominio diverso che non usa SSO funziona anche bene.
- Disabilitando SSO per Discourse, il forum viene mostrato, ma non ho mai avuto login normali funzionanti, quindi non è di molto aiuto. Ma almeno ora so che è davvero SSO a creare i problemi.
- Gemini suggerisce di testare in una finestra di navigazione in incognito, quindi accendo effettivamente Firefox e, cosa, il forum funziona perfettamente. Ottimo, tranne che per… che cosa?
- Opera fallisce ancora. Sì, probabilmente continua a mettere in cache il reindirizzamento, ma non era qualcosa che sapevo all’epoca. Non ho ancora pulito i cookie del sito, le cache ecc.
- Poiché le cose funzionano, ho fatto il lavoro necessario che intendevo effettivamente fare usando Firefox per mezz’ora.
- Ho riavviato Opera ed ecco fatto, il forum viene mostrato. Potrei aver riavviato Opera prima, non ricordo, ma forse la cache è scaduta e ha fatto un refresh appropriato.
Sorpresa, mi sono svegliato stamattina e Opera ha fatto un altro aggiornamento. Forse questo aggiornamento di cache aggressiva ha creato molti altri problemi altrove
.
Nota aggiuntiva: il punto 3) è ovviamente la parte più interessante per noi. Forse può ancora essere trovato dai log (posso scavare se necessario). Se Discourse crolla, cerca di riavviarsi usando qualche timer? O l’intero sito era giù fino a quando non sono entrato e ho riavviato l’app?