Como de costumbre, voy a abrir un poco más el problema, casi como una divertida historia sobre 3-5 puntos de fallo.
No tan divertida después de 4 horas de investigaciones a medianoche. Parte de esto probablemente sea técnicamente incorrecto, pero es una lectura más amena, con posibles errores.
Hechos base (perdón por las explicaciones): Mi SSO redirige a mi servidor en casa (después de que Gandi no pudiera resolver ciertas cosas hace unos años y yo me cambiara a Dynadot). También funciona mejor redirigir después de que Hostpapa comprara el muy fiable hosting de LFC y no pudieras estar seguro de que actualizaran algo en silencio y toda tu infraestructura colapsara.
Ahora, para los 3 (¿o podría incluso contar esto como un fallo de 5 puntos, sería un nuevo récord?)
1*) Opera se actualizó hoy, de nuevo, aparentemente añadiendo algún código que realmente (no) le gusta las redirecciones 301/302 y las cachea de forma agresiva (algo de Chromium).
2*) Dynadot aparentemente tuvo un retraso de más de 30 segundos esta noche (que es lo necesario para desencadenar el problema de Chromium, que ahora quedó en caché, uh oh).
3*) Discourse se cayó (el oops mencionado anteriormente) porque no podía acceder al SSO dentro de los 30 segundos. La aplicación tuvo que ser reiniciada, pero en realidad no estoy seguro de si Discourse estuvo caído hasta el reinicio o no (estaba en modo pánico
). Gemini me hizo dar vueltas alrededor de sso/rails/redis etc. basándome en los registros, sin embargo. Esto fue después de que intentara actualizar, pero lo menciono bajo este punto para mantener la coherencia.
4*) Como no puedo averiguar qué está fallando, reinicio Linux por si acaso y comienzo a actualizar Discourse. Esto falla debido al problema de github. Y sí, tuve que limpiar un poco los discos primero como de costumbre, pero nunca estuve en 0G, lo que habría sido una posible razón también para los problemas de redis. Y sí, ahora que las cosas parecen estables, agregaré 10G en la nube y tal vez una actualización de Arkshine.
5*) Algo así como el primer problema, pero mientras intentaba resolver todo esto, actualizo la página de forma agresiva continuamente para ver si algo se hubiera arreglado en algún lugar. Supongo que estoy golpeando la redirección en caché del fallo inicial todo el tiempo, lo que significa que no puedo ni siquiera ver si el problema se ha corregido, incluso después del primer reinicio.
- Puedo acceder a mi SSO sin problema.
- Otro sitio de dominio que no usa SSO también funciona bien.
- Deshabilitar SSO para Discourse muestra el foro, pero nunca he tenido que los inicios de sesión normales funcionen, así que no ayuda mucho. Pero al menos ahora sé que realmente es el SSO el que está causando problemas.
- Gemini sugiere probar en una ventana privada, así que realmente abro Firefox y, ¿qué?, el foro funciona perfectamente. Genial, excepto… ¿qué?
- Opera sigue fallando. Sí, sigo sospechando que está en caché la redirección, pero no era algo que supiera en ese momento. No voy a limpiar las cookies del sitio, cachés, etc. todavía.
- Como las cosas funcionan, hice el trabajo necesario que realmente pretendía hacer usando Firefox durante media hora.
- Reinicié Opera y, hey presto, el foro aparece. Podría haber reiniciado Opera antes, no lo recuerdo, pero tal vez la caché haya expirado ahora y haya hecho una actualización adecuada.
Curiosamente, me desperté esta mañana y Opera hizo otra actualización. Tal vez esta actualización de caché agresiva haya creado muchos problemas en otros lugares también
.
Nota adicional: 3) es, por supuesto, la parte más interesante para nosotros. Quizás todavía pueda encontrarse en los registros (puedo buscar si es necesario). Si Discourse se cae, ¿intenta reiniciarse usando algún temporizador? ¿O estuvo todo el sitio caído hasta que inicié sesión y reinicié la aplicación?