Fatal: konnte Benutzername für „https://github.com“ nicht lesen

Wie üblich werde ich das Problem etwas weiter aufschlüsseln – fast eine lustige Geschichte über 3 bis 5 Ausfallpunkte. Nach 4 Stunden Recherche um Mitternacht ist es allerdings nicht ganz so lustig. Einige dieser Angaben sind technisch wahrscheinlich nicht ganz korrekt, aber so liest es sich besser, auch wenn Fehler dabei sein könnten.

Grundlagen (Entschuldigung für die Erklärungen): Mein SSO leitet auf meinen Heimserver um (nachdem Gandi vor ein paar Jahren einige Dinge nicht lösen konnte und ich zu Dynadot gewechselt bin). Es funktioniert auch besser, nach dem Umzug von Hostpapa umzuleiten, die das sehr zuverlässige LFC-Hosting gekauft haben – da konnte man sich nicht sicher sein, ob sie etwas stillschweigend upgraden und die gesamte Infrastruktur zum Absturz bringen.

Und nun zu den 3 (oder kann ich das sogar als 5-Punkt-Ausfall zählen? Das wäre ein neuer Rekord):

1*) Opera wurde heute erneut aktualisiert, scheinbar mit neuem Code, der 301/302-Umleitungen wirklich (nicht) mag und sie hart im Cache speichert (Chromium irgendetwas).
2*) Dynadot hatte heute Nacht scheinbar eine Verzögerung von über 30 Sekunden (genau das, was nötig ist, um das Chromium-Problem auszulösen, das nun im Cache liegt – oh je).
3*) Discourse ist abgestürzt (das oben erwähnte „oops“), weil es nicht innerhalb von 30 Sekunden auf das SSO zugreifen konnte. Die App musste neu gestartet werden, aber ich bin mir tatsächlich nicht sicher, ob Discourse bis zum Neustart down war oder nicht (ich war im Panikmodus :wink: ). Gemini hat mich basierend auf den Logs in Schleifen um SSO/Rails/Redis usw. gejagt. Das war, nachdem ich versucht hatte, ein Upgrade durchzuführen, erwähne ich es aber unter diesem Punkt, um die Kohärenz zu wahren.
4*) Da ich nicht herausfinden konnte, was schiefgeht, habe ich Linux vorsichtshalber neu gestartet und angefangen, Discourse zu upgraden. Das schlug fehl wegen des GitHub-Problems. Und ja, ich musste vorher wie üblich etwas Speicherplatz auf den Disks freigeben, aber ich war nie bei 0 GB, was ebenfalls ein möglicher Grund für Redis-Probleme gewesen wäre. Und ja, II, da die Dinge nun stabil zu sein scheinen, werde ich 10 GB in der Cloud hinzufügen und vielleicht ein Arkshine-Upgrade durchführen.
5*) Eher das 1. Problem, aber während ich versuchte, all dies zu lösen, habe ich die Seite kontinuierlich hart aktualisiert, um zu sehen, ob irgendwo etwas behoben wurde. Ich vermute, ich treffe ständig die gecachte Umleitung vom ursprünglichen Fehler, was bedeutet, dass ich nicht einmal sehen kann, ob das Problem behoben wurde, selbst nach dem ersten Neustart.

  1. Ich kann mein SSO problemlos aufrufen.
  2. Eine andere Domain, die kein SSO verwendet, funktioniert ebenfalls gut.
  3. Wenn ich das SSO für Discourse deaktiviere, wird das Forum angezeigt, aber normale Logins haben bei mir nie funktioniert, daher bringt das nicht viel. Aber jetzt weiß ich zumindest, dass es wirklich das SSO ist, das die Probleme verursacht.
  4. Gemini schlug vor, in einem privaten Fenster zu testen, also habe ich stattdessen Firefox gestartet und – was, das Forum funktioniert einwandfrei. Super, außer… was war das?
  5. Opera schlägt weiterhin fehl. Ja, ich vermute immer noch, dass die Umleitung gecacht wird, aber das wusste ich zum Zeitpunkt der Ereignisse nicht. Ich werde die Site-Cookies, Caches usw. vorerst nicht leeren.
  6. Da es funktioniert, habe ich die Arbeit, die ich eigentlich vorhatte, eine halbe Stunde lang in Firefox erledigt.
  7. Opera neu gestartet und hey presto, das Forum wird angezeigt. Vielleicht habe ich Opera früher schon neu gestartet, ich erinnere mich nicht, aber vielleicht ist der Cache nun abgelaufen und es wurde eine ordnungsgemäße Aktualisierung durchgeführt.

Amüsierenderweise bin ich heute Morgen aufgewacht, und Opera hatte erneut ein Upgrade erhalten. Vielleicht hat dieses hart gecachte Upgrade auch viele andere Probleme verursacht :slight_smile: .

Zusätzlicher Hinweis: 3) ist natürlich der interessanteste Teil für uns. Vielleicht kann es noch aus den Logs gefunden werden (kann bei Bedarf nachschauen). Wenn Discourse abstürzt, versucht es, sich über einen Timer neu zu starten? Oder war die gesamte Site down, bis ich eingeloggt war und die App neu gestartet habe?