Newsletter

    Newsletter abonnieren

    Neue Infrastruktur-Guides, Vergleichsberichte und Migrationshinweise direkt ins Postfach.

    Infrastruktur-Notizen, Guides und neue Tools. Jederzeit abbestellbar.

    Zurück zum Blog
    Kubernetes
    Tooling
    Produktion

    Was geht in der Kubernetes-Produktion tatsächlich schief?

    1. Februar 2026
    3 Min. Lesezeit

    Wie die Diskussion begann

    Hallo Kubernetes-Leute,

    mich interessieren eure realen Produktionserfahrungen mit Kubernetes.

    An alle, die k8s in Produktion betreiben:

    Welche Sicherheitsprobleme habt ihr tatsächlich erlebt?

    Welche Beobachtbarkeitslücken haben die meisten Probleme verursacht?

    Was für Dinge sind in Live-Umgebungen schiefgelaufen?

    Mich interessieren besonders praktische Ausfälle, nicht nur Best Practices.

    Und: Welche Open-Source-Tools haben euch am meisten geholfen, diese Probleme zu lösen? (Security, Logging, Tracing, Monitoring, Policy Enforcement usw.)

    Ich versuche einfach, von Leuten zu lernen, die schon Dinge in Produktion haben scheitern sehen.

    Danke!

    Was in den Kommentaren auffiel

    Diskussionspunkt 1

    Es gab eine Zeit, in der hier alles festgehalten wurde: https://k8s.af/ Ich lache heute noch darüber, weil ich einiges davon schon selbst erlebt habe.

    Diskussionspunkt 2

    Subnetzgröße für k8s zu klein angelegt, an Grenzen gestoßen, brauchte einen neuen, größeren Subnetz-IP-Bereich, was eine ganze Menge neuer Firewall-Anfragen erforderte.

    Diskussionspunkt 3

    Habe versehentlich ~60 Maschinen dem Apiserver-Pool statt dem Node-Pool hinzugefügt, etcd wurde WIRKLICH wütend und brach unter seinem eigenen Gewicht zusammen. An diesem Tag habe ich zwei Dinge gelernt: - Die Workloads laufen größtenteils erstaunlich lange in ihrem letzten bekannten Zustand weiter, wenn die Control Plane ausfällt. Nichts kann sich erholen oder bewegen, aber sie tuckern an Ort und Stelle weiter. - Wenn man alle bis auf ein Mitglied der Apiserver von vor der Änderung herunterfährt, kann man etcd sein eigenes Datenverzeichnis als Backup/Snapshot übergeben, und es stellt die Cluster-Daten bereitwillig ohne etcd-Mitgliedschaft wieder her, und tritt dann den anderen Mitgliedern bei, die man im etcd-Cluster haben möchte.

    Diskussionspunkt 4

    DockerHub-Rate-Limits sind ein großes Henne-Ei-Problem.

    Diskussionspunkt 5

    Windows und Kubernetes ist einer der Kreise der Hölle, von denen Dante gesprochen hat.

    Thread-Übersicht

    Weiterführende Ressourcen