09.06.2026 aktualisiert


verifiziert
Premiumkunde
100 % verfügbarSenior Platform / SRE | Kubernetes | KRITIS & Regulierte Umgebungen | 10+ Jahre
Seelow, Deutschland
Weltweit
Fachinformatiker Systemintegration (IHK)Über mich
Senior Platform Engineer & SRE mit 10+ Jahren in Public Sector, KRITIS und Healthcare. Referenzen: Corona-Warn-App (50M+, 99,95% SLA), Hallo Magenta (Telekom), Bundeswehr AIS Healthcare. Spezialisierung: Kubernetes in regulierten Umgebungen, GitOps, BSI-konforme Architekturen. 100% Remote.
Skills
SREArgo CDGitOpsHelmLokiProxmoxMicrosoft AzurePythonPostgreSQLMariaDBMicrosoft Sql-ServerOpenShiftAnsibleGoogle CloudIstio
PLATFORM ENGINEERING & SITE RELIABILITY
Aufbau und Betrieb hochverfügbarer Kubernetes-Plattformen in regulierten Umgebungen — Public Sector, KRITIS, Bundeswehr, Healthcare, Telekommunikation. Schwerpunkt auf Air-Gapped Architekturen, BSI-IT-Grundschutz-Compliance und auditierbare Plattformzustände.
Kubernetes & Container Orchestration
Kubernetes (10+ Jahre, Multi-Cluster, HA, Air-Gapped), AKS, GKE, Google Distributed Cloud, Rancher, OpenShift, Vanilla K8s, VanillaStack, Helm (Umbrella-Charts), Kustomize, Cilium (eBPF CNI), Longhorn (Distributed Storage), Velero (S3-Backup / DR), Docker, Containerd.
GitOps & CI/CD
ArgoCD (Multi-Cluster, Sync-Waves, Deep Expertise), FluxCD, GitLab CI/CD (DAG-Pipelines, On-Premise & SaaS), Forgejo + Forgejo Actions (Self-Hosted), Tekton, Jenkins, SOPS + age + KSOPS-ArgoCD-Plugin (eigene Init-Container-Integration), Supply-Chain Security (SBOM, Trivy).
Infrastructure as Code
Terraform (10+ Jahre, Azure/GCP, Multi-Environment, State-Management), Ansible (10+ Jahre, eigene Roles, Jinja2-Templates), Crossplane v2 (Multi-Cloud Provider-Setup, Azure + GCP), Bash, Python, PowerShell.
Observability & SRE
Prometheus, Grafana, Loki, AlertManager, kube-prometheus-stack, Jaeger, OpenTelemetry. SLI/SLO-basiertes Monitoring, Error Budgets, Incident Response, strukturierte Postmortems, Root-Cause-Analysis. Erfahrung in 24/7-On-Call-Rotationen mit öffentlicher Sichtbarkeit.
Security & Compliance
BSI IT-Grundschutz, KRITIS-regulierte Umgebungen, Air-Gapped Architekturen, VS-NfD-Kontext. Keycloak (OIDC/SSO, eigene Realms), oauth2-proxy + Traefik ForwardAuth. Service Mesh: Linkerd und Istio (mTLS, Zero-Trust). Cert-Manager + ACME für Certificate-Automation.
Cloud Platforms
Microsoft Azure (10+ Jahre: AKS, VMSS, Front Door, Key Vault), Google Cloud Platform (GKE, Google Distributed Cloud / Air-Gapped), Open Telekom Cloud, Microsoft Cloud Deutschland (Data Trustee), Proxmox, Hetzner.
Datenbanken
Oracle 19c Enterprise (Data Guard, HA, RMAN, HAProxy Health Checks), Microsoft SQL Server 2022 (Pacemaker/Corosync HA), PostgreSQL inkl. CloudNativePG-Operator + pgBackRest, MariaDB, Redis, Kafka.
Web & LLM-Application-Engineering
Eigenentwicklung Labtastic Scout: Production-LLM-Pipeline mit Anthropic SDK, 3-Stufen-Architektur (Rule-based → Claude Haiku → Claude Sonnet) mit Cost-Tier-Optimization. AJV-JSON-Schema-Validation für LLM-Outputs. TypeScript, Next.js 15 (App Router), Drizzle ORM, BullMQ-Worker, Redis, Pino. Playwright für Web-Automation.
Healthcare-IT & weitere
MEDISTAR, JiveX, Mirth Connect (HL7/FHIR-Integration). HAProxy, Keepalived, Traefik, MetalLB. Windows Server 2022 (1.000+ Terminal-Sessions). ITSM: ServiceNow, Jira Service Management.
Arbeitsweise
Remote-First, bundesweit flexibel. Strukturierte Dokumentation, Stakeholder-Kommunikation auf Management- bis Ministerial-Ebene. Agile Teams (Scrum, Kanban). Mentoring, Code Reviews, Architecture Decision Records.
Sprachen
Englischverhandlungssicher
Projekthistorie
Kubernetes-Platform-Engineering für kritische Healthcare-IT-Infrastruktur in hochsicherer, Air-Gapped Umgebung. Verantwortung für den Aufbau und Betrieb der Container-Plattform sowie des vollständigen Observability-Stacks.
Hauptaufgaben:
- Design und Implementierung Multi-Cluster Kubernetes-Architektur auf Google Distributed Cloud
- Aufbau GitOps-basierter Deployment-Pipelines mit ArgoCD
- Implementation vollständiger Observability (Prometheus, Grafana, Loki)
- High Availability Setup für Oracle 19c und MSSQL 2022 Datenbanken
- Load Balancing und Health Checking mit HAProxy
- Supply Chain Security und Container Image Scanning
- Last- und Performance-Testing mit 1.000+ konkurrierenden Sessions
Besonderheiten:
Air-Gapped Deployment ohne externe Internet-Anbindung, höchste Security-Anforderungen, regulatorische Compliance für Healthcare-Daten, On-Premises Google Distributed Cloud Infrastructure.
Erfolge:
- Vollständiger Observability-Stack produktiv im Einsatz
- GitOps-Workflows etabliert mit automatisierten Deployments
- HA-Datenbank-Architekturen erfolgreich getestet
- Monitoring und Alerting für alle kritischen Komponenten
Kubernetes, ArgoCD, GitOps, Prometheus, Grafana, Loki, Jaeger, Terraform, Helm, Google Distributed Cloud, Oracle 19c, MSSQL 2022, HAProxy, Docker, Linux, Python, Bash, Supply Chain Security
Rolle & Verantwortung: Fachliche und disziplinarische Leitung eines DevOps-Teams zur Implementierung von SRE-Praktiken und zum Aufbau hochverfügbarer Cloud-Native-Plattformen in einer KRITIS-regulierten Umgebung des öffentlichen Sektors. Technische Ownership für Plattform-Architektur, Automatisierung und Betriebsprozesse unter strengsten Sicherheits- und Compliance-Anforderungen.
Kernaufgaben & Ergebnisse:
- Team-Führung DevOps (Aufgabenverteilung, Mentoring, Code Reviews, ADRs)
- Aufbau und Betrieb hochverfügbarer Kubernetes-Plattformen (On-Premises / Private Cloud)
- SRE-Implementierung: SLI/SLO-Definition, Error Budgets, Incident Response, strukturierte Postmortems
- Vollautomatisierte GitOps-Deployment-Prozesse mit ArgoCD
- Observability-Stack (Prometheus, Grafana, Loki) für Infrastructure- und Application-Monitoring
- Infrastructure as Code mit Terraform und Ansible
- Stakeholder-Kommunikation auf Management-Ebene
- Abstimmung mit Security und Compliance zur Einhaltung KRITIS-regulatorischer Anforderungen (BSI IT-Grundschutz-Kontext)
- Betriebsprozess-Automatisierung, Capacity Planning, 24/7-Bereitschaftskonzepte
Tech-Stack: Kubernetes, ArgoCD, Helm, Prometheus, Grafana, Loki, Terraform, Ansible, GitLab CI, Linux, Bash, Python, HAProxy, On-Premises / Private Cloud
Arbeitsmodell: 100% Remote
Technische Leitung der Platform Operations für die Corona-Warn-App, eine der meist-heruntergeladenen Apps in Deutschland (50M+ Downloads). Verantwortung für Kubernetes-Infrastruktur, GitOps-Automatisierung und 24/7 Operations unter höchster öffentlicher Aufmerksamkeit.
Hauptaufgaben:
- Technische Leitung Platform Operations Team
- Kubernetes Cluster Management und Orchestrierung
- GitOps-Workflows mit ArgoCD für vollautomatisierte Deployments
- Incident Management und 24/7 On-Call Rotationen
- Monitoring mit Prometheus und Grafana
- Helm Chart Management und Versionierung
- Zusammenarbeit mit Development und Security Teams
- Stakeholder-Kommunikation auf Management-Ebene
Besonderheiten:
Höchste Security- und Compliance-Anforderungen (GDPR), intensive öffentliche und politische Aufmerksamkeit, schneller Aufbau der Operations-Strukturen innerhalb von 2 Wochen, Open-Source-Projekt mit Community-Engagement.
Erfolge:
- 99,95% SLA über gesamte Projektlaufzeit
- Aufbau Operations-Strukturen für 3 Teams in 2 Wochen
- Erfolgreicher Betrieb unter extremer öffentlicher Beobachtung
- Skalierung auf 50M+ aktive Nutzer ohne größere Incidents
Kubernetes, ArgoCD, GitOps, Azure, Prometheus, Grafana, Helm, Terraform, Python, CI/CD, Incident Management, High Availability, Security Compliance, GDPR

exali Berufshaftpflicht-Siegel
Das original exali Berufshaftpflicht-Siegel bestätigt dem Auftraggeber, dass die betreffende Person oder Firma eine aktuell gültige branchenspezifische Berufs- bzw. Betriebshaftpflichtversicherung abgeschlossen hat.
Versichert bis: 01.03.2029