Profilanlagen 2026-04-Valery.Khamenya-Principal-DS-Math-ML-AI-CS.docx
Über mich Erklärbare XAI/ML+Optimierung (NP-hard) für constrained Entscheidungsprobleme
End-to-End: Modellierung bis Deployment/Integration (Python/R,C++,Spark,AWS/GCP,Solver,Docker)
Branchen: AdTech/TV, Telco, Auto(ADAS/Maps), Fin/Ins, Pharma/Biotech, IoT
Verfügbar 02/2026
München/Remote.
Skills Fahrerassistenzsysteme Unternehmensplanung Amazon Web Services Amazon S3 Data Analysis Künstliche Neurale Netzwerke Automatisierung Automobilindustrie Telekommunikation Big Data Biotechnologie Biostatistik C++ Inhaltsanalyse Data Mining Datenmodell Linux Ingenieurwesen Finanzen Forecasting R (Programmiersprache) Apache Hadoop Skalierbarkeit Python PostgreSQL MongoDB Pharmazie TensorFlow Scala Softwareentwicklung Statistiken Zeitreihenanalyse Fahren von Bussen Ablaufplanung PyTorch Large Language Models Apache Spark Deep Learning Git Kotlin Docker
Mehr anzeigen
Senior Data Scientist & Mathematiker (M.Sc.) aus München mit 15+ Jahren in ML/Statistik & R&D und 20+ Jahren professioneller Softwareentwicklung. Ich übernehme Projekte von Problemformulierung & Datenanalyse über Modellierung/Optimierung bis zur robusten Implementierung (inkl. Performance, Deployment, Monitoring-Basics).
Was ich liefere
Angewandte ML-Modelle (klassische ML-Verfahren bis Deep Learning, je nach Problem sinnvoll), inkl. Diagnostik, Interpretierbarkeit, Drift-BewusstseinZeitreihen & Forecasting (u.a. TSFM, GAM/ARIMA-Familie)Optimierung / Operations Research: Planungs- und Allokationsprobleme, multiple-constraint knapsack-artige Aufgaben, MILP/CP-SAT-nahe Modellierung, heuristische & stochastische VerfahrenML(LLM) & NLP für Semantische Suche: Dokumentverständnis, semantische Extraktion, Retrieval-Systeme, skalierbare TextanalyseBig Data / Engineering: Spark/EMR, Batch-Pipelines, Datenmodellierung, Docker/Linux-first DeliveryTechnologien: Python, R, Scala, Kotlin, C++ | PyTorch, TensorFlow, ONNX | Spark/Hadoop | PostgreSQL, MongoDB | AWS (EMR/EC2/S3/Batch), GCP | Docker, Git
Branchen (erprobt): AdTech/TV-Media, Telecom, Automotive (ADAS/Maps), Finance/Insurance, Pharma/Biotech.
Deutschverhandlungssicher Englischverhandlungssicher RussischMuttersprache
Projekthistorie • Mentoring für Advanced Analytics
• Beratung zu Datenanalyse-Methodik und statistischer Modellierung
• Begleitung der Produktionsreife von Analytik-Lösungen
Tools: R, Python
• Mentoring für Advanced Analytics • Multivariate Analyse, Korrespondenzanalyse, Ursache-Wirkungs-Analyse, Faktorenanalyse, ICA, PCA, etc.Tools: R / RStudio, Python / PyTorch
• High-Performance Resource Allocation via Auktion
• Holistische (multi-campaign & multi-channel) Anzeigen-Platzierungs-Optimierung
• Algorithmische Optimierung für NP-hard / NP-complete Probleme
• Multiple Knapsack Problem mit Constraints
• Online-Schätzung von Parametern in stochastischen Umgebungen
Tools: Python, R, Kotlin, MILP / SAT / CP Solver, PyTorch, Pandas, Docker
• Anzeigen-Platzierungs-Optimierung
• Algorithmische Optimierung für NP-hard / NP-complete Probleme
• Polynomial-Zeit-Approximationen für Probleme mit exponentieller Komplexität
• Multiple Knapsack Problem mit Constraints
Tools: Python, R, Kotlin, MILP / SAT / CP Solver, PyTorch
• Angewandte Forschung in Machine Learning und Deep Learning
• Modellentwicklung und Prototyping für interne F&E-Projekte
• End-to-End: Datenanalyse, Modellierung, Training, Deployment
• Übergang von R&D-Prototypen zu produktionsreifen Lösungen
Tools: Python, PyTorch, TensorFlow, ONNX, Linux, Docker
• Beratung zur Parallelisierung von R-Workloads
• Profiling, Vektorisierung, Multi-Core- und Multi-Node-Patterns
• Empfehlungen zur Skalierung statistischer Berechnungen für Rückversicherungs-Use-Cases
Tools: R, Linux
• Angewandte ML / NLP-Beratung im Kontext Personaldienstleistung
• Text-Mining, Pattern Recognition, statistische Modellierung
• Empfehlungen zu Produktionsreife und Skalierbarkeit der Lösungen
Tools: Python, R, Linux
• Aufbau eines Data Lake von Grund auf
• Automatisiertes Spark-Batch-Processing
• Aufsetzen des vollständigen GitLab-CI- und GitLab-Flow-Zyklus
• Spark-basierte Datenanonymisierung und -historisierung
• Definition des Software-Developer-Guides für das Team
Tools: Spark, Hive, Hadoop, Python, PySpark, GitLab, Docker, Docker Hub, Apache Zeppelin, Hortonworks, Nexus, git, Linux toolset
• Highlight: Autor der von Telefónica eingesetzten Geolokalisierungs-Technologie
• Location Intelligence aus Big Data abgeleitet
• Geolokalisierung von Teilnehmenden auf Basis anonymisierter Low-Level-Event-Daten aus dem Mobilfunknetz
• Big-Data-Analyse von Netzwerk-Event-Daten mit AWS EMR und Spark
Tools: Scala, Spark, Python, R, Zeppelin, Hive SQL, Hadoop, S3, AngularJS, AWS EMR, EC2, Docker, AWS Linux, OpenStreetMap (OSM)
• Edge Computing, „5G“ und allgemeines AWS Cloud Computing
• Beratung zu Python-basiertem Microservice-Networking (TCP/UDP/OSC/HTTP)
• Beratung zum Roll-out, Zusammenarbeit mit Hardware-Engineering
• Beratung zu DevOps-Themen
Tools: Python, C++, Docker
• Beratung zu Attributionsmodellierung in R
• Beratung zu Generalized Additive Models (GAM) für Zeitreihen
• Beratung zu Autoregressive Moving Average Modellen (ARMA / ARIMA)
• Beratung zu Algorithmen für optimale Budget-Verteilung über Assets (Investmentstrategien zur ROI-Maximierung)
Tools: R
• Schwerpunkt: Team-Leading und Delivery-Management für zwei SOA-Komponenten der Thermomix® Cloud Platform während der Cook-Key® Go-Live-Phase
• Reporting an das Top-Management der Thermomix®-Gruppe von Vorwerk
• Kommunikation mit Software-Lieferanten benachbarter AWS-Microservices
• Hands-on Incident-Management in Backend-Komponenten
• Governance-Prozesse, Change- & Release-Management
• Automatisierung des KPI-Reportings
• Integration beider Microservices in die Thermomix® Cloud Platform
• Hands-on Zusammenarbeit mit DevOps bei Deployment und Konfiguration
• Automatisierte Auswertung großer Mengen Log-Daten
Tools: Polarion, Kibana, Docker, C++, git, nginx, MySQL und weitere
• Coaching für Mitarbeitende des AbbVie-Forschungsteams
• Thema: „Semantic Search und Web-Mining“
Tools: umfangreiche eigene Erfahrung und PowerPoint!
• Entwicklung hochpräziser Straßenkarten für Fahrerassistenzsysteme (ADAS) und autonomes Fahren
• Umsetzung der Lösung in Software (SCRUM)
Tools: C++, PostgreSQL, OpenCV, Linux toolset
• Entwicklung von DB-Triggern zur Erkennung betrügerischer Transaktionen
• MySQL-Reporting für Fraud-Transaction-Monitoring
Tools: MySQL / MariaDB, Linux toolset
• Beratung zur Audio-Pattern-Recognition
• Coaching zu Python, TDD, SCRUM
• Deployment, Konfiguration, Provisionierung (Docker, Puppet)
• Microservices-Architektur / Service-Oriented Architecture (SOA)
Tools: Python, pypy, numpy, Docker, Puppet, MATLAB, Linux toolset
• Bewertung von Sensor-Fähigkeiten für Fahrerassistenzsysteme (ADAS) und autonomes Fahren
• Automatisierte Auswertung großer Mengen von Sensordaten
• Automatisierte Report-Generierung für technische und Management-Entscheidungen
Tools: MATLAB, LaTeX, XML, XSLT, C++, OpenCV, Linux toolset
• Einsatz einer Semantic-Search-Engine zum Finden von Kandidat:innen statt Stellenanzeigen
• Optimierung der Suchergebnisse
• Erweiterung der kontextbasierten Suche
Tools: Python, MongoDB, Lucene, Java, Linux toolset
• Deployment-Automatisierung in verteilter SOA-Umgebung
• Automatisierung der Konfiguration einzelner Knoten
Tools: Python, Oracle WebLogic 12, bash, Linux toolset
• Design einer Semantic-Search-Engine für Stellensuch-Applikationen
• Extraktion von Semantik aus Korpora mittels Machine Learning
• Anpassung an Nutzer-Präferenzen mittels Machine Learning
• Implementierung eines Semantic-Search-Engine-Prototyps
• Volle Verantwortung für Data-Mining, Text-Mining und Web-Mining
• Data-Warehouse-Implementierung
• Deployment-Management
• Siehe auch: Screencast-Video
Tools: Python, MongoDB, R, Lucene, Java, GNU make, bash, Linux toolset
• Akquise und Betreuung von Leads
• Vertretung des Outsourcing-Unternehmens Reksoft in Deutschland
• Schwerpunkt: Koordination von 30+ Mitarbeitenden in ca. 20 Software-Projekten für Fujitsu-Siemens
• Vertretung des Outsourcing-Unternehmens Reksoft in München
• Delivery-Management, Konfliktmanagement
• Budget- und Kapazitätsplanung
Tools: C# / .NET, Microsoft SharePoint
• Schwerpunkt: Aufbau eines Such-Services zum Finden von Alternativen zu nahezu beliebigen bekannten Suchbegriffen
• Web-Mining-basierter Such-Service erstellt: dooblet.com
Tools: R, Python, Django, Linux toolset
• Schwerpunkt: Identifikation epigenetischer Biomarker auf DNA-Basis
• Moderation regelmäßiger Software-Developer-Seminare
Tools: R, Sweave, Bioconductor, LaTeX, Affymetrix, Linux toolset
• Schwerpunkt: Aufbau eines parallelisierten Software-Services zur Identifikation von Peptid-Biomarkern aus großen Datenmengen aus HPLC- und Massenspektrometrie-Verfahren
• Data Mining in großen Mengen molekularer Messdaten
• Data Storytelling in der explorativen Proteinanalyse
• Aufbau eines Compute-Clusters mit 50 Knoten zur Beschleunigung der Berechnungen
• Entwicklung der Cluster-Software
Tools: C++, R, OpenSSI, Linux toolset
• Schwerpunkt: Beschleunigung der internen Gesichtserkennungs-Software mittels Intel Performance Libraries (Ansatz im Bewerbungsgespräch eingebracht)
Tools: C++, Intel MKL / IPP / IPL, Linux toolset
• Schwerpunkt: Leitung von 3 R&D-Teams an eigenständigen ML- und Neural-Networks-Projekten
• Unter eigener Koordination erfolgreich abgeschlossene Projekte:
• – Automatische Personenerkennung anhand von Iris-Bildern
• – Automatische Personenerkennung anhand beliebiger Phrasen
• – Automatisches Fahrzeug-Überwachungssystem mit Geschwindigkeitsmessung
• Schwerpunkt: Entwicklung eines Neural-Network-Paradigmas mit transparentem Modell für nachvollziehbares Training und Inferenz
• Leitung eines Teams aus 4 Mitarbeitenden
• Nachweis, dass SOM-Netze so erweitert werden können, dass sie komplexe mehrdimensionale Datenverteilungen ähnlich Gaussian Mixture Models approximieren
• Auf Basis der erweiterten SOM-Netze zwei Projekte für Jena-Optronik und DaimlerChrysler Aerospace durchgeführt
Tools: C++, Linux toolset
Mehr anzeigen