PySpark Experten in Frankfurt
aus über 15.000 Lebensläufen mit der Kraft von KIBeauftragen Sie Experten, die Spark-Jobs in zuverlässige Datenpipelines verwandeln, Batch- und Streaming-Workflows aufbauen und Notebooks, Jobs und Cluster-Läufe für den Produktiveinsatz optimieren. FRATCH bringt Sie schnell mit geprüften, verfügbaren Freelancern zusammen.
Lerne FRATCH Experten in Frankfurt kennen, die kürzlich PySpark eingesetzt haben
Monika Thepale
Letzte Position:
Senior ETL Lead bei Takeda GmbH
- Leitete Design, Entwicklung und Bereitstellung von Datenlösungen zur Unterstützung einer großen Pharma-Übernahme für die Takeda Pharmaceutical Company und lieferte Transparenz-Reporting-Systeme auf den Plattformen Azure, Databricks (Python und Shell-Skripting).
- Verantwortete, entwarf und entwickelte skalierbare ELT-Pipelines, um Kunden- und Produktdaten mit Azure, komplexem SQL, Databricks und Shell-Skripting zu verarbeiten und so eine effiziente Datenintegration und -verarbeitung aus mehreren Quellen zu ermöglichen, einschließlich Job-Orchestrierung und Workflow-Automatisierung.
- Implementierte Performance-Optimierungstechniken (Query-Tuning, Parallelität, Workload-Optimierung) und verbesserte die Systemeffizienz sowie die Verarbeitungszeit.
- Setzte starke Analyse- und Problemlösungsfähigkeiten ein, um technische Lösungen zu bewerten und Geschäftsanforderungen für Compliance- und Transparenz-Reporting zu unterstützen.
- Entwarf skalierbare Datenfundamente für Downstream-Analysen und AI-Workloads.
- Leitete Data-Quality-Initiativen, indem mehrere Quelldaten geprüft, Qualitätsmetriken definiert und Prozesse für Monitoring und kontinuierliche Verbesserung etabliert wurden.
Tan Pham
Letzte Position:
DevOps-Ingenieur im DevOps-Team bei Rise-World
- Implementierung der spezifizierten DevOps-Lösungen zur Automatisierung der Infrastruktur (Terraform, Bicep, CloudFormation, Ansible) im lokalen Rechenzentrum (Ovirt, Proxmox, Ceph-Cluster, MinIO) und in der Private Cloud.
- Verwaltung, Konfiguration und Umsetzung von CI/CD-DevOps-Pipelines (GitLab, GitFlow) zur Unterstützung des Entwicklungsprozesses (Artifactory, Prometheus, Istio, Service Mesh, Helm Charts, OpenShift (Red Hat Enterprise) / Kubernetes-Cluster), Red Hat Satellite.
- Verwaltung, Einrichtung, Überwachung und Einspielung von Patches der Linux-Infrastruktur auf Basis von Red Hat Enterprise für Dev, Test und QA.
- Einsatz von Scrum- und Kanban-Methoden.
- Verwaltung, Konfiguration und Umsetzung von Sicherheitsstandards für die Bereitstellung in den Dev-, Test-, QA- und Produktionsphasen der neuen ePA-Anwendungen.
- Entwicklung neuer Plugins und Add-ons für die bestehende Infrastruktur.
- Datenbankunterstützung.
- Unterstützung der Datenanalyse (Python, Spark, Pandas, Power BI, Splunk Enterprise).
- Umsetzung von Best Practices für DevSecOps und BizDevOps unter Einsatz von GitOps (ArgoCD), Streamlit-Framework und Semaphore Ansible UI.
- Konfiguration und Test von iperf, uperf, sysbench mit dem Benchmark-Operator für externe Quelldaten und IoT/MDM-Geräte, Erstellung von Berichten über ELK/OpenSearch.
- Aufbau einer neuen Databricks-Plattform zur Sammlung und Analyse von Big Data aus verschiedenen Quellen und IoT-Geräten im Hadoop-Framework (Python, Pandas, PySpark, Power BI, Apache Airflow).
- Aufbau der Backend-Datenaggregation und -verarbeitung zur Automatisierung der Bereitstellung von Konfigurationen zwischen verschiedenen OpenShift-Clustern und dem Big-Data-Framework (Python, Pandas, PySpark, Apache Spark, PostgreSQL, Django 2, Ansible Automation, Jira JSM).
- Aufbau einer neuen ML-Pipeline-Plattform unter Verwendung von Kubeflow, TensorFlow, KServe.
- Extraktion, Transformation und Laden von Daten aus verschiedenen Quellen, einschließlich strukturierter und unstrukturierter Daten, in ein analytisches DWH bzw. Big-Data-Cluster mit Python, Pandas, Polars, Power BI, Django-Backend und PostgreSQL.
- Einrichtung eines neuen DevOps-Test- und QA-HashiCorp-Vault-Clusters für PKI und IAM.
- Konfiguration und Test automatisierter Patches basierend auf CVSS-Bewertungen und SIEM-integrierten CVEs.
- Einsatz von Nexpose und InsightVM zum Scannen von Schwachstellen in Netzwerken, Hosts, Containern und Anwendungen.
- Planung und Umsetzung sicherer und skalierbarer AWS-Architekturen einschließlich VPC, EC2, S3, RDS und Route53 sowie ähnlicher Umgebungen auf Azure und GCP.
- Automatisierte Systembereitstellung und -deployment mit CloudFormation-Vorlagen.
- Konfiguration von IAM-Rollen, Richtlinien und Berechtigungen zur Gewährleistung einer sicheren Zugriffskontrolle.
- Patch-Management, Backup-Automatisierung und Einrichtung der Notfallwiederherstellung in der AWS-Infrastruktur.
- Überwachung und Optimierung der Systemleistung mit AWS CloudWatch und AWS Trusted Advisor.
- Unterstützung von VMware-Diensten (vSphere, Aria, Horizon) und der virtuellen Desktop-Umgebung.
- Entwicklung und Wartung von CI/CD-Pipelines mit Jenkins, GitLab CI/CD und AWS CodePipeline mit Schnittstelle zu Nutanix.
- Konfiguration von AWS CloudWatch zur Überwachung der Anwendungsleistung und Systemereignisse.
- Planung und Durchführung der Migration von On-Premises-Anwendungen zu AWS-Cloud-Plattformen.
- Bereitstellung containerisierter Anwendungen mit Docker und Kubernetes in AWS-Umgebungen.
- Bereitstellung interner Softwarepakete zwischen Verfügbarkeitszonen mit AWS CodeDeploy.
- Erstellen und Bereitstellen von ML-Modellen mit Scikit-Learn, XGBoost und Spark MLlib einschließlich Hyperparameter-Tuning, Modellevaluation und Produktivsetzung.
Ulm Paunel
Letzte Position:
DataStage ETL Experte bei ING Bank
- Datastage 11.7, dbt, Oracle 19, Python 3.12 / PySpark 3.5, Azure GitHub, Azure DevOps, Automic
- Entwicklung von Migrations-Jobs zur Übertragung der Daten aus dem Collection-DWH in den neuen Risk Mart sowie Entwicklung von ETL-Strecken zur Migration historischer Daten vom alten Mart in den neuen Risk Mart.
- Speicherung der Silver Layer auf Hadoop und der Gold Layer in Oracle.
- Übersetzung von DataStage-Jobs in dbt zur Veröffentlichung von Berichtsdaten in der Google Cloud auf eine PostgreSQL-Datenbank.
- Erstellung und Optimierung komplexer SQL-Abfragen zur Datenextraktion aus einem Data Vault unter Berücksichtigung der Historisierung in den Point-in-Time-Tabellen.
- Erstellung von Oracle-Tabellendefinitionen (DDL) und Anpassung bestehender Stored Procedures.
- Versionierung der Änderungen in GitHub und Deployment über das CI/CD-Portal.
- Umbau von DataStage-Langläufer-Jobs in Python unter Einsatz von PySpark zur Reduzierung der Serverlast.
- Migration von SAS-Skripten nach PL/SQL einschließlich Neuentwicklung von Verteilungsfunktionen ohne direktes Äquivalent in Oracle.
- Entwicklung von Automic-Jobs zur Ausführung von DataStage-Strecken und Python-Skripten (PySpark-Jobs), die die Befüllung der SME- und Institutional-Risk-Tabellen im Risk Mart steuern und fachliche Berechnungen ausführen.
- Teilnahme am agilen Prozess, einschließlich der Erstellung von User Stories, Schätzungen und Planung in Azure DevOps.
- Bearbeitung von Azure DevOps-Tickets und enge Zusammenarbeit mit Testern und Fachbereichen zur Fehleranalyse und -behebung.
Ashkan Zadeh
Letzte Position:
Senior Data Engineer / Senior Data Scientist (Microsoft Azure) bei Vattenfall Europe
- Beratung bei der Nutzung von Analyse- und BI-Tools und Diensten im Microsoft Azure-Stack (z. B. MS Fabric, Synapse Workspaces und dedizierte SQL-Pools, SQL Database, PostgreSQL, Snowflake, Databricks, Data Factory, SSIS, Analysis Services, Function Apps, Power BI, ML)
- Selbstständiger Entwurf von Analyselösungen mit Python, SQL etc.
- Entwurf und Implementierung von ETLs und Datenpipelines
- Erstellung und Pflege von APIs
- Selbstständige Anwendung von CI/CD, Testing und Versionskontrolle
- Modellierung von Daten
- Modellentwicklung und Modelloptimierung
- Anomalieerkennung mit KI
- Predictive Analytics
Verwendete Technologien:
- Snowflake
- Fabric
- Azure Synapse Analytics
- Azure DataFactory
- Azure Data Lake
- Azure DevOps
- Databricks
- Spark
- CI/CD
- SQL Database
- Python
- Power Platform
Alona Liuzniak
Letzte Position:
KI-Architektin
KI-gestützte Plattform für automatisierte UX-Validierung und Designer-Unterstützung
- Konzeption und technische Leitung einer unternehmensweiten KI-Lösung zur automatisierten UX-Überprüfung, die die Designqualität verbessert und manuelle Review-Prozesse in den Teams deutlich reduziert
- Entwicklung eines automatischen UX-Validierungstools als Figma-Plugin und Web-Anwendung, das auf Basis interner Richtlinien Testfälle generiert und aktuelle Designs zuverlässig auf Konsistenz und Standardkonformität prüft
- Umsetzung eines interaktiven Designer-Chats auf RAG-Basis, der Fragen zum aktuellen Design sowie zu den UX-Richtlinien des Unternehmens beantwortet sowie Konzeption der Deployment-Architektur auf Basis containerisierter Services
- Python, Azure OpenAI, PostgreSQL, REST API, Docker, OpenShift, Helm, CI/CD, Figma MCP, LLM, RAG, Prompt Engineering, GenAI, XAI, KI-Architektur, KI-Strategie
Eduard Van Kleef
Letzte Position:
Leiter Workshop „Einführung von KI Entwicklungstools“ bei Softwareunternehmen in Wiesbaden
- Vortrag zur Einführung in generische K.I. und Large Language Models
- Erläuterung rechtlicher Rahmenbedingungen (EU AI Act, US CLOUD Act, DSGVO)
- Systematische Betrachtung von KI-Tools entlang des SDLC und Holistische Systeme
- Vergleich On-Prem LLMs vs. cloudbasiert sowie Change-Management und Betriebsrat
- Moderation der Diskussion und Ableitung nächster Schritte für die Einführung von KI Entwicklungstools
Roman Krivtsov
Letzte Position:
Senior Data Engineer / Cloud-Architekt bei DB Systel
- Entwicklung einer zentralen Abrechnungs-App für Cloud-Kosten bei der DB
- AWS
- Python
- AWS CDK
- RDS
- Spark (PySpark)
- Glue
- Lambda
- CI/CD (GitLab)
- React/Typescript
- Datenoptimierung
- Scrum
Petru Kisalita
Letzte Position:
Architekt & Technischer Teamleiter & Senior Entwickler bei Goetel GmbH
- Konzeption, Architektur & Entwicklung/Programmierung der ETL/ELT-Datenpipelines, DWH und BI-Lösung
- Technische Projektleitung, POC – Erstellung eines Proof of Concept
- Vermittlung zwischen Fachbereichen und technischen Teams
- Azure DevOps Boards & Jira
- Datenmodellierung & Data Engineering – Data Warehouse & Data Mart
- Azure (Data Factory, Azure SQL, Azure DevOps CI/CD, Azure Data Lake V2, Business Central REST API, OData API, OAuth2-Token)
- SharePoint-Liste & API für ADF, Firebird DB, Postgres DB, DB2
- Power BI (Power Query), DAX, Excel-PBI-Add-on, GIS-Daten
- Automatisiertes Monitoring/Logging von ETL-Prozessen, Performance-Monitoring, Fehler-Monitoring – Erkennung und Behebung
- Index-Performance-Tuning & Statistik-Monitoring, Transact-SQL
- Datensicherheit – MFA – Multifaktor-Authentifizierung & OAuth2, MS Graph, Azure-Netzwerke & Firewalls, Gateways, Rollen, Benutzergruppen – mit Lese- und Schreibberechtigungen
- Quellen – Vario Bill, Camunda, Radius, Geo-Datenbank, OTRS, PAST, MS Dynamics Business Central, Azure Blob Data Lake, SharePoint-Liste
Anton Rösler
Letzte Position:
AI-Engineer bei Börsennotiertes Unternehmen, Industrielle Sicherheitstechnik
- Entwurf und Umsetzung der agentischen KI-Architektur für eine unternehmensweite Plattform zur sicheren Bereitstellung von LLM-basierten Agenten
- Design und Implementierung von End-to-End RAG-Pipelines aus multiplen Quellen: Dokumentenaufbereitung, Chunking-Strategien für heterogene Dokumenttypen, Embedding, Retrieval mit Re-Ranking und robuste Prompt-Orchestrierung
- Modulares Context-Engineering-Framework mit Skill-Architektur, Kontext-Isolation und dynamischer Ressourcenverwaltung; Human-in-the-Loop-Kontrolle für Enterprise-Tool-Integrationen
- Aufbau der CI/CD-Pipeline, Test-Strategie, Tracing sowohl auf Software-Seite als auch automatisierte LLM- und Agenten-Evaluierungen, Red Team Testing und Tracing sowie Übergabe in reproduzierbaren Betrieb (ISO27001 und SOC2 konform)
Entdecke mehr als 15.000 Top-Freelancer
Statistiken von Experten, die PySpark einsetzen
Aggregiert aus den beruflichen Profilen passender Freelancer.
Berufserfahrung
18 Jahre (Deutschland: 13 Jahre)
Positionsdauer
2,2 Jahre (Deutschland: 2,8 Jahre)
Positionen pro Freelancer
17 (Deutschland: 10)
Häufigste Fachbereiche
Informationstechnologie (IT), Business Intelligence, Produktentwicklung
Häufigste Branchen
Informationstechnologie (IT), Gesundheitswesen, Bank- und Finanzwesen
Fokus der Zertifizierungen
Informationstechnologie (IT), Business Intelligence, Projektmanagement
Bachelor-Abschluss oder höher
100% (Deutschland: 96%)
Master-Abschluss oder höher
57% (Deutschland: 71%)
Doktortitel
14% (Deutschland: 13%)
Zertifizierungen pro Freelancer
5 (Deutschland: 4)
Häufigste Sprachen
Deutsch, Englisch, Französisch
Sprechen zwei oder mehr Sprachen
100% (Deutschland: 96%)
Basierend auf unserem Profilpool, Stand 30 Aug 2026.
Tagessatzverteilung
Das Diagramm zeigt, wie sich die Tagessätze der Freelancer in dieser Technologie in Frankfurt verteilen, basierend auf aktuellen Verträgen auf unserer Plattform. Jeder Balken deckt eine Tagessatzspanne ab – seine Höhe zeigt, wie viele Freelancer innerhalb dieser Spanne abrechnen.
Durchschnittssätze von Experten in Frankfurt, die PySpark einsetzen
Die Tagessätze basieren auf aktuellen Verträgen und enthalten keinen FRATCH-Aufschlag.
Der durchschnittliche Tagessatz ist der Mittelwert aller Tagessätze aus aktuellen Verträgen vergleichbarer Freelancer auf unserer Plattform.
Der Median-Tagessatz ist der mittlere Wert aller Tagessätze – die Hälfte der vergleichbaren Freelancer verlangt weniger, die andere Hälfte mehr. Anders als der Durchschnitt wird er von Ausreißern kaum beeinflusst.
Berechnet auf Basis der Tagessätze unserer Freelancer, Stand 30 Aug 2026. Die tatsächlichen Tagessätze können je nach Dienstalter, Erfahrung, Fachkenntnissen, Projektkomplexität und Auftragsdauer variieren.
Über die Technologie
PySpark in der Praxis
PySpark ist die Python-API für Apache Spark. Unternehmen nutzen es, um große Datenmengen zu verarbeiten, Transformationen auszuführen und Batch- oder Streaming-Pipelines aufzubauen, die in einem Cluster skalieren können. Es wird häufig in Analytics-, Data-Engineering- und Machine-Learning-Workflows eingesetzt.
Was Teams liefern
- Jobs für Datenaufnahme und Datenbereinigung
- ETL- und ELT-Pipelines
- Structured-Streaming-Workflows
- Feature-Aufbereitung für Machine Learning
- Reporting-Ebenen auf Basis von Spark SQL
Wichtige Fähigkeiten
Starke PySpark-Profis schreiben effizienten DataFrame-Code, verstehen Spark-Ausführungspläne und gehen sorgfältig mit Partitionierung, Joins und Shuffles um. Außerdem arbeiten sie mit Python, SQL und Speichersystemen wie S3, HDFS, Delta Lake oder Parquet.
Passendes Ökosystem
PySpark ist oft Teil von Stacks mit Apache Spark, Databricks, Airflow, Kafka und Cloud-Diensten für Daten. In Frankfurt passt es gut zu Teams, die verlässliche Datenverarbeitung für Finanzen, Logistik, Medien oder grenzüberschreitende Prozesse brauchen.
Wann Freelancer hinzuziehen
Unternehmen holen Freelancer dazu, wenn eine Pipeline langsam ist, eine Migration Fokus braucht oder ein Team Hilfe braucht, um Spark-Arbeit ohne Verzögerung zu liefern. Ein Spezialist kann auch Code-Reviews, die Härtung für den Produktiveinsatz und die Übergabe an das interne Team unterstützen.
Was gute Experten tun
Ein starker PySpark-Experte schreibt Code, der gut lesbar, testbar und für Skalierung ausgelegt ist. Er weiß, wie man Datenbewegungen reduziert, teure Operationen vermeidet und das Verhalten von Jobs so klar macht, dass andere sie nach Projektende weiter betreuen können.
Häufig gestellte Fragen
Alles, was Kunden üblicherweise über PySpark wissen wollen – kompakt an einem Ort.
PySpark wird genutzt, um große Datenmengen mit Apache Spark aus Python heraus zu verarbeiten. Teams setzen es für ETL, Datenaufbereitung, Streaming-Jobs und Analytics-Workflows ein, die verteilte Verarbeitung brauchen. Es ist eine praktische Wahl, wenn Python die Hauptsprache ist, aber Verarbeitung in Spark-Größe nötig ist.
PySpark ist für verteilte Workloads gebaut, während einfache Python-Tools meist auf einem einzelnen Rechner laufen. Wenn der Job größere Datenmengen verarbeiten oder Cluster-Verarbeitung nutzen muss, ist PySpark die bessere Wahl. Für kleinere lokale Aufgaben können pandas oder normales Python einfacher sein.
Ein PySpark-Spezialist hilft, wenn die Lieferung durch Performance-Probleme, Pipeline-Design oder eine Migration von älterem Spark-Code blockiert ist. Freelancer sind auch nützlich, wenn Sie für ein zeitlich begrenztes Projekt gezielte Unterstützung brauchen und nicht das ganze Team von anderer Arbeit abziehen wollen. Sie können beim Aufbau, Review oder bei der Fehlerbehebung einspringen.
Ein starker PySpark-Freelancer kennt meist SQL, Python, Datenmodellierung und Spark-Interna wie Partitionierung und Shuffles. Erfahrung mit Databricks, Airflow, Kafka, Delta Lake oder Cloud-Speicher ist oft ebenfalls wichtig. Klare Test- und Debugging-Gewohnheiten zählen auch.
Nicht immer. Viele PySpark-Aufgaben können remote erledigt werden, wenn der Zugriff auf Daten, Notebooks und Cluster-Umgebungen gut organisiert ist. Arbeit vor Ort in Frankfurt kann bei sensiblen Daten, der frühen Analyse oder enger Zusammenarbeit mit lokalen Stakeholdern helfen, besonders in regulierten Umgebungen.
Ein PySpark-Projekt braucht jemanden, der ähnliche Spark-Arbeit bereits produktiv umgesetzt hat. Einfache Notebook-Arbeit ist leichter als stabile Batch- oder Streaming-Pipelines aufzubauen, daher hängt die nötige Tiefe von der Aufgabe ab. Wenn es um Performance, Zuverlässigkeit oder Migration geht, zahlt sich Erfahrung auf Senior-Niveau aus.
Bei PySpark zeigt sich Qualität in Code, der effizient, gut lesbar und sicher erneut auszuführen ist. Achten Sie auf saubere DataFrame-Logik, sinnvolle Partitionierung, Tests und einen klaren Umgang mit Datenqualitätsproblemen. Gute Spezialisten erklären Abwägungen in einfacher Sprache und verstecken keine teuren Operationen.
PySpark ist die Python-Schnittstelle für Apache Spark, nicht die vollständige Plattform selbst. Databricks ist eine häufig genutzte Umgebung, in der PySpark eingesetzt wird, aber der Code kann auch in anderen Spark-Setups laufen. Beim Vergleich der Optionen ist die wichtigste Frage, wo Ihre Spark-Jobs laufen und wie sie betrieben werden.
Der durchschnittliche Stundensatz von Freelancern in Frankfurt, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, liegt bei 103 €, was einem Tagessatz von etwa 824 € bei einem 8-Stunden-Tag entspricht.
Von den Freelancern in Frankfurt, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, haben 100% mindestens einen Bachelor-Abschluss, 57% mindestens einen Master-Abschluss und 14% einen Doktortitel.
Freelancer in Frankfurt, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, haben im Durchschnitt 18 Jahre Berufserfahrung; ein einzelnes Projekt dauert typischerweise etwa 2,2 Jahre.
Die häufigsten Sprachen unter Freelancern in Frankfurt, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, sind Deutsch (100%), Englisch (100%) und Französisch (33%).
Die häufigsten Industrien unter Freelancern in Frankfurt, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, sind Informationstechnologie (IT) (89%), Gesundheitswesen (67%) und Bank- und Finanzwesen (56%).
Die häufigsten Bereiche unter Freelancern in Frankfurt, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, sind Informationstechnologie (IT) (100%), Business Intelligence (89%) und Produktentwicklung (78%).
Hauptstandorte der FRATCH Experten, die kürzlich PySpark eingesetzt haben
Unsere Freelancer und Interim-Experten sind in der gesamten DACH-Region zuhause — verfügbar vor Ort in den wichtigsten Wirtschaftszentren oder komplett remote. Wähle einen Standort und entdecke passende Spezialisten, lokale Markteinblicke und aktuelle Verfügbarkeiten.
Kostenlose Demo vereinbaren
Kontaktiere uns und das FRATCH-Team meldet sich innerhalb von 4 Stunden bei dir.
Möchtest du lieber direkt mit uns in Kontakt treten?
Wir haben immer Zeit für einen Anruf oder eine E-Mail!

Berlin
München