Zum Hauptinhalt springen
🇩🇪DSGVO konform
Bewährte

PySpark Experten in Berlin

für skalierbare Datenpipelines finden, in wenigen Minuten mit geprüften und verfügbaren Freelancern vermittelt

Beauftragen Sie Experten, die verteilte Datenpipelines entwickeln, Spark-Workloads optimieren und Lakehouse-Systeme mit Python, SQL und Cloud-Datendiensten verbinden. Erhalten Sie schnell eine präzise Vermittlung mit geprüften, verfügbaren Freelancern.

Lerne FRATCH Experten in Berlin kennen, die kürzlich PySpark eingesetzt haben

Verifizierter Experte

Alexander Z.

Profil ansehen

Senior Data Architekt & Data Engineer

Berlin
Alexander Z.

Letzte Position:

Senior Data Solutions Engineer bei VMware Inc.

  • Private Cloud-Datenplattform auf VMware vSphere entworfen und implementiert, Greenplum MPP, Apache Kafka, Kubernetes und Apache Solr integriert und Echtzeit-Ingestion-Pipelines mit Kafka Connect und Schema Registry entwickelt.
  • Migration von Oracle Exadata zu Greenplum geleitet, Datenmodelle neu architektonisch aufgebaut, Speicher optimiert, RabbitMQ mit Debezium für CDC implementiert und VectorDB für Generative AI eingeführt.
  • PoC für Multi-Cloud-Migration über AWS, Azure und GCP entworfen und umgesetzt, KPIs für Durchsatz, Latenz und Kosteneffizienz definiert, Bulk-Datentransfers durchgeführt, Analytics- und Streaming-Workloads validiert und Architektur-Empfehlungen im großen Maßstab geliefert.
  • Legacy-On-Premises-Infrastruktur bewertet und moderne cloud-native Datenplattformen mit Greenplum und containerisierten Microservices entworfen, mit Beratung zu Skalierbarkeit, Disaster Recovery und High Availability.
Verifizierter Experte

Haseeb Z.

Profil ansehen

Senior AI Engineer | LLM Engineer | ML Engineer

Berlin
Haseeb Z.

Letzte Position:

Senior Data Scientist bei WPP MEDIA

  • Enterprise-Retrieval-Augmented-Generation-(RAG)-Anwendungen mit LangChain, LangGraph, Vektordatenbanken, Embeddings und Open-Source-LLMs entworfen und bereitgestellt, die über vLLM auf GCP-GPU-Infrastruktur betrieben wurden.
  • Agentic-AI-Workflows mit LangGraph entwickelt, inklusive Planung, Schlussfolgern, Tool-Ausführung, persistenter Speicherung, Sitzungsverwaltung und Human-in-the-Loop-Freigabemechanismen.
  • LLM-gestützte Automatisierungssysteme entwickelt, die BigQuery, SQL-Pipelines und externe Werbe-APIs wie Meta, TikTok, Amazon, Snapchat, Google und Pinterest integrieren und manuelle operative Abläufe reduzieren.
  • Multi-Agent-AI-Systeme für Enterprise-Analytics- und Entscheidungsunterstützungs-Workflows entworfen, die autonome Aufgabenausführung und intelligente Dateninteraktionen ermöglichen.
  • Retrieval-Optimierungsstrategien umgesetzt, darunter Multi-Retriever-Architekturen, semantische Suche, Kontextoptimierung und Query-Verbesserungstechniken, wodurch die Relevanz der Antworten um etwa 40 % verbessert wurde.
  • Strukturierte Prompting-Strategien, Function-Calling-Schemata und Validierungs-Workflows entwickelt, um die Zuverlässigkeit von mehrstufigen LLM-Anwendungen zu verbessern.
  • Skalierbare AI-Services mit Python, FastAPI, Cloud Run, Pub/Sub, BigQuery, Docker und cloud-nativen Bereitstellungsarchitekturen entworfen.
Verifizierter Experte

Wolfram K.

Profil ansehen

Zertifizierter AI- & Machine-Learning-Engineer · Senior Consultant

Berlin
Wolfram K.

Letzte Position:

AI / Machine Learning Engineer (Projects & Applied AI) bei UNIVERSITÉ PARIS 1 PANTHEON-SORBONNE & LIORA

  • Entwickelte und implementierte ein hybrides Empfehlungssystem (Content-Based + Collaborative Filtering)
  • Baute End-to-End-ML-Pipelines inklusive Datenverarbeitung, Feature Engineering, Modelltraining und Bewertung
  • Entwickelte RAG-basierte LLM-Systeme mit LangChain und Vektordatenbanken für semantische Suche und Wissensabruf
  • Etablierte MLOps-Workflows mit MLflow für Experiment-Tracking, Versionierung und Deployment-Bereitschaft
  • Implementierte Deep-Learning-Modelle (Computer Vision & Klassifikation) mit PyTorch und TensorFlow
Verifizierter Experte

Muzamal A.

Profil ansehen

Data Scientist | KI-Ingenieur

Berlin
Muzamal A.

Letzte Position:

Data Scientist / KI-Berater bei HelmX

  • KI- und Data-Science-Lösungen geliefert, darunter LLM-basierte Chatbots und Datenpipelines, wodurch die operative Effizienz verbessert wurde.
  • An Produktfunktionen mitgearbeitet, messbare Wirkung erzielt und starke Kundenbeziehungen gepflegt.
Verifizierter Experte

Hamza K.

Profil ansehen

Wissenschaftlicher Forschungsmitarbeiter im Gesundheitsbereich (ehrenamtlich)

Berlin
Hamza K.

Letzte Position:

Wissenschaftlicher Forschungsmitarbeiter im Gesundheitsbereich (ehrenamtlich)

  • Agierte als technischer Berater zur Optimierung von mehrschichtigen Ensemble-Modellen, die ResNet, CNN-BiGRU-Attention und XGBoost kombinierten.
  • Begleitete die Umsetzung eines Logistic-Regression-Meta-Lerners zur Lösung von Klassenungleichgewichten und erreichte 92,86 % Genauigkeit und einen AUC-Wert von 0,9644 auf den Datensätzen PTB-XL und Chapman-Shaoxing.
Verifizierter Experte

Jan K.

Profil ansehen

Datenexperte

Berlin
Jan K.

Letzte Position:

Datenexperte bei Fertigung

Verifizierter Experte

Enrico G.

Profil ansehen

Data- & KI-Engineering | Backend-Softwareentwicklung

Berlin
Enrico G.

Letzte Position:

Freiberuflicher Software & Data/AI Engineer bei Freiberuflicher Software & Data/AI Engineer

  • Dozent für den GenAI-Track des Master School Institute of Technology
  • Entwicklung einer Full-Stack-KI-Anwendung (React + Python/FastAPI) für den automatisierten Lieferanten-Produktimport mit intelligenter Spalten- und Kategorienklassifizierung (4-Layer, hierarchisch) inkl. Human-in-the-Loop-Validierung
Verifizierter Experte

Raphael M.

Profil ansehen

Gründer / Quant-Entwickler

Berlin
Raphael M.

Letzte Position:

Gründer / Quant-Entwickler bei Market Maker

  • Entwicklung von Krypto-Quant-Strategien, automatisierte Handelsausführung, On-Chain-Daten-Client (Ethereum / Solana)
  • Entwicklung von Daten- und Handelsarchitektur für Liquiditätsbereitstellung
Verifizierter Experte

Unnikuttan V.

Profil ansehen

Geschäftsführer (Mitgründer)

Berlin
Unnikuttan V.

Letzte Position:

Geschäftsführer (Mitgründer) bei AathmaSignals

  • Verantwortlich für Investorenakquise und Partnerschaftsentwicklung als Gründungs-Geschäftsführer, Aufbau des Business Case und der technischen Story, um Erstfinanzierung und strategische Partner im Bereich Digital Health zu gewinnen
  • Konzeption von Multi-Agenten-KI-Systemen für autonome Biosignalanalysen, Orchestrierung von LLM-basierten Reasoning-Pipelines mit fachspezifischem medizinischen Kontext zur Unterstützung intelligenter, klinischer Entscheidungsfindung
Verifizierter Experte

Vili D.

Profil ansehen

Senior Data Engineer, Data Architect, Softwareentwickler

Neuenhagen
Vili D.

Letzte Position:

Technical Lead, Data Engineer bei Mercedes-Benz Consulting

  • Optimierung der Datenarchitektur (Medallion) für eine bessere Entkopplung der Verarbeitungsschritte sowie höhere Transparenz und Reproduzierbarkeit
  • Technische Qualitätssicherung der Datenverarbeitung in Databricks durch Einführung von Schema Enforcement, Datenqualitätschecks und strukturierter Datenarchitektur
  • Pipeline-Orchestrierung mit Azure Data Factory
  • Professionalisierung und Automatisierung des Entwicklungs- und Deploymentprozesses durch Integration von Git und GitHub Actions
  • Fachliche Führung des Data Engineering Teams (3 Mitarbeitende)
  • Leitung von Workshops zur Optimierung und Stabilisierung der Datenplattform und des Entwicklungsprozesses
  • Aufnahme und Priorisierung neuer Anfragen, Pflege des Produktbacklogs
  • Technologien: Microsoft Azure (Data Lake, Data Factory), Databricks, Apache Spark (PySpark), Python, SQL, Git, Confluence, Power BI, Power Apps, Dataverse, MS SharePoint, Mural
Verifizierter Experte

Tushar R.

Profil ansehen

Wissenschaftlicher Mitarbeiter/Masterarbeit

Berlin
Tushar R.

Letzte Position:

Wissenschaftlicher Mitarbeiter/Masterarbeit bei Otto-von-Guericke Universität Magdeburg

  • Durchgeführte qualitative und quantitative Analysen der gewonnenen Ergebnisse, Kategorisierung von Themen, Bewertung von Methoden und Beurteilung der Studienqualität und -zuverlässigkeit.
  • Erstellte Forschungsberichte und Evidenzzusammenfassungen, um wichtige Trends, Lücken und Chancen für akademische Betreuer oder funktionsübergreifende Teams zu kommunizieren.
  • Präsentierte Ergebnisse durch klar strukturierte Visualisierungen, Tabellen und narrative Zusammenfassungen, um Entscheidungsprozesse zu unterstützen und zukünftige Forschungsrichtungen zu steuern.
Verifizierter Experte

Mohamed G.

Profil ansehen

Gründer & CEO

Berlin
Mohamed G.

Letzte Position:

Lead / Principal Cloud-, KI- & Sicherheitsarchitekt bei Freiberufler / CC Conceptualise GmbH

Durchgeführte Projekte:

Projekt: RWE – Aufbau einer konzernweiten Zero-Trust-Cybersecurity-Architektur (CITADEL) Rolle: Senior Enterprise Cybersecurity-Architekt / Zero-Trust-Architekt Unternehmen: RWE AG Beschreibung: Konzeption und Umsetzung der strategischen Cybersecurity-Zielarchitektur CITADEL bei RWE, basierend auf dem Zero-Trust-Architekturprinzip und ausgerichtet an regulatorischen Anforderungen wie NIS2, ISO 27001 und konzernweiten Security-Governance-Vorgaben. Ziel war der Aufbau einer messbaren, auditierbaren und skalierbaren Sicherheitsarchitektur mit starkem Fokus auf Identity Governance, Compliance-Transparenz und operative Steuerbarkeit. Aufgaben & Erfolge:

  • Zero-Trust-Architekturdesign: Entwicklung einer unternehmensweiten Zero-Trust-Referenzarchitektur (Identity, Device, Network, Application, Data) inkl. Trust-Zonen, Kontrollpunkten und Durchsetzungsmechanismen gemäß NIS2.
  • Identity & Access Governance (IGA): Design und Einführung von IGA-Governance-Strukturen inkl. Rollenmodellen, Rezertifizierungsprozessen, Segregation of Duties (SoD) und Lifecycle-Management für Identitäten und Zugriffe.
  • Security Governance & KPIs: Definition und Implementierung von Security-KPIs und Metriken zur Steuerung von Zero-Trust-Reifegrad, Identitätsrisiken und Compliance-Erfüllung auf Management-Ebene.
  • Compliance & Reporting: Aufbau standardisierter Compliance-Reports und Dashboards zur Unterstützung interner Audits, externer Prüfungen und regulatorischer Nachweispflichten (u. a. NIS2).
  • Architektur- & Stakeholder-Alignment: Enge Abstimmung mit Enterprise Architecture, IT-Betrieb und Fachbereichen zur Integration der CITADEL-Architektur in bestehende IT- und Security-Landschaften.
  • Strategische Sicherheitsberatung: Beratung von Programmen und Projekten hinsichtlich Zero-Trust-Konformität, Identity-Zentrierung und regulatorischer Anforderungen im Energie- und KRITIS-Umfeld. Technologien & Methoden: Zero Trust Architecture, NIS2, Identity Governance & Administration (IGA), IAM, RBAC, SoD, Entra ID, Sailpoint, Zscaler, Terraform / IaC, Policy as Code, Security KPIs, Compliance Reporting, NIS2, NIST 2.0, ISO 27001, Enterprise Security Architecture, Governance Frameworks, Risk & Control Management

Projekt: Aufbau einer skalierbaren AI Workbench Plattform auf Microsoft Azure Rolle: Cloud-Architekt und -Ingenieur Unternehmen: Siemens Energy Beschreibung: Konzeption, Entwicklung und Betrieb einer sicheren, modularen Cloud-Infrastruktur zur Unterstützung von Data Science, Machine Learning und KI-Anwendungen für verschiedene Engineering-Teams bei Siemens Energy. Aufgaben & Erfolge:

  • Cloud-Architektur: Entwurf und Implementierung einer Infrastructure-as-Code-Lösung (Terraform) zur automatisierten Bereitstellung von Azure-Ressourcen (Resource Groups, Storage Accounts, Cosmos DB, Application Insights, Netzwerk, PostgreSQL Flexible Server, Azure Container Apps, Azure Container Registry).
  • Developer Portal: Um Self-Service und die Befähigung von Entwicklern, Data Scientists und KI/ML-Ingenieuren zu ermöglichen, wurde Backstage mit benutzerdefinierten Frontend- und Backend-Plugins (Node.js, TypeScript, React.js, PostgreSQL, Container-Apps) verwendet.
  • Rollenbasierte Zugriffskontrolle: Umsetzung von Azure RBAC, um Engineering-Gruppen (z. B. AI Engineers) gezielten Zugriff (z. B. Storage Blob Data Contributor, Reader) auf relevante Ressourcen zu ermöglichen.
  • Datenplattform-Engineering: Aufbau und Konfiguration einer mehrstufigen Storage-Landschaft (Raw, Curated, Vektordaten) inkl. automatisierter Container-Erstellung und Zugriffssteuerung für fortgeschrittene Analyse- und KI-Workloads.
  • DevOps-Integration: Anbindung von Azure DevOps für CI/CD-Pipelines zur automatisierten Bereitstellung, Überwachung und Einhaltung von Sicherheitsstandards.
  • Sicherheit & Compliance: Implementierung von Private Endpoints, Netzwerkrichtlinien und Managed Identities zur Sicherstellung von Datenschutz und regulatorischer Konformität.
  • Zusammenarbeit: Enge Abstimmung mit interdisziplinären Teams zur Ausrichtung der Cloud-Infrastruktur an geschäftlichen und technischen Anforderungen und zur Förderung der digitalen Transformation bei Siemens Energy. Technologien: Azure, Terraform, Azure DevOps, Cosmos DB, Application Insights, Azure Storage, Private Endpoints, Azure Synapse, Azure Machine Learning, Azure Entra ID, RBAC, Backstage, Node.js, React.js, PostgreSQL, Python (Automatisierung), Git

Projekt: Aufbau einer skalierbaren Data Plattform POC auf Azure Kubernetes Service (AKS) Rolle: Cloud-Architekt und -Ingenieur Unternehmen: Hannover Rück SE Beschreibung: Entwicklung und Bereitstellung einer modularen, containerisierten KI-Plattform auf Microsoft Azure zur Unterstützung von Data Engineering und Data Science Teams bei der Hannover Rück SE. Die Plattform basiert auf AKS und integriert JupyterHub, Spark, Kafka, Airflow sowie eine zentrale Benutzeroberfläche zur Verwaltung. Ziel war es, eine wiederverwendbare, sichere Umgebung für datengetriebene Anwendungen und Experimente bereitzustellen. Aufgaben & Erfolge:

  • Cloud- und Plattformarchitektur: Aufbau einer Kubernetes-basierten Infrastruktur mittels Terraform und Helm, unterstützt durch Azure Container Registry (ACR) für die Bereitstellung containerisierter Komponenten.
  • Workbench-Design: Integration von JupyterHub (Bitnami Helm Chart), Spark-Cluster, Kafka-Streaming, Apache Airflow und Redpanda in ein konsistentes System mit rollenbasierter Steuerung.
  • DevOps-Automatisierung: Entwicklung von PowerShell-Skripten und CI/CD-Prozessen für Image-Vorbereitung, Chart-Deployment und Secrets-Management mit Helm.
  • Self-Service & Skalierbarkeit: Ermöglichung einer standardisierten, reproduzierbaren Bereitstellung für Data Science Umgebungen auf Mandantenbasis. Katalog und Entwicklerportal wurden über Backstage mit einer benutzerdefinierten Integration mit Azure DevOps bereitgestellt, um Pipelines auszulösen und zu überwachen (Node.js, TypeScript, React.js, Spotify Backstage mit Custom Plugins, gehostet auf AKS).
  • Netzwerk & Sicherheit: Einsatz privater Endpunkte, Netzwerkrichtlinien, Key Vault und RBAC zur Sicherstellung von Sicherheit und Governance-Vorgaben im Versicherungskontext.
  • Interdisziplinäre Zusammenarbeit: Enge Abstimmung mit Data Scientists, DevOps-Teams und Security Offices zur Integration von Anforderungen in Design und Betrieb. Technologien: Azure, AKS, Helm, Terraform, Azure Container Registry, PowerShell, Apache Spark, JupyterHub, Airflow, Kafka, Redpanda, Azure Key Vault, Azure Monitor, RBAC, Kubernetes Secrets, Backstage, Node.js, React.js, PostgreSQL

Projekt: Data & AI Plattform Engineer Unternehmen: Allianz Technology Beschreibung:

  • Befähigung und Unterstützung der Nutzer der Allianz Data Platform (ADP) – insbesondere Data Engineers, Data Scientists und Machine Learning Engineers – zur optimalen Nutzung der Plattform auf Basis von Azure Synapse und Azure Machine Learning, um ihre geschäftlichen Ziele effizient zu erreichen.
  • Beratung zu Architektur, Best Practices und effizientem Einsatz der ADP für End-to-End-Anwendungsfall-Pipelines – von der Datenaufnahme über Datenverarbeitung bis hin zu Softwarebereitstellung und Feedbackschleifen.
  • Erklärung von Vor- und Nachteilen vorgeschlagener Plattformlösungen gegenüber internen und externen Stakeholdern, um fundierte Entscheidungen zu ermöglichen.
  • Definition und Implementierung von Best Practices (insbesondere in PySpark) sowie kontinuierliche Verbesserung des ADP-Stacks und der finalen Produktionsumgebung.
  • Identifikation und Umsetzung von Optimierungsmöglichkeiten zur Steigerung von Leistung, Zuverlässigkeit und Automatisierung der Plattform.
  • Erstellung technischer Dokumentation sowie interner Ankündigungen und Blogbeiträge, um Neuerungen, Funktionen und Best Practices der ADP zu kommunizieren.

Projekt: OneTenant – Post-Merger Azure & M365 Consolidation Rolle: Projektleiter / Azure Workstream Lead Unternehmen: Alliance Healthcare Deutschland / GEHE

  • Post-Merger Tenant-Konsolidierung: Migration und Zusammenführung von zwei bestehenden Microsoft-Tenants in einen neuen Ziel-Tenant im Rahmen eines M&A-Projekts, inkl. Azure, Entra ID (Azure AD) und Microsoft 365.
  • End-to-End-Migrationssteuerung: Planung, Koordination und Durchführung von Cloud-to-Cloud- und On-Prem-to-Cloud-Migrationen unter Berücksichtigung von Business Continuity, regulatorischen Anforderungen (u. a. Datenschutz, IT-Compliance) und Cutover-Strategien.
  • Azure Plattform-Setup: Design, Aufbau und Härtung der neuen Azure-Landing-Zone inkl. Subscription-Struktur, Netzwerk-Topologie, Identity-Architektur, Security-Baseline und Governance-Framework (RBAC, Policies, Blueprints).
  • IAM & Security-Integration: Konsolidierung und Neustrukturierung von Entra ID (Azure AD), Rollenmodellen, Conditional Access, Privileged Identity Management (PIM) und Identity-Governance für eine sichere Post-Merger-Zielarchitektur.
  • Microsoft 365 Migration: Durchführung der mandantenübergreifenden M365-Migration (Exchange Online, OneDrive, SharePoint, Teams) mit AvePoint Fly, inkl. Benutzer-, Daten- und Berechtigungsübernahme.
  • Problem- & Cutover-Management: Identifikation, Priorisierung und Lösung technischer und organisatorischer Risiken während der Migrationswellen, inkl. Go-Live-Vorbereitung und Hypercare-Phase.
  • Stakeholder- & Programmsteuerung: Enge Abstimmung mit IT, Security, Compliance, Business Units und externen Migrationspartnern zur Sicherstellung einer stabilen und revisionssicheren Post-Merger-IT-Plattform.
  • Service Transition: Überführung von Applikationen, Plattformen und Betriebsmodellen in eine konsolidierte Zielorganisation.
  • Kommunikation: Steuerung internationaler Projektteams in Deutsch und Englisch in einem unternehmenskritischen Post-Merger-Transformationsprogramm.
  • Technologien: Azure Cloud: Aufbau und Betrieb einer M&A-fähigen Cloud-Plattform mit Azure Networking, Compute, Storage, Entra ID, Security Center und Governance-Services; Microsoft 365 & AvePoint Fly: Tenant-to-Tenant Migration von Collaboration-, Mail- und Identitätsdaten.

Projekt: Aufbau einer Azure KI & Analytics Plattform für Single Risk Reporting Unternehmen: Hannover Rück SE

  • Entwickelte eine skalierbare und leistungsstarke Azure Data & AI Analytics Plattform für das Single Risk Reporting.
  • Implementierte die Infrastruktur automatisiert mit Infrastructure as Code (IaC) mittels Tools wie PowerShell/Bicep.
  • Entwickelte und optimierte Datenpipelines für die Verarbeitung und Validierung großer Datenmengen.
  • Setzte eine Self-Hosted Integration Runtime auf, um eine sichere Verbindung zu SAP-Systemen zu gewährleisten.
  • Integrierte die aufbereiteten Daten in MicroStrategy und erstellte interaktive Dashboards und Berichte für datenbasierte Entscheidungen.
  • Sicherstellte Datenschutzkonformität und Sicherheitsanforderungen durch rollenbasierte Zugriffskontrolle und Compliance-Maßnahmen. Technologien: Azure Synapse Analytics, Azure Machine Learning, RAG, LLMs, Infrastructure as Code (IaC), Azure Data Pipelines, Self-Hosted Integration Runtime, SAP, MicroStrategy

Integrations-Engineering Azure / CI/CD Unternehmen: Mercedes-Benz Tech Innovation Tätigkeiten & Verantwortlichkeiten:

  • Systemanalyse & Anforderungsdefinition: Bewertung geplanter Systemlandschaften zur Identifikation von Integrations- und Sicherheitsanforderungen.
  • Integrationsarchitektur & Design: Definition und Umsetzung von Anforderungen zur Integration von Microsoft Dynamics 365 in bestehende Azure-basierte Infrastrukturen.
  • Architektur & Infrastruktur: Aufbau sicherer, skalierbarer Azure Landing Zones, Design von Cloud-Architekturen und Implementierung von Infrastructure-as-Code (IaC) mittels Bicep, YAML und PowerShell.
  • Entwicklung von KI-Lösungen: Design & Implementierung einer RAG-Lösung (Retrieval Augmented Generation) auf Basis von Azure OpenAI, Azure AI Search, Cosmos DB, Data Lake und Azure Machine Learning Workspace.
  • Programmierung & Services: Entwicklung und Integration von Lösungen mit C#, TypeScript, PowerShell und X++ sowie Einsatz von Azure Functions, Azure Logic Apps, Power Platform und weiteren Services.
  • API-Management: Verwaltung und Sicherstellung des sicheren Datenflusses durch Azure API Management und Implementierung von RESTful APIs.
  • DevSecOps: Aufbau und Betrieb sicherer DevSecOps-Pipelines in Azure DevOps und GitHub, inklusive automatisierter Security- und Compliance-Checks.
  • Fehlerbehebung & Optimierung: Identifizierung, Analyse und Behebung von Integrationsproblemen in Echtzeit sowie kontinuierliche Optimierung von Prozessen für Performance und Effizienz.
  • Dokumentation & Wissenstransfer: Erstellung umfassender technischer Dokumentation (inkl. IaC) sowie Schulung von Teammitgliedern und Endanwendern. Eingesetzte Technologien & Tools: Microsoft Azure (Landing Zones, Data Lake, API Management, Logic Apps, Functions, Cosmos DB, Machine Learning Workspace), Microsoft Dynamics 365 Finance & Operations (ERP in der Public Cloud), C#, TypeScript, PowerShell, YAML, Bicep, Azure DevOps, GitHub Actions, Security- und Compliance-Tools.

Projekt: Sirius: Weiterentwicklung von Single Risk Solution Unternehmen: Hannover Rück SE

  • Weiterentwicklung des Systems: Verbesserung der bestehenden Module für die Erfassung, Verarbeitung und Administration von Policydaten.
  • Integration neuer Features: Einführung neuer Funktionen, die den aktuellen geschäftlichen Anforderungen entsprechen.
  • Optimierung der Benutzererfahrung: Verbesserung der Interaktion zwischen Benutzern und System, insbesondere durch Anpassungen in der UI/UX.
  • Datenverwaltung: Entwicklung von Lösungen für die Verwaltung und Konsistenz von Single-Risk-Daten, inklusive automatisierter Validierung und Berichterstattung.
  • Sicherstellung der Skalierbarkeit: Optimierung der Software-Architektur, um zukünftige Anforderungen und eine wachsende Datenmenge zu unterstützen.
  • Technologien: Azure DevOps, C# und .NET Core, Angular, RabbitMQ

Projekt: Cloud Native Anwendung für Security und Compliance Management Unternehmen: Münchener Rückversicherungs-Gesellschaft AG

  • Das Projekt entwickelt eine interne cloud-native Webanwendung für das Sicherheits- und Compliance-Management in der Azure Cloud.
  • Architekturkonzeption, Prototyping, POC, MVP und vollständige Produktentwicklung. Bereitstellung der Azure-Infrastruktur.
  • Aufbau von CI/CD-Pipelines mit Azure DevOps. Azure Cloud Verwaltung.
  • Azure DevOps, Azure AD, App-Registrierung und Sicherheit. Entwicklung von Diensten in .NET Core.
  • Selbstverwaltung und Onboarding von Anwendungen auf der Plattform über Spotify Backstage mit benutzerdefinierten Plugins zur Integration mit Azure DevOps und zur Automatisierung von Richtlinienbereitstellung und Überwachungstools.
  • IaC mit YAML und Bicep / ARM-Vorlagen. SQL Server DB, App Services, Functions.
  • Microsoft Graph API, Single Sign-On, Azure AD Services. Betrieb und Sicherheitsüberwachung der Dienste.

Projekt: Semis Rollout Unternehmen: GEA Gruppe

  • OTSec - PSec Projektkombination aus Azure DevOps Pipeline, Terraform, Kubernetes, CAF.

Projekt: Entwicklung einer Cloud Native Data Platform Unternehmen: Carl Zeiss Digital Innovation GmbH Teil des Teams der Gesundheitsdatenplattform

  • Konzeption, Prototyping, POC, MVP und Full-Product-Entwicklung. Bereitstellung von Azure-Infrastruktur, Sicherheit und Compliance, Serverless-Architektur, CI/CD und Qualitätssicherung.
  • Terraform IaC und Bash-Scripting. TypeScript und Node.js für Azure Functions.
  • Verwendung von Azure API Management, Azure Functions, Azure FHIR APIs, Azure Data Lake, DICOM, Azure Health Services, Azure Cosmos DB
Verifizierter Experte

Srikar K.

Profil ansehen

Anwendungsentwickler

Berlin
Srikar K.

Letzte Position:

Anwendungsentwickler bei Vavili Technologies

  • War als Full-Stack-Entwickler entscheidend an der Entwicklung von templeswiki.com beteiligt und erstellte und optimierte mehrere Seiten und Microservices, um ein responsives und benutzerfreundliches Erlebnis sicherzustellen.
  • Entwickelte einen interaktiven Chatbot mit Natural Language Processing (NLP), um die Nutzerinteraktion zu verbessern und die Kundenkommunikation in der Anwendung zu vereinfachen.
  • Baute eine robuste ETL-Pipeline mit Python auf, um mehrsprachige Labels zu erstellen und so eine nahtlose Übersetzung von Inhalten zu ermöglichen.
  • Leitete das QA-Team, erstellte einen umfassenden Testplan, um die reibungslose Funktion der Anwendung gründlich zu prüfen, und entwickelte gleichzeitig ein internes Tool zur Anwesenheitsdokumentation, um die Effizienz zu steigern.
Verifizierter Experte

Apoorv S.

Profil ansehen

KI-Interviewer

Berlin
Apoorv S.

Letzte Position:

KI-Interviewer

  • Einen KI-Forschungsassistenten mit RAG, LangChain, LangGraph und OpenAI-LLMs sowie integrierter Vektorsuche entwickelt.

Entdecke mehr als 15.000 Top-Freelancer

Statistiken von Experten, die PySpark einsetzen

Aggregiert aus den beruflichen Profilen passender Freelancer.

Berufserfahrung

12 Jahre (Deutschland: 13 Jahre)

PySpark Experten in Berlin verfügen im Durchschnitt über 12 Jahre Berufserfahrung. Das sind 1 Jahr weniger als in Deutschland, wo der Durchschnitt 13 Jahre beträgt.

Positionsdauer

2,2 Jahre (Deutschland: 2,8 Jahre)

PySpark Experten in Berlin bleiben im Durchschnitt 2,2 Jahre in einer Position. Das sind 0,6 Jahre weniger als in Deutschland, wo der Durchschnitt 2,8 Jahre beträgt.

Positionen pro Freelancer

8 (Deutschland: 10)

PySpark Experten in Berlin haben im Laufe ihrer Karriere durchschnittlich 8 Positionen abgeschlossen. Das sind 2 weniger als in Deutschland, wo der Durchschnitt 10 beträgt.

Häufigste Fachbereiche

Informationstechnologie (IT), Produktentwicklung, Business Intelligence

PySpark Experten in Berlin haben den Großteil ihrer praktischen Projekterfahrung in den Bereichen Informationstechnologie (IT), Produktentwicklung und Business Intelligence gesammelt.

Häufigste Branchen

Informationstechnologie (IT), Bildung, Professionelle Dienstleistungen

PySpark Experten in Berlin sind in den Branchen Informationstechnologie (IT), Bildung und Professionelle Dienstleistungen am stärksten gefragt.

Fokus der Zertifizierungen

Informationstechnologie (IT), Business Intelligence, Produktentwicklung

PySpark Experten in Berlin erwerben ihre Zertifizierungen am häufigsten in den Bereichen Informationstechnologie (IT), Business Intelligence und Produktentwicklung.

Bachelor-Abschluss oder höher

93% (Deutschland: 96%)

93% der PySpark Experten in Berlin haben mindestens einen Bachelor-Abschluss. Das sind 3% weniger als in Deutschland, wo der Anteil 96% beträgt.

Master-Abschluss oder höher

60% (Deutschland: 71%)

60% der PySpark Experten in Berlin haben mindestens einen Master-Abschluss. Das sind 11% weniger als in Deutschland, wo der Anteil 71% beträgt.

Doktortitel

7% (Deutschland: 15%)

7% der PySpark Experten in Berlin haben einen Doktortitel (PhD). Das sind 8% weniger als in Deutschland, wo der Anteil 15% beträgt.

Zertifizierungen pro Freelancer

3 (Deutschland: 4)

PySpark Experten in Berlin besitzen im Durchschnitt 3 berufliche Zertifizierungen. Das sind 1 weniger als in Deutschland, wo der Durchschnitt 4 beträgt.

Häufigste Sprachen

Englisch, Deutsch, Spanisch

PySpark Experten in Berlin sprechen am häufigsten Englisch, Deutsch und Spanisch.

Sprechen zwei oder mehr Sprachen

82% (Deutschland: 96%)

82% der PySpark Experten in Berlin sprechen zwei oder mehr Sprachen. Das sind 14% weniger als in Deutschland, wo der Anteil 96% beträgt.

Basierend auf unserem Profilpool, Stand 19 Sep 2026.

Tagessatzverteilung

0 1 2 3 4
3 der PySpark Experten in Berlin verlangen weniger als 320 € pro Tag.
Einer der PySpark Experten in Berlin verlangt zwischen 320 € und 480 € pro Tag.
3 der PySpark Experten in Berlin verlangen zwischen 480 € und 640 € pro Tag.
3 der PySpark Experten in Berlin verlangen zwischen 640 € und 800 € pro Tag.
Einer der PySpark Experten in Berlin verlangt zwischen 800 € und 960 € pro Tag.
3 der PySpark Experten in Berlin verlangen zwischen 960 € und 1120 € pro Tag.
2 der PySpark Experten in Berlin verlangen 1120 € oder mehr pro Tag.
<€320 €320-​480 €480-​640 €640-​800 €800-​960 €960-​1120 €1120+

Das Diagramm zeigt, wie sich die Tagessätze der Freelancer in dieser Technologie in Berlin verteilen, basierend auf aktuellen Verträgen auf unserer Plattform. Jeder Balken deckt eine Tagessatzspanne ab – seine Höhe zeigt, wie viele Freelancer innerhalb dieser Spanne abrechnen.

Durchschnittssätze von Experten in Berlin, die PySpark einsetzen

Die Tagessätze basieren auf aktuellen Verträgen und enthalten keinen FRATCH-Aufschlag.

1000
750
500
250
Stundensatzvergleich-Diagramm
Ø Tagessatz 679 €
Ø Deutschland 750 €

Der durchschnittliche Tagessatz ist der Mittelwert aller Tagessätze aus aktuellen Verträgen vergleichbarer Freelancer auf unserer Plattform.

1000
750
500
250
Stundensatzvergleich-Diagramm
Median-Tagessatz 660 €
Median Deutschland 800 €

Der Median-Tagessatz ist der mittlere Wert aller Tagessätze – die Hälfte der vergleichbaren Freelancer verlangt weniger, die andere Hälfte mehr. Anders als der Durchschnitt wird er von Ausreißern kaum beeinflusst.

Berechnet auf Basis der Tagessätze unserer Freelancer, Stand 19 Sep 2026. Die tatsächlichen Tagessätze können je nach Dienstalter, Erfahrung, Fachkenntnissen, Projektkomplexität und Auftragsdauer variieren.

Branchenfokus der PySpark Experten

Sieh, in welchen Branchen unsere gematchten Freelancer am häufigsten tätig sind — jede Zahl wird live aus den Freelancern auf FRATCH berechnet.

  • Informationstechnologie (IT) (88%)
  • Bildung (53%)
  • Professionelle Dienstleistungen (53%)
  • Automotive (41%)
  • Gesundheitswesen (41%)
  • Energie (35%)
  • Fertigung (29%)
  • Bank- und Finanzwesen (24%)

Bitte beachte, dass Freelancer in mehreren Branchen tätig sein können, daher überschneiden sich die Prozentwerte.

Über die Technologie

Verteilte Datenverarbeitung

PySpark ist die Python-API für Apache Spark, ein Framework für verteiltes Rechnen zur Verarbeitung großer Datensätze über Cluster hinweg. Es unterstützt Batch-Transformationen, SQL-Abfragen, Streaming-Workloads und Workflows für maschinelles Lernen. Unternehmen nutzen es, um Rohdaten in zuverlässige, nutzbare Informationen umzuwandeln.

Pipelines und Workloads

PySpark-Spezialisten erstellen Datenprodukte, die wiederholt ausgeführt werden und wechselnde Volumen ohne manuelle Eingriffe verarbeiten.

  • Batch- und Streaming-Ingestion-Pipelines entwickeln
  • Daten aus unterschiedlichen Quellen bereinigen, verknüpfen und transformieren
  • Datensätze für Analysen und maschinelles Lernen vorbereiten
  • Workloads zwischen Data Lakes, Data Warehouses und Cloud-Speicher verschieben

Ökosystem und Tools

Effektives Arbeiten mit PySpark umfasst mehr als das Schreiben von DataFrame-Operationen. Experten nutzen Spark SQL, Structured Streaming, RDDs, wenn sinnvoll, sowie Formate wie Parquet und Delta Lake. Außerdem arbeiten sie mit Orchestrierungstools, Versionskontrolle, Test-Frameworks und Cloud-Diensten von AWS, Azure oder Google Cloud.

Wann Expertise wichtig ist

Unternehmen holen sich freiberufliche PySpark-Expertise ins Haus, wenn aus einem Prototyp eine zuverlässige Produktionspipeline werden muss, Jobs zu langsam laufen oder eine bestehende Spark-Umgebung sorgfältig neu gestaltet werden muss. Berliner Teams können von Spezialisten profitieren, die je nach Sicherheits- und Lieferanforderungen remote über Zeitzonen hinweg arbeiten oder vor Ort zusammenarbeiten.

  • Langsame Phasen, verzerrte Joins und übermäßige Shuffles diagnostizieren
  • Praktiken für Monitoring, Tests und Deployment etablieren
  • Veraltete Hadoop- oder Spark-Workflows modernisieren

Kompetenzen rund um PySpark

Starke Fachkräfte verbinden Python und SQL mit Datenmodellierung, verteilten Systemen und Cloud-Infrastruktur. Sie verstehen Partitionierung, Caching, Serialisierung, Schema-Evolution und Fehlerbehebung. Erfahrung mit Kafka, Airflow, Kubernetes, Notebooks und Lakehouse-Architekturen ist wertvoll, wenn das Projekt Ingestion, Verarbeitung und Bereitstellung umfasst.

Einen starken Spezialisten auswählen

Suchen Sie nach jemandem, der erklären kann, warum eine Pipeline auf eine bestimmte Weise aufgebaut ist, und nicht nur funktionierenden Code liefert. Prüfen Sie Beispiele für Produktions-Workloads, Datenqualitätskontrollen und Performance-Analysen. Ein guter Spezialist macht Abwägungen sichtbar, dokumentiert betriebliche Anforderungen und hinterlässt wartbare Jobs, die andere Teams ausführen und verbessern können.

Veröffentlicht am:
FRATCH GPT

FRATCH GPT liefert in Minuten Freelancer-Vorschläge mit nachvollziehbarer Begründung und transparenten Preisen und hilft deiner Personalabteilung, schnell und regelkonform die besten Talente zu finden.

Probier es aus:

Teste FRATCH GPT

Häufig gestellte Fragen

Schnelle Antworten auf die Fragen, die rund um PySpark am häufigsten aufkommen.

PySpark wird verwendet, um große Datensätze über verteilte Rechencluster hinweg zu verarbeiten und zu transformieren. Häufige Anwendungen sind Batch-Pipelines, Streaming-Systeme, die Vorbereitung von Merkmalen für maschinelles Lernen, Log-Analysen und Lakehouse-Workloads.

PySpark verteilt die Verarbeitung über ein Cluster, während pandas hauptsächlich für Daten ausgelegt ist, die auf eine einzelne Maschine passen. pandas kann für explorative Arbeiten einfacher sein, aber PySpark eignet sich besser für wiederholbare Workloads, die mehr Kapazität und Fehlertoleranz benötigen.

Ein starker PySpark-Spezialist verbindet in der Regel Python, SQL und Datenmodellierung mit Kenntnissen über Cloud-Speicher und verteilte Systeme. Kafka, Airflow, Docker, Kubernetes, Delta Lake und Praktiken zur Datenqualität sind je nach umgebender Architektur nützlich.

Beschreiben Sie die Datenquellen, erwarteten Ausgaben, Verarbeitungsmuster, die Bereitstellungsumgebung und betriebliche Einschränkungen. Bei PySpark hilft es außerdem, aktuelle Engpässe, Änderungen des Datenvolumens, Latenzanforderungen und die bereits für Orchestrierung und Monitoring eingesetzten Tools zu erläutern.

PySpark unterstützt die Verarbeitung nahezu in Echtzeit durch Structured Streaming. Ein Spezialist sollte Ereigniseingänge, Zustandsverwaltung, Checkpointing, Zustellgarantien und die akzeptable Verzögerung prüfen, bevor er das passende Design auswählt.

Ja. PySpark-Arbeit eignet sich häufig gut für die Remote-Zusammenarbeit, da Pipelines, Tests und Infrastruktur über gemeinsame Repositories und Cloud-Umgebungen geprüft werden können. Vor-Ort-Arbeit kann dennoch wichtig sein, wenn Datenzugriff, interne Systeme oder die Koordination auf Deutsch dies erfordern.

Das richtige Niveau hängt eher vom Workload und seinem Betriebsrisiko ab als von einer einfachen Zeitspanne. Bei PySpark kann eine kleine Transformation gezielte Pipeline-Kompetenzen erfordern, während ein kritisches Streaming- oder Lakehouse-System nachgewiesene Erfahrung mit Performance, Zuverlässigkeit und Produktionssupport verlangt.

Bitten Sie den Spezialisten, Partitionierung, Joins, Shuffles, Schemaänderungen und Fehlerbehandlung im Kontext Ihres Workloads zu erklären. Hochwertige PySpark-Arbeit umfasst lesbare Transformationen, automatisierte Tests, beobachtbare Jobs, kontrollierte Kosten und eine Dokumentation, die die spätere Wartung unterstützt.

Der durchschnittliche Stundensatz von Freelancern in Berlin, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, liegt bei 85 €, was einem Tagessatz von etwa 679 € bei einem 8-Stunden-Tag entspricht.

Von den Freelancern in Berlin, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, haben 93% mindestens einen Bachelor-Abschluss, 60% mindestens einen Master-Abschluss und 7% einen Doktortitel.

Freelancer in Berlin, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, haben im Durchschnitt 12 Jahre Berufserfahrung; ein einzelnes Projekt dauert typischerweise etwa 2,2 Jahre.

Die häufigsten Sprachen unter Freelancern in Berlin, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, sind Englisch (100%), Deutsch (82%) und Spanisch (18%).

Die häufigsten Industrien unter Freelancern in Berlin, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, sind Informationstechnologie (IT) (88%), Bildung (53%) und Professionelle Dienstleistungen (53%).

Die häufigsten Bereiche unter Freelancern in Berlin, Deutschland, die PySpark in ihren letzten Projekten eingesetzt haben, sind Informationstechnologie (IT) (100%), Produktentwicklung (88%) und Business Intelligence (82%).

Hauptstandorte der FRATCH Experten, die kürzlich PySpark eingesetzt haben

Unsere Freelancer und Interim-Experten sind in der gesamten DACH-Region zuhause — verfügbar vor Ort in den wichtigsten Wirtschaftszentren oder komplett remote. Wähle einen Standort und entdecke passende Spezialisten, lokale Markteinblicke und aktuelle Verfügbarkeiten.

Berlin Hamburg München Köln Frankfurt Stuttgart Düsseldorf Leipzig Dortmund Essen Bremen Dresden Hannover Nürnberg

Kostenlose Demo vereinbaren

Kontaktiere uns und das FRATCH-Team meldet sich innerhalb von 4 Stunden bei dir.

Kontakt-Formular

Möchtest du lieber direkt mit uns in Kontakt treten?
Wir haben immer Zeit für einen Anruf oder eine E-Mail!

FRATCH CEO Avatar

Philipp Thomaschewski

FRATCH CEO

LinkedInFRATCH