Justas S.-Daten- & KI-Ingenieur | GenAI / LLM | Datenplattformen
Tagessatz prüfen
Erfahrungen
Praktikant für Performance-Analyse
Luminor Bank - CIO Office
- Entwicklung analytischer und validierender Systeme über 5 Organisationsbereiche, etwa 35 Geschäftsbereiche und 280 operative Prozesse hinweg.
- Entwicklung von Python- und SQL-Transformationspipelines, automatisierten Validierungsregeln, KPI-Modellen und reproduzierbaren Analyse-Workflows zur Unterstützung des Reportings auf CIO-Ebene.
- Untersuchung von Dateninkonsistenzen in Quellsystemen, Transformationspipelines, Metrikdefinitionen und Reporting-Ebenen mithilfe einer systematischen Ursachenanalyse.
- Implementierung automatisierter Prüfungen auf Vollständigkeit, Schemakonsistenz, Korrektheit von Aggregationen, Ausreißer, doppelte Datensätze und Metrik-Regressionen.
- Zusammenarbeit mit Stakeholdern aus dem Fachbereich, um operative Anforderungen in wiederverwendbare Datenmodelle, Metriken und gesteuerte analytische Ergebnisse zu übersetzen.
- Validierung analytischer Pipelines und Reporting-Ergebnisse, um Konsistenz, Nachvollziehbarkeit und eine zuverlässige Weiterverwendung durch Stakeholder sicherzustellen.
Principal Engineer / Solo-Entwickler
AlphaFlow
- Architektur einer ereignisgesteuerten Plattform für Echtzeitaufnahme, Feature-Berechnung, ML-Inferenz, deterministisches Replay, Ausführungssimulation und quantitative Forschung.
- Entwicklung deterministischer Replay- und Regressionstest-Workflows zur Reproduktion von Fehlern und Validierung von Positionen, Feature-Vektoren, Modellausgaben und Systemzuständen über wiederholte Ausführungen hinweg.
- Entwicklung asynchroner Marktdateninfrastruktur für BTC, ETH, SOL und XRP mit garantierter Reihenfolge, Umgang mit Duplikaten, Wiederherstellung, Synchronisierung, Validierung, Telemetrie und defensiver Nachrichtenverarbeitung.
- Entwicklung modularer und testbarer Schnittstellen über Aufnahme, Modelle, Strategien, Ausführung und Risiko hinweg mit Rust, Python, Docker, WebSockets, ONNX und asynchronen Systemen.
- Entwicklung von Event-Streaming- und Event-Sourcing-Infrastruktur mit Apache Pulsar, einschließlich strukturierter Ereignisschemas, asynchroner Produzenten und Konsumenten, wiederabspielbarer Ereignisverläufe und verteilter Nachrichtenverarbeitung.
- Entwicklung von Verarbeitungsgarantien für Ereignisidentität, Reihenfolge, Umgang mit Duplikaten, idempotente Konsumenten, Richtlinien für verspätete Ereignisse, Wiederherstellung und deterministisches Replay.
- Implementierung reproduzierbaren Event-Replays und von Regressionstests mit kanonisiertem Zustand, Hashing pro Stufe und Erkennung der ersten Abweichung über verteilte Verarbeitungsstufen hinweg.
- Steigerung der GPU-Auslastung von etwa 45% auf 80% durch Einführung von Batching und Verlagerung der Tokenisierung aus dem kritischen Ausführungspfad.
- Reduzierung der Evaluierungsdauer von etwa 3 Stunden auf 70 Minuten durch Pipeline-Optimierung und effizientere Ausführung.
- Entwicklung eines auf FastAPI basierenden Evaluierungsdienstes für Auftragserstellung, Ausführungsverfolgung und Ergebnisabruf bei etwa 2,000 Evaluierungsläufen pro Monat.
- Arbeit mit etwa 15 TB an Logs und Evaluierungsdaten bei gleichzeitiger Aufrechterhaltung deterministischer Ausführungs- und Debugging-Workflows.
Mitgründer & Lead Engineer
ServeAI
- Leitung der Entwicklung einer AI-SaaS-Plattform mit Python, PyTorch, Hugging Face, PostgreSQL, Vektorsuche, LLM-Inferenz, APIs und Cloud-Infrastruktur.
- Entwicklung von Retrieval- und Generierungspipelines mit Einschränkungen, die Modellantworten ausschließlich auf kundenspezifischen Daten basieren und deterministisches Retrieval, Filtern, Validierung und Zugriffskontrollen verwenden.
- Entwicklung von Inferenz-Benchmarking-Workflows zum Vergleich von Modellqualität, Token-Durchsatz, Time-to-First-Token, End-to-End-Latenz, Speicherverbrauch und Batching-Strategien.
- Evaluierung lokaler und gehosteter Inferenz-Stacks einschließlich vLLM, SGLang, llama.cpp, Hugging Face Transformers und quantisierter Modelldeplyoments.
- Implementierung von dynamischem Batching, Streaming-Generierung, Caching, Token-Budget-Steuerung, strukturierten Ausgaben, Wiederholungslogik und Inferenz-Observability.
- Verantwortung für ML-Architektur, Evaluierung, Deployment, Backend-Dienste, Datenmodelle, Modellintegration, Performance-Optimierung, Debugging und Produktionszuverlässigkeit.
- Leitung der Backend-Entwicklung einer AI-SaaS-Plattform mit API-Diensten, PostgreSQL, Authentifizierung, LLM-Systemen, Retrieval, Zahlungen und Kubernetes-basierter Cloud-Infrastruktur.
- Entwicklung von Servicegrenzen, REST-APIs, Microservices, Backend-Workflows, Datenmodellen, externen Integrationen und KI-gestützten Produktfunktionen.
- Implementierung GitOps-basierter Deployment-Workflows mit ArgoCD für deklarative Kubernetes-Anwendungsbereitstellung, automatische Synchronisierung und Management von Produktionsdeployments.
- Entwicklung strukturierter RAG-Workflows, die KI-Antworten mit Retrieval-Einschränkungen, Validierung und Zugriffskontrollen auf Anwendungsebene auf kundenspezifischen Daten fundieren.
- Verantwortung für Architektur, Implementierung, Integrationstests, Deployment-Automatisierung, Debugging und produktive Weiterentwicklung über den gesamten Backend-Lebenszyklus hinweg.
- Entwicklung von Datenbankschemas und Backend-Retrieval-Schnittstellen für strukturierten Wissenszugriff, semantische Suche und zuverlässige KI-gestützte Antworten.
- Entwicklung von Validierungs- und Guardrail-Logik für Modellantworten, um die Zuverlässigkeit von Antworten zu verbessern und sicherzustellen, dass Ausgaben auf autorisierten Anwendungsdaten basieren.
Software Engineer - Praktikant für maschinelles Lernen
OpenAI
- Entwicklung und Validierung von Python- und PyTorch-Workflows für Modelltraining, Inferenz, Evaluierung und ML-Experimente im großen Maßstab auf NVIDIA-GPU-Infrastruktur.
- Profiling einer Evaluierungspipeline, in der CPU-Tokenisierung zu einer geringen GPU-Auslastung führte; Neuentwicklung von Batching und Vorverarbeitung zur Steigerung der GPU-Auslastung von 46% auf 82% und Reduzierung der Laufzeit von 3.1 Stunden auf 74 Minuten.
- Implementierung von Korrektheitstests auf Modell- und Tensor-Ebene für Formen, Datentypen, Maskierung, Padding, Attention-Ausgaben, numerische Toleranzen, deterministische Ausführung und Konsistenz zwischen Implementierungen.
- Debugging numerischer Instabilität in fp16 und bf16 mit NaNs, überlaufenden Logits, instabilen Reduktionen und Gradient Scaling; Validierung der Korrekturen anhand von fp32-Referenzimplementierungen.
- Arbeit mit PyTorch, Hugging Face Transformers, Tokenizers, NumPy, SciPy, CUDA, Triton, NCCL und verteilten Multi-GPU-Workloads.
- Benchmarking von Modellimplementierungen anhand von Latenz, Durchsatz, maximalem VRAM, GPU-Auslastung, numerischem Fehler und Kriterien zur Ausgabegleichheit.
- Entwicklung reproduzierbarer Evaluierungs-Workflows über die Kommandozeile mit festgelegten Abhängigkeiten, deterministischen Seeds, containerisierter Ausführung, strukturierter Konfiguration und automatisierter Ergebnisvalidierung.
- Diagnose verteilter und systembezogener Fehler einschließlich NCCL-Synchronisationsproblemen, GPU-OOMs, Host-zu-Gerät-Engpässen, Speicherfragmentierung, Verbindungslecks und instabilen CI-Workloads.
- Prüfung von ML-Implementierungen und KI-generierten technischen Lösungen hinsichtlich Korrektheit, Effizienz, Reproduzierbarkeit, numerischem Verhalten und Engineering-Qualität.
- Entwicklung und Unterstützung produktionsnaher Backend- und Machine-Learning-Systeme mit Python, C++, verteilten Diensten, APIs und containerisierter Infrastruktur.
- Arbeit mit Kubernetes, Docker, Terraform, Azure, CI-Systemen, FastAPI und gRPC zur Entwicklung, Bereitstellung, Prüfung und dem Betrieb verteilter ML-Dienste.
- Entwicklung und Wartung groß angelegter Daten- und Ereignisverarbeitungs-Workflows mit Kafka, Spark, Airflow, PostgreSQL und verteilter Verarbeitungsinfrastruktur.
- Beitrag zu Serviceschnittstellen, automatisierten Tests, Produktionsdebugging, Reliability Engineering und Performance-Optimierung in großen gemeinsam genutzten Codebasen.
LLM Inference Optimization Suite
- PyTorch, vLLM, SGLang, Transformers, CUDA, Triton
- Entwicklung einer reproduzierbaren Benchmark-Suite zum Vergleich von Hugging Face Transformers, vLLM, SGLang und llama.cpp hinsichtlich Latenz, Token-Durchsatz, maximalem Speicherverbrauch, Parallelität und Ausgabekorrektheit.
- Test von kontinuierlichem Batching, KV-Cache-Nutzung, Prefix-Caching, Quantisierung, Tensor-Parallelismus, Sequenzlänge und Abwägungen bei Batch-Größen.
- Steigerung des Durchsatzes bei repräsentativen Transformer-Workloads um 3.4x und gleichzeitige Reduzierung des maximalen GPU-Speicherverbrauchs um 31% durch Optimierung von Batching, Speicherlayout und Inferenz-Engine.
- Hinzufügen automatisierter Regressionsschwellenwerte, sodass Änderungen, die Anforderungen an Korrektheit, Speicher, Latenz oder Durchsatz nicht erfüllten, automatisch abgelehnt wurden.
Verteiltes Training & Fehleranalyse
- PyTorch DDP/FSDP, CUDA, NCCL, Kubernetes
- Entwicklung von Multi-GPU-Trainings-Workflows mit DDP und FSDP, einschließlich Mixed Precision, Gradient Accumulation, Checkpointing, verteiltem Datenladen und fehlertoleranter Wiederherstellung von Checkpoints.
- Diagnose von CUDA-OOMs mithilfe von Memory-Snapshots und Profiler-Traces sowie Unterscheidung zwischen speicherbezogener Nutzung durch Parameter, Aktivierungen, Optimizer-Zustände, temporäre Puffer und Fragmentierung.
- Untersuchung verteilter Hänger durch inkonsistente Collective-Operationen, Fehler beim Laden von Daten, Abweichungen zwischen Ranks, Netzwerkprobleme und das Synchronisationsverhalten von NCCL.
- Erstellung reproduzierbarer Fehlerfälle und automatisierter Regressionstests vor der Integration von Fehlerbehebungen in die Trainingsinfrastruktur.
Numerische Korrektheit & Autograd-Validierung
- PyTorch, JAX, NumPy, SciPy
- Eigenständige Implementierung von Transformer- und neuronalen Netzwerkkomponenten in PyTorch, JAX und NumPy, um Forward-Ausgaben und Gradienten frameworkübergreifend zu vergleichen.
- Diagnose von Abweichungen durch Broadcasting, Maskierung, Reihenfolge von Reduktionen, Dtype-Konvertierung, instabile Softmax-Berechnungen, Unterschiede bei der Initialisierung und Gleitkommapräzision.
- Entwicklung von Dienstprogrammen zur Gradientenprüfung mithilfe finiter Differenzen und hochpräziser Referenzberechnungen für eigene differenzierbare Operationen.
- Definition expliziter absoluter und relativer Fehlertoleranzen auf Grundlage des Operationstyps, des Dtypes, der Tensorgröße und der Akkumulationstiefe.
Forschungsingenieur für maschinelles Lernen
Leiden University - LIACS
- Entwicklung von Forschungsimplementierungen neuronaler Netzwerkarchitekturen in PyTorch und JAX für Experimente zu Optimierung, Repräsentationslernen, Sequenzmodellierung und numerischen Methoden.
- Direkte Neuimplementierung von Modellkomponenten anhand mathematischer Definitionen und wissenschaftlicher Publikationen, einschließlich Attention, Normalisierung, Loss-Funktionen, Optimizer, Convolutional Layers und eigener differenzierbarer Operationen.
- Nutzung von JAX-Transformationen einschließlich jit, grad, vmap und pmap zur Erstellung beschleunigter und vektorisierter numerischer Workloads.
- Überprüfung von Implementierungen der automatischen Differenzierung mithilfe analytischer Ableitungen, finiter Differenzen, numerischer Toleranztests und Cross-Checks zwischen PyTorch und JAX.
- Entwicklung kontrollierter Experimente mit festen Seeds, versionierten Datensätzen, fixierten Umgebungen, Konfigurationsdateien, Experiment-Tracking und reproduzierbaren CLI-Einstiegspunkten.
- Betreuung des Benchmarkings von Trainings- und Inferenzimplementierungen auf CPU- und GPU-Hardware sowie Dokumentation von Performance- und numerischen Abwägungen.
Branchenerfahrung
Sieh, in welchen Branchen dieser Freelancer den Großteil seiner beruflichen Laufbahn verbracht hat.
Erfahren in Bildung, Informationstechnologie (IT) und Bank- und Finanzwesen.
Erfahrung nach Fachbereich
Zeigt, in welchen Abteilungen und Funktionen dieser Freelancer am meisten mitgewirkt hat.
Erfahren in Informationstechnologie (IT), Forschung und Entwicklung (F&E), Qualitätssicherung, Produktentwicklung und Business Intelligence.
Zusammenfassung
Ingenieur für maschinelle Lernsysteme mit 8 Jahren Erfahrung in der Entwicklung, dem Training, Profiling, Debugging und der Optimierung von Deep-Learning-Systemen. Spezialisiert auf Python, PyTorch, JAX, numerische Berechnungen, GPU-Beschleunigung, verteiltes Training und leistungsstarke LLM-Inferenz. Erfahrung mit vLLM, SGLang, Hugging Face Transformers, Tokenizers, CUDA, Triton, NCCL und reproduzierbaren ML-Workflows. Nachweislich erfolgreich bei der Diagnose numerischer Instabilität, Fehlern bei Tensorformen und Datentypen, Speicherengpässen, Fehlern in verteilten Systemen und Performance-Regressionen – vom Modellcode bis zur GPU-Ausführung. Außerdem Erfahrung in der Entwicklung von RAG-Workflows, LLM-basierten Anwendungen, Batch- und Streaming-Datenpipelines, Evaluierungssystemen, Produktions-APIs, Datenplattformen und produktiven Infrastrukturen mit Python, SQL, Spark, Kafka, Airflow, PostgreSQL, MLflow, Kubernetes, Terraform, Azure, AWS und modernen Lakehouse-Mustern.
Fähigkeiten
Programmierung: Python, C++, Rust, Sql, Bash, Typescript, Java, Go
Ml-Frameworks: Pytorch, Jax, Flax, Hugging Face Transformers, Hugging Face Tokenizers, Scikit-Learn, Xgboost, Lightgbm
Inferenz: Vllm, Sglang, Llama.Cpp, Onnx Runtime, Tensorrt, Kontinuierliches Batching, Kv-Caching, Quantisierung, Spekulatives Decoding
Numerische Berechnungen: Numpy, Scipy, Tensoralgebra, Automatische Differentiation, Numerische StabilitäT, Validierung Mit Finiten Differenzen, Gemischte PräZision
Training: Ddp, Fsdp, Gradient Accumulation, Gradient Checkpointing, Amp, Bf16/Fp16, Optimizer-Tuning, Lernratenplanung
Gpu Und Performance: Cuda, Triton, Nccl, Nvidia Nsight, Pytorch Profiler, Torch.Compile, Xla, Kernel-Profiling, Speicheranalyse
Daten Und Systeme: Spark, Kafka, Airflow, Postgresql, Duckdb, Redis, Verteilte Verarbeitung, Etl, Streaming-Pipelines
Infrastruktur: Kubernetes, Docker, Terraform, Aws, Azure, Linux, Fastapi, Grpc, Bazel, Github Actions, Ci/Cd
Evaluierung: Reproduzierbarkeit, Benchmark-Design, Regressionstests, Numerische Validierung, Durchsatz, Latenz, Speicher, Korrektheit
Modellimplementierung: In Der Lage, Modellkomponenten Direkt Aus Gleichungen Zu Implementieren, Statt Sich AusschließLich Auf High-Level-Apis Zu Verlassen.
Numerisches Debugging: Erfahrung In Der Diagnose Von Nans, Explodierenden Gradienten, PräZisionsverlust, Instabilen Reduktionen, Fehlerhaftem Broadcasting Und Datentypbezogenen Fehlern.
Performance-Optimierung: Misst EngpäSse Vor Der Optimierung Mithilfe Von Profiling, Hardwareauslastung, Durchsatz, Latenz Und SpeicherverläUfen.
Reproduzierbarkeit: Verwendet Festgelegte Umgebungen, Container, Deterministische Seeds, Explizite Konfigurationen, Cli-Workflows, Versionierte Daten Und Automatisierte Verifikation.
Validierung: Entwickelt Objektive Korrektheitstests, Referenzimplementierungen, Numerische Toleranzen, Performance-Schwellenwerte Und Regressionsbenchmarks.
SystemverstäNdnis: Sicher Im Debugging üBer Python, Interne Framework-Komponenten, Gpu-AusfüHrung, Verteilte Kommunikation, Datenpipelines Und Infrastruktur Hinweg.
ZusäTzliche Backend-Systeme: Apache Pulsar, Argocd, Node.Js, Nestjs, Javascript, Flink, Iceberg, Delta Lake, Mlflow, Buildkite, Event Sourcing, Idempotenz, Observability, Integrationstests.
Genai Und Datenplattformen: Rag, Embeddings, Semantische Suche, Chunking-Strategien, Prompt Engineering, Strukturierte Ausgaben, Function Calling, Tool-Nutzung, Grounding, Guardrails, Antwortbewertung, Feature Engineering, Zeitreihen-Ml, DatenqualitäT, Datenmodellierung, Lakehouse-Architektur, Objektspeicher, ModellüBerwachung, Kostenbewusste Inferenz, Rest-Apis.
Sprachen
Ausbildung
Leiden University
BSc · Datenwissenschaft & Künstliche Intelligenz · Leiden, Niederlande · 9.8/10
Leiden University
MSc, Deep Learning, Machine Learning Systems, Numerische Optimierung, Paralleles Rechnen, Probabilistisches maschinelles Lernen · Informatik - Künstliche Intelligenz
Leiden University
BSc · Datenwissenschaft & Künstliche Intelligenz
Statistiken
Erfahrung
Fachkenntnisse
Qualifikationen
Profil
Häufig gestellte Fragen
Du hast Fragen? Hier findest du mehr.
Justas spricht folgende Sprachen: Litauisch (Muttersprache), Englisch (Verhandlungssicher), Russisch (Grundkenntnisse).
Justas hat mindestens 5 Jahre Erfahrung. In dieser Zeit hat Justas in mindestens 8 verschiedenen Rollen und für 5 verschiedene Firmen gearbeitet. Die durchschnittliche Dauer der einzelnen Projekte beträgt 1 Jahr und 7 Monate. Beachten Sie, dass Justas möglicherweise nicht alle Erfahrungen geteilt hat und tatsächlich mehr Erfahrung hat.
Basierend auf der jüngsten Erfahrung wäre Justas gut geeignet für Rollen wie: Praktikant für Performance-Analyse, Principal Engineer / Solo-Entwickler, Mitgründer & Lead Engineer.
Die neueste Position von Justas ist Praktikant für Performance-Analyse bei Luminor Bank - CIO Office.
In den letzten Jahren hat Justas für Luminor Bank - CIO Office, AlphaFlow, ServeAI, OpenAI und Leiden University - LIACS gearbeitet.
Justas hat die meiste Erfahrung in Industrien wie Bildung, Informationstechnologie (IT) und Bank- und Finanzwesen.
Justas hat die meiste Erfahrung in Bereichen wie Informationstechnologie (IT), Forschung und Entwicklung (F&E) und Qualitätssicherung. Justas hat auch etwas Erfahrung in Produktentwicklung und Business Intelligence.
Justas hat einen Bachelor in Datenwissenschaft & Künstliche Intelligenz von Leiden University.
Justas ist sofort vollzeit verfügbar für passende Projekte.
Ähnliche Freelancer
Entdecke andere Experten mit ähnlichen Qualifikationen und Erfahrungen
Experten, die kürzlich an ähnlichen Projekten gearbeitet haben
Freelancer mit praktischer Erfahrung in vergleichbaren Projekten als Praktikant für Performance-Analyse
