TensorRT Experten in Deutschland
ein, in Minuten aus über 15.000 CVs mit der Kraft von KI passend ausgewählt.Engagieren Sie Experten, die NVIDIA TensorRT Inference optimieren, Modelle für den GPU-Einsatz konvertieren und abstimmen sowie Engines in produktive Services integrieren. Erhalten Sie schnelles, präzises Matching mit geprüften, verfügbaren Freelancern.
Lerne FRATCH Experten in Deutschland kennen, die kürzlich TensorRT eingesetzt haben
Benjamin Matschke
Letzte Position:
Gründer, Systemarchitekt und Hauptentwickler bei Institute for Artificial Study (IAS)
- Von Experten betreute KI-Systeme für wissenschaftliches Schlussfolgern, Modellevaluation und Forschungs-Workflows.
- Entwickelte den IAS Problem Solver, ein orchestriertes System für schwieriges mathematisches Schlussfolgern; es erreichte 84 % in einem eingereichten Antwortsatz auf dem Leipziger Mathematik-Benchmark.
- Entwickelte eine fortsetzbare State-Machine-Pipeline für die Generierung von Benchmarks in der Forschungsmathematik: Quellenauswahl, LLM-Agent-basierte Phänomenfindung, Aufgabensynthese, Gold-Antwort- und Zertifikatsgenerierung sowie Validierung, Probe, Reparatur, menschliches Feedback und Quality Gates, mit Fokus auf Aufgaben, die schwierig, natürlich, verifizierbar und kosteneffizient sind.
- Die aktuelle Arbeit erweitert dies zu budgetbewussten KI-Forschungs-Workflows für reale wissenschaftliche Probleme mit Expertenprüfung.
Tech-Stack: Python, OpenAI/OpenRouter-kompatible APIs, Embeddings, RAG, SQLite.
Hamza Salaar
Letzte Position:
Wissenschaftlicher Mitarbeiter - KI & autonome Systeme bei Hochschule Coburg
- KI-basierte Wahrnehmungs- und multimodale Systeme für reale Umgebungen entwickelt und umgesetzt
- Machine-Learning- und Deep-Learning-Modelle mit Python, PyTorch, TensorFlow und OpenCV gebaut, trainiert und evaluiert
- Mit Vision-Language-Modellen (VLMs), Large Language Models (LLMs), transformerbasierten Architekturen und multimodalen KI-Systemen gearbeitet
- LoRA-basierte Fine-Tuning-Techniken angewendet und mit Diffusionsmodellen für generative und multimodale KI-Anwendungen experimentiert
- Multimodale Wahrnehmungspipelines mit Kamera-, LiDAR- und Sensordaten entwickelt
- End-to-End-Workflows für Datenverarbeitung, Modelltraining, Evaluation, Benchmarking und Robustheitsanalyse entworfen
- HuggingFace Transformers und moderne Deep-Learning-Frameworks für KI-Experimente und Deployment-Workflows genutzt
- GPU-beschleunigtes Rechnen, CUDA-basierte Verarbeitung sowie ONNX- und TensorRT-Optimierung für effiziente Inferenz und großskaliges Modelltraining eingesetzt
- Mit Industriepartnern wie Valeo und REHAU an angewandten KI- und intelligenten Systemprojekten zusammengearbeitet
- Skalierbare KI-Architekturen und prototypische Softwarelösungen für Automatisierungs- und Wahrnehmungsaufgaben entwickelt
Ariel Lev
Letzte Position:
Sr. Principal Engineer bei Slalom
- Hatte direkte Linienverantwortung für ein Team von 4 Platform Engineers — inklusive Hiring, Performance Reviews und Karriereentwicklung — und habe dabei einen gemeinsamen Rahmen für Engineering-Standards sowie eine Coaching-Kultur aufgebaut, die die Delivery über Kundenprojekte hinweg beschleunigt hat.
- Habe ein Team von Engineers geführt, um ein cloud-natives Voice-AI-System für einen großen Inspektionskunden zu entwerfen. Damit konnten 2.500 Außendienst-Inspektoren ihre Arbeit komplett freihändig per Echtzeit-Transkription und AI Agents dokumentieren — manuelle Dateneingabe über 440.000 Inspektionen pro Monat wurde eliminiert und die Kosten pro Nutzer von 9 $ auf 1 $ gesenkt. Stack: AWS (DynamoDB, S3, Transcribe, CloudFront, API Gateway, Bedrock), ElevenLabs, Claude.
- Habe ein Team von Engineers geführt, um das Management von Kubernetes-Clustern über mehrere Regionen für einen globalen SaaS-Marktführer zu automatisieren. Dadurch sank die Bereitstellungszeit von 3 Wochen auf unter einen Tag und 90 % der Konfigurationsfehler wurden eliminiert. Stack: EKS, Terragrunt, Python, Bash, ArgoCD.
- Accelerator - Cloud-agnostische KI-Plattform: Ich habe eine cloud-agnostische, Kubernetes-native Plattform als Accelerator entworfen und ausgeliefert. Damit wurde das Multi-Tenant-Management von selbst gehosteten LLMs im Enterprise-Maßstab ermöglicht, inklusive gleichzeitiger Bereitstellung mehrerer Basismodelle und dynamischem Serving von LoRA-Adaptoren. Ich habe die Produktionsinfrastruktur mit Open-Source-Tools (ArgoCD, Karpenter, vLLM, SGLang) entworfen, inklusive automatisiertem Modell-Lifecycle-Management, API-Security (Keycloak + LiteLLM) und kostenoptimierter GPU-Bereitstellung.
Kartik Trivedi
Letzte Position:
Masterarbeit bei Fraunhofer LBF
- Thema: Objekterkennung und semantische Segmentierung für (AUV)-Systeme mit transformerbasierten Vision-Modellen und Sensorfusion.
- Entwicklung und Implementierung einer durchgängigen Multi-Sensor-Fusion-Wahrnehmungspipeline (Kamera, LiDAR, IMU) in ROS
- Entwicklung eines CNN-basierten Machine-Learning-Modells (YOLOv8) und transformerbasierter Vision-Modelle für die Echtzeit-Objekterkennung
- Verarbeitung und Clustering von 3D-LiDAR-Point-Clouds mit DBSCAN, RANSAC und Voxel-Grid-Filtering für eine robuste Objektlokalisierung in verrauschten Umgebungen.
- Entwicklung von Bayesian-Netzwerk-Modellen (GeNle) für probabilistisches Schließen und sensorbasierte Entscheidungsfusion unter Unsicherheit.
- Einsatz von Kalman-Filtering zur Schätzung des Sensorzustands, zeitlichen Ausrichtung und glatten Objektverfolgung, wodurch False Positives in sicherheitskritischen Szenarien reduziert wurden.
- Auswertung der Systemleistung unter realistischen Fahrdynamiken, Verbesserung der Tracking-Stabilität und der Robustheit der gesamten Wahrnehmung.
- Aufbau von Deep-Learning-Pipelines für Training, Validierung und Performancebewertung von Wahrnehmungsmodellen mit Sensordaten.
Amr Amer
Letzte Position:
Machine-Learning-Ingenieur bei German Research Center for Artificial Intelligence (DFKI)
- Entwicklung von durchgängig reproduzierbaren ML-Pipelines (PyTorch) mit Datenversionierung (DVC), Experiment-Tracking (MLflow), automatisierten Tests (PyTest) und CI/CD über alle Trainings-Workflows.
- Skalierung von Vision Transformer- und CNN-Trainings auf NVIDIA A100 GPU-Cluster (CUDA, DDP, SLURM); Durchführung von Hyperparameter-Optimierung (W&B Sweeps) zur Reduzierung des Trainingsaufwands und zur Identifizierung optimaler Konfigurationen.
- Entwicklung eines Echtzeit-3D-Systems zur Generierung menschlicher Bewegungen (ViT, VQ-VAE, SMPL-X/PIXIE) für persönlichkeitsabhängige Avatar-Synthese; Erreichen von Spitzenwerten mit FID = 6,15 und P-FID = 10,31 im UDIVA-Benchmark.
- Validierung der Modell-Ausdruckskraft durch strukturierte Nutzerstudien und Erreichen einer 86%-Genauigkeit bei der Unterscheidung zwischen extrovertierten und introvertierten Avatar-Verhalten.
- Optimierung von Inferenz-Pipelines durch Deployment von PyTorch-Modellen mittels TensorRT und ONNX Runtime in nativen C++-Code; Durchführung von Performance-Benchmarks.
Ghaith Ale
Letzte Position:
Leitender Wahrnehmungsingenieur bei Driving Examiner AI Platform
- Automatisierte Fahreranalyse durch Programmierung zeitlicher Regel-Engines zur Bewertung der Sicherheit beim Spurwechsel, Kopfhaltungskontrollen im Rückspiegel, Blinkerzyklen und Einhaltung von Ampeln und Verkehrszeichen
- Echtzeit-Verkehrszeichenerkennung und mehrstufige Ampelklassifikation synchronisiert mit zeitreihengenauer CAN-Bus-Telemetrie und HD-Karten-Raumprioren zur Bewertung der Verkehrsregelkonformität
- Trainierte und bereitgestellte separate Deep-Learning-Modelle, optimiert für die Innenraumüberwachung und die Außenbereichswahrnehmung
- Verknüpfte Wahrnehmungsausgaben mit kameraintrinsischen Parametern und Horizont-Stabilitätschecks, um unter Annahme einer ebenen Geometrie die 3D-Entfernung von Objekten auf der Bodenebene zu schätzen
- Bereitstellung eines Split-Compute-Edge-Netzwerks über VPN für eine Flotte von 10 Fahrzeugen und Implementierung einer Zero-Allocation-Host-Memory-Pipeline zur Eliminierung der Frame-Akkumulationslatenz (6×21 FPS pro Fahrzeug)
Dilip Goswami
Letzte Position:
Freiberuflicher Computer-Vision-Berater bei Spiral Physical Therapy Inc.
- Entwicklung von Methoden für monokulare 3D-Gesichtsrekonstruktion und personalisierte geometrische Modellierung aus mobilen Bildern
- Entwicklung lernbasierter Ansätze für Gesichtsformschätzung, videobasierte Gesichtsanalyse und datenschutzfreundliches visuelles Lernen
Shiqing Fan
Letzte Position:
Technischer Direktor bei EmotionPool GmbH
- Leitete die EU-Markteintrittsstrategie für L3/L4-autonome Logistikfahrzeuge und trieb die technologische Lokalisierung sowie den Einsatz des Smart-Robotics-Portfolios der Muttergesellschaft voran.
- Stimmte die Technik führender Anbieter autonomer Fahrtechnologien in China und Europa ab und übersetzte komplexe Kundenanforderungen in präzise Ingenieursvorgaben gemäß EU-Normen.
- Initiierte strategische gemeinsame F&E-Projekte mit führenden europäischen Universitäten, Forschungsinstituten und Unternehmen, um den Übergang neuester Robotikkonzepte in kommerzielle Produkte zu beschleunigen.
- Entwarf die End-to-End-Architektur intelligenter Lagerlösungen und führte funktionsübergreifende Teams bei der Optimierung der Hardwareintegration für autonome Fahrzeuge und Roboter sowie der Gesamtssystemleistung.
- Leitete die F&E für hochauflösende Simulationen und KI-Algorithmen mit NVIDIA Isaac Sim & Lab und etablierte robuste "Sim-to-Real"-Pipelines, um dynamische Pfadplanungsoptimierung, intelligente Hindernisvermeidung und komplexe Navigationssysteme vor der physischen Implementierung zu trainieren und zu validieren.
- Beibehielt praktische Kontrolle über die Kernsystemarchitektur mit Fokus auf Performance-Tuning auf niedrigster Ebene, Beschleunigung der KI-Modellinferenz mit TensorRT/ONNX Runtime und Sensorintegration.
Oliver Köhn
Letzte Position:
Berater für datengetriebene KI-Lösungen bei Oliver Köhn - IT-Freelancer
- KI-gestützte Automatisierung mit Fokus auf Effizienz, Informationsverarbeitung und Assistenzsysteme
- Automatisierte E-Mail-Klassifizierung (OpenAI, FastAPI)
- Vertragsanalyse für LegalTech (Llama 3, LangGraph)
- Interne Wissenssuche mit RAG (VLLM, Hugging Face)
- Anomalieerkennung auf Edge-Geräten (LLAVA, TensorRT)
- Agentensystem für Management-Reports (LangGraph, Zapier)
Surya Alla
Letzte Position:
KI-Softwareingenieur bei Fraunhofer FIT
- Entwicklung von LLM-basierten Automatisierungs-Utilities, darunter strukturierte Reasoning-Pipelines, LLM-as-a-Judge-Bewertungstools und Multi-Model-Vergleichs-Frameworks.
- Aufbau von RAG-Pipelines für interne Forschungs-Workflows mit LangChain, ChromaDB und FastAPI, um semantische Suche und mehrstufiges Reasoning zu ermöglichen.
- Integration von LLM-Microservices in bestehende ML-Systeme mit Docker, FastAPI und GitLab CI/CD sowie reproduzierbare Deployment-Workflows.
- Entwurf von Inferenz-APIs, die Vision-Modelle und LLM-Reasoning für multimodale Analysen und Entscheidungsfindung kombinieren.
- Optimierung der embeddings-basierten Suche durch Pruning von Vektorspeichern, verbesserte Chunking-Logik und dynamische Retriever-Auswahl.
- Durchführung von Prompt Engineering und Feintuning der Systemanweisungen für Konsistenz, Robustheit und bessere Reasoning-Qualität.
- Erstellung von Benchmarking-Suites zur Bewertung von LLM-Latenz, Reasoning-Qualität, Retrieval-Genauigkeit und Robustheit unter verschiedenen Prompt-Templates.
Adithya Balaji
Letzte Position:
Edge AI Software Engineer bei Neura Robotics GmbH
- Vision-Language-Action-(VLA)- und Diffusion-Policy-Modelle auf NVIDIA Jetson Orin und Jetson Thor bereitgestellt und optimiert, um Echtzeit-Inferenz-Latenz-Ziele für humanoide Roboter-Steuerungsschleifen zu erreichen.
- TensorRT-Engine-Pipelines (PyTorch → ONNX → TensorRT) mit INT8/FP8 Post-Training-Quantisierung, Design von Kalibrierungsdatensätzen und quantisierungsbewusster Validierung aufgebaut, wodurch der Inferenz-Speicherbedarf auf Jetson um mehr als das 3-Fache reduziert wurde, ohne Genauigkeitsverlust.
- Eigene CUDA-C++-Plugins und CUDA Graphs für latenzdeterministische, echtzeitfähige Policy-Ausführung entwickelt – und damit harte Laufzeit- und Speichergrenzen auf eingebetteten GPU-Zielsystemen eingehalten.
- Eine Inferenz-Engine für VLA-Modelle auf Basis von llama.cpp entwickelt, die verschiedene VLA-Policies unter einer einzigen Runtime zusammenführt und jede als eine einzelne, selbst enthaltene GGUF verpackt, die kein Python oder PyTorch benötigt.
- GPU-Ausführung mit NVIDIA Nsight Systems und Nsight Compute profiliert und optimiert, CUDA-Kernel-Engpässe, Sättigung der Speicherbandbreite und SM-Auslastungsprobleme über Jetson-Orin- und Thor-Compute-Profile hinweg identifiziert und damit eine Performance-Optimierung über mehrere Schichten umgesetzt.
Entdecke mehr als 15.000 Top-Freelancer
Statistiken von Experten, die TensorRT einsetzen
Aggregiert aus den beruflichen Profilen passender Freelancer.
Berufserfahrung
13 Jahre
Positionsdauer
1,7 Jahre
Positionen pro Freelancer
7
Häufigste Fachbereiche
Informationstechnologie (IT), Produktentwicklung, Forschung und Entwicklung (F&E)
Häufigste Branchen
Informationstechnologie (IT), Automotive, Bildung
Bachelor-Abschluss oder höher
100%
Master-Abschluss oder höher
91%
Doktortitel
27%
Zertifizierungen pro Freelancer
0
Häufigste Sprachen
Deutsch, Englisch, Arabisch
Sprechen zwei oder mehr Sprachen
100%
Basierend auf unserem Profilpool, Stand 30 Aug 2026.
Tagessatzverteilung
Das Diagramm zeigt, wie sich die Tagessätze der Freelancer in dieser Technologie in Deutschland verteilen, basierend auf aktuellen Verträgen auf unserer Plattform. Jeder Balken deckt eine Tagessatzspanne ab – seine Höhe zeigt, wie viele Freelancer innerhalb dieser Spanne abrechnen.
Durchschnittssätze von Experten in Deutschland, die TensorRT einsetzen
Die Tagessätze basieren auf aktuellen Verträgen und enthalten keinen FRATCH-Aufschlag.
Der durchschnittliche Tagessatz ist der Mittelwert aller Tagessätze aus aktuellen Verträgen vergleichbarer Freelancer auf unserer Plattform.
Der Median-Tagessatz ist der mittlere Wert aller Tagessätze – die Hälfte der vergleichbaren Freelancer verlangt weniger, die andere Hälfte mehr. Anders als der Durchschnitt wird er von Ausreißern kaum beeinflusst.
Berechnet auf Basis der Tagessätze unserer Freelancer, Stand 30 Aug 2026. Die tatsächlichen Tagessätze können je nach Dienstalter, Erfahrung, Fachkenntnissen, Projektkomplexität und Auftragsdauer variieren.
Über die Technologie
Inference-Geschwindigkeit
TensorRT ist NVIDIA's Inference-Optimizer und Runtime, um trainierte neuronale Netze auf NVIDIA GPUs schneller auszuführen. Spezialisten nutzen es, um Latenz zu senken, den Durchsatz zu erhöhen und Modelle für den Echtzeiteinsatz in Produktionssystemen vorzubereiten.
Typische Aufgaben
- Modelle aus PyTorch, ONNX oder TensorFlow für den Einsatz konvertieren
- TensorRT Engines für Inference mit geringer Latenz erstellen
- Präzision, Batching und Speichernutzung abstimmen
- Inference in Services, Edge-Apps und Pipelines integrieren
Einbettung ins Ökosystem
TensorRT sitzt oft neben CUDA, cuDNN, ONNX, Triton Inference Server und DeepStream. Starke Spezialisten verstehen, wie diese Bausteine zusammenarbeiten, besonders wenn das Ziel eine stabile GPU-Inference über Server oder Embedded Devices hinweg ist.
Wann man jemanden beauftragt
Unternehmen holen sich freiberufliche Experten dazu, wenn das Modelltraining abgeschlossen ist, die Produktionsleistung aber noch nicht gut genug ist. Das ist häufig bei Computer Vision, Sprache, Empfehlungssystemen und anderen Systemen der Fall, die planbare Antwortzeiten brauchen.
Was starke Experten tun
Gute TensorRT Profis lesen Modellgraphen, erkennen nicht unterstützte Layer und wählen die passende Präzision und die richtigen Engine-Einstellungen. Sie testen nach der Optimierung auch die Korrektheit, denn Geschwindigkeit zählt nur, wenn die Ausgabe weiterhin dem Modellziel entspricht.
Projekte in Deutschland
In Deutschland unterstützt TensorRT Arbeit oft industrielle Inspektion, Mobilität, Robotik und andere GPU-intensive Produkte. Remote-Zusammenarbeit ist üblich, aber Vor-Ort-Sessions können helfen, wenn Teams praktische Arbeit mit Hardware, Deployment-Zielen oder internen Modellpipelines brauchen.
Häufig gestellte Fragen
Was Kunden uns zu TensorRT am häufigsten fragen – kurz beantwortet.
TensorRT wird genutzt, um trainierte Modelle auf NVIDIA GPUs schneller laufen zu lassen. Unternehmen beauftragen Spezialisten für Inference-Tuning, Engine-Erstellung und Deployment-Arbeiten, wenn Latenz oder Durchsatz wichtiger sind als Training.
Ja. TensorRT ist der offizielle Name von NVIDIA, und viele Suchende verwenden auch NVIDIA TensorRT oder die Kurzform TRT. Das Kernziel ist dasselbe: Inference für unterstützte GPUs optimieren.
TensorRT wird meist gewählt, wenn das Hauptziel maximale Inference-Performance auf NVIDIA Hardware ist. ONNX Runtime ist breiter bei den Backends, während CUDA allein mehr Low-Level-Kontrolle bietet, aber nicht denselben modellbezogenen Optimierungsworkflow.
Ein starker TensorRT Spezialist kennt meist ONNX, Exportpfade aus PyTorch oder TensorFlow, CUDA-Grundlagen und das Verhalten von GPU-Speicher. Erfahrung mit Deployment-Tools wie Triton Inference Server oder DeepStream ist oft ebenfalls wertvoll.
TensorRT Projekte brauchen meist mehr als nur grundlegendes Modellwissen. Die richtige Person sollte Konvertierungsprobleme, Präzisionsentscheidungen, Engine-Serialisierung und Validierung nach der Optimierung an echten Workloads schon gelöst haben.
Ja, die meiste TensorRT Arbeit kann remote erledigt werden, wenn das Team Modelle, Testdaten und Details zur Zielhardware teilen kann. Vor-Ort-Arbeit in Deutschland ist vor allem nützlich für Hardwarezugang, Debugging im Labor oder enge Zusammenarbeit mit internen Deployment-Teams.
Ein starker TensorRT Experte kann erklären, warum ein Modell langsam ist, welche Layer oder Präzisionseinstellungen das Problem verursachen und wie man den Fix prüft. Er sollte auch die Abwägungen zwischen Geschwindigkeit, Genauigkeit und Kompatibilität klar machen.
TensorRT Freelancer werden oft für Produktions-Inference-Pipelines, Edge-Deployments, Vision-Systeme und Performance-Rettungseinsätze hinzugezogen, nachdem das Modelltraining abgeschlossen ist. Sie sind auch hilfreich, wenn ein Team auf NVIDIA Hardware ausliefern muss und keine langen Tuning-Zyklen riskieren kann.
Der durchschnittliche Stundensatz von Freelancern in Deutschland, die TensorRT in ihren letzten Projekten eingesetzt haben, liegt bei 92 €, was einem Tagessatz von etwa 737 € bei einem 8-Stunden-Tag entspricht.
Von den Freelancern in Deutschland, die TensorRT in ihren letzten Projekten eingesetzt haben, haben 100% mindestens einen Bachelor-Abschluss, 91% mindestens einen Master-Abschluss und 27% einen Doktortitel.
Freelancer in Deutschland, die TensorRT in ihren letzten Projekten eingesetzt haben, haben im Durchschnitt 13 Jahre Berufserfahrung; ein einzelnes Projekt dauert typischerweise etwa 1,7 Jahre.
Die häufigsten Sprachen unter Freelancern in Deutschland, die TensorRT in ihren letzten Projekten eingesetzt haben, sind Deutsch (100%), Englisch (100%) und Arabisch (18%).
Die häufigsten Industrien unter Freelancern in Deutschland, die TensorRT in ihren letzten Projekten eingesetzt haben, sind Informationstechnologie (IT) (100%), Automotive (45%) und Bildung (36%).
Die häufigsten Bereiche unter Freelancern in Deutschland, die TensorRT in ihren letzten Projekten eingesetzt haben, sind Informationstechnologie (IT) (100%), Produktentwicklung (91%) und Forschung und Entwicklung (F&E) (82%).
Hauptstandorte der FRATCH Experten, die kürzlich TensorRT eingesetzt haben
Unsere Freelancer und Interim-Experten sind in der gesamten DACH-Region zuhause — verfügbar vor Ort in den wichtigsten Wirtschaftszentren oder komplett remote. Wähle einen Standort und entdecke passende Spezialisten, lokale Markteinblicke und aktuelle Verfügbarkeiten.
Kostenlose Demo vereinbaren
Kontaktiere uns und das FRATCH-Team meldet sich innerhalb von 4 Stunden bei dir.
Möchtest du lieber direkt mit uns in Kontakt treten?
Wir haben immer Zeit für einen Anruf oder eine E-Mail!
