Krisztian Simon-KI-Trainer & Evaluation-Spezialist · Adversarial VQA · Human Data Review
Tagessatz prüfen
Erfahrungen
Freelance Evaluator & Human Data Reviewer
Independent AI Training & Evaluation Projects
- KI-generierte Ausgaben anhand detaillierter Rubrics bewerten, mit Fokus auf Relevanz, Genauigkeit, Groundedness, Sicherheit, Natürlichkeit und Aufgabenerfüllung.
- Simulierte Storefront- und Support-Agent-Gespräche auf Groundedness, Policy-Konformität, Natürlichkeit und Aufgabenerfüllung prüfen.
- KI-generierte Bild- und Videoausgaben hinsichtlich Prompt-Abgleich, visueller Konsistenz, Artefakten, Realismus und zeitlicher Kohärenz vergleichen.
- Sich ändernde Kalibrierungsvorgaben und Edge-Case-Policies konsistent über große Evaluierungs-Workflows anwenden.
- Knackige, faktenbasierte Bewertungsbegründungen schreiben, die beobachtete Fakten klar von Annahmen trennen.
- E-Commerce-Produktklassifizierung, Katalog-QA, Search-Quality-Evaluation, Kategorie-Tagging und Attribut-Extraktion für strukturierte Datensätze bearbeiten.
Sole Developer & Project Lead
ZeroBounce
- Eigeninitiativ und allein umgesetzt: eine native Salesforce-Integration, vom Executive-Team genehmigt, um einen unzuverlässigen Drittanbieter-Connector zu ersetzen.
- Die komplette Lösung in Apex und JavaScript schreiben, über Salesforce CLI ausrollen und testen und das Verhalten manuell gegen Live-Traffic validieren.
- Das Ganze neben einer Vollzeit-Lead-Rolle aufbauen, indem ich Coding-Agents (Claude Code, Codex) durch Design, Implementierung und Tests führe, jede Änderung prüfe und gegen das Live-API-Verhalten verifiziere.
- Architektur-, Packaging- und AppExchange-Distributionspläne gegenüber Engineering und Executive Leadership präsentiert.
Adversarial VQA Benchmark Creation
micro1
- Bild-Frage-Antwort-Benchmark-Aufgaben erstellen (bisher 211 eingereicht), die aktuelle multimodale Modelle bei dichten Diagrammen, Schaubildern und detaillierten Fotos gezielt scheitern lassen.
- Fragen schreiben, die mehrere Denkschritte erfordern, mit exakten Ground-Truth-Antworten, die ein Reviewer direkt am Quellbild prüfen kann.
- Benchmark-Items entwerfen, die Schwächen im multimodalen Denken treffen und dabei Antworten objektiv, reproduzierbar und überprüfbar halten.
- Reviewer-Feedback und Kalibrierungsvorgaben anwenden, um den Schwierigkeitsgrad zu erhöhen und Mehrdeutigkeiten zu entfernen. Jede Aufgabe wird vor der Annahme einzeln geprüft.
- Öffentlich verfügbare und CC0-Bilder beschaffen, damit jedes Benchmark-Item sauber und reproduzierbar ist.
Technical Enablement Lead (Technical Support Manager)
ZeroBounce
- Das Support-Domain-Design für ein internes KI-Agenten-Bewertungssystem entwickelt: simulierte Kundengespräche, technische Szenarien und Scoring-Rubriken, mit menschlicher Endfreigabe für jedes Ergebnis.
- Zendesk betreuen und das Tuning des AI Copilot über Workflow-Reviews, Agent-Feedback, Analyse der Antwortqualität und wiederkehrende Fallmuster vorantreiben.
- Technisches Enablement für ein Support- und Sales-Team mit 30+ Personen leiten und direkt einen Enablement-Spezialisten führen.
- Tier-3-Eskalationsverantwortung für REST-API-, CRM-Integrations-, SMTP-, Authentifizierungs- und DNS-Fehler. Das Eskalationsvolumen um 28 % gesenkt, indem wiederkehrende Fälle in SOPs und gezieltes Training überführt wurden.
- Eine Wissensdatenbank mit 210+ Seiten aufbauen und pflegen, die E-Mail-Validierung, REST-API-Verhalten, Status- und Substatus-Logik sowie CRM-Integrationen abdeckt, zusammen mit 15+ SOPs und Entscheidungsbaum-Workflows.
- Das Onboarding neuer Mitarbeitender in einen szenariobasierten Lehrplan rund um API-Authentifizierung, JSON-Payloads und Live-Tickets umgebaut und die Einarbeitungszeit von sechs auf drei Wochen verkürzt.
- API-Traffic in Cloudflare überwachen, missbräuchliche Nutzungsmuster untersuchen, die Kundenansprache koordinieren und Traffic-Control-Regeln verfeinern.
Technical Support Engineer
SendGrid (via IntelligentBee)
- SMB- bis Enterprise-Kunden bei SMTP, REST-APIs, JSON-Payloads, Authentifizierung, SPF/DKIM/DMARC, Suppression-Listen, Bounce-Klassifizierung und IP-Warmup unterstützt.
- Zustellverhalten in Splunk, Snowflake und Postman nachverfolgt und die Root Cause direkt an die Kunden erklärt.
- Täglich 13+ Tickets und 25+ Live-Chats innerhalb der SLA bearbeitet. Wegen technischer Leistung und Mentoring für neuere Engineers zu TSE+ befördert.
Technical Support Engineer
DIGI (RCS-RDS)
- Bearbeitete B2B- und Privatkunden-Eskalationen im Netzwerkbereich in MPLS-, BGP-, Breitband-, Mobilfunk-, GPON/PON- und VLAN-Umgebungen unter SLA-Vorgaben.
- Überwachte den Netzwerkstatus in einem Drei-Länder-Kreis bei nächtlichen Einsätzen und koordinierte Field-Teams, um die Verbindung wiederherzustellen.
Customer Support Agent
DIGI (RCS-RDS)
- Bearbeitete täglich über 70 Support-Anfragen zu Konnektivität, Router-Konfiguration und Kontoproblemen und half beim Einarbeiten neuer Mitarbeiter.
Branchenerfahrung
Sieh, in welchen Branchen dieser Freelancer den Großteil seiner beruflichen Laufbahn verbracht hat.
Erfahren in Telekommunikation, Informationstechnologie (IT) und Einzelhandel.
Erfahrung nach Fachbereich
Zeigt, in welchen Abteilungen und Funktionen dieser Freelancer am meisten mitgewirkt hat.
Erfahren in Kundendienst, Informationstechnologie (IT), Betrieb, Produktentwicklung, Qualitätssicherung und Projektmanagement.
Zusammenfassung
KI-Trainer und Evaluation-Spezialist mit 9 Jahren technischem Hintergrund in SaaS-Support, Tier-3-Eskalationen, API-Operations und Enablement. Erstelle adversariale VQA-Benchmark-Aufgaben für das Testen multimodaler Modelle und bewerte LLM-Ausgaben anhand detaillierter Rubrics über Text, Bild, Audio und Video hinweg. Bei ZeroBounce verantworte ich das Support-Domain-Design eines internen KI-Agenten-Bewertungssystems: simulierte Gespräche, technische Szenarien, Bewertungsrichtlinien und Guardrails, mit menschlicher Endfreigabe. Jahrelange Root-Cause-Analysen und technisches Schreiben bilden die Grundlage für die Evaluationsarbeit: präzise Begründungen, konsistente Kalibrierung und Antworten, die ein Reviewer unabhängig prüfen kann.
Fähigkeiten
- Ki-Evaluation & Human-In-The-Loop-Systeme: Review Von Llm-Ausgaben, Adversariale Vqa, Rlhf/Sft-Aufgaben, Response Ranking, Rubric-Basiertes Scoring, Halluzinations-Erkennung, Groundedness, Faktentreue, Sicherheit, Szenarien-Design, Guardrails, Menschliche Endfreigabe
- Human Data & Annotation: Visual Question Answering, Datenlabeling, Produktklassifizierung, Katalog-Qa, Kategorie-Tagging, Attribut-Extraktion, Search-Quality-Evaluation, Tts- Und Audio-Review, Bild- Und Video-Prompt-Abgleich
- Agentenbewertung & QualitäT: Simulierte Support-GespräChe, Bewertung Technischer Kenntnisse, Scoring-Guidance, Kalibrierung, Qa-Feedback, Szenariobasierte Bewertung
- Saas- & Api-Systeme: Rest-Apis, Json, Webhooks, AuthentifizierungsabläUfe, Postman, Cloudflare, Salesforce (Apex, Salesforce Cli), Hubspot, Zendesk, Jira, Splunk, Snowflake
- E-Mail-Infrastruktur: Smtp, Dns, Spf, Dkim, Dmarc, Bimi, Ip- Und Domain-Warmup, Bounce-Analyse, Inbox-Placement, Suppression-Listen
Sprachen
Ausbildung
Colegiul Național „Simion Bărnuțiu”
Rumänisches Abitur · Philology · Șimleu Silvaniei, Rumänien
Zertifikate & Bescheinigungen
HubSpot Sales Hub Software Certified
HubSpot Service Hub Software Certified
Statistiken
Erfahrung
Globale Erfahrung
Fachkenntnisse
Qualifikationen
Profil
Häufig gestellte Fragen
Du hast Fragen? Hier findest du mehr.
Tagessatzverteilung
Die angegebenen Tagessätze entsprechen der typischen Marktspanne für Freelancer in dieser Position, basierend auf aktuellen Projekten auf unserer Plattform.
Die tatsächlichen Tagessätze können je nach Dienstalter, Erfahrung, Fachkenntnissen, Projektkomplexität und Auftragsdauer variieren.
Durchschnittlicher Tagessatz für ähnliche Positionen
Die Tagessätze basieren auf aktuellen Projekten und enthalten keine FRATCH-Marge.
Der durchschnittliche Tagessatz ist der Mittelwert aller Tagessätze aus aktuellen Verträgen vergleichbarer Freelancer auf unserer Plattform.
Der Median-Tagessatz ist der mittlere Wert aller Tagessätze – die Hälfte der vergleichbaren Freelancer verlangt weniger, die andere Hälfte mehr. Anders als der Durchschnitt wird er von Ausreißern kaum beeinflusst.
Die tatsächlichen Tagessätze können je nach Dienstalter, Erfahrung, Fachkenntnissen, Projektkomplexität und Auftragsdauer variieren.
Ähnliche Freelancer
Entdecke andere Experten mit ähnlichen Qualifikationen und Erfahrungen
Experten, die kürzlich an ähnlichen Projekten gearbeitet haben
Freelancer mit praktischer Erfahrung in vergleichbaren Projekten als Freelance Evaluator & Human Data Reviewer
Freelancer in der Nähe
Fachkräfte, die in oder in der Nähe von Oradea, Rumänien arbeiten
