Zum Hauptinhalt springen
Top-Experten-Abzeichen
Empfohlener Experte
Profil-Kopfzeilen-Hintergrund

Arya D.-Quality Analyst & KI-Evaluierungsspezialist

Arya D. - Quality Analyst & KI-Evaluierungsspezialist - Profilbild
Profil-Kopfzeilen-Overlay
Verfügbar
Surat, Indien

Tagessatz prüfen

Erfahrungen

März 2026 - Heute
Indien

Quality Analyst

Alignerr

Stellenbeschreibung
Quality Analyst bei Alignerr
Industrien
Informationstechnologie (IT)
Bereichen
Informationstechnologie (IT)
Qualitätssicherung
Forschung und Entwicklung (F&E)
Entdecke QA Engineer
  • AI-Evaluierungs- und datenbezogene Bewertungsprojekte über Text-, Code-, Bild- und strukturierte Daten-Modalitäten hinweg abgeschlossen und dabei die Qualitätsstandards und Review-Anforderungen der Plattform stets erfüllt.
  • RLHF-basierte Evaluierungs-Workflows angewendet, darunter Präferenz-Ranking, Rubrik-Bewertung, Adversarial Testing und Bewertung von Instruktionsbefolgung über Multi-Turn-LLM-Interaktionen hinweg.
  • Modell-Ausgaben auf Halluzinationen, Instruction Drift, kontextuelle Inkonsistenzen, logische Widersprüche und Regelverstöße anhand strukturierter Annotationen und Evaluierungs-Frameworks geprüft.
  • Annotationen auf Qualität überprüft und Evaluator-Feedback gegeben, um die Bewertungskonsistenz und die Einhaltung der Evaluierungsrichtlinien zu verbessern.
  • Zu KI-Evaluierungs-, Generalist- und Data-Science-Projekten beigetragen, die Reasoning-Validierung, Qualitätsbewertung und Modellverhaltensanalyse umfassten.
März 2026 - Heute

LLM Failure Mode Taxonomy & Severity Classification System

Turing

Stellenbeschreibung
LLM Failure Mode Taxonomy & Severity Classification System bei Turing
Industrien
Informationstechnologie (IT)
Bereichen
Produktentwicklung
Qualitätssicherung
Forschung und Entwicklung (F&E)
  • Die produktionsnahe LLM-Evaluierung hatte kein gemeinsames Framework, um Fehlertypen über Evaluatoren hinweg einheitlich zu kategorisieren und zu priorisieren, daher habe ich eine strukturierte Taxonomie für sechs Muster erstellt — Halluzination, Constraint Leakage, Instruction Drift, Toninkonsistenz, logischer Widerspruch und kontextuelles Gedächtnisversagen — jeweils mit dokumentierten Auslösern und annotierten Beispielen aus echten Ausgaben.
  • Jedem Fehlertyp Schweregrade (kritisch / hoch / gering) zugewiesen, basierend auf dem potenziellen Einfluss auf den Nutzer, mit einer konsistenten Bewertungslogik, die von verschiedenen Evaluatoren auf unterschiedliche Ausgabe-Batches einheitlich angewendet werden konnte.
  • Das Framework im wöchentlichen Evaluierungsworkflow von Turing eingesetzt, um Engineering-Reports mit Schweregrad zu erstellen, wodurch Unklarheiten in der Fehlerkommunikation reduziert und dem Engineering-Team des Kunden ein reproduzierbares Priorisierungssignal gegeben wurde.
Jan. 2026 - Juli 2026

Rubric-Based Multi-Turn Adversarial Evaluation Framework

Turing

Stellenbeschreibung
Rubric-Based Multi-Turn Adversarial Evaluation Framework bei Turing
Industrien
Informationstechnologie (IT)
Bereichen
Informationstechnologie (IT)
Qualitätssicherung
Forschung und Entwicklung (F&E)
  • Inkonsistente Bewertungen zwischen Evaluatoren unter adversarialen Prompting-Bedingungen zeigten, dass eine Rubrik-Struktur fehlte — daher habe ich ein modulares Evaluierungsframework über vier Qualitätsdimensionen entwickelt: Befolgung der Anweisungen, faktische Konsistenz, Tonalitätssteuerung und kontextuelle Kontinuität, jeweils mit annotierten Pass-/Fail-Grenzen und Beispielausgaben, die auf das Urteilsvermögen der Evaluatoren abgestimmt waren.
  • Fortschreitende Schwierigkeitsstufen integriert, von Single-Turn-Eckfällen bis hin zu Multi-Turn-Jailbreak-Versuchen, sodass sich die Rubrik in der Schwierigkeit skalieren ließ, ohne die zugrunde liegende Bewertungslogik zu ändern.
  • Bei Turing zur Unterstützung von Release-Readiness-Bewertungen eingesetzt und anschließend für Text- und Code-Annotationen auf den Plattformen Alignerr und RWS angepasst.
Dez. 2025 - März 2026
Indien

Business Analyst – AI Evaluation

Turing

Stellenbeschreibung
Business Analyst – AI Evaluation bei Turing
Industrien
Informationstechnologie (IT)
Bereichen
Informationstechnologie (IT)
Qualitätssicherung
Forschung und Entwicklung (F&E)
  • Wöchentlich 150+ produktionsreife LLM-Ausgaben mit strukturierten Rubrics, adversarialen Prompting-Szenarien und Multi-Turn-Antwortanalyse bewertet, um Modellqualität, Reasoning und Befolgung von Anweisungen zu beurteilen.
  • Wiederkehrende Modellfehler wie Halluzinationen, kontextuelle Gedächtnisfehler, Instruction Drift, logische Widersprüche, Toninkonsistenzen und Regelverstöße durch systematische Prüfung der Ausgaben identifiziert.
  • Annotationen auf Qualität geprüft und Kalibrierungsmaßnahmen für Evaluatoren unterstützt, um die Bewertungskonsistenz über die Workflows hinweg zu verbessern.
  • Schwerigkeitsbasierte Reporting-Frameworks entwickelt, die die Fehlerkategorisierung standardisierten und die Priorisierung von Modellproblemen für die nachgelagerte Prüfung verbesserten.
  • Kundenanforderungen an die Qualität in Rubrik-Kriterien, Bewertungsdimensionen und QA-Dokumentation übersetzt, um Release-Readiness-Bewertungen und die Analyse des Modellverhaltens zu unterstützen.
Juli 2025 - Dez. 2025
Surat, Indien

Business Analyst

Mountain Monk Consulting

Stellenbeschreibung
Business Analyst bei Mountain Monk Consulting
Industrien
Energie
Lebensmittel und Getränke
Einzelhandel
Bereichen
Revision
Betrieb
Projektmanagement
  • Kundenprojekte in den Bereichen Einzelhandel, Solarenergie, F&B, Interior Design und Experience Retail durch Anforderungsaufnahme, Sprint-Planung und Prozessdokumentation unterstützt.
  • SOWs, Prozessdokumentationen, Stakeholder-Präsentationen und Business-Process-Modelle erstellt, die auf die Lieferziele des Kunden abgestimmt waren.
  • Mehr als 20 Kundenergebnisse pro Monat auf logische Konsistenz, semantische Genauigkeit und fachliche Passung geprüft und dabei die Kommunikation zwischen den Stakeholdern koordiniert.
Feb. 2025 - Juli 2025

LLM-Framework für Inhaltsbewertung und Annotation

Unabhängige Praxis

Stellenbeschreibung
LLM-Framework für Inhaltsbewertung und Annotation bei Unabhängige Praxis
Industrien
Informationstechnologie (IT)
Bereichen
Informationstechnologie (IT)
Qualitätssicherung
Forschung und Entwicklung (F&E)
  • Entwickelte eine strukturierte Pipeline für Annotation und Bewertung, um Inhaltsqualität, semantische Übereinstimmung, kontextuelle Genauigkeit, Wahrung der Intention und tonale Konsistenz über LLM-generierte Ausgaben hinweg zu prüfen.
  • Bewertete von LLM generierte Textpaare mit taxonomiegestützten Labels für Sentiment-Klassifikation, Intentionserkennung, kontextuelle Korrektheit und Qualitätsbewertung; dokumentierte mehrdeutige und besondere Grenzfälle mit strukturierten Begründungsnotizen.
  • Erstellte einen dokumentierten Annotation-Datensatz mit definierten Qualitätsgrenzen und einem wiederverwendbaren Labeling-Schema, das später Designansätze für Rubriken in professionellen KI-Bewertungsworkflows beeinflusste.
Sept. 2024 - Juli 2025
Surat, Indien

Analyst

AUM Electric Engineering Pvt. Ltd.

Stellenbeschreibung
Analyst bei AUM Electric Engineering Pvt. Ltd.
Industrien
Bauwesen
Energie
Versorgungsdienstleistungen
Bereichen
Betrieb
Projektmanagement
Forschung und Entwicklung (F&E)
Strategie und Planung
  • Erfasste und strukturierte Kundenanforderungen in Industrie-Elektrifizierungs- und Infrastrukturprojekten und übersetzte technische Inputs in operative Planungsrahmen.
  • Führte Marktanalysen, Wettbewerbsanalysen, technische Dokumentation und Stakeholder-Reporting durch, um die Geschäftsplanung und Projektausführung zu unterstützen.
Feb. 2024 - Juli 2024

System zur Erkennung von Fahrer-Müdigkeit

NMIMS

Stellenbeschreibung
System zur Erkennung von Fahrer-Müdigkeit bei NMIMS
Industrien
Automotive
Informationstechnologie (IT)
Bereichen
Informationstechnologie (IT)
Produktentwicklung
Forschung und Entwicklung (F&E)
  • Fahrermüdigkeit ist ohne kontinuierliches Echtzeit-Monitoring schwer zu erkennen — ich habe ein Computer-Vision-System gebaut, das Schläfrigkeit anhand von Gesichtsvideos klassifiziert und dabei ML-basierte Verhaltensanalyse auf ein sicherheitskritisches Problem angewendet, bei dem die Erkennungslatenz direkte Auswirkungen in der realen Welt hat.
  • OpenCV für Augenblinzel-Tracking und Gesichtspunkt-Erkennung aus Live-Frames verwendet; eine Feature-Extraction-Pipeline umgesetzt, die Müdigkeitsindikatoren isoliert; einen Keras-Neural-Network-Klassifikator auf gelabelten Daten zu Müdigkeitszuständen trainiert, die in kontrollierten Aufnahmesitzungen erfasst wurden.
  • Etwa 85 % Klassifikationsgenauigkeit mit Echtzeit-Inferenzleistung erreicht, die für den Einsatz auf gängiger Consumer-Hardware geeignet ist.
Jan. 2024 - Juli 2024

ML-basiertes Modell zur Erkennung von Gebärdensprache

NMIMS

Stellenbeschreibung
ML-basiertes Modell zur Erkennung von Gebärdensprache bei NMIMS
Industrien
Bildung
Informationstechnologie (IT)
Bereichen
Informationstechnologie (IT)
Produktentwicklung
Forschung und Entwicklung (F&E)
  • Barrierefreiheits-Tools für Nutzer von Gebärdensprache erfordern meist teure Hardware oder cloudabhängige APIs — ich habe ein eigenständiges End-to-End-System gebaut, das American Sign Language-Gesten mit nur einer Standard-Webcam in Live-Textausgabe übersetzt.
  • OpenCV für Gestenerfassung und Frame-Vorverarbeitung verwendet, TensorFlow zum Trainieren eines Klassifikators über 26 ASL-Handzeichen und Flask, um Live-Vorhersagen über eine leichte Weboberfläche bereitzustellen; Erfassung, Inferenz und Auslieferung als unabhängige Module gestaltet, um eine Erweiterung auf andere Gestensets ohne Umbau der Pipeline zu unterstützen.
  • Eine funktionierende Echtzeit-Geste-zu-Text-Pipeline mit konsistenter Einzelzeichen-Erkennung und einer Flask-Oberfläche geliefert, die ohne lokale Installation zugänglich ist und sich für Bildungs- und öffentliche Einsatzszenarien eignet.
Aug. 2023 - Juli 2025
Mumbai, Indien

Drehbuchautor

MadLads Studios

Stellenbeschreibung
Drehbuchautor bei MadLads Studios
Industrien
Werbung
Medien, Unterhaltung und Druck
Bereichen
Marketing
  • 50+ englischsprachige Skripte für Podcasts, Werbekampagnen und narrative Content-Formate erstellt.
  • Strukturierte Ansätze entwickelt, um narrative Kohärenz, Konsistenz von Anweisungen und Tonalität zu bewerten, die später in KI-Bewertungsworkflows eingeflossen sind.

Branchenerfahrung

Sieh, in welchen Branchen dieser Freelancer den Großteil seiner beruflichen Laufbahn verbracht hat.

Erfahren in Werbung, Medien, Unterhaltung und Druck, Informationstechnologie (IT), Energie, Bauwesen und Versorgungsdienstleistungen.

Werbung
Medien, Unterhaltung und Druck
Informationstechnologie (IT)
Energie
Bauwesen
Versorgungsdienstleistungen
Profil-Übereinstimmungsdiagramm

Erfahrung nach Fachbereich

Zeigt, in welchen Abteilungen und Funktionen dieser Freelancer am meisten mitgewirkt hat.

Erfahren in Forschung und Entwicklung (F&E), Marketing, Informationstechnologie (IT), Betrieb, Projektmanagement und Qualitätssicherung.

Forschung und Entwicklung (F&E)
Marketing
Informationstechnologie (IT)
Betrieb
Projektmanagement
Qualitätssicherung
Profil-Übereinstimmungsdiagramm

Zusammenfassung

Quality Analyst & KI-Evaluierungsspezialist mit Erfahrung in LLM-Evaluierung, RLHF-Präferenz-Ranking, Annotation-Qualitätssicherung und Reviewer-Workflows bei Turing, Alignerr und RWS. Habe wöchentlich 150+ produktionsreife LLM-Ausgaben mit strukturierten Rubrics, adversarialen Tests und Multi-Turn-Bewertungsframeworks geprüft, um Halluzinationen, Instruction Drift, logische Inkonsistenzen und kontextuelle Fehler zu erkennen.

Erfahren in Annotation-Review, Evaluator-Kalibrierung, Rubrik-Design, Fehlerursachenanalyse und schwerigkeitsbasierter Berichterstattung zur Unterstützung von Modell-Alignment und Release-Readiness-Bewertungen.

Fähigkeiten

  • Ki-Evaluierung & Llm-Bewertung: Llm-Evaluierung, Ki-Modellbewertung, Rlhf-PräFerenz-Ranking, Annotation-QualitäTssicherung, Adversarial Testing, Reasoning-Bewertung, Rubrik-Design, Fehlerursachenanalyse, Halluzinationserkennung, Multi-Turn-Evaluierung

  • Business-Analyse & QualitäTsprüFung: Anforderungsaufnahme, Stakeholder-Management, Prozessanalyse, Technische Dokumentation, Uat, Datenvalidierung, Kpi-Tracking, Agile Workflows, Sow-Erstellung

  • Programmierung & Machine Learning: Python, Sql, Pandas, Numpy, Tensorflow, Keras, Opencv, Flask

  • Tools & Plattformen: Power Bi, Github, Google Workspace, Microsoft Office Suite, Alignerr, Rws, Labelbox, Feather Openai

Sprachen

Englisch
Muttersprache
Gujarati
Muttersprache
Hindi
Muttersprache

Ausbildung

Aug. 2020 - Juli 2024

Mukesh Patel School of Technology Management & Engineering, NMIMS

Bachelor of Technology, Spezialisierung: Artificial Intelligence · Computer Science Engineering · Mumbai, Indien

Statistiken

Erfahrung

Positionen gesamt 10
Erfahrung in Werbung 2 J.
Durchschn. Dauer 8 M.
Längste Erfahrung 1 J. 11 M.

Globale Erfahrung

Länder gearbeitet 1 (Indien)
Hauptland Indien

Fachkenntnisse

Aktuelle Rollen Quality Analyst, LLM Failure Mode Taxonomy & Severity Classification System, Rubric-Based Multi-Turn Adversarial Evaluation Framework
Hauptbranchen Werbung, Medien, Unterhaltung und Druck, Informationstechnologie (IT)
Hauptfachbereiche Forschung und Entwicklung (F&E), Marketing, Informationstechnologie (IT)

Qualifikationen

Höchster Abschluss Bachelor

Profil

Mitglied seit
Du suchst Freelancer?Passende Kandidaten in Sekunden!
FRATCH GPT testen
Weitere Aktionen

Häufig gestellte Fragen

Du hast Fragen? Hier findest du mehr.

Arya ist in Surat, Indien ansässig.

Arya spricht folgende Sprachen: Englisch (Muttersprache), Gujarati (Muttersprache), Hindi (Muttersprache).

Arya hat mindestens 3 Jahre Erfahrung. In dieser Zeit hat Arya in mindestens 10 verschiedenen Rollen und für 7 verschiedene Firmen gearbeitet. Die durchschnittliche Dauer der einzelnen Projekte beträgt 4 Monate. Beachten Sie, dass Arya möglicherweise nicht alle Erfahrungen geteilt hat und tatsächlich mehr Erfahrung hat.

Basierend auf der jüngsten Erfahrung wäre Arya gut geeignet für Rollen wie: Quality Analyst, LLM Failure Mode Taxonomy & Severity Classification System, Rubric-Based Multi-Turn Adversarial Evaluation Framework.

Die neueste Position von Arya ist Quality Analyst bei Alignerr.

In den letzten Jahren hat Arya für Alignerr, Turing, Mountain Monk Consulting, Unabhängige Praxis und AUM Electric Engineering Pvt. Ltd. gearbeitet.

Arya hat die meiste Erfahrung in Industrien wie Werbung, Medien, Unterhaltung und Druck und Informationstechnologie (IT). Arya hat auch etwas Erfahrung in Energie, Bauwesen und Versorgungsdienstleistungen.

Arya hat die meiste Erfahrung in Bereichen wie Forschung und Entwicklung (F&E), Marketing und Informationstechnologie (IT). Arya hat auch etwas Erfahrung in Betrieb, Projektmanagement und Qualitätssicherung.

Arya hat einen Bachelor in Computer Science Engineering von Mukesh Patel School of Technology Management & Engineering, NMIMS.

Arya ist sofort verfügbar für passende Projekte.

Tagessatzverteilung

0 1 2 3 4
<€320 €320-​480 €480-​640 €640-​800 €960+

Die angegebenen Tagessätze entsprechen der typischen Marktspanne für Freelancer in dieser Position, basierend auf aktuellen Projekten auf unserer Plattform.

Durchschnittlicher Tagessatz für ähnliche Positionen

Die Tagessätze basieren auf aktuellen Projekten und enthalten keine FRATCH-Marge.

600
450
300
150
Stundensatzvergleich-Diagramm
Ø Tagessatz 446 €

Der durchschnittliche Tagessatz ist der Mittelwert aller Tagessätze aus aktuellen Verträgen vergleichbarer Freelancer auf unserer Plattform.

600
450
300
150
Stundensatzvergleich-Diagramm
Median-Tagessatz 400 €

Der Median-Tagessatz ist der mittlere Wert aller Tagessätze – die Hälfte der vergleichbaren Freelancer verlangt weniger, die andere Hälfte mehr. Anders als der Durchschnitt wird er von Ausreißern kaum beeinflusst.

Berechnet auf Basis der Tagessätze unserer Freelancer, Stand 9 Sep 2026. Die tatsächlichen Tagessätze können je nach Dienstalter, Erfahrung, Fachkenntnissen, Projektkomplexität und Auftragsdauer variieren.