Zum Hauptinhalt springen
Top-Experten-Abzeichen
Empfohlener Experte
Profil-Kopfzeilen-Hintergrund

Majid Khan-Senior Software Engineer

Majid Khan - Senior Software Engineer - Profilbild
Profil-Kopfzeilen-Overlay
Verfügbar
Stockport, Vereinigtes Königreich

Tagessatz prüfen

Erfahrungen

Jan. 2024 - Heute
Vereinigtes Königreich

Senior AI / LLM Evaluation Engineer

OPENCAST

Stellenbeschreibung
Senior AI / LLM Evaluation Engineer bei OPENCAST
Industrien
Informationstechnologie (IT)
Bereichen
Business Intelligence
Informationstechnologie (IT)
Produktentwicklung
Qualitätssicherung
Forschung und Entwicklung (F&E)
Entdecke KI-Ingenieur
  • Entwerfe und pflege Evaluierungs-Frameworks für große Sprachmodelle in den Bereichen Reasoning, Coding, Instruction Following, Factuality, Tool Use, Agent Behaviour und Safety.
  • Entwickle strukturierte Datensätze und Evaluierungsaufgaben für Supervised Fine-Tuning (SFT), RLHF, Preference Optimization, Post-Training-Evaluation und Model Benchmarking.
  • Erstelle Prompts, Referenzlösungen, Bewertungskriterien, Metadaten-Schemas, Evaluierungs-Rubriken und Reviewer-Guidelines für Model-Training-Datensätze.
  • Prüfe und ranke konkurrierende Modellantworten nach Korrektheit, Vollständigkeit, Reasoning-Qualität, Relevanz, Einhaltung von Anweisungen, Code-Qualität und Sicherheit.
  • Baue Python-Evaluierungspipelines, die Testfälle ausführen, Grader-Ergebnisse bündeln, Fehlerarten kategorisieren und die Modellleistung über Releases hinweg vergleichen.
  • Entwickle deterministische und modellgestützte Grader, mit regelbasierter Validierung dort, wo objektive Checks möglich sind, und rubrikbasierter Bewertung für offene Aufgaben.
  • Entwerfe Coding-Agent-Tasks auf Repository-Ebene, die Debugging, Feature-Implementierung, API-Integration, Refactoring, Dependency-Änderungen und Test-Reparatur abdecken.
  • Baue isolierte Docker-Ausführungsumgebungen, in denen Agents Repositories ändern, Terminal-Befehle ausführen, Tests starten und sicher mit Development-Tools arbeiten können.
  • Implementiere Hidden Tests, Integrationstests, Dateisystem-Validierung, Timeout-Kontrollen und Prüfungen auf Änderungen, um Reward Hacking, Test-Tampering, Hardcoded Outputs und falsche Erfolgsmeldungen zu erkennen.
  • Untersuche wiederkehrende Modellfehler wie Halluzinationen, falsche Tool-Nutzung, ungültige Annahmen, unvollständige Ausführung, instabiles Reasoning und Verstöße gegen Anweisungen; überführe die Erkenntnisse in neue Benchmark- und Trainingsbeispiele.
  • Trage zu Pairwise Preference Ranking und Evaluator-Kalibrierung bei, analysiere Reviewer-Uneinigkeit und verfeinere Annotation-Guidelines, um die Konsistenz zu verbessern.
  • Erstelle Model-Quality-Reports zu Pass-Raten, Regressionen, Grader-Uneinigkeit, Fehlerkategorien und Leistung über verschiedene Evaluierungsdimensionen hinweg.
Jan. 2021 - Dez. 2024
Vereinigtes Königreich

Software Engineer / Machine Learning Engineer

SCOTT LOGIC

Stellenbeschreibung
Software Engineer / Machine Learning Engineer bei SCOTT LOGIC
Industrien
Informationstechnologie (IT)
Professionelle Dienstleistungen
Bereichen
Informationstechnologie (IT)
Produktentwicklung
Forschung und Entwicklung (F&E)
Entdecke KI-Ingenieur
  • Entwickelte Python-Backend-Services und REST APIs für Enterprise-Anwendungen mit FastAPI, Flask und Django, mit Fokus auf Wartbarkeit, Tests und klaren Service-Grenzen.
  • Baute Datenverarbeitungspipelines für Analyse- und Machine-Learning-Anwendungen und integrierte strukturierte sowie unstrukturierte Informationen aus internen Services, Datenbanken und Drittanbieter-APIs.
  • Entwarf Backend-Datenmodelle und arbeitete mit PostgreSQL, SQL, Redis, Caching, asynchroner Verarbeitung und Performance-Optimierung von Anwendungen.
  • Entwickelte angewandte NLP-Features wie Textklassifikation, Information Extraction, Semantic Search, Ähnlichkeitsabgleich und Dokumentenabruf.
  • Experimentierte mit BERT und Sentence Transformers und integrierte ausgewählte Transformer-Modelle über Python-basierte Inference-Services in Anwendungsabläufe.
  • Baute embedding-basierte Dokumentenabruf- und Semantic-Search-Systeme und erweiterte die Arbeit später zu frühen Retrieval-Augmented-Generation-Prototypen.
  • Integrierte LLM-APIs in interne Tools und Kundenprototypen für Dokumenten-Q&A, Zusammenfassungen, strukturierte Extraktion und kontrollierte Textgenerierung.
  • Erstellte Prompt-Templates, Validierung für strukturierte Ausgaben, Retry-Logik, Vergleichs-Utilities für Modellantworten und automatisierte Tests zur Messung von Korrektheit, Relevanz, Konsistenz und Formatierung.
  • Arbeitete mit Engineers, Product Managern und Data-Teams zusammen, um ML- und generative-AI-Prototypen in testbare, wartbare Produktionsservices zu überführen.
Jan. 2018 - Dez. 2021
Vereinigtes Königreich

Software Engineer

SOFTWARE

Stellenbeschreibung
Software Engineer bei SOFTWARE
Industrien
Informationstechnologie (IT)
Bereichen
Informationstechnologie (IT)
Produktentwicklung
Qualitätssicherung
  • Entwickelte Backend-Anwendungen, Web-Services und interne Plattformen mit Python über Anforderungen, Implementierung, Tests, Deployment und Produktionssupport hinweg.
  • Entwarf REST APIs und Integrationen, die interne Services mit externen Plattformen und Third-Party-Systemen verbinden.
  • Baute und pflegte PostgreSQL-Schemas und SQL-Queries, einschließlich Migrationen, Indexing, transaktionalen Workflows und Performance-Tuning.
  • Entwickelte Frontend-Funktionen mit JavaScript, TypeScript und React und arbeitete dabei eng mit Backend-Engineers, Designern und QA-Teams zusammen.
  • Implementierte Authentifizierung, Autorisierung, Request-Validierung, Fehlerbehandlung, Logging und Sicherheitsmaßnahmen für Anwendungen.
  • Schrieb Unit- und Integrationstests, untersuchte Produktionsfehler, containerisierte Anwendungen mit Docker und arbeitete an Git-basierten CI/CD-Workflows mit.
  • Baute Python-Automatisierungs- und Datenverarbeitungs-Skripte und sammelte erste Erfahrungen mit Datenanalyse, Machine-Learning-Experimenten und NLP-Anwendungen.

Coding Agent Evaluation Environment

Stellenbeschreibung
Coding Agent Evaluation Environment
Industrien
Informationstechnologie (IT)
Bereichen
Informationstechnologie (IT)
Qualitätssicherung

Ich habe eine containerisierte Umgebung gebaut, in der Coding Agents Aufgaben auf Repository-Ebene erhalten, Code ändern, Befehle ausführen und anhand deterministischer und Hidden Tests bewertet werden. Ergänzt um Dateisystem-Validierung, Timeouts, Dependency-Isolation und Prüfungen auf Reward Hacking und unbeabsichtigte Änderungen.

LLM Evaluation & Benchmarking Framework

Stellenbeschreibung
LLM Evaluation & Benchmarking Framework
Industrien
Informationstechnologie (IT)
Bereichen
Informationstechnologie (IT)
Produktentwicklung
Qualitätssicherung
Forschung und Entwicklung (F&E)

Entwickelte ein Python-Framework zur Bewertung mehrerer LLMs anhand strukturierter Datensätze mit deterministischen Gradern, rubrikbasierter Bewertung, LLM-gestütztem Grading, Pairwise Comparison, Regression Tracking und Fehlerkategorisierung.

RAG- & Tool-Use-Evaluation

Stellenbeschreibung
RAG- & Tool-Use-Evaluation
Industrien
Informationstechnologie (IT)
Bereichen
Informationstechnologie (IT)
Forschung und Entwicklung (F&E)

Ich habe RAG-Workflows mit Embeddings und Vektorsuche sowie Bewertungsszenarien für Abrufqualität, Fundierung, faktische Konsistenz, Tool-Auswahl, API-Ausführung, mehrstufiges Denken und Fehlerbehebung aufgebaut.

Branchenerfahrung

Sieh, in welchen Branchen dieser Freelancer den Großteil seiner beruflichen Laufbahn verbracht hat.

Erfahren in Informationstechnologie (IT) und Professionelle Dienstleistungen.

Informationstechnologie (IT)
Professionelle Dienstleistungen
Profil-Übereinstimmungsdiagramm

Erfahrung nach Fachbereich

Zeigt, in welchen Abteilungen und Funktionen dieser Freelancer am meisten mitgewirkt hat.

Erfahren in Informationstechnologie (IT), Produktentwicklung, Qualitätssicherung, Forschung und Entwicklung (F&E) und Business Intelligence.

Informationstechnologie (IT)
Produktentwicklung
Qualitätssicherung
Forschung und Entwicklung (F&E)
Business Intelligence
Profil-Übereinstimmungsdiagramm

Zusammenfassung

Software Engineer und AI Engineer mit über 8 Jahren Erfahrung im Aufbau von Backend-Systemen, APIs, Datenplattformen, Machine-Learning-Anwendungen und AI-Evaluierungs-Infrastruktur. Starker Python-Engineering-Background mit praktischer Arbeit in NLP, Transformern, Semantic Search, RAG und generativer KI. In letzter Zeit spezialisiert auf LLM-Evaluation, RLHF, Preference Data, Post-Training, Coding-Agent-Evaluation und Modellqualitätsbewertung. Erfahrung im Entwerfen von Evaluierungsdatensätzen, Benchmarks, Gradern, Hidden-Test-Umgebungen und containerisierten Ausführungssystemen für große Sprachmodelle und AI-Agenten.

Fähigkeiten

  • Programming: Python, Javascript, Typescript, Sql, Bash
  • Backend & Apis: Fastapi, Flask, Django, Rest Apis, Microservices
  • Llm / Genai: Llm Evaluation, Rlhf, Rlaif, Sft, Preference Data, Preference Optimization, Prompt Engineering, Response Ranking, Llm-As-A-Judge, Tool / Function Calling, Agent Evaluation
  • Evaluation: Benchmark Development, Rubric Design, Pairwise Ranking, Human Evaluation, Automated Grading, Model Regression Testing, Failure Analysis, Safety Evaluation, Coding-Agent Evaluation
  • Ml / Nlp: Pytorch, Hugging Face Transformers, Bert, Sentence Transformers, Embeddings, Semantic Search, Classification, Information Extraction
  • Rag & Agents: Retrieval-Augmented Generation, Faiss, Vector Databases, Langchain, Langgraph, Agentic Workflows, Retrieval Evaluation
  • Infrastructure: Docker, Git, Github Actions, Ci/Cd, Linux, Aws, Postgresql, Mysql, Redis, Mongodb, Pytest

Sprachen

Urdu
Muttersprache
Englisch
Verhandlungssicher
Punjabi
Verhandlungssicher

Ausbildung

Okt. 2016 - Juni 2018

University of Leeds

MSc Advanced Computer Science · Advanced Computer Science · Vereinigtes Königreich

Okt. 2013 - Juni 2016

University of Birmingham

BSc Computer Science · Computer Science · Vereinigtes Königreich

Statistiken

Erfahrung

Positionen gesamt 6
Erfahrung in Informationstechnologie (IT) 8.5 J.
Durchschn. Dauer 1 J. 9 M.
Längste Erfahrung 3 J. 11 M.

Globale Erfahrung

Länder gearbeitet 1 (Vereinigtes Königreich)
Hauptland Vereinigtes Königreich

Fachkenntnisse

Aktuelle Rollen Senior AI / LLM Evaluation Engineer, Software Engineer / Machine Learning Engineer, Software Engineer
Hauptbranchen Informationstechnologie (IT), Professionelle Dienstleistungen
Hauptfachbereiche Informationstechnologie (IT), Produktentwicklung, Qualitätssicherung

Qualifikationen

Höchster Abschluss Master

Profil

Mitglied seit
Du suchst Freelancer?Passende Kandidaten in Sekunden!
FRATCH GPT testen
Weitere Aktionen

Häufig gestellte Fragen

Du hast Fragen? Hier findest du mehr.

Majid ist in Stockport, Vereinigtes Königreich ansässig.

Majid spricht folgende Sprachen: Urdu (Muttersprache), Englisch (Verhandlungssicher), Panjabi (Verhandlungssicher).

Majid hat mindestens 9 Jahre Erfahrung. In dieser Zeit hat Majid in mindestens 3 verschiedenen Rollen und für 3 verschiedene Firmen gearbeitet. Die durchschnittliche Dauer der einzelnen Projekte beträgt 3 Jahre und 10 Monate. Beachten Sie, dass Majid möglicherweise nicht alle Erfahrungen geteilt hat und tatsächlich mehr Erfahrung hat.

Basierend auf der jüngsten Erfahrung wäre Majid gut geeignet für Rollen wie: Senior AI / LLM Evaluation Engineer, Software Engineer / Machine Learning Engineer, Software Engineer.

Die neueste Position von Majid ist Senior AI / LLM Evaluation Engineer bei OPENCAST.

In den letzten Jahren hat Majid für OPENCAST, SCOTT LOGIC und SOFTWARE gearbeitet.

Majid hat die meiste Erfahrung in Industrien wie Informationstechnologie (IT) und Professionelle Dienstleistungen.

Majid hat die meiste Erfahrung in Bereichen wie Informationstechnologie (IT), Produktentwicklung und Qualitätssicherung. Majid hat auch etwas Erfahrung in Forschung und Entwicklung (F&E) und Business Intelligence.

Majid hat kürzlich in Industrien wie Informationstechnologie (IT) und Professionelle Dienstleistungen gearbeitet.

Majid hat kürzlich in Bereichen wie Informationstechnologie (IT), Produktentwicklung und Qualitätssicherung gearbeitet.

Majid hat einen Master in Advanced Computer Science von University of Leeds und einen Bachelor in Computer Science von University of Birmingham.

Majid ist sofort vollzeit verfügbar für passende Projekte.

Tagessatzverteilung

0 1 2 3 4
<€320 €480-​640 €640-​800 €800-​960 €960+

Die angegebenen Tagessätze entsprechen der typischen Marktspanne für Freelancer in dieser Position, basierend auf aktuellen Projekten auf unserer Plattform.

Durchschnittlicher Tagessatz für ähnliche Positionen

Die Tagessätze basieren auf aktuellen Projekten und enthalten keine FRATCH-Marge.

1000
750
500
250
Stundensatzvergleich-Diagramm
Ø Tagessatz 751 €

Der durchschnittliche Tagessatz ist der Mittelwert aller Tagessätze aus aktuellen Verträgen vergleichbarer Freelancer auf unserer Plattform.

1000
750
500
250
Stundensatzvergleich-Diagramm
Median-Tagessatz 800 €

Der Median-Tagessatz ist der mittlere Wert aller Tagessätze – die Hälfte der vergleichbaren Freelancer verlangt weniger, die andere Hälfte mehr. Anders als der Durchschnitt wird er von Ausreißern kaum beeinflusst.

Berechnet auf Basis der Tagessätze unserer Freelancer, Stand 23 Aug 2026. Die tatsächlichen Tagessätze können je nach Dienstalter, Erfahrung, Fachkenntnissen, Projektkomplexität und Auftragsdauer variieren.