Majid Khan-Senior Software Engineer

Tagessatz prüfen
Erfahrungen
Senior AI / LLM Evaluation Engineer
OPENCAST
- Entwerfe und pflege Evaluierungs-Frameworks für große Sprachmodelle in den Bereichen Reasoning, Coding, Instruction Following, Factuality, Tool Use, Agent Behaviour und Safety.
- Entwickle strukturierte Datensätze und Evaluierungsaufgaben für Supervised Fine-Tuning (SFT), RLHF, Preference Optimization, Post-Training-Evaluation und Model Benchmarking.
- Erstelle Prompts, Referenzlösungen, Bewertungskriterien, Metadaten-Schemas, Evaluierungs-Rubriken und Reviewer-Guidelines für Model-Training-Datensätze.
- Prüfe und ranke konkurrierende Modellantworten nach Korrektheit, Vollständigkeit, Reasoning-Qualität, Relevanz, Einhaltung von Anweisungen, Code-Qualität und Sicherheit.
- Baue Python-Evaluierungspipelines, die Testfälle ausführen, Grader-Ergebnisse bündeln, Fehlerarten kategorisieren und die Modellleistung über Releases hinweg vergleichen.
- Entwickle deterministische und modellgestützte Grader, mit regelbasierter Validierung dort, wo objektive Checks möglich sind, und rubrikbasierter Bewertung für offene Aufgaben.
- Entwerfe Coding-Agent-Tasks auf Repository-Ebene, die Debugging, Feature-Implementierung, API-Integration, Refactoring, Dependency-Änderungen und Test-Reparatur abdecken.
- Baue isolierte Docker-Ausführungsumgebungen, in denen Agents Repositories ändern, Terminal-Befehle ausführen, Tests starten und sicher mit Development-Tools arbeiten können.
- Implementiere Hidden Tests, Integrationstests, Dateisystem-Validierung, Timeout-Kontrollen und Prüfungen auf Änderungen, um Reward Hacking, Test-Tampering, Hardcoded Outputs und falsche Erfolgsmeldungen zu erkennen.
- Untersuche wiederkehrende Modellfehler wie Halluzinationen, falsche Tool-Nutzung, ungültige Annahmen, unvollständige Ausführung, instabiles Reasoning und Verstöße gegen Anweisungen; überführe die Erkenntnisse in neue Benchmark- und Trainingsbeispiele.
- Trage zu Pairwise Preference Ranking und Evaluator-Kalibrierung bei, analysiere Reviewer-Uneinigkeit und verfeinere Annotation-Guidelines, um die Konsistenz zu verbessern.
- Erstelle Model-Quality-Reports zu Pass-Raten, Regressionen, Grader-Uneinigkeit, Fehlerkategorien und Leistung über verschiedene Evaluierungsdimensionen hinweg.
Software Engineer / Machine Learning Engineer
SCOTT LOGIC
- Entwickelte Python-Backend-Services und REST APIs für Enterprise-Anwendungen mit FastAPI, Flask und Django, mit Fokus auf Wartbarkeit, Tests und klaren Service-Grenzen.
- Baute Datenverarbeitungspipelines für Analyse- und Machine-Learning-Anwendungen und integrierte strukturierte sowie unstrukturierte Informationen aus internen Services, Datenbanken und Drittanbieter-APIs.
- Entwarf Backend-Datenmodelle und arbeitete mit PostgreSQL, SQL, Redis, Caching, asynchroner Verarbeitung und Performance-Optimierung von Anwendungen.
- Entwickelte angewandte NLP-Features wie Textklassifikation, Information Extraction, Semantic Search, Ähnlichkeitsabgleich und Dokumentenabruf.
- Experimentierte mit BERT und Sentence Transformers und integrierte ausgewählte Transformer-Modelle über Python-basierte Inference-Services in Anwendungsabläufe.
- Baute embedding-basierte Dokumentenabruf- und Semantic-Search-Systeme und erweiterte die Arbeit später zu frühen Retrieval-Augmented-Generation-Prototypen.
- Integrierte LLM-APIs in interne Tools und Kundenprototypen für Dokumenten-Q&A, Zusammenfassungen, strukturierte Extraktion und kontrollierte Textgenerierung.
- Erstellte Prompt-Templates, Validierung für strukturierte Ausgaben, Retry-Logik, Vergleichs-Utilities für Modellantworten und automatisierte Tests zur Messung von Korrektheit, Relevanz, Konsistenz und Formatierung.
- Arbeitete mit Engineers, Product Managern und Data-Teams zusammen, um ML- und generative-AI-Prototypen in testbare, wartbare Produktionsservices zu überführen.
Software Engineer
SOFTWARE
- Entwickelte Backend-Anwendungen, Web-Services und interne Plattformen mit Python über Anforderungen, Implementierung, Tests, Deployment und Produktionssupport hinweg.
- Entwarf REST APIs und Integrationen, die interne Services mit externen Plattformen und Third-Party-Systemen verbinden.
- Baute und pflegte PostgreSQL-Schemas und SQL-Queries, einschließlich Migrationen, Indexing, transaktionalen Workflows und Performance-Tuning.
- Entwickelte Frontend-Funktionen mit JavaScript, TypeScript und React und arbeitete dabei eng mit Backend-Engineers, Designern und QA-Teams zusammen.
- Implementierte Authentifizierung, Autorisierung, Request-Validierung, Fehlerbehandlung, Logging und Sicherheitsmaßnahmen für Anwendungen.
- Schrieb Unit- und Integrationstests, untersuchte Produktionsfehler, containerisierte Anwendungen mit Docker und arbeitete an Git-basierten CI/CD-Workflows mit.
- Baute Python-Automatisierungs- und Datenverarbeitungs-Skripte und sammelte erste Erfahrungen mit Datenanalyse, Machine-Learning-Experimenten und NLP-Anwendungen.
Coding Agent Evaluation Environment
Ich habe eine containerisierte Umgebung gebaut, in der Coding Agents Aufgaben auf Repository-Ebene erhalten, Code ändern, Befehle ausführen und anhand deterministischer und Hidden Tests bewertet werden. Ergänzt um Dateisystem-Validierung, Timeouts, Dependency-Isolation und Prüfungen auf Reward Hacking und unbeabsichtigte Änderungen.
LLM Evaluation & Benchmarking Framework
Entwickelte ein Python-Framework zur Bewertung mehrerer LLMs anhand strukturierter Datensätze mit deterministischen Gradern, rubrikbasierter Bewertung, LLM-gestütztem Grading, Pairwise Comparison, Regression Tracking und Fehlerkategorisierung.
RAG- & Tool-Use-Evaluation
Ich habe RAG-Workflows mit Embeddings und Vektorsuche sowie Bewertungsszenarien für Abrufqualität, Fundierung, faktische Konsistenz, Tool-Auswahl, API-Ausführung, mehrstufiges Denken und Fehlerbehebung aufgebaut.
Branchenerfahrung
Sieh, in welchen Branchen dieser Freelancer den Großteil seiner beruflichen Laufbahn verbracht hat.
Erfahren in Informationstechnologie (IT) und Professionelle Dienstleistungen.
Erfahrung nach Fachbereich
Zeigt, in welchen Abteilungen und Funktionen dieser Freelancer am meisten mitgewirkt hat.
Erfahren in Informationstechnologie (IT), Produktentwicklung, Qualitätssicherung, Forschung und Entwicklung (F&E) und Business Intelligence.
Zusammenfassung
Software Engineer und AI Engineer mit über 8 Jahren Erfahrung im Aufbau von Backend-Systemen, APIs, Datenplattformen, Machine-Learning-Anwendungen und AI-Evaluierungs-Infrastruktur. Starker Python-Engineering-Background mit praktischer Arbeit in NLP, Transformern, Semantic Search, RAG und generativer KI. In letzter Zeit spezialisiert auf LLM-Evaluation, RLHF, Preference Data, Post-Training, Coding-Agent-Evaluation und Modellqualitätsbewertung. Erfahrung im Entwerfen von Evaluierungsdatensätzen, Benchmarks, Gradern, Hidden-Test-Umgebungen und containerisierten Ausführungssystemen für große Sprachmodelle und AI-Agenten.
Fähigkeiten
- Programming: Python, Javascript, Typescript, Sql, Bash
- Backend & Apis: Fastapi, Flask, Django, Rest Apis, Microservices
- Llm / Genai: Llm Evaluation, Rlhf, Rlaif, Sft, Preference Data, Preference Optimization, Prompt Engineering, Response Ranking, Llm-As-A-Judge, Tool / Function Calling, Agent Evaluation
- Evaluation: Benchmark Development, Rubric Design, Pairwise Ranking, Human Evaluation, Automated Grading, Model Regression Testing, Failure Analysis, Safety Evaluation, Coding-Agent Evaluation
- Ml / Nlp: Pytorch, Hugging Face Transformers, Bert, Sentence Transformers, Embeddings, Semantic Search, Classification, Information Extraction
- Rag & Agents: Retrieval-Augmented Generation, Faiss, Vector Databases, Langchain, Langgraph, Agentic Workflows, Retrieval Evaluation
- Infrastructure: Docker, Git, Github Actions, Ci/Cd, Linux, Aws, Postgresql, Mysql, Redis, Mongodb, Pytest
Sprachen
Ausbildung
University of Leeds
MSc Advanced Computer Science · Advanced Computer Science · Vereinigtes Königreich
University of Birmingham
BSc Computer Science · Computer Science · Vereinigtes Königreich
Statistiken
Erfahrung
Globale Erfahrung
Fachkenntnisse
Qualifikationen
Profil
Häufig gestellte Fragen
Du hast Fragen? Hier findest du mehr.
Majid ist in Stockport, Vereinigtes Königreich ansässig.
Majid spricht folgende Sprachen: Urdu (Muttersprache), Englisch (Verhandlungssicher), Panjabi (Verhandlungssicher).
Majid hat mindestens 9 Jahre Erfahrung. In dieser Zeit hat Majid in mindestens 3 verschiedenen Rollen und für 3 verschiedene Firmen gearbeitet. Die durchschnittliche Dauer der einzelnen Projekte beträgt 3 Jahre und 10 Monate. Beachten Sie, dass Majid möglicherweise nicht alle Erfahrungen geteilt hat und tatsächlich mehr Erfahrung hat.
Basierend auf der jüngsten Erfahrung wäre Majid gut geeignet für Rollen wie: Senior AI / LLM Evaluation Engineer, Software Engineer / Machine Learning Engineer, Software Engineer.
Die neueste Position von Majid ist Senior AI / LLM Evaluation Engineer bei OPENCAST.
In den letzten Jahren hat Majid für OPENCAST, SCOTT LOGIC und SOFTWARE gearbeitet.
Majid hat die meiste Erfahrung in Industrien wie Informationstechnologie (IT) und Professionelle Dienstleistungen.
Majid hat die meiste Erfahrung in Bereichen wie Informationstechnologie (IT), Produktentwicklung und Qualitätssicherung. Majid hat auch etwas Erfahrung in Forschung und Entwicklung (F&E) und Business Intelligence.
Majid hat kürzlich in Industrien wie Informationstechnologie (IT) und Professionelle Dienstleistungen gearbeitet.
Majid hat kürzlich in Bereichen wie Informationstechnologie (IT), Produktentwicklung und Qualitätssicherung gearbeitet.
Majid hat einen Master in Advanced Computer Science von University of Leeds und einen Bachelor in Computer Science von University of Birmingham.
Majid ist sofort vollzeit verfügbar für passende Projekte.
Tagessatzverteilung
Die angegebenen Tagessätze entsprechen der typischen Marktspanne für Freelancer in dieser Position, basierend auf aktuellen Projekten auf unserer Plattform.
Durchschnittlicher Tagessatz für ähnliche Positionen
Die Tagessätze basieren auf aktuellen Projekten und enthalten keine FRATCH-Marge.
Der durchschnittliche Tagessatz ist der Mittelwert aller Tagessätze aus aktuellen Verträgen vergleichbarer Freelancer auf unserer Plattform.
Der Median-Tagessatz ist der mittlere Wert aller Tagessätze – die Hälfte der vergleichbaren Freelancer verlangt weniger, die andere Hälfte mehr. Anders als der Durchschnitt wird er von Ausreißern kaum beeinflusst.
Berechnet auf Basis der Tagessätze unserer Freelancer, Stand 23 Aug 2026. Die tatsächlichen Tagessätze können je nach Dienstalter, Erfahrung, Fachkenntnissen, Projektkomplexität und Auftragsdauer variieren.
Ähnliche Freelancer
Entdecke andere Experten mit ähnlichen Qualifikationen und Erfahrungen
Experten, die kürzlich an ähnlichen Projekten gearbeitet haben
Freelancer mit praktischer Erfahrung in vergleichbaren Projekten als Senior AI / LLM Evaluation Engineer
Freelancer in der Nähe
Fachkräfte, die in oder in der Nähe von Stockport, Vereinigtes Königreich arbeiten
