Retour a l'aperçu
Visible aujourd'hui sur IKONSNouveauPopulaire
Ingénieur Python Évaluation d'agents de codage IA
BelgiqueRemoteHeures a convenir<3mois
À propos de la mission.
- Une entreprise technologique met en relation des spécialistes avec des opportunités d'IA basées sur des projets pour des entreprises technologiques de premier plan, axées sur le test, l'évaluation et l'amélioration des systèmes d'IA.
- La participation est basée sur des projets, et non sur un emploi permanent.
- Nous construisons un ensemble de données pour évaluer les agents de codage IA – la capacité d'un modèle à gérer des tâches de développement réelles.
- Les tâches pour ce projet sont estimées à 30 heures, selon la complexité. Il s'agit d'une estimation et non d'une exigence de calendrier; vous choisissez quand et comment travailler.
- Les tâches doivent être soumises avant la date limite et répondre aux critères d'acceptation énumérés pour être acceptées.
- Rémunération par tâche acceptée. Votre taux dépend du niveau de qualification que vous atteignez et de l'efficacité avec laquelle vous accomplissez les tâches – jusqu'à l'équivalent de 200 $/heure.
Ce que vous faites
- Vous créerez des tâches stimulantes et des critères d'évaluation dans des environnements simulés réalistes:
- Construire des environnements de développement réalistes – une entreprise virtuelle avec une base de code, une infrastructure et un contexte (tickets, documents, conversations) qui forment un historique de développement crédible.
- Concevoir des tâches à partir d'états intermédiaires de ces environnements – élaborer l'invite, définir ce que signifie « résolu » et s'assurer que la tâche est soluble par un agent IA.
- Écrire des tests qui vérifient les solutions des agents – accepter toutes les approches valides et rejeter les incorrectes, ni trop strictes ni trop indulgentes.
- Itérer sur les tâches et les tests en fonction des retours QA – examiner les solutions des agents, analyser les échecs et affiner jusqu'à ce que l'évaluation soit juste et robuste.
- Ce n'est PAS de l'étiquetage de données, PAS de l'ingénierie d'invite, PAS de l'écriture de code à partir de zéro – l'agent écrit la majeure partie du code; vous guidez et évaluez.
Ce qu'ils demandent.
- 8+ ans d'expérience en développement logiciel.
- Stack principal: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis.
- Expérience en écriture de tests (fonctionnels, d'intégration).
- Maîtrise de l'anglais: B2+.
Profil
- Les modèles de pointe sont déjà performants en codage. Créer une tâche qui défie véritablement les meilleurs modèles n'est pas trivial.
- Vous devez comprendre en profondeur où les modèles échouent et quels scénarios révèlent la différence entre une bonne et une mauvaise solution.
- Les tâches ont de nombreuses solutions valides – écrire des tests qui acceptent toutes les solutions correctes et rejettent les incorrectes est plus difficile qu'il n'y paraît.
Aspects pratiques.
- Horaires de travail flexibles: vous choisissez quand et comment travailler.
- Rôle entièrement à distance.
Comment postuler
Consultez le texte complet de la mission et les informations de candidature des que votre candidature sur mesure est prete.
Commandez une candidature sur mesure pour consulter la mission complete et les informations de candidature.
Plus de contexte, moins d'heures de recherche dispersees.
Vous recevez juste assez de contexte pour evaluer si cette mission est interessante. Le briefing complet, les details client et les prochaines etapes restent disponibles dans l'app.