Applied AI Engineer

Velixo

Montreal (Télétravail)
Compétences recherchées — Connectez-vous et téléversez votre CV pour comparer avec votre profil
Analyse de données Intelligence artificielle Git +7 autres

Détails du poste

  • Lieu de travail : Montreal (Télétravail)
  • Type de poste : Permanent à temps plein

À propos de Velixo

Velixo construit des fonctionnalités de reporting, de planification et d’automatisation natives d’Excel pour les équipes finance utilisant Acumatica, Sage Intacct, Business Central et MYOB.

Fondée en 2017 et basée à Montréal, nous servons les équipes finance et comptabilité qui vivent dans des tableurs et ont besoin que les données de leur ERP soient à jour, fiables et modifiables. Velixo est un employeur garantissant l’égalité des chances.

Nous célébrons la diversité et nous nous engageons à créer un environnement inclusif pour tous les employés.

Ce poste est entièrement à distance.

Bien que nous accueillions les candidatures partout au Canada, nous donnons actuellement la priorité aux candidats situés au Québec.

Description du poste

Dans ce rôle, vous assumerez la responsabilité de la performance de Velixo Intelligence ainsi que des coûts nécessaires pour le faire fonctionner.

Concrètement, il s’agit de construire l’infrastructure d’évaluation qui nous permet de déterminer si un changement de modèle a amélioré ou dégradé notre produit, tout en réduisant le coût par action sans détériorer la qualité. Il s’agit d’un rôle d’ingénierie axé sur la mesure.

Aujourd’hui, nous livrons des fonctionnalités IA et nous nous forgions des opinions sur la qualité à partir d’anecdotes.

Vous remplacerez cela par des preuves. À propos de Velixo Intelligence

Velixo Intelligence est notre passerelle basée sur MCP qui permet aux équipes finance d’interroger leur ERP en langage naturel et d’effectuer des écritures encadrées depuis Claude, ChatGPT et Copilot.

Les lectures passent par GIQL, notre langage de requête.

Les écritures passent par les propres API d’écran de l’ERP afin que toutes les permissions, validations et règles d’audit continuent de s’appliquer. Elle a été lancée en preview publique cette année.

L’utilisation augmente, la surface fonctionnelle s’élargit et notre compréhension des unités économiques n’a pas suivi.

Ce manque est la raison pour laquelle ce poste existe. Ce que vous assumerez

Évaluation

  • Construire et maintenir des suites de régression pour la génération de requêtes GIQL, la correction des writebacks, et la sélection des outils
  • Définir ce que signifie « bon » pour chaque type d’action et le rendre mesurable
  • Exécuter des évaluations structurées avant chaque mise à niveau du modèle ou changement d’invite, et produire une recommandation claire « ship ou no-ship »
  • Suivre la qualité dans le temps afin de détecter la dégradation avant que les clients ne la constatent

Génie des coûts

  • Instrumenter chaque action de la passerelle pour les tokens, le comportement du cache, le modèle, la latence et le tenant
  • Établir et maintenir une base de référence de coût par action que le reste de l’entreprise prévoit en s’appuyant dessus
  • Réduire les coûts grâce à la compression des prompts, le prompt caching, l’élagage du contexte, et l’orientation vers des modèles plus petits lorsque l’évaluation montre que la qualité reste au même niveau
  • Identifier l’extrémité coûteuse : quels clients, quelles formes de requêtes, quels échecs et boucles de retry

Stratégie de modèles

  • Suivre les nouvelles versions des modèles chez les différents fournisseurs et les évaluer sur nos charges de travail plutôt que sur des benchmarks publiés
  • Maintenir une vue à jour de l’avant-garde en matière de prix et de performance pour ce que nous faisons
  • Recommander quand migrer, quand attendre, et quand exécuter des modèles en parallèle

Partenariat avec Finance

  • Fournir les données de coût unitaire qui servent à notre tarification par crédit et aux allocations de plan
  • Modéliser l’impact sur la marge des changements de tarification proposés avec notre VP Finance
  • Signaler quand les décisions produit feront évoluer la courbe des coûts avant leur lancement

Vous ne serez pas responsable des décisions de prix.

Vous serez responsable des chiffres dont ces décisions dépendent.

Premier 90 jours

Jours 1 à 30 : Instrumentation complète de la passerelle.

Un tableau de bord montrant le coût par type d’action, par tenant et par modèle que l’équipe exécutive consulte chaque semaine.

Jours 31 à 60 : Une suite d’évaluation fonctionnelle couvrant nos types d’action les plus fréquents, avec une base de référence documentée.

Jours 61 à 90 : Une feuille de route priorisée de réduction des coûts avec des estimations chiffrées, et au moins une optimisation livrée avec une mesure de la qualité avant/après.

Ce que nous recherchons

  • Une expérience substantielle de construction sur des API LLM en production, pas dans des démos ou des notebooks
  • Vous avez construit un banc d’évaluation (eval harness) et vous pouvez expliquer pourquoi la version naïve vous trompe
  • Des compétences pratiques avec l’environnement d’outillage actuel : plateformes de tracing et d’observabilité telles que Langfuse, frameworks d’évaluation tels que promptfoo
  • Vous avez des opinions sur les outils qui méritent leur place et ceux qui ajoutent de la cérémonie sans apporter de signal
  • À l’aise avec la comptabilisation des tokens, la gestion de la fenêtre de contexte, et les stratégies de caching
  • Un bon sens analytique et une maîtrise de la donnée
  • Vous cherchez une requête ou un notebook avant de chercher une opinion
  • Capacité à écrire clairement sur les compromis pour un public non technique, parce que vos conclusions seront présentées dans des board decks et des réunions de tarification
  • Maîtrise de Python ou TypeScript

Atouts

  • Expérience avec MCP ou d’autres frameworks d’appel d’outils
  • Connaissances en ERP, comptabilité ou systèmes financiers
  • Expérience préalable avec des modèles de tarification basés sur l’utilisation ou sur le crédit
  • Expérience dans une petite entreprise où vous fixez vos propres priorités

Pourquoi ce rôle est intéressant

La plupart des entreprises ajoutent une boîte de discussion à leur produit et espèrent.

Nous construisons un accès en écriture encadré et vérifiable vers des systèmes financiers de référence, où une réponse erronée a de réelles conséquences et où une écriture de journal hallucinée est inacceptable.

Le problème d’évaluation ici est vraiment difficile et vraiment important. Vous aurez aussi une visibilité inhabituelle.

Les chiffres que vous produirez détermineront directement ce que nous facturons et ce que nous construisons.

Powered by JazzHR