Aller au contenu
JEAN-PHILIPPE MERCIER, PhD
Applied AI · Computer Vision · Robotics

Jean-Philippe Mercier, PhDApplied Scientist

Je conçois des systèmes d'IA qui relient l'apprentissage automatique, le logiciel et le monde physique

Photo de Jean-Philippe Mercier

À propos

Je suis cofondateur et Applied Scientist chez NQB AI, où je conçois des systèmes d'IA qui règlent des problèmes techniques et opérationnels concrets.

Mon travail couvre deux domaines complémentaires. La Physical AI relie l'apprentissage automatique aux robots, aux caméras, aux capteurs et aux autres systèmes physiques. L’Organizational AI applique l'IA, le logiciel et l'optimisation pour améliorer le fonctionnement des organisations.

Mon parcours est ancré dans la vision par ordinateur et la robotique. J'ai obtenu un doctorat en informatique à l’Université Laval, avec des recherches sur la détection d'objets, l'estimation de pose 6D, l'apprentissage sim-to-real et la perception 3D. Avant NQB AI, j'ai participé au développement d'un produit de vision robotique industrielle chez Robotiq et, en poste chez Aerex Avionique, j'ai bâti des systèmes d'IA et logiciels pour RDDC Valcartier, en combinant IA, logiciel, capteurs et modules matériels dans des prototypes de recherche et des preuves de concept.

En recherche comme en industrie, le fil conducteur de mon travail est de transformer des modèles d'IA en systèmes qui tiennent sous les contraintes du monde réel.

Expérience

  • Je mène et livre des projets d'IA appliquée en vision par ordinateur, en robotique, en IA générative, en optimisation et en développement logiciel sur mesure. Selon le projet, je suis le contributeur technique principal, le responsable d'une petite équipe technique ou le superviseur de développeurs et de chercheurs.

    NQB AI
  • Systèmes d'IA et logiciels bâtis pour RDDC Valcartier, en poste chez Aerex Avionique, combinant vision par ordinateur, développement logiciel, intégration de capteurs et matériel expérimental. Travaux de détection, de suivi et de classification d'objets, avec des systèmes de perception visible, infrarouge et hyperspectrale. Modèles exécutés sur serveurs, PC et systèmes embarqués dans des prototypes de recherche. Coauteur d'un article OTAN.

  • Thèse « Deep learning for object detection in robotic grasping contexts », sous la supervision de Philippe Giguère (Université Laval) et la codirection d'Abdeslam Boularias (Rutgers University).

    Lire la thèse
  • Co-développement d'un produit de vision pour le pick-and-place industriel sur les bras robotisés d'Universal Robots, du firmware caméra jusqu'à la détection d'objets. Le produit s'inspire de mes travaux de maîtrise et je suis co-inventeur de son brevet (CA2977077C, délivré en 2019). En poste de 2015 à 2018, puis une année supplémentaire de collaboration comme stagiaire au doctorat, financée par une subvention Mitacs.

    Robotiq
  • Collaboration de recherche dans le laboratoire d'Abdeslam Boularias, sur la localisation d'objets et l'estimation de pose 6D à partir de simulation et d'images réelles faiblement annotées. Travaux publiés à ICRA 2019.

    Rutgers Robot Learning Lab
  • Saisie robotisée par démonstration : reconnaissance et appariement d'objets par nuages de points 3D, puis contrôle d'un bras Kinova Jaco pour reproduire la prise. Stage de fin de maîtrise chez Robotiq, où le projet a inspiré un produit de l'entreprise. Prix d'excellence Pierre Marchand (2014).

Recherche et publications choisies

  • Manuscrit en évaluation

    N. Lapointe, K. Laurent, K. Voyer, J.-P. Mercier, M. R. Karimi Dastjerdi, A. Grenier, C. Croeser, I. Van Der Wat

  • FUSION · International Conference on Information Fusion

    B. Debaque, H. Perreault, J.-P. Mercier, M.-A. Drouin et al.

    Fusing thermal and visible images is a recurring challenge in computer vision, especially when the images of the two modalities are not well registered. This registration problem is traditionally solved by matching descriptors and depends on the richness and discriminating power of the representation. Ensuring that detected features are dense and uniformly distributed is not necessarily guaranteed. More recently, machine learning methods addressed the issue of visible to visible matching, but few address the multi-modality setting. In this paper, we propose to address the special case of thermal-visible image registration with small baseline parallax correction. Our deep homography model is evaluated on an open thermal and visible dataset with two training settings, unsupervised and supervised. Results demonstrate the feasibility of the approach, and performances comparison to state-of-the-art models is evaluated.

  • Sensors · MDPI

    A. Coluccia et al. (dont J.-P. Mercier)

    Adopting effective techniques to automatically detect and identify small drones is a very compelling need for a number of different stakeholders in both the public and private sectors. This work presents three different original approaches that competed in a grand challenge on the “Drone vs. Bird” detection problem. The goal is to detect one or more drones appearing at some time point in video sequences where birds and other distractor objects may be also present, together with motion in background or foreground. Algorithms should raise an alarm and provide a position estimate only when a drone is present, while not issuing alarms on birds, nor being confused by the rest of the scene. In particular, three original approaches based on different deep learning strategies are proposed and compared on a real-world dataset provided by a consortium of universities and research centers, under the 2020 edition of the Drone vs. Bird Detection Challenge. Results show that there is a range in difficulty among different test sequences, depending on the size and the shape visibility of the drone in the sequence, while sequences recorded by a moving camera and very distant drones are the most challenging ones. The performance comparison reveals that the different approaches perform somewhat complementary, in terms of correct detection rate, false alarm rate, and average precision.

  • WACV · Winter Conference on Applications of Computer Vision

    J.-P. Mercier, M. Garon, P. Giguère, J.-F. Lalonde

    Much of the focus in the object detection literature has been on the problem of identifying the bounding box of a particular class of object in an image. Yet, in contexts such as robotics and augmented reality, it is often necessary to find a specific object instance, a unique toy or a custom industrial part for example, rather than a generic object class. Here, applications can require a rapid shift from one object instance to another, thus requiring fast turnaround which affords little-to-no training time. What is more, gathering a dataset and training a model for every new object instance to be detected can be an expensive and time-consuming process. In this context, we propose a generic 2D object instance detection approach that uses example viewpoints of the target object at test time to retrieve its 2D location in RGB images, without requiring any additional training (i.e. fine-tuning) step. To this end, we present an end-to-end architecture that extracts global and local information of the object from its viewpoints. The global information is used to tune early filters in the backbone while local viewpoints are correlated with the input image. Our method offers an improvement of almost 30 mAP over the previous template matching methods on the challenging Occluded Linemod dataset (overall mAP of 50.7). Our experiments also show that our single generic model (not trained on any of the test objects) yields detection results that are on par with approaches that are trained specifically on the target objects.

  • OTAN · STO-MP-MSG-SET-183, communication 19

    G. Gagné, M. Breton, Y. de Villers, J.-P. Mercier, V. Paquin, J. Giesbrecht

  • Thèse de doctorat · Université Laval

    J.-P. Mercier

    Dans la dernière décennie, les approches basées sur les réseaux de neurones convolutionnels sont devenus les standards pour la plupart des tâches en vision numérique. Alors qu'une grande partie des méthodes classiques de vision étaient basées sur des règles et algorithmes, les réseaux de neurones sont optimisés directement à partir de données d'entraînement qui sont étiquetées pour la tâche voulue. En pratique, il peut être difficile d'obtenir une quantité suffisante de données d'entraînement ou d'interpréter les prédictions faites par les réseaux. Également, le processus d'entraînement doit être recommencé pour chaque nouvelle tâche ou ensemble d'objets. Au final, bien que très performantes, les solutions basées sur des réseaux de neurones peuvent être difficiles à mettre en place. Dans cette thèse, nous proposons des stratégies visant à contourner ou solutionner en partie ces limitations en contexte de détection d'instances d'objets. Premièrement, nous proposons d'utiliser une approche en cascade consistant à utiliser un réseau de neurone comme pré-filtrage d'une méthode standard de « template matching ». Cette façon de faire nous permet d'améliorer les performances de la méthode de « template matching » tout en gardant son interprétabilité. Deuxièmement, nous proposons une autre approche en cascade. Dans ce cas, nous proposons d'utiliser un réseau faiblement supervisé pour générer des images de probabilité afin d'inférer la position de chaque objet. Cela permet de simplifier le processus d'entraînement et diminuer le nombre d'images d'entraînement nécessaires pour obtenir de bonnes performances. Finalement, nous proposons une architecture de réseau de neurones ainsi qu'une procédure d'entraînement permettant de généraliser un détecteur d'objets à des objets qui ne sont pas vus par le réseau lors de l'entraînement. Notre approche supprime donc la nécessité de réentraîner le réseau de neurones pour chaque nouvel objet.

  • ICRA · International Conference on Robotics and Automation

    J.-P. Mercier, C. Mitash, P. Giguère, A. Boularias

    This work proposes a process for efficiently training a point-wise object detector that enables localizing objects and computing their 6D poses in cluttered and occluded scenes. Accurate pose estimation is typically a requirement for robust robotic grasping and manipulation of objects placed in cluttered, tight environments, such as a shelf with multiple objects. To minimize the human labor required for annotation, the proposed object detector is first trained in simulation by using automatically annotated synthetic images. We then show that the performance of the detector can be substantially improved by using a small set of weakly annotated real images, where a human provides only a list of objects present in each image without indicating the location of the objects. To close the gap between real and synthetic images, we adopt a domain adaptation approach through adversarial training. The detector resulting from this training process can be used to localize objects by using its per-object activation maps. In this work, we use the activation maps to guide the search of 6D poses of objects. Our proposed approach is evaluated on several publicly available datasets for pose estimation. We also evaluated our model on classification and localization in unsupervised and semi-supervised settings. The results clearly indicate that this approach could provide an efficient way toward fully automating the training process of computer vision models used in robotics.

  • Brevet canadien délivré · CA2977077C

    V. Paquin, M.-A. Lacasse, Y. Drolet-Mihelic, J.-P. Mercier

    A robotic arm mounted camera system allows an end-user to begin using the camera for object recognition without involving a robotics specialist. Automated object model calibration is performed under conditions of variable robotic arm pose dependent feature recognition of an object. The user can then teach the system to perform tasks on the object using the calibrated model. The camera's body can have parallel top and bottom sides and adapted to be fastened to a robotic arm end and to an end effector with its image sensor and optics extending sideways in the body, and it can include an illumination source for lighting a field of view.

  • WACV · Winter Conference on Applications of Computer Vision

    J.-P. Mercier, L. Trottier, P. Giguère, B. Chaib-draa

    Pick-and-place is an important task in robotic manipulation. In industry, template-matching approaches are often used to provide the level of precision required to locate an object to be picked. However, if a robotic workstation is to handle numerous objects, brute-force template-matching becomes expensive, and is subject to notoriously hard-to-tune thresholds. In this paper, we explore the use of Deep Learning methods to speed up traditional methods such as template matching. In particular, we employed a Single Shot Detection (SSD) and a Residual Network (ResNet) for object detection and classification. Classification scores allows the re-ranking of objects so that template matching is performed in order of likelihood. Tests on a dataset containing 10 industrial objects demonstrated the validity of our approach, by getting an average ranking of 1.37 for the object of interest. Moreover, we tested our approach on the standard Pose dataset which contains 15 objects and got an average ranking of 1.99. Because SSD and ResNet operates essentially in constant time in a Graphics Processor Unit, our approach is able to reach near-constant time execution. We also compared the F1 scores of LINE-2D, a state-of-the-art template matching method, using different strategies (including our own) and the results show that our method is competitive to a brute-force template matching approach. Coupled with near-constant time execution, it therefore opens up the possibility for performing template matching for databases containing hundreds of objects.

  • ICRA · International Conference on Robotics and Automation

    F.-M. De Rainville, J.-P. Mercier, C. Gagné, P. Giguère, D. Laurendeau

    This paper proposes a complete system for robotic sensor placement in initially unknown arbitrary three-dimensional environments. The system uses a novel approach for computing the quality of acquisition of a mobile sensor group in such environments. The quality of acquisition is based on a geometric model of a camera which allows accurate sensor models and simple occlusion computation. The proposed system combines this new metric with a global derivative-free optimization algorithm to find simultaneously the number of sensors and their configuration to sense accordingly the environment. The presented framework compares favourably with current techniques working in two-dimensional environments. Furthermore, simulation and experimental results demonstrate the ability of the system to cope with full three-dimensional environments, a domain still unexplored by previous methods.

Projets

Robotique et Physical AI

  • Co-développement chez Robotiq d'un produit de vision pour le pick-and-place industriel sur Universal Robots : firmware caméra, calibration, détection d'objets et intégration robot. Technologie brevetée (CA2977077C) déployée en usine.

    Voir le brevet
  • Système de robotique d'assistance pour utilisateurs de fauteuil roulant : reproduction autonome d'une prise à partir d'une seule démonstration, avec Kinova Jaco, Kinect, ROS, OpenCV et PCL. Travaux de maîtrise, prix d'excellence Pierre Marchand (2014), adaptés ensuite en contexte industriel chez Robotiq.

    Lire la thèse
  • Calibration de la transformation entre un bras Kinova Jaco et une caméra Kinect à l'aide d'AR tags, avec workflow ROS/RViz documenté (jpmerc/perception3d).

    Code sur GitHub
  • Extension d'ar_track_alvar : transformation caméra→tag robuste calculée par RANSAC sur les coins 3D plutôt que par solvePnP, avec démonstration vidéo publique (jpmerc/3D_Tracking).

    Code sur GitHub

Vision par ordinateur et inspection

  • Système de vision pour la détection automatisée de défauts dans les conduites d'égout, à partir de plateformes robotisées équipées de caméras fisheye.

  • Système d'apprentissage automatique développé chez NQB AI pour évaluer la sévérité de la dégradation de composantes structurales de puits de mine à partir de données d'inspection. Article soumis en 2026.

  • Création de signatures visuelles uniques pour des étiquettes de produits pharmaceutiques, afin d'authentifier les originaux et de détecter les contrefaçons sur des emballages cylindriques.

  • Détection de contrefaçons par analyse des motifs d'impression en demi-teintes, avec caractéristiques conçues à la main et réseaux de neurones convolutifs.

  • Vision par ordinateur pour analyser et prédire l'évolution des traces d'usure sur des outils de pierre préhistoriques. Collaboration avec les laboratoires d'archéologie de l'Université Laval.

Détection et capteurs

  • Détecteurs profonds sur imagerie visible et infrarouge, avec découpage en tuiles pour repérer de très petits objets, exécutés sur une plateforme multi-capteurs.

  • Adaptation d'un pipeline de détection temps réel au traitement d'imagerie multispectrale et hyperspectrale, sur des bandes visibles et infrarouges.

  • Système multi-caméras avec inférence profonde en périphérie et génération automatisée de rapports, intégré à des outils de supervision existants.

  • Mandats de consultation chez Aerex Avionique pour RDDC Valcartier : détection, suivi et classification d'objets en imagerie visible, infrarouge et hyperspectrale, exécutés sur serveurs, PC et systèmes embarqués dans des prototypes de recherche. Coauteur d'un article OTAN.

  • Interface Qt de configuration d'un télémètre Leddar (oversampling, accumulation, intensité DEL, seuils) et intégration du capteur dans une stack ROS (jpmerc/leddarUI, jpmerc/leddartech).

    Code sur GitHub
  • Système d'essai d'un capteur de distance à temps de vol en eaux profondes (mer des Caraïbes). Raspberry Pi avec interface maison pour l'affichage temps réel.

Apprentissage et optimisation

  • Recherche opérationnelle appliquée chez NQB AI : optimisation de tournées de véhicules et de confection d'horaires sous contraintes métier réelles.

  • Calibration et optimisation de détecteurs plastiques à scintillation hyperspectraux utilisés en dosimétrie de radiothérapie.

  • Réseaux LSTM convolutifs pour prédire les images suivantes de simulations de dynamique des fluides. Pipeline automatisé de génération de jeux de données synthétiques à partir de simulations CFD.

  • Apprentissage profond et rendu 3D différentiable pour prédire des résultats d'analyse selon différents points de vue et paramètres. Comparaison d'approches d'interpolation neuronales et déterministes.

  • Chaîne d'apprentissage automatique pour prédire les résultats d'essais de pénétration de matériaux à partir de données expérimentales, avec analyse des limites de généralisation des modèles.

  • Simulateur, partitionnement et classification pour reconnaître des motifs de déplacement de groupe à partir de données de suivi de capteurs, avec génération de jeux de données synthétiques pour la reconnaissance d'activités.

Logiciel et systèmes d'IA

  • Extraction automatisée d'information de câblage depuis les schémas PDF de clients et interaction avec les systèmes internes pour accélérer la production de devis.

  • Système de réponse vocale qui traite des appels téléphoniques en temps réel avec des agents IA spécialisés (réceptionniste, conseiller produit, soutien). Bâti sur Asterisk avec mise en file intelligente, transfert vers un humain, boîte vocale IA et résumés courriel automatisés.

  • Plateforme SaaS de création et d'édition d'images et de modèles 3D par IA, intégrant des modèles génératifs dans des flux de production réels.

  • Agents conversationnels s'appuyant sur la génération augmentée par récupération et l'appel de fonctions pour répondre à partir de bases de connaissances internes.

  • Évaluation de solutions SaaS puis preuve de concept utilisant des LLM (Claude, GPT, Gemini) pour redimensionner automatiquement des annonces Adobe InDesign vers plusieurs formats, en transformant le HTML5 exporté. Boucle de rétroaction génération, capture et critique.

  • Système de réponse automatisée pour une entreprise de location, qui analyse les demandes de réservation et génère des réponses adaptées au contexte.

  • Génération automatisée de catalogues structurés à partir d'entrées de base de données bruitées et non structurées, par traitement du langage naturel.

  • Outil d'annotation intégrant détection et suivi d'objets pour propager les étiquettes, avec transformations affines entre capteurs pour transférer les annotations d'une modalité à l'autre.

  • Logiciel de contrôle pour la simulation de systèmes électro-optiques et les essais matériels en boucle (hardware-in-the-loop).

  • Outil de visualisation interactive de schémas électriques qui permet aux opérateurs de naviguer fil par fil, avec surlignage précis des tracés sur les diagrammes PDF.

Entrons en contact

Toujours partant pour parler d'IA appliquée, de vision par ordinateur, de robotique ou d'un projet d'IA exigeant. N'hésitez pas à m'écrire!

Envoyer un message