“Il faut tout un village bienveillant pour élever une IA bienveillante.”
Ab Initio Safety of Large Language Models™ — un programme de recherche qui pose une autre question sur la sécurité de l’IA : non pas comment contraindre un modèle une fois construit, mais comment y intégrer la sécurité dès le tout début.
La vision
L’IA d’aujourd’hui repose sur des bancs d’essai, des garde-fous et des océans de données de pré-entraînement non filtrées — et sa sécurité est rajoutée à la toute fin, une fois que le modèle est déjà devenu ce qu’il est. Ab Initio Safety part de la prémisse inverse : qu’un système sûr, comme un enfant bien élevé, se façonne dès les premiers principes de sa formation — nourri, de façon développementale, par la communauté qu’il servira un jour.
C’est le fil conducteur de mon travail doctoral : un long programme, construit au grand jour, une pièce à la fois.
Le programme
Un article de position montrant que l’approche dominante de la sécurité de l’IA, fondée sur les garde-fous et l’évaluation comparative, est irresponsable et dangereusement inadéquate pour les usages à enjeux élevés en conditions réelles — étayée par des préjudices documentés et lue à travers le prisme de la science de la mesure.
La critique n’est que la première pièce. La moitié constructive de la thèse — un exposé positif et réalisable de ce que peut être la sécurité ab initio — ainsi que les travaux qui la suivront sont en développement actif et apparaîtront ici à mesure qu’ils mûriront.