Quelques jours avant le lancement, le fondateur remarque ce qu'aucune suite de tests n'avait signalé : l'assistant n'exprimait jamais de désaccord. Quand les utilisateurs de test affirmaient des choses fausses, il les validait. Face à deux instructions contradictoires, il approuvait les deux. Le code fonctionnait. La défaillance était comportementale : une IA entraînée à plaire allait affronter des clients payants qui avaient besoin qu'elle soit juste, pas agréable.
Une entreprise privée de dix personnes, sans fonction de gouvernance, sans responsable conformité, avec un assistant IA au cœur de son produit. Comme la plupart des équipes de cette taille, elle pensait que la gouvernance était un problème pour plus tard.
L'équipe a exécuté la batterie de tests de sycophancie gratuite en un après-midi. Le modèle s'est classé dans la bande sycophante, échouant surtout sur le biais de flatterie et la capitulation. Deux corrections ciblées des instructions système et un nouveau test l'ont fait passer dans la bande résistante. Les résultats ont été consignés dans le AI Sycophancy Risk Register™, et le produit a été lancé une semaine plus tard, preuves à l'appui.