Navigation principale

Apprentissage des invites système : un nouveau paradigme pour les systèmes d’IA

L’apprentissage des invites système aide les équipes à améliorer le comportement de l’IA sans réentraîner les modèles, tout en facilitant la compréhension des limites.

Avez-vous déjà constaté qu’une invite fonctionne bien, puis cesse soudainement de fonctionner?

Vous êtes-vous déjà retrouvé à modifier sans cesse votre invite système pour tenter d’améliorer les résultats, sans que rien ne fonctionne?

L’apprentissage des invites système pourrait être exactement ce qu’il vous faut.

L’apprentissage des invites système (SPL) est un domaine d’intérêt émergent dans la communauté de l’IA et a été largement popularisé par Andrej Karpathy sur X en mai.

L’apprentissage des invites système répond aux limites des systèmes d’IA rigides et fragiles qui reposent sur des invites système statiques ou des configurations de réglage fin difficiles à gérer. Il offre une autre façon de favoriser l’apprentissage continu dans les systèmes d’IA.

Avant d’entrer dans le vif du sujet, passons brièvement en revue quelques principes de base de la formulation des invites.

Lors du développement d’un agent ou d’un modèle personnalisé, nous devons d’abord concevoir deux éléments clés :

  1. Une invite système

  2. Une invite utilisateur

Les invites système établissent les règles de base régissant le comportement d’un modèle. Lorsqu’elles sont rédigées pour des solutions d’IA personnalisées, elles commencent souvent ainsi :

« Vous êtes un assistant intelligent. Votre rôle consiste à effectuer <insérer la tâche ici>.

Vous ne devez pas faire (A), (B) ni (C). »

À l’inverse, les invites utilisateur contiennent généralement la requête d’un utilisateur et d’autres renseignements pertinents, comme son fuseau horaire et ses préférences. Une invite utilisateur pourrait ressembler à ceci :

Capture d’écran illustrant l’introduction.

Je suis dans la capitale du Portugal. Pouvez-vous me suggérer des activités pour ce soir?

Les fuites d’invites système sont devenues courantes après le lancement de nouveaux modèles par de grands laboratoires d’IA, les utilisateurs faisant subir un jailbreak aux agents conversationnels pour révéler leurs instructions sous-jacentes. Un dépôt GitHub populaire regroupe maintenant bon nombre de ces invites système au même endroit. Elles révèlent la « recette secrète » que les laboratoires d’IA ont élaborée au fil du temps pour favoriser un comportement approprié des modèles. Par exemple, l’invite système de GPT-5 récemment divulguée (exposée dans ChatGPT) contient environ 6 000 mots, ce qui illustre la quantité de connaissances et de directives à encoder pour façonner le comportement du système.

Ces invites système exhaustives couvrent généralement plusieurs domaines clés, notamment :

  • Instructions de recherche

  • Définitions des outils

  • Préférences de l’utilisateur

  • Instructions de citation

  • Correctifs rapides pour les problèmes connus

En pratique, les développeurs de systèmes d’IA personnalisés corrigent manuellement et de façon itérative les invites système à mesure qu’ils testent et peaufinent leurs applications, en s’appuyant principalement sur des évaluations pour guider ce processus d’amélioration.

Voici d’autres façons d’orienter le comportement d’un modèle :

  • Ingénierie des invites, y compris la génération augmentée par récupération (RAG), qui contrôle le contenu fourni à un modèle

  • Réglage fin (modification directe des poids sous-jacents du modèle)

Et s’il existait une autre façon d’influencer le comportement des modèles? Imaginez un système qui apprend et peaufine dynamiquement sa propre invite système à l’aide de réflexions, de plans et de stratégies générés précédemment. Il pourrait s’appuyer à la fois sur les commentaires des utilisateurs et sur des évaluations de type LLM comme juge pour évaluer ses résultats.

Qu’est-ce que l’apprentissage des invites système?

Pensez à un défi d’affaires persistant que vous souhaitez automatiser à l’aide d’un système agentique. Les solutions efficaces exigent des capacités de raisonnement qui dépassent l’automatisation élémentaire des flux de travail. Dans de tels cas, il devient essentiel d’intégrer un composant de génération de plans à votre système d’IA. Cela permet au système de travailler de différentes façons avec plusieurs agents, selon la tâche. Certaines étapes peuvent comprendre des instructions pour accéder à d’autres agents afin d’accomplir des sous-tâches ou pour utiliser des outils.

Capture d’écran illustrant ce qu’est l’apprentissage des invites système.

Remarque : Un outil d’agent est une fonction, une API ou une ressource externe qu’un agent d’IA peut appeler pour aller au-delà du texte et accomplir des actions concrètes.

Vous pourriez choisir d’« amorcer » l’invite système du modèle avec un plan qui suit les étapes logiques qu’un humain adopterait, bien que les LLM aient généralement besoin de directives plus précises sur l’utilisation des outils, la mise en forme des résultats et les exigences connexes. Il arrive que la stratégie optimale ne soit pas claire ou que vous traitiez un problème qui n’a pas été réévalué parce qu’on le considérait auparavant comme résolu. C’est là qu’intervient l’apprentissage des invites système (SPL).

Le SPL améliore une invite système de façon itérative en y intégrant des stratégies générées précédemment. À mesure que de nouveaux problèmes surviennent, le système accumule graduellement des connaissances et devient plus robuste. Voyez cela comme la création d’un manuel pour résoudre les problèmes de votre domaine.

Le SPL intègre graduellement à l’invite système les enseignements tirés des commentaires des utilisateurs. À mesure que votre système gagne en maturité, vous pourriez découvrir des problèmes récurrents pouvant être synthétisés en principes plus généraux et de plus haut niveau.

Un guide étape par étape

Examinons de plus près le fonctionnement du processus, étape par étape :

  1. Commencez par la requête de l’utilisateur, qui demande au système d’effectuer une tâche précise.

    1. Si votre système ne traite qu’un seul problème, vous pourriez adopter une approche « gloutonne » en sélectionnant les stratégies les mieux notées des exécutions précédentes. Vous pouvez aussi favoriser l’exploration en échantillonnant une distribution qui privilégie les stratégies très bien notées tout en incluant occasionnellement celles qui le sont moins. Cette approche est particulièrement utile lorsque vous commencez tout juste à recueillir des stratégies.

    2. Pour les systèmes conçus afin de traiter divers ensembles de problèmes, envisagez d’ajouter une couche de classification ou d’utiliser des plongements et la similarité cosinus — les mêmes techniques généralement employées dans la RAG — afin de repérer les approches pertinentes. Cela vous aide à sélectionner des stratégies adaptées au problème précis, par exemple des stratégies conçues pour les tâches de programmation.

Remarque : Les plongements utilisés avec la similarité cosinus permettent de mesurer le degré de relation entre deux éléments d’information, ce qui facilite l’association de documents, de requêtes ou d’idées, même lorsque leur formulation exacte diffère.

Exemple de point de départ d’un répertoire de stratégies simplifié pour résoudre des problèmes de programmation.

Remarque : Les « stratégies d’amorçage » présentées ici sont données à titre d’exemple. Dans de véritables scénarios de programmation, nous les peaufinerions davantage. Les problèmes d’affaires spécialisés exigeraient de recueillir des renseignements supplémentaires au fil du temps.

ID_génération (ordre inverse)

Sujet

Note

Texte_stratégie

Explication

4

programmation

1

Comprendre le problème, les contraintes et les cas limites. Concevoir un algorithme avec les bonnes structures de données. Valider le plan à l’aide d’exemples et d’invariants. Écrire du code propre et lisible. Peaufiner par la refactorisation, l’optimisation et la mise en forme finale. Utilisation des outils : Lorsque vous utilisez un outil, expliquez brièvement pourquoi il était nécessaire.

Intègre et combine les meilleurs éléments des trois stratégies ci-dessous.

3

programmation

1

Comprendre le problème, les contraintes et les cas limites. Concevoir un algorithme avec les bonnes structures de données. Valider le plan à l’aide d’exemples et d’invariants. Écrire du code propre et lisible. Peaufiner par la refactorisation, l’optimisation et la mise en forme finale.

Une stratégie plus complète, mais sans directives sur l’utilisation des outils.

2

programmation

-1

Comprendre le problème, les contraintes et les cas limites. Concevoir un algorithme avec les bonnes données. Écrire du code propre et lisible. Utilisation des outils : lorsque vous accédez à des outils, résumez brièvement pourquoi vous avez utilisé cet outil.

Une meilleure stratégie qui mentionne l’utilisation des outils, mais qui pourrait encore être améliorée.

1

programmation

-1

Parcourir rapidement le problème. Résoudre le problème. Créer des tests minimaux. Soumettre ce qui fonctionne.

Mentionne les tests, mais constitue une stratégie globalement faible.

3. Après avoir échantillonné N stratégies, intégrez-les à l’invite système. La génération de plans s’appuie ainsi sur des commentaires d’experts antérieurs, plutôt que de laisser le modèle créer des plans avec un minimum de directives. Encouragez le modèle à « sortir des sentiers battus » et à ajouter des étapes au besoin plutôt qu’à simplement copier mot pour mot les stratégies échantillonnées.

Capture d’écran illustrant un guide étape par étape.

4. Avec votre invite système créée dynamiquement, générez une nouvelle stratégie pour répondre à la demande de l’utilisateur. Ce processus devrait produire des tâches supplémentaires qui améliorent le résultat final. L’objectif est la créativité : combinez les meilleurs éléments des stratégies précédentes, regroupez les étapes qui se chevauchent et ajoutez de nouvelles étapes utiles au besoin.

Remarque : N’oubliez pas que la température est un paramètre réglable permettant de produire des résultats plus variés et moins déterministes, ce qui est utile lorsqu’on recherche la créativité. Lorsque la température est différente de zéro, chaque plan généré peut varier.

5. Après avoir reçu le résultat du modèle, faites-le évaluer par une personne ou un LLM juge selon des critères précis qui définissent une bonne solution à votre problème. Pour l’exemple des activités au Portugal mentionné précédemment, les critères d’évaluation pourraient comprendre :

  • Concision (une réponse limitée à une phrase)

  • Pertinence de l’activité suggérée

  • Exactitude du lieu

6. Selon cette évaluation, utilisez un autre modèle pour peaufiner la stratégie. Une boucle de rétroaction facultative peut intégrer l’apport humain et favoriser des améliorations collaboratives. Stockez la stratégie peaufinée dans votre base de données avec les métadonnées appropriées pour suivre les versions et les modifications.

Capture d’écran illustrant un guide étape par étape.

Alors, pourquoi se donner tout ce mal? Vous pourriez examiner les résultats manuellement et ajuster l’invite système en conséquence. Cependant, de puissants modèles de raisonnement peuvent peaufiner les stratégies en utilisant à la fois le contexte des résultats et les commentaires humains. Bien que les humains puissent facilement repérer les lacunes d’approches simples, cette tâche devient difficile et fastidieuse dans les systèmes complexes qui traitent de vastes ensembles de problèmes.

Les LLM ont souvent besoin d’instructions détaillées et d’étapes supplémentaires pour recueillir les connaissances contextuelles que les humains apportent naturellement à un problème. Le nombre de tâches requises peut croître rapidement lorsqu’un système s’étend pour traiter de plus vastes ensembles de problèmes. Par exemple, les humains qui s’attaquent à des problèmes de programmation peuvent comprendre intuitivement la base de code environnante, tandis qu’un LLM devra peut-être d’abord « lire » plusieurs fichiers.

L’incidence de la mise en œuvre du SPL dans vos solutions d’IA

Découvrir de nouvelles façons de résoudre les problèmes

  • Quand c’est utile : Imaginez que vous dirigez une équipe de soutien à la clientèle et qu’un agent d’IA trie les billets. Au fil du temps, le SPL pourrait découvrir une méthode de catégorisation à laquelle votre équipe n’avait pas pensé, réduisant ainsi les taux de recours hiérarchique.

  • Quand ce ne l’est pas : Si des exigences de conformité ou des règlements définissent déjà vos flux de travail, comme pour les rapports financiers, le SPL peut offrir peu de valeur, car la créativité devient un risque plutôt qu’un atout.

Améliorer la collaboration entre les humains et l’IA

  • Quand c’est utile : Dans les rôles axés sur la recherche, comme la veille commerciale ou la stratégie de produit, vous pouvez collaborer avec l’IA en peaufinant ses plans, en enrichissant ses résultats et en intégrant ces améliorations pour un usage futur. Chaque interaction améliore l’efficacité du système.

  • Quand ce ne l’est pas : Si votre équipe utilise surtout l’IA pour des flux de travail simples nécessitant peu d’intervention humaine, comme le traitement des factures, les efforts de collaboration peuvent dépasser les avantages.

Adaptation à de nouveaux problèmes

  • Quand c’est utile : Supposons que vous vous établissiez dans une nouvelle région et que l’IA doive soudainement traiter des demandes fiscales locales. Le SPL vous permet d’encoder rapidement de nouvelles règles et heuristiques à mesure qu’elles apparaissent, évitant ainsi les erreurs répétées.

  • Quand ce ne l’est pas : Si votre environnement est statique, comme lorsque vous convertissez des transcriptions de réunions en résumés normalisés, l’adaptation constante offre peu d’avantages.

Défis et facteurs de risque

En théorie, tout cela semble prometteur, mais la mise en œuvre du SPL présente de réels défis. Nous abordons ci-dessous certains des principaux défis :

Absence de convergence

Au début de la génération de stratégies, les progrès stagnent souvent : les nouveaux résultats ne s’appuient pas sur les précédents et l’élan ralentit. Deux problèmes principaux en sont généralement la cause :

    • Solution : Encodez dès le départ toutes les connaissances d’affaires disponibles afin que le système dispose d’une base approfondie.

    • Solution : Concevez une grille nuancée qui évalue plusieurs aspects d’une réponse, comme l’exactitude, la clarté et la pertinence, puis ajustez votre échantillonnage selon ces signaux.

Explosion du nombre de stratégies

Si votre système génère des centaines de stratégies, mais reçoit peu de commentaires pour distinguer les bonnes des mauvaises, l’échantillonnage devient rapidement difficile à gérer. La solution est l’élagage.

Lorsque vous peaufinez votre répertoire de stratégies, tenez compte des éléments suivants :

  • Durée de vie : Retirez les stratégies lorsqu’elles dépassent une période ou un nombre de générations définis.

  • Note : Utilisez votre grille d’évaluation pour éliminer les stratégies qui donnent constamment de mauvais résultats. En combinant ce critère à la durée de vie, vous ne conservez que les approches qui prouvent leur valeur au fil du temps.

  • Évaluation par un LLM : Évaluez périodiquement les stratégies pour repérer celles qui n’apportent plus de perspectives uniques, puisque leurs éléments utiles ont probablement déjà été intégrés aux versions récentes.

Solution : Traitez votre base de données de stratégies comme un système vivant : élaguez-la régulièrement pour ne conserver que les connaissances pertinentes et de grande valeur.

Conclusion

L’apprentissage des invites système en est encore à ses débuts, mais son potentiel est immense. Les entreprises qui dépendent uniquement d’invites statiques ou d’un réglage fin sans fin se heurteront à des limites bien connues : systèmes fragiles, coûts croissants et efforts gaspillés. Le SPL permet de sortir de ce cycle en créant des systèmes qui s’améliorent au fil du temps et encodent des principes de haut niveau plutôt que des correctifs isolés.

Le SPL est encore émergent, mais sa trajectoire est claire : les systèmes capables d’apprendre par eux-mêmes dépasseront ceux qui ne le peuvent pas. C’est le moment d’expérimenter, de commencer modestement, de consigner les leçons apprises et de jeter les bases de systèmes d’IA qui s’améliorent à chaque interaction.

Auteur

George Williamson