Tester et itérer
Un agent s’affine par itérations : changez une chose, relancez la même tâche, comparez. endue conserve les révisions du prompt, si bien que l’étape « revenir en arrière » reste toujours possible.
Quand l’utiliser
Section intitulée « Quand l’utiliser »Chaque fois qu’un agent est presque au point. L’écueil que cette page veut vous éviter est le plus courant : trois changements à la fois, l’agent s’améliore sur un point et se dégrade sur un autre, et plus rien ne peut être attribué à quoi que ce soit.
Une boucle qui fonctionne
Section intitulée « Une boucle qui fonctionne »- Gardez une tâche à relancer. Deux ou trois demandes réelles que vous avez déjà faites, et dont vous reconnaissez tout de suite une bonne réponse. C’est votre jeu de test. Sans lui, « mieux » n’est qu’une impression.
- Changez une seule chose. Le prompt, ou le modèle, ou une association, mais pas les trois.
- Relancez la même tâche dans une nouvelle conversation. Une nouvelle conversation compte : un fil existant porte un historique qui modifie la réponse indépendamment de votre changement.
- Comparez avec ce que vous aviez obtenu. Regardez les appels d’outils, pas seulement le texte final : c’est généralement là qu’un changement de prompt se manifeste en premier.
- Conservez ou revenez en arrière. Si c’est moins bien, restaurez la révision précédente du prompt et essayez un autre changement.
Que changer, et dans quel ordre
Section intitulée « Que changer, et dans quel ordre »Parcourez cette liste de haut en bas. Les premiers éléments font davantage bouger les résultats, à effort égal.
| Essayez | Quand le symptôme est |
|---|---|
| Préciser dans le prompt « à quoi ressemble un bon résultat » | La réponse est juste mais inutilisable : mauvais format, mauvaise profondeur, l’essentiel est noyé |
| Ajouter une règle stricte | Il répète une erreur précise |
| Associer un connecteur ou une compétence | Il devine ce qu’il devrait aller vérifier |
| Désactiver un groupe d’outils intégrés | Il se tourne vers une capacité qui n’est que du bruit pour cet agent |
| Augmenter l’effort de raisonnement | Il saute des étapes dans les tâches longues |
| Changer de modèle | Tout ce qui précède est en place et il ne parvient toujours pas à suivre la tâche |
| Scinder en deux agents | Le prompt a grossi pour couvrir deux missions sans rapport |
Lire une exécution pour poser un diagnostic
Section intitulée « Lire une exécution pour poser un diagnostic »La plupart des problèmes du type « l’agent est mauvais » se voient dans l’exécution elle-même.
- Il n’a appelé aucun outil. Il pense pouvoir répondre avec ce qu’il sait déjà. Le plus souvent un problème de prompt, parfois une association manquante.
- Il a appelé le bon outil avec de mauvais arguments. Il lui manque du contexte : indiquez-le dans le prompt, ou enregistrez-le dans la mémoire.
- Il a appelé des outils en boucle sans converger. La tâche est insuffisamment définie, ou le réglage d’effort est trop bas pour sa longueur.
- Il vous a demandé quelque chose qu’il devrait savoir. Cette information a sa place dans le prompt ou dans la mémoire.
- Il n’existe ni banc d’évaluation intégré ni notation automatique. La comparaison se fait à la main, sur des tâches que vous choisissez.
- Il n’existe pas de mode brouillon : un agent a une seule configuration active, et les modifications prennent effet à sa prochaine exécution. Pour tenter un changement risqué sans perturber un agent sur lequel vous comptez, créez-en une copie et faites vos essais dessus.
- L’historique des révisions concerne le prompt système. Les autres paramètres (modèle, associations, groupes d’outils) ne sont pas versionnés : notez ce que vous avez changé.
Voir aussi
Section intitulée « Voir aussi »Prompt système et révisionsLe levier que vous actionnerez le plus, et comment revenir en arrière.
ExécutionsLire ce que l'agent a réellement fait, étape par étape.
Guider une exécutionCorriger une exécution en cours, et ce que cela vous apprend.