Aller au contenu

Tester et itérer

Afficher en Markdown

Un agent s’affine par itérations : changez une chose, relancez la même tâche, comparez. endue conserve les révisions du prompt, si bien que l’étape « revenir en arrière » reste toujours possible.

Chaque fois qu’un agent est presque au point. L’écueil que cette page veut vous éviter est le plus courant : trois changements à la fois, l’agent s’améliore sur un point et se dégrade sur un autre, et plus rien ne peut être attribué à quoi que ce soit.

  1. Gardez une tâche à relancer. Deux ou trois demandes réelles que vous avez déjà faites, et dont vous reconnaissez tout de suite une bonne réponse. C’est votre jeu de test. Sans lui, « mieux » n’est qu’une impression.
  2. Changez une seule chose. Le prompt, ou le modèle, ou une association, mais pas les trois.
  3. Relancez la même tâche dans une nouvelle conversation. Une nouvelle conversation compte : un fil existant porte un historique qui modifie la réponse indépendamment de votre changement.
  4. Comparez avec ce que vous aviez obtenu. Regardez les appels d’outils, pas seulement le texte final : c’est généralement là qu’un changement de prompt se manifeste en premier.
  5. Conservez ou revenez en arrière. Si c’est moins bien, restaurez la révision précédente du prompt et essayez un autre changement.

Parcourez cette liste de haut en bas. Les premiers éléments font davantage bouger les résultats, à effort égal.

EssayezQuand le symptôme est
Préciser dans le prompt « à quoi ressemble un bon résultat »La réponse est juste mais inutilisable : mauvais format, mauvaise profondeur, l’essentiel est noyé
Ajouter une règle stricteIl répète une erreur précise
Associer un connecteur ou une compétenceIl devine ce qu’il devrait aller vérifier
Désactiver un groupe d’outils intégrésIl se tourne vers une capacité qui n’est que du bruit pour cet agent
Augmenter l’effort de raisonnementIl saute des étapes dans les tâches longues
Changer de modèleTout ce qui précède est en place et il ne parvient toujours pas à suivre la tâche
Scinder en deux agentsLe prompt a grossi pour couvrir deux missions sans rapport

La plupart des problèmes du type « l’agent est mauvais » se voient dans l’exécution elle-même.

  • Il n’a appelé aucun outil. Il pense pouvoir répondre avec ce qu’il sait déjà. Le plus souvent un problème de prompt, parfois une association manquante.
  • Il a appelé le bon outil avec de mauvais arguments. Il lui manque du contexte : indiquez-le dans le prompt, ou enregistrez-le dans la mémoire.
  • Il a appelé des outils en boucle sans converger. La tâche est insuffisamment définie, ou le réglage d’effort est trop bas pour sa longueur.
  • Il vous a demandé quelque chose qu’il devrait savoir. Cette information a sa place dans le prompt ou dans la mémoire.
  • Il n’existe ni banc d’évaluation intégré ni notation automatique. La comparaison se fait à la main, sur des tâches que vous choisissez.
  • Il n’existe pas de mode brouillon : un agent a une seule configuration active, et les modifications prennent effet à sa prochaine exécution. Pour tenter un changement risqué sans perturber un agent sur lequel vous comptez, créez-en une copie et faites vos essais dessus.
  • L’historique des révisions concerne le prompt système. Les autres paramètres (modèle, associations, groupes d’outils) ne sont pas versionnés : notez ce que vous avez changé.