テストと改善
エージェントは、繰り返し試しながら調整します。1つだけ変えて、同じタスクを実行し、比較します。endue はプロンプトのリビジョンを保存しているので、「元に戻す」手順はいつでも使えます。
エージェントがほぼ思いどおりに動いているときです。このページが防ごうとしているのは、よくある失敗です。一度に3つ変更した結果、エージェントがある面では良くなり、別の面では悪くなって、どの変更が何に効いたのか判断できなくなるというものです。
効果的な改善ループ
Section titled “効果的な改善ループ”- 繰り返し実行するタスクを用意します。以前に実際に頼んだことがあり、良い回答を見ればすぐにそれとわかる依頼を2〜3個選びます。これがテストセットです。これがないと、「良くなった」はただの感覚になってしまいます。
- 1つだけ変更します。プロンプト、モデル、紐付けのどれか1つです。3つすべてを変えてはいけません。
- 新しい会話で同じタスクを実行します。新しい会話であることが重要です。既存のスレッドには履歴があり、その履歴が、変更とは関係なく回答を変えてしまうからです。
- 以前の結果と比較します。最終的なテキストだけでなく、ツール呼び出しも確認しましょう。プロンプトの変更は、たいていそこに最初に表れます。
- 採用するか、元に戻します。悪くなっていたら、以前のプロンプトのリビジョンを復元し、別の変更を試します。
変更する順番
Section titled “変更する順番”次の表を上から順に試します。上にある項目ほど、かけた手間に対して結果が大きく変わります。
| 試すこと | こんな症状のとき |
|---|---|
| プロンプトの「良い結果とはどういうものか」をより明確にする | 回答は正しいが使えない(形式が違う、深さが合わない、要点が埋もれている) |
| 必ず守るルールを追加する | 特定の間違いを繰り返す |
| コネクターやスキルを紐付ける | 調べるべきことを推測で済ませる |
| 組み込みツールのグループをオフにする | このエージェントにとっては雑音でしかない機能に手を出す |
| 推論レベルを上げる | 長いタスクで手順を飛ばす |
| モデルを変更する | 上記がすべて適切なのに、タスクについていけない |
| 2つのエージェントに分ける | 無関係な2つの仕事を扱うために、プロンプトが膨らんでいる |
実行を読み解いて原因を探る
Section titled “実行を読み解いて原因を探る”「エージェントの出来が悪い」という問題の多くは、実行そのものに表れています。
- ツールを1つも呼び出していない。手持ちの知識だけで答えるべきだと判断しています。たいていはプロンプトの問題で、ときには紐付けの漏れが原因です。
- 正しいツールを誤った引数で呼び出した。コンテキストが足りていません。プロンプトに書くか、メモリに保存しましょう。
- ツールを繰り返し呼び出して、収束しない。タスクの定義が不十分か、タスクの長さに対して推論レベルが低すぎます。
- 知っているはずのことを尋ねてきた。その事実は、プロンプトかメモリに入れておくべきものです。
- 評価用の仕組みや自動採点は組み込まれていません。比較は、自分で選んだタスクを使って手作業で行います。
- 下書きモードはありません。エージェントの設定は常に有効な1つだけで、変更は次の実行から反映されます。頼りにしているエージェントに影響を与えずに思い切った変更を試すには、コピーを作ってそちらで実験しましょう。
- リビジョン履歴が残るのはシステムプロンプトだけです。モデル、紐付け、ツールグループなどのほかの設定はバージョン管理されないため、何を変えたかを記録しておいてください。