レベル3とレベル4の最大の違いは、バグ発見・修正ループに人間が残るかどうかという点です。
レベル3では、システムを実際に動かして問題を見つけるのは人間(プロパシー/プロンプター)であり、「ここがおかしい」とClaude Codeに伝えることで修正が走ります。
つまり、承認や気づきの起点が人間にある状態です。
レベル4(A2A完全自律)になると、エージェントを管理する「メタエージェント(エージェント・オーバー・エージェント)」が存在し、実行エージェントの出力異常を自動検知して修正エージェントを呼び出し、承認まで自律的に完結させます。
実装上はagentsファイルに監視用メタエージェントを定義し、検知→修正→再検証のループを人間の手を借りずに回せる構成が必要になります。
またClaude Code上のレベル4では、ChatGPTやGeminiといった上位AIがオーケストレーターを担い、Claude Codeはその指示を受ける実行層として機能するという構成も示されています。
人間がループの外に出られるかどうかが、レベル3と4を分ける本質的な境界線です。