2026年9月14日、AnthropicはClaudeの公式ブログで内部継続的統合(CI)システムの拡張体験を明らかにしました。Claudeが約80%のコードを書いたことで、エンジニアリングチームは2021-2025年と比べて四半期平均8倍のコード量を納品し、テスト数は10倍に増加し、CIタスクはわずか6か月で20倍に増加しました。この事例はコーディングエージェントを展開するチームへの警鐘です。開発速度が上がった後、最初にプレッシャーを受けるのはモデルやエディタではなく、テスト選択、キュー、状態ストレージである場合もあります。
なぜ一時的な拡大はこんなに早く失敗するのでしょうか?
Anthropicはより大きなマシンへの切り替え、パッケージごとにシャーディングし、プロセス障害時に自動的に再起動する方法を試みました。大型マシンは約70日しか持ちこたえず、シャーディングは約29日後にピークに達し、再起動は1日以内に効果を失いました。その理由は、旧システムがテスト履歴を単一のプロセス内に保存していたためです。リスナーは結果を受け取り、どのテストがコード変更に関連しているかを計算していました。ワークロードが急激に増加するにつれて、計算、メモリ、状態の復旧が相互に制約し合い、ローリング展開やクラッシュがバックログを増幅させました。
再建の焦点は単に機械を積み重ね続けることだけではありません
チームはその後、アーキテクチャをステートレスリスナー、メモリデータストレージ、ログ消費プロセスに分割しました。リスナーは水平方向にスケールでき、テスト結果のみを記録します。独立した利用者はイベントをテストのメンテナンス履歴に整理し、セレクターは過去のヒット数やパッケージの相関に基づいてどのテストを実行するかを決定します。Anthropicによると、切り替え後も新システムは安定しており、エンジニアはClaudeを使って、かつてほぼ4分の1だったものを約3週間で完了させました。
コーディングエージェントを採用するチームにとってはどういう意味ですか?
- 極端な成長を想定している:Anthropicは、インフラリーダーに対し、2四半期で25倍の負荷増加を予想すると推奨していますが、これは自社のビジネスから来ており、業界の統一予測として機械的に適用すべきではありません。
- 状態と計算のデカップリング:キー履歴をプロセスの外に残すことで、ワーカーノードの拡張や再起動時にコンテキストを失うのを防ぐことができます。
- まずは入力と出力を監視してください。テストイベントの20分の遅延は数万件の更新を見逃すことを意味します。キュー遅延、選択ヒット率、重複実行数はすべてコア指標であるべきです。
- 再計算コスト削減:エージェントはコード生成速度が向上しますが、テスト、キャッシュ、ハッシュコストも増加するため、開発成果だけに集中すると純リターンを過大評価しがちです。
実施前にキャパシティドリルを実施してください
企業はCIが完全に混雑するまで行動を起こす必要はありません。まずマージごとにトリガーされるテスト数、ピークキュー時間、過去の状態回復時間、変更あたりのコストを数え、その後5倍、10倍、25倍の同時進行をシミュレートできます。システムが依然として単一ノードメモリや手動再起動に依存しているなら、観察可能性層と状態層の変更を優先すべきです。Anthropicの数字はすべてのチームが同じ曲線に直面することを証明するわけではありませんが、明確なメッセージを送っています。コーディングエージェントの調達計画はソフトウェア提供インフラの予算と共に見直されるべきだということです。