米マイクロソフト(Microsoft)のハラルド・キルシュナー(Harald Kirschner)氏が、VS Code開発チームにおいてAIエージェントが生成したコードの生存率が従来の55%から86%へ向上したと明かした。日立製作所が1,000人規模のFDE体制構築を進めるなどAI実装を急ぐ国内エンタープライズにとっても、生成コードの破棄コストを抑えリリース速度へ転換するパイプライン設計は極めて重要な判断軸となる。
VS Code開発チームにおけるコード生存率86%向上と週次リリースの実態
Visual Studio Code(VS Code)は、全世界で5,000万人規模の開発者に利用されているオープンソースのコードエディタである。その開発とGitHub Copilotの統合を統括する米マイクロソフトのプリンシパル・プロダクトマネージャー、ハラルド・キルシュナー氏が、2026年10月の「AI Engineer podcast」で開発運用の内部数値を公表した。
AIエージェントが自動生成したプルリクエストやコードパッチのうち、人間に差し戻されたり破棄されたりせず、最終的にリポジトリへマージされてコミットに残る割合を示す「コード生存率(Code Survival Rate)」が大幅に改善した。従来、GPT-4.1を利用していた局面では55%にとどまっていた同指標が、米アンソロピック(Anthropic)のClaude Opus 4.6をパイプラインに組み込んだことで86%まで到達したという。
この信頼性向上を受け、VS Codeの開発体制そのものに重大な変化が起きている。チームは過去10年間にわたり月次(毎月)のリリースサイクルを死守してきた。しかし、エージェント生成コードの生存率が8割を超えた段階で、毎週本番ビルドを出荷する週次リリース体制へと完全に舵を切った。
| 評価指標・運用項目 | GPT-4.1導入時 | Claude Opus 4.6移行後 |
|---|---|---|
| 生成コード生存率 | 55%(約半数が破棄) | 86%(大半が本番マージ) |
| リリースサイクル | 月次(マンスリー)出荷 | 週次(ウィークリー)出荷 |
| テレメトリ自動処理 | 人手依存の課題選別 | 日次510億件から約10件を自動抽出 |
| テスト修正ループ | 人手による再現と修正 | Playwright連携による自己修正 |
キルシュナー氏が示したデータは、単なるLLMの知能競争にとどまらない。生成されたコードの破棄率が低下したことで、人間側のレビューやデバッグに費やす摩擦が劇的に削減され、チーム全体のデプロイ頻度が4倍に加速した事実を裏付けている。
さらに、VS Codeチームではユーザーから送られる1日あたり510億件にのぼる膨大なテレメトリイベントを処理している。以前はエンジニアがログを分析して不具合を特定していたが、現在はエージェント主導の自動イシュートリアージシステムを稼働させている。システムが510億件のイベント群からノイズを排除し、開発者が着手すべき実効的な課題を約10件にまで絞り込んで自動起票する仕組みが定着した。
参考記事: AIエージェントとは?自律型AIの仕組みから2030年のマシンエコノミー予測まで徹底解説
なぜコード生存率は跳ね上がったのか?Agent-Readyパイプラインの技術構造
コード生存率が30ポイント以上跳ね上がった技術的背景には、フロンティアモデルの推論能力向上に加え、パイプライン側を「AIエージェントが自律走行できる構造(Agent-Ready)」へと作り変えた点がある。キルシュナー氏は「ソフトウェア工学における現在の最大の難題は、AIにコードを書かせることではなく、AIが書いたコードを信頼することである」と指摘した。
コードを書くだけなら既存の補完ツールでも可能である。しかし、書かれたコードがアーキテクチャ規約を満たしているか、エッジケースを破壊していないかを検証できなければ、人間のエンジニアが確認作業に忙殺される。この検証負荷を解消するためにVS Codeチームが満たした技術的前提条件(Prerequisites)は3点存在する。
1点目は、エンドツーエンド(E2E)テストフレームワーク「Playwright」を用いた自己修正ループの確立である。エージェントがコードを生成した直後、ヘッドレスブラウザ上でVS CodeのUI操作テストを自律実行させる。テストが失敗した場合、エージェントはスタックトレースや画面差分を自ら読み込み、合格するまでコードを再修正する。キルシュナー氏が「エージェントが自社製品を実際に操作・利用できないのであれば、作ったものが正常に動くかどうかをどうやって判断するのか」と語った通り、実行環境とフィードバックループの統合がコード生存率を底上げした。
2点目は、必須のAIコードレビューゲートの設置である。人間がコードを読む前に、別の静的解析エージェントとセキュリティ監査エージェントが二重で構文、メモリ効率、アクセシビリティを検証する。人間のシニアエンジニアに届く段階では、すでに機械的テストと規約チェックをパスした状態が担保されている。
3点目は、段階的ロールアウト(カナリアリリース)の自動化である。週次出荷された機能は、まず社内ドッグフーディング環境とInsidersビルドへ配信される。テレメトリを監視するエージェントがクラッシュ率やレイテンシの異常を検知した場合は、即座に自動ロールバックが走る。
[開発課題の抽出]
│
▼
[日次510億件のテレメトリ解析] ─── エージェントによる絞り込み(約10件)
│
▼
[Claude Opus 4.6によるコード生成]
│
▼
[PlaywrightによるUI自己修正ループ] ─── 不合格ならエージェントが自動再修正
│
▼
[AIコードレビューゲート] ─── 規約・セキュリティ検査
│
▼
[生存率86%のパッチがマージ] ─── 週次リリース・段階的配信へ
生成されたコードを人間が一行ずつ読む運用を前提にしている限り、生存率86%も週次出荷も実現しない。AIが生成した成果物を、機械が厳密に判定し、AI自身に直させる閉ループパイプラインの構築こそが本質である。
参考記事: 生成AIで生産性が下がる3つの理由とは?Google DORAが明かす「Jカーブ」とROI最大化の条件
日本のソフトウェア開発が直面する検証コストの壁とパイプライン刷新
VS Codeの事例は、日本のエンタープライズや受託開発企業が直面している「AIを導入しても開発スピードが上がらない」というボトルネックに直接的な解を与える。国内の開発現場では、GitHub Copilotなどのコーディング支援ツールを導入したものの、人間側のレビュー負担が増大して開発速度が停滞する「Jカーブ現象」に突き当たっているケースが散見される。
生成コードの生存率が50%前後に留まる環境では、残りの半分に潜むバグや設計違反を警戒し、レビュアーが過剰な確認作業を強いられる。結果として、コード生成工数は削減できても、テストや検収の工数が肥大化して全体のリードタイムが縮まらない。
この構造的障壁を打破するアプローチとして、仕様駆動開発(Spec-Driven Development: SDD)へのシフトが進みつつある。日立製作所が1,000人規模のFDE(Forward Deployed Engineer)体制を組織し、顧客業務の仕様定義からデプロイまでの自動化を進めている動きは、その先駆けといえる。人月積算型のビジネスモデルに依存するSIer構造では、コードを速く書くことへのインセンティブが働きにくい。しかし、発注側企業が成果物の品質と生存率を指標に据えるようになれば、テスト自動化インフラの有無が受託側の競争力を直接左右する。
また、日本の多くの基幹系システムやレガシーWebアプリケーションでは、そもそもE2Eテストや結合テストが自動化されておらず、手動のテスト仕様書と目視確認に頼っている。この状態のままAIエージェントを投入しても、エージェントは自身の変更が正しく動作したかを検証できない。VS CodeがPlaywrightを用いてUIテストを自己完結させたように、自社プロダクトの操作ログや画面検証をAPI経由でエージェントに提供できる環境を整備することが先決となる。
エンジニアの評価基準も変化を求められる。コードを速く正確に書く技能よりも、エージェントが遵守すべき仕様書を厳密に定義し、自動テストの網羅性を担保し、生成されたコードのアーキテクチャ適合性を監査する能力が問われる。
参考記事: 仕様駆動開発(SDD)の仕組みとは?バイブコーディングの限界と日立1,000人FDE体制が示す脱・人月のロードマップ
参考記事: コーディング教育AI時代のプログラミング学習|「動くコード」から設計・監査能力へシフトする実践アプローチ
開発組織が着手すべきパイプライン刷新の具体策
エージェント生成コードの生存率86%という成果は、モデルの進化をパイプラインのアーキテクチャ刷新と結びつけた結果として達成された。自組織のデリバリーサイクルを週次レベルへ引き上げるために、技術責任者は以下の3つのアクションを実行に移す必要がある。
- 生成コードの生存率(マージ率)をKPIとして可視化する
エージェントが提案したコードのうち、修正なし、あるいは軽微な手戻りのみで本番マージされた比率の計測を開始する。破棄率が高い領域を特定することで、コンテキストの不足や仕様の曖昧さを洗い出す。
- エージェントが実行できるE2EテストループをCI/CDへ組み込む
Playwrightなどを活用し、エージェントが自身のパッチを自動適用してヘッドレス環境でテストを実行、エラーログをもとに自己修復できる仕組みを整備する。人間がバグを指摘して直させる往復をCIパイプライン内で機械的に完結させる。
- レビュー体制をAIゲートとシニア監査の2層に再編する
構文チェックや型定義、基本的なセキュリティ監査をAIレビューゲートへ完全に委譲する。人間のシニアエンジニアはシステム全体のドメイン設計、データ整合性、運用耐性の評価に集中する役割分担へと移行する。
単にAIツールを配る段階は終了した。テストインフラと検証ループを整備し、機械が生成した成果物を機械が検証できる開発環境を構築した組織だけが、コード生存率を80%台へ引き上げ、週次リリースのスピードを享受できる。
出典: ai.engineer
出典: biggo.com
出典: microsoft.com
