AI支援によるインシデント対応の魅力は高まっている。深夜にチームがまさに望むこと、つまりアラートを調査し、テレメトリを比較し、騒がしい通知のたびにエンジニアを起こすことなく、修正案を提示したり、場合によっては修正を適用したりできるためだ。しかし最近の論考は、同じ能力によって、まれで複雑な障害がついに自動化をすり抜けたとき、対応担当者の習熟度が低下しているという、より目立たない長期的問題が生じる可能性があると指摘する。

中心的な懸念は単純だ。AIシステムが日常的なインシデントを十分うまく処理すれば、人間は自分たちのサービスがどのように障害を起こすのかについて直感を養う機会を失う。最も困難なインシデントは、見慣れたものとは異なることが多いため、これは重要だ。そうした場面でもエンジニアは、シグナルを解釈し、人員を調整し、以前ほど深く把握していないかもしれないシステムについて推論しなければならない。著者はこの隔たりを「理解負債」の一形態と呼ぶ。ソフトウェアが担う作業が増えるほど、その周囲にいる人々の理解が浅くなる可能性があるという意味だ。

この論考は、そのリスクをヒューマンファクター研究者のリサン・ベインブリッジが1983年に指摘した古典的な自動化の問題と結び付けている。記事内で要約された同氏の主張によれば、自動化は通常業務を練習する機会を減らす一方、異例で重大な結果を伴うエッジケースへの対処責任は人間に残す可能性がある。言い換えれば、機械は簡単な部分をさらに簡単にしながら、残された人間にとって難しい部分をいっそう難しくし得る。

記事は、自動化が一般的でありながら訓練が徹底されている航空業界も参考にしている。パイロットは今もシミュレーターでまれな障害を訓練し、それを定期的に行っている。自動化によって緊急事態がなくなるとは想定されていないからだ。想定されているのは、自動化によって運用者に求められる能力の種類が変わるということだ。著者はこの類比を用い、ソフトウェアチームは判断力を置き換えることよりも、それを維持することを重視すべきだと論じている。

その維持は受動的ではなく、能動的に行える。この論考は、インシデント管理ツールとLLMを活用した関係者役を使って構築されたインシデントシミュレーションについて説明している。そこでは、エンジニアが管理された環境で障害対応を訓練する。こうした演習は、実際の障害が教訓をもたらすのを待つことなく、プレッシャー、不確実性、調整上の要求を再現することを目的としている。重要なのは、事後にAIが何が起きたかを説明するのを見ることではない。実際に重大な結果が生じる状況になる前に、人間自身が作業する機会を得ることだ。

より広い主張は、AIインシデント対応ツールが悪いというものではない。著者によれば、こうしたツールは有用であり、特に日常的な問題を修正して人々を眠らせたままにしてくれるときには、魔法のように感じられることも多い。警告しているのは、簡単な事例での速さが、難しい事例に備える訓練不足を覆い隠しかねないという点だ。平均対応時間が改善する一方で高度なトラブルシューティング能力が衰えれば、チームは、自分たちのシステムが機械には理解できても、その責任を負う人間には以前より読み解きにくいものになっていたと、手遅れになってから気付くかもしれない。

エンジニアリング部門のリーダーにとって、これは単純な運用上の転換を示唆する。AIは初動対応のより多くを処理できるが、チームには依然として、定期的な実践型のインシデント対応、障害シミュレーション、不確実な状況に向き合うことを人々に強いる体系的な演習が必要だ。自動化はアシスタントにはなれる。だが、実践の代用品にしてはならない。