出来事の発生日:2026年2月5日。 Comma.aiは、自社オフィス内で運営するコンピューティング施設についての詳細な説明を公開し、機械学習の負荷が安定している組織は、クラウド容量を借りる代わりにインフラを所有することで、コスト面とエンジニアリング面の利点を得られると主張した。同社は、このデータセンターに約500万ドルを費やしたと見積もっており、同等のクラウド利用にかかる2,500万ドル超と比較している。

これらの数字はComma.ai自身の推計であって、独立した価格比較ではなく、その構成は特殊なワークロードを反映している。この施設では、同社のモデル訓練、指標処理、データ保存を実行し、最大需要時には約450キロワットに達する。電気料金は大きな支出であり、同社によると、1キロワット時当たりの料金が40セントを超えるサンディエゴで、2025年に電力代として54万112ドルを支出した。

冷却には従来型のコンピューター室用空調システムではなく、主に外気を利用している。大型の吸気ファンと排気ファンが空間内に空気を通し、再循環ファンが温かい排気と流入する外気を混ぜ、湿度を45%未満に保つ。1台のサーバーに取り付けられたセンサーが、温度と湿度に応じてファンを調整する制御ループにデータを送る。Comma.aiによると、この仕組みの消費電力はわずか数十キロワットだ。

演算能力の大半は、自社で組み立てた75台のTinyBox Proに搭載された600基のGPUで構成される。各システムは2基のCPUと8基のGPUを備え、モデル訓練にも一般的なタスクにも利用できる。同社によると、自社製マシンの故障率は既製品と同程度である一方、社内で組み立てているため修理は迅速に行える。

ストレージは、ソリッドステートドライブを満載したDell R630およびR730サーバーの複数のラックを占め、合計約4ペタバイトを提供している。容量3ペタバイトの主要アレイは、個々の記録は重要ではないと同社が判断しているため、冗長化せずに走行データを保存している。総読み出し速度は毎秒約1テラバイトで、未加工データから直接訓練できるとしている。別の約300テラバイトのアレイが処理済み結果をキャッシュし、さらに別の冗長化システムが訓練済みモデルと指標を保持する。

相互接続された3台の100ギガビット・イーサネットスイッチが主要ネットワークを構成する。2台のInfiniBandスイッチが、分散処理のために訓練用マシン群を接続している。Ubuntuはネットワーク経由でインストールされ、Saltがサーバーを管理し、Slurmが計算処理をスケジューリングする。訓練にはPyTorchの分散型Fully Sharded Data Parallelシステムを使用し、Minirayと呼ばれる軽量のオープンソース・スケジューラーが、空いているマシンにその他のPythonタスクを送る。

Comma.aiの事例は、一般的な処方箋ではない。ハードウェアを所有すれば、電力、冷却、ネットワーク、修理、容量計画に対する責任は運営者に移り、同社は一部サービスの冗長性を低くする代わりに、可用性99%を目標としている。同社の経験が示すのは、むしろ具体的な参考例だ。需要が持続的で、技術的に予測可能な場合には、小規模な専門チームが、クラウドの柔軟性と引き換えに、より低いと主張するコスト、直接的な管理、単一のワークロードに最適化されたインフラを得られる可能性がある。