メインコンテンツにスキップ
2人のデータセンターエンジニアが、サーバーラックを背景にタブレット上の情報を確認している。

コパッケージドオプティクスとプラガブル:総所有コスト分析

クラスターが100,000台のアクセラレーターと次世代スイッチング速度に向けて拡大するにつれ、従来のプラガブルオプティクスは物理的および熱的な限界に達しています。総所有コスト(TCO)分析では、電力、冷却機能、施設の設置面積がますます制限される中、ハイパースケーラーがより多くのコンピューティングを提供する上でコパッケージドオプティクス(CPO)がどのように役立つかを示します。

読了時間:5分

AI帯域幅の需要の急増により、エンジニアは、ネットワークアーキテクチャーがシステムパフォーマンスと長期的なコストの両方にどのように影響するかを再度検討するよう迫られています。電気信号は、高周波で標準PCBを横断すると急速に劣化するため、長い銅トレースやケーブルを介してフェイスプレートケージまでデータを出力するには、電力容量が大量に消費されます。厳格な電力購入契約により、ハイパースケールのサイトで電力網から引き出すことができる総ワット数が制限されることもよくあります。ネットワークファブリックを実行するため1メガワットを割り当てるごとに、実際の処理で1メガワット分が利用できなくなるため、事業者は効率的なアーキテクチャーを最優先することとなります。

スイッチプロセッサーと光エンジン間の電気経路を短縮することで、長い高速銅線経路に伴う信号再構成の負担を軽減します。また、帯域幅を拡張するためのより効率的な経路も形成します。設計エンジニアにとって主な課題は、シグナルインテグリティと電力です。しかし、クラスターレベルでは、結果として生じるアーキテクチャーも、利用可能なコンピューティングの提供コストに影響を与えます。実質的な総所有コストを比較する場合、ハードウェアの購入価格だけでなく、各アーキテクチャーが5~10年のライフサイクルにわたってコンピューティングを提供するコストにどのように影響するかを測定する必要があります。

ここでの分析は、あらゆる条件に対して一律の最適解を示しているわけではありません。プラガブルは、保守性と短期的なコストの低減が重視される場面で魅力的となる一方、CPOは、電力と密度の制限が厳しくなるにつれてより魅力的になります。その中間的なものとして、近傍パッケージドオプティクス(NPO)は、銅トレース長を短縮する実用的な方法となります。しかし、200G SerDesを超える場合、CPOの方がより詳細なコンポーネント統合を実現し、消費電力を減らして、信号対雑音比(S/N)を向上させます。感度分析は、さまざまな導入仮定の下で結果がどのように変化するかを示すことができます。これは、光アーキテクチャーがクラスターの経済性にどのように影響するかに焦点を当てる必要があります。

コパッケージドオプティクスとプラガブルの総所有コストの比較

プラガブルオプティクスは、多くの現行世代の展開において、引き続き実用的で保守可能な選択肢となっています。各トランシーバーは現場で交換でき、ポートあたりの現在のコストは、新しいCPO実装のコストよりも低い可能性があります。しかし、帯域幅が拡大するにつれて、信号損失と熱密度がネットワーク効率を低下させ、利用可能なコンピューティングの提供コストを高める場合があります。標準光モジュールがフルに搭載された128ポートスイッチフェースプレートは、約2kWの局所熱を生成します。その極端な熱出力を放散するには、従来の空冷アーキテクチャーでは実用的ではなくなり、実際のコンピュートタスクからメガワットが消費されてしまいます。

設備投資と初期ハードウェア展開コスト
メガワットあたり数百万ドルのコストで新しい施設を建設することが、これらの電力を必要とするクラスターを収容する唯一の方法となり、事業者は処理電力ではなく、ネットワークの維持に多額の資本を費やすことになります。

電力と冷却効率による運用上の節約
DSPリタイマーは、長い銅線経路間で信号を送信する際に、望まない遅延を発生させます。目標スループットに定期的に到達するには、この失われた処理時間を相殺するために、何千ものアクセラレーターを追加で購入する必要があります。

メンテナンスの現実と現場での保守性への影響
設計チームにとって、差し迫った懸念はシグナルインテグリティとネットワークパフォーマンスの維持です。これらの制約により、より多くのハードウェアが必要となる場合や、コンピューティングをサポートするために使用できるはずの電力が消費されると、総所有コストに影響することになります。

何千もの個別のプラガブルトランシーバーを設置して維持するなら、統計的に見て、頻繁なコンポーネントの故障は避けられません。CPOは、これらの頻繁な小さな故障を、滅多にない大型のシャーシスワップと交換することで、最終的に総ダウンタイムを削減し、クラスター全体の実質的な可用性を向上させます。

コパッケージドオプティクスがGPUの設置面積を縮小する方法

CPOは、ネットワーク効率を改善し、よりフラットなアーキテクチャーを作成することで、総所有コストを削減できます。事業者がこのセットアップを、同じ物理スペースにより多くの処理機能を詰め込んだ新しいアクセラレーターと組み合わせると、金銭的なメリットが増大します。光エンジンをスイッチプロセッサーのすぐ隣に配置することで、電力消費の多いDSPリタイマーが不要になり、ポートあたり最大10ワットを節約し、ネットワーク遅延の主な原因を排除できます。

事業者は、ハードウェアのほんの一部を使用して、パフォーマンス目標を達成しています。最新のMolex TCOモデリングでは、高度に最適化されたネットワークが、25,000台未満の次世代アクセラレーターを使用して100,000台のGPUの出力を生成できることが示されています。アクセラレーターとネットワークスイッチの購入台数を減らしながらも、同等のコンピューティングを可能にすることで、5年間のライフサイクルで何十億ドルもの設備投資の節約と長期的な電気料金の節約を実現できます。

CPOは、ハードウェア全体の設置面積を削減するだけでなく、残りのラックの物理的レイアウトも簡素化します。ブラインド嵌合インターフェースを介してファイバーを配線することで、通常のフロントパネルの乱雑さをすっきりとできます。シャーシをデータセンターの床に設置する前にケーブル設備全体を構成して検証することで、開始を遅らせる設置ミスを回避できます。また、故障した機器の交換も迅速化して容易になります。

既存の施設制約内でコンピューティングを拡張する

ハードウェアの設置面積を縮小することで、ハイパースケーラーが施設の拡張やラックレベルの接続に対し、どのように対応するかが大幅に変わります。コンピューティングパワーをより少ないラックに統合することで、貴重な床面積と無駄になっていたメガワットを有効活用できるため、事業者はまったく新しい建物に資金をつぎ込むのではなく、既存のデータセンターをアップグレードできます。さらに、厳格な電力購入契約により、ハイパースケールのサイトで電力網から引き出すことができる総ワット数が制限されることもよくあります。入力電力に厳しい制限があるため、実際の処理のために電力網容量を確保するには、ネットワークファブリックによって引き込まれる電力を最小限に抑えることが唯一の解決策となります。

高速銅線はサーバー内の短距離配線処理には引き続き使用されていますが、距離が1メートルを超えると、物理的な限界にぶつかります。帯域幅が銅線の物理的限界を超えた場合、ラック間の接続には光スケールアップリンクが代わりに使用されます。速度が上昇し、距離のニーズが標準的な銅線配線で処理できる範囲を超えるため、光学系への移行は、選択肢ではなく、必須になります。

ワークロードに適したアーキテクチャーの選択

導入が行われるたびに、総所有コストの算出方法は変わります。プラガブルとコパッケージドオプティクスを比較する場合、従来のモジュールは小規模または現行世代のシステムに引き続き適しており、一方でCPOは、電力とスケールの制約が厳しくなるにつれてより魅力的になります。プラガブルは使い慣れたメンテナンスルーチンで利用でき、初期コストも削減されますが、帯域幅が拡大することで電気的到達距離や熱密度が限界に達すると、CPOの方がよりメリットが大きくなります。

最終的に、総所有コストの比較では、これらのエンジニアリング上の制約は、利用可能なコンピューティングの経時的な提供コストに変換されます。多くの場合、主な利点となるのは、既存の施設により多くのコンピューティングを導入できることです。損益分岐点は、各事業者の前提によって変わります。

ハイブリッド光接続への移行

信頼性の高いファイバー対シリコンアーキテクチャーを実装するには、データセンターファブリック全体で標準化された高公差のインターコネクトが必要です。これらの接続は、統合リスクを軽減し、CPOの総所有コストのメリットをサポートします。

Molexは、シリコンを広範なネットワークに直接接続する、完全な光ハイウェイポートフォリオを提供しています。アプリケーションに最適化されたインターコネクトをリーフスイッチ、スパイン、サーバーネットワークインターフェースカード(NIC)、スケールアップインターコネクト全体に供給することで、調達を簡素化し、設計エンジニアの統合リスクを軽減できます。

高密度ファイバーカップリング技術
TeraVERSEは、拡張ビーム光のセルフアライメントインターフェースを使用して、時間のかかる手動の光アライメントなしで厳しい許容差仕様を満たす、新しいファイバー・チップ間のカップリング技術を提供します。この着脱可能な接続により、メーカーは高密度の光パッケージをより迅速かつ確実に組み立てることができます。

信頼性の高い光電力の供給
ELSFP相互接続システムは、外部レーザー光源から光チップへの継続的な光電力供給を確保します。ホストとプラガブルモジュール間のブラインド嵌合接続により、貴重なスペースを節約し、現場でのサービスが容易になり、クラスターをスムーズに稼働させて、外部レーザー光源から光チップへの光電力供給を可能にします。ホストとプラガブルモジュール間のブラインド嵌合接続により、貴重なスペースを節約し、現場でのサービスが容易になり、クラスターをスムーズに稼働させます。

モジュラーのバックプレーンと接続の効率化
Versatile Format Interconnect(VFI)光バックプレーンコネクターは、ラックの配線でプラグアンドプレイのモジュール性を可能にします。これらの複雑な接続をバックプレーンに移動することで、ヒューマンエラーが軽減され、大量生産のための予測性の高い製造プロセスが確立されます。さらに、VersaBeam拡張ビーム光(EBO)インターフェースは、トランクおよびブラインド嵌合アプリケーションにおけるラックの導入を迅速化します。この接続の効率化により、データセンターの立ち上げ時間が最大85パーセント短縮されます。

データセンター向けのMolex CPOソリューションが、統合リスクの低減、コンピューティング単位あたりのコストの低減、電力効率の向上にどのように役立ち、ハイパースケールの制約内で利用可能なコンピューティングを拡張するかをご覧ください。

その他のリソース


アプリケーション

AIデータセンター向けコパッケージドオプティクス

光レーザーをスイッチプロセッサーに恒久的に取り付けると、一度の故障により、基板全体を交換することになり、コストを跳ね上げて深刻な中断を引き起こす可能性があります。MolexのCPOソリューションは、プラガブル外部モジュールを使用して熱に敏感なレーザーを高温になるプロセッサーから切り離し、早期故障を防止して、ハードウェア投資を長期的に保護します。

サーバーラックの横に立ってノートパソコンで作業しているデータセンターのエンジニア。高速データ接続を示すデジタルブルーのラインがラック上で光っている。

アプリケーション

データセンターの高パフォーマンス化を実現する光ファイバー接続

データセンターの高速化によりケーブル数が増えるにつれてラックスペースが混雑し、ケーブル管理とメンテナンスがより複雑になります。Molexの光ファイバーポートフォリオが、手動終端、クリーニング、現場テストを最小限に抑え、セットアップ時間と総所有コスト(TCO)を削減する方法をご覧ください。

AIデータセンターの光ファイバー用コネクター。

ブログ

インターコネクトをチップに近づける

224Gの速度では、従来のPCBルーティングは性能面で2つの大きなの制約に直面します。1つは、長いトレースでは信号が急速に劣化するため、電力と熱が増加するということです。もう1つは、高密度プロセッサーでは、1,024以上の接続が必要となる場合がありますが、そのようなスペース内では、標準ボードは効率的にルーティングできないということです。MolexのCPOソリューションがインターコネクトをチップに近づけて、より高密度で高速なアーキテクチャーをサポートする方法についてご覧ください。

高速コンピューティングインフラストラクチャをサポートする最新のデータセンター内の高密度サーバーラックの列。