本発表では、エンタープライズAIにおける次の制約は「知性」ではなく「利用率」にあるという指摘に基づき、成熟したGPU管理プラクティスを具体的に示した制約認識型GPUアロケータが紹介されました。
この新しいアロケータは、従来のFIFO(先入れ先出し)スケジューラと比較検証され、同一のハードウェアと同一のワークロード条件下で、GPU利用率が最大で33パーセンテージポイント増加し、優先度加重出力が全シナリオで最大105パーセント増加するという結果が得られました。
この性能向上の要因はハードウェアの変更ではなく、「割り当て決定が行われる順序」の変更にあります。
システムが実行できる具体的な決定は「GPUを忙しく保つ」という抽象的な指示ではなく、「どのGPUが、どのジョブを、どのタイムステップで、どの優先度で実行するか」という、GPU、ジョブ、タイムステップの組み合わせごとに二値の選択を行う、より具体的で困難な問題です。
競合するワークロードには、トレーニング、リアルタイム推論、バッチ推論、量子化の4種類があり、これらは「バッチ型」(開始後、ジョブ完了まで連続したGPUブロックを必要とする)と「弾性型」(タイムステップごとに需要曲線に従って増減するリアルタイム推論)という2つの異なる割り当て形状に分類されます。
この互換性のない形状が同じハードウェアで競合することが、本質的な課題となっています。
比較の基準となったFIFOスケジューラは、リアルタイム推論を固定予約で処理し、その他のジョブを到着順に処理するものです。
システムに余裕がある状況ではFIFOでも十分ですが、リソースが逼迫する「競合状態」において、割り当ての順序が利用率に大きなコストを発生させることが明らかになりました。
本研究は、この競合状態における効率的なGPUリソース管理の新たな指針を提供しています。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。
Hugging Face
Same Cluster, 33 Points More Utilization: What Changed Was the Order
原文の記事を確認する ↗