Skip to main content
W&B から NVIDIA NeMo Inference Microservice にモデルアーティファクトをデプロイします。これを行うには、W&B Launch を使用します。W&B Launch はモデルアーティファクトを NVIDIA NeMo Model に変換し、実行中の NIM/Triton サーバーにデプロイします。 W&B Launch は現在、以下の互換性のあるモデルタイプをサポートしています。
  1. Llama2
  2. StarCoder
  3. NV-GPT (近日対応予定)
デプロイ時間は、モデルとマシンタイプによって異なります。ベースの Llama2-7b 設定では、Google Cloud の a2-ultragpu-1g で約 1 分かかります。

クイックスタート

  1. まだ作成していない場合は、Launch queue を作成します。以下にキュー設定の例を示します。
  2. プロジェクト内でこのジョブを作成します。
  3. GPU マシンでエージェントを起動します。
  4. Launch UI から、必要な設定を指定してデプロイ用の launch ジョブを送信します。
    1. CLI から送信することもできます。
  5. Launch UI でデプロイの進行状況をトラッキングできます。
  6. 完了したら、すぐにエンドポイントに curl リクエストを送ってモデルをテストできます。モデル名は常に ensemble です。