Digio インフラストラクチャ

AI モデルと GPU

今すぐマネージド フロンティア モデルでエージェントを実行します。あるいは、GPU 容量をレンタルし、独自の重みをデプロイし、同じワークスペース内のプライベート エンドポイントに Digio タスクをルーティングします。

クロード、GPT、ジェミニ エージェントごとのモデルの選択 GPUレンタルとBYOM
管理モデル

現在 Digio で入手可能なモデル

エージェントごとにデフォルトのモデルを割り当てるか、タスクごとにオーバーライドします。使用量はプラン残高から Digio トークンで測定されます。エージェントが Sonnet、GPT-4o、または Gemini Flash を呼び出しても、同じウォレットです。

人間的なクロード

  • Claude Opus 4.7 主要な推論、長いコンテキスト、アーキテクチャ、および戦略の作業。
  • Claude Opus 4.6 安定した高品質の分析を実現する前世代の Opus。
  • Claude Sonnet 4.6 毎日のドライバー - コーディング、書き込み、および複数ステップのエージェント ループ。
  • Claude Sonnet 4.5 / 4 サポートされているワークロードでのプロンプト キャッシュを備えた高速 Sonnet 層。
  • Claude Haiku 4.5 低遅延の下書き、分類、および大量のサブタスク。

B2B SaaS Web サイトの UI ラベル。自然言語に翻訳: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 一般およびエージェントのワークロード用の最新の GPT-5 ファミリ。
  • GPT-4.1 & GPT-4o 実稼働エージェント向けの信頼性の高いマルチモーダル チャットとツールの使用。
  • GPT-4o mini サマリーと軽量ステップのためのコスト効率の高いルーティング。
  • o3 / o3-pro / o3-mini / o4-mini 数学、計画、検証のための推論に重点を置いたモデル。
  • GPT-5.3 Codex & Codex mini コード生成、リファクタリング、およびリポジトリ対応エージェントのスキル。

Google ジェミニ

  • Gemini 2.5 Pro 長期にわたるコンテキストの調査と構造化された抽出。
  • Gemini 2.5 Flash 競争力のあるトークン レートによる高スループットのエージェント ステップ。
  • Gemini 2.0 Flash 解析、タグ付け、バッチ ジョブの超高速パス。

オープンかつ専門的な API

  • DeepSeek Chat & Reasoner チャットや思考連鎖スタイルのタスクに大きな価値があります。
  • Mistral Large 多言語エージェント チーム向けのヨーロッパホストのオプション。
  • Llama 3.3 70B API を介したオープンウェイト クラス モデル - プライベート GPU とうまく組み合わせます。
  • Grok 3 ニュースおよびソーシャル監視エージェント向けのリアルタイム指向モデル。
  • Sonar Pro 研究エージェント向けの検索に基づいた回答。
  • Command R+ RAG フレンドリーなエンタープライズ チャットおよび検索ワークフロー。

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

使用法

エージェントがモデルを選択する方法

コーディネーターは、タスクのタイプに基づいて、Sonnet、Opus、またはより安価なフラッシュ モデルを推奨します。パワー ユーザーは、Sonnet での調査、Opus での最終レビュー、Haiku または Gemini Flash での一括タグ付けなど、エージェントの役割ごとにデフォルトを設定します。

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

GPUレンタル

GPU をレンタルして独自のモデルを実行する

微調整、エアギャップチェックポイント、または予測可能な推論価格設定が必要ですか? Digio ワークスペースに専用の GPU 容量を追加し、好みのサービング スタックをインストールして、エージェントをプライベート エンドポイントにポイントします。

専用インスタンス

時間ごとまたは月ごとの GPU ノード (A100、H100、L40S クラス) がテナントに接続され、他の顧客から隔離されます。

あなたの体重

セーフテンソル、GGUF をアップロードするか、レジストリからプルします。 Llama、Mistral、Qwen を実行し、カスタム微調整を行います。

標準盛り

vLLM、TGI、Ollama、または管理するコンテナ イメージ - Digio エージェントは、OpenAI 互換のベース URL を呼び出します。

同じオーケストレーション

行うべきことは、チーム チャット、スキル、コラボレーションは変わらず、推論バックエンドだけがあなたのものになります。

ハイブリッドルーティング

機密ステップをプライベート GPU に送信し、1 つのワークフローで公開研究にクロードまたは GPT を使用します。

エンタープライズ管理

VPC ピアリング、静的出力、監査ログ、および規制対象チームのモデル許可リスト。

独自のモデルを持ち込む

カスタム モデルのインストールと接続

ゼロからエージェントがエンドポイントを呼び出すまでの一般的なセットアップ:

  1. GPUを予約する

    VRAM、リージョン、稼働時間 (バーストまたは常時オン) を選択します。ウェイト用のストレージはインスタンスに付属するか、バケットにマウントされます。

  2. スタックをデプロイする

    提供イメージまたは SSH を開始し、CUDA ドライバーをインストールし、チェックポイントをロードします。ヘルスチェックにより、モデルの準備ができていることが確認されます。

  3. エンドポイントの登録

    ワークスペース設定にベース URL、API キー、モデル ID を追加します。 Digio は、稼働前にレイテンシとトークン形式を検証します。

  4. エージェントに割り当てる

    選択したエージェントのデフォルトとしてプライベート モデルを選択します。管理対象の Claude/GPT モデルは引き続き並行して利用できます。

GPU のレンタルは、Digio プランのサブスクリプションとは別に請求されます。キャパシティ プランニング、SLA、既存の推論クラスターからの移行については、お問い合わせください。

よくある質問

モデルと GPU に関する質問

Digio でのマネージド API とセルフホスト推論の選択。

プランと API の 2 回支払いになりますか?

Digio サブスクリプションには、インフラストラクチャ、エージェント、および含まれる Digio トークンが含まれます。マネージド モデルの使用量は、実際の入出力トークンによってトークンのバランスを引き落とします。 GPU レンタルは、制御するマシンのアドオンです。

エージェントごとに異なるモデルを使用できますか?

はい - 各エージェントは独自のデフォルトを持つことができます。タスクとチャットは、グローバルなデフォルトを変更せずに、1 回の実行で上書きできます。

ソネットとオーパスの違いは何ですか?

Opus は、より困難な推論とより長い一貫性のある計画向けに調整されています。 Sonnet は日常のエージェント ループにとって高速かつ安価です。 Haiku および Flash クラスのモデルは、ボリュームのあるサブタスクに最適です。

自分のモデルのみを実行し、クラウド API をブロックすることはできますか?

エンタープライズ ワークスペースは、アウトバウンド モデル プロバイダーを制限し、すべてのエージェント トラフィックを GPU エンドポイントにルーティングできます。ハイブリッド モードは、ほとんどのチームのデフォルトです。

どの GPU サイズが利用可能ですか?

製品は地域と需要によって異なります。通常、7B ~ 70B クラスのモデルには 24 ~ 80 GB の VRAM 層があり、より大きなスタックにはマルチ GPU ノードが使用されます。パラメーター数と量子化に基づいて VRAM のサイズを決定するのに役立ちます。

プライベート GPU の使用でも Digio トークンを消費しますか?

オーケストレーション (エージェント、タスク、ストレージ) は計画に含まれます。 GPU での推論は GPU 時間として課金されます。オプションで、内部チャージバックのためにトークン形式の使用量を測定できます。

マネージド モデルを選択するか、GPU を持ち込んでください

今すぐ Claude と GPT を使い始めて、カスタム ウェイト (同じエージェント、同じタスク、推論) をホストする準備ができたら、専用 GPU を追加します。