「The model is overloaded」は、自分側が原因ではない唯一のGeminiエラーです。そのモデルのサービングプールに現在容量がありません。プロジェクト設定で防ぐことはできません。制御できるのは、どれだけ穏当に障害を乗り切るか、解消しない場合にどのフォールバックを選ぶかです。
エラー
{
"error": {
"code": 503,
"message": "The model is overloaded. Please try again later.",
"status": "UNAVAILABLE"
}
}原因と対処法の概要
| 原因 | 対処法 |
|---|---|
| そのモデルのサービングプールで需要が急増 | ジッター付き指数バックオフ。急増は通常、数秒から数分で収まります。 |
| プレビュー/実験的モデルのバリアント | -expおよびプレビュービルドは小規模なプールで動作し、最初に過負荷になります。本番環境では安定版エイリアスを固定してください。 |
| ピーク時間帯の重いリクエスト | 巨大なコンテキストや最大出力上限を設定したリクエストは、負荷時に処理対象から外されやすくなります。不要な内容を削り、レスポンスをストリーミングしてください。 |
503 UNAVAILABLEであり、429ではないことを確認する
429 RESOURCE_EXHAUSTEDはあなたの割当量で、503 UNAVAILABLEはGoogle側の容量です。この違いがその後の対応をすべて決めます。割当量エラーには請求または制限の変更が必要で、容量エラーには再試行とフォールバックが必要です。503に対してプロジェクト設定を調べても意味はありません。そこに原因はありません。
バックオフで再試行する — ただし予算を決める
503は定義上、再試行可能です。429と同じジッター付き指数バックオフを使用してください(Claude 429ガイドのスニペットはそのまま使え、すでに500番台のステータスを再試行します)。ただし、呼び出し側が許容できる時間で合計待機時間に上限を設けてください。1分間に約5回試行しても続く過負荷は、すぐには解消しません。
再試行を使い切ったら、ループではなくモデルを変更する
必要になる前にフォールバックチェーンを用意してください。プレビュービルドを使っていたなら安定版エイリアス、2.5 Proが苦戦しているならgemini-2-5-flash(逆も同様)、または失敗させられないリクエストでは別プロバイダーを選びます。フォールバックは障害を品質低下へ変換します。
Kunavo経由で呼び出している場合
この障害モードが、Kunavoがリクエスト内部で再試行する理由です。モデルに複数のアップストリームチャネルが設定されている場合、失敗した試行はエラーが表示される前に別チャネルへ切り替わります。一時的なアップストリーム障害が503ではなく、遅い成功になります。失敗したリクエストには一切課金されません。また、1つのキーでGemini、Claude、GPTを利用できるため、ステップ3のプロバイダー間フォールバックは2つ目の統合ではなくモデル文字列の変更で済みます。 フォールバックモデルを検討中ですか?Geminiファミリー全体のトークン単価は、Googleの表示価格と並べて Gemini API料金一覧.
よくある質問
503を返すリクエストにも課金されますか?
いいえ。推論前にリクエストが拒否されるため、Googleから課金されず、Kunavoでも失敗したリクエストには課金されません。503のコストはトークンではなく、遅延と再試行です。
Geminiの過負荷はどのくらい続きますか?
通常は数秒から数分です。新しいモデルの公開初日に発生する急増は、より長く続くことがあります。そのため、妥当な方針は数回のバックオフ再試行後にフォールバックモデルへ切り替えることであり、無制限の再試行ループではありません。
有料ティアへアップグレードすれば503は止まりますか?
いいえ。有料ティアで増えるのは割当量(429系)ですが、503 UNAVAILABLEは共有サービング容量の問題です。プールが飽和すれば無料トラフィックも有料トラフィックも発生します。対策は請求ではなくフォールバックです。