> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/ja/roboflow-cloud/serverless-api/model-pricing.md).

# モデルの料金

Serverless Cloud API で提供されるモデルのクレジット価格（画像 1,000 枚あたり）。

Serverless Cloud API の画像推論は、画像ごとにクレジットで課金されます。このページの各価格は、標準レートでの画像1,000枚あたりのクレジット数であり、小数点以下4桁に丸めています。各行は最小サイズから価格が設定されたモデルアーキテクチャであり、各セクションを展開するとすべてのサイズが表示されます。

月間使用量がしきい値を超えると、自動的にボリューム割引が適用されます。 [料金](/deployment/ja/roboflow-cloud/serverless-api/pricing.md) は、Workflow の実行や、どの失敗したリクエストが課金対象になるかを含め、課金の仕組みを説明しています。動画は別途 [Serverless Video Streaming](/deployment/ja/roboflow-cloud/serverless-api/serverless-video-streaming-api.md).

## 物体検出

各アーキテクチャの最小サイズを使って、画像1,000枚あたりのクレジット数を COCO mAP 50:95 で割った値の昇順で並べています。精度の数値は [Roboflow モデルリーダーボード](https://leaderboard.roboflow.com/).

これらは、このタスクにおける最も効率的な5つのアーキテクチャです。

<table data-search="false"><thead><tr><th>モデル</th><th>画像1,000枚あたりのクレジット</th><th>サイズ</th><th>最高 COCO mAP 50:95</th></tr></thead><tbody><tr><td>RF-DETR</td><td>0.125</td><td>7</td><td>59.9%</td></tr><tr><td>YOLO26</td><td>0.125</td><td>5</td><td>56.3%</td></tr><tr><td>YOLOv12</td><td>0.125</td><td>5</td><td>54.0%</td></tr><tr><td>YOLOv11</td><td>0.125</td><td>5</td><td>53.6%</td></tr><tr><td>YOLOv10</td><td>0.125</td><td>6</td><td>53.6%</td></tr></tbody></table>

<details>

<summary>すべての物体検出モデルとサイズ</summary>

* RF-DETR
  * Nano: 0.125
  * Small、Base、Medium、Large: 0.1875
  * XL: 0.25
  * 2XL: 0.3125
* YOLO26
  * Nano: 0.125
  * Small、Medium、Large: 0.1875
  * XL: 0.25
* YOLOv12
  * Nano: 0.125
  * Small、Medium、Large: 0.1875
  * XL: 0.25
* YOLOv11
  * Nano: 0.125
  * Small、Medium、Large: 0.1875
  * XL: 0.25
* YOLOv10
  * Nano: 0.125
  * Small、Medium、Balanced、Large: 0.1875
  * XL: 0.25
* YOLOv8
  * Nano: 0.125
  * Small、Medium、Large: 0.1875
  * XL: 0.25
* YOLOv9
  * Tiny: 0.125
  * Small、Medium、Compact: 0.1875
  * Extended: 0.25
* YOLOv7
  * Tiny: 0.125
  * Base: 0.1875
  * X: 0.25
* YOLOv5
  * Nano: 0.125
  * Small、Medium、Large: 0.1875
  * XL: 0.25
* YOLOLite
  * Nano: 0.125
  * Small、Medium、Large: 0.1875
  * XL: 0.25
* YOLO-NAS
  * Small、Medium: 0.1875

</details>

## インスタンスセグメンテーション

価格の安い順に並べています。

これらは、このタスクにおける最も低価格な5つのアーキテクチャです。

<table data-search="false"><thead><tr><th>モデル</th><th>画像1,000枚あたりのクレジット</th><th>サイズ</th></tr></thead><tbody><tr><td>RF-DETR Seg</td><td>0.1875</td><td>7</td></tr><tr><td>YOLO26 Seg</td><td>0.1875</td><td>5</td></tr><tr><td>YOLOv11 Seg</td><td>0.1875</td><td>5</td></tr><tr><td>YOLOv8 Seg</td><td>0.1875</td><td>5</td></tr><tr><td>YOLOv5 Seg</td><td>0.1875</td><td>5</td></tr></tbody></table>

<details>

<summary>すべてのインスタンスセグメンテーションモデルとサイズ</summary>

* RF-DETR Seg
  * Nano: 0.1875
  * Small、Medium、Large、Preview: 0.25
  * XL、2XL: 0.3125
* YOLO26 Seg
  * Nano: 0.1875
  * Small、Medium、Large: 0.25
  * XL: 0.3125
* YOLOv11 Seg
  * Nano: 0.1875
  * Small、Medium、Large: 0.25
  * XL: 0.3125
* YOLOv8 Seg
  * Nano: 0.1875
  * Small、Medium、Large: 0.25
  * XL: 0.3125
* YOLOv5 Seg
  * Nano: 0.1875
  * Small、Medium、Large: 0.25
  * XL: 0.3125
* YOLACT
  * ResNet-101: 0.25

</details>

## セマンティックセグメンテーション

<table data-search="false"><thead><tr><th>モデル</th><th>画像1,000枚あたりのクレジット</th><th>サイズ</th></tr></thead><tbody><tr><td>YOLO26 Semantic Seg</td><td>0.25</td><td>5</td></tr><tr><td>DeepLabV3+</td><td>0.25</td><td>1</td></tr></tbody></table>

<details>

<summary>すべてのセマンティックセグメンテーションモデルとサイズ</summary>

* YOLO26 Semantic Seg
  * Nano、Small、Medium、Large、XL: 0.25
* DeepLabV3+
  * MobileNetV2: 0.25

</details>

## キーポイント検出

<table data-search="false"><thead><tr><th>モデル</th><th>画像1,000枚あたりのクレジット</th><th>サイズ</th></tr></thead><tbody><tr><td>YOLO26 Pose</td><td>0.125</td><td>5</td></tr><tr><td>YOLOv11 Pose</td><td>0.125</td><td>5</td></tr><tr><td>YOLOv8 Pose</td><td>0.125</td><td>5</td></tr><tr><td>RF-DETR Keypoint</td><td>0.25</td><td>1</td></tr></tbody></table>

<details>

<summary>すべてのキーポイント検出モデルとサイズ</summary>

* YOLO26 Pose
  * Nano: 0.125
  * Small、Medium、Large: 0.1875
  * XL: 0.25
* YOLOv11 Pose
  * Nano: 0.125
  * Small、Medium、Large: 0.1875
  * XL: 0.25
* YOLOv8 Pose
  * Nano: 0.125
  * Small、Medium、Large: 0.1875
  * XL: 0.25
* RF-DETR Keypoint
  * Preview: 0.25

</details>

## 分類

<table data-search="false"><thead><tr><th>モデル</th><th>画像1,000枚あたりのクレジット</th><th>サイズ</th></tr></thead><tbody><tr><td>ViT</td><td>0.0625</td><td>1</td></tr><tr><td>ResNet</td><td>0.0625</td><td>4</td></tr><tr><td>DINOv3 Probe</td><td>0.0625</td><td>2</td></tr></tbody></table>

<details>

<summary>すべての分類モデルとサイズ</summary>

* ViT
  * B/16: 0.0625
* ResNet
  * 18, 34, 50, 101: 0.0625
* DINOv3 Probe
  * Small: 0.0625
  * Base: 0.125

</details>

## オープンボキャブラリ検出

これらのモデルは、学習なしでテキストプロンプトから物体を検出します。

<table data-search="false"><thead><tr><th>モデル</th><th>画像1,000枚あたりのクレジット</th><th>サイズ</th></tr></thead><tbody><tr><td>YOLO-World</td><td>0.1875</td><td>8</td></tr><tr><td>Roboflow Instant</td><td>0.75</td><td>1</td></tr><tr><td>Grounding DINO</td><td>0.75</td><td>1</td></tr><tr><td>OWLv2</td><td>0.75</td><td>2</td></tr></tbody></table>

<details>

<summary>すべてのオープンボキャブラリ検出モデルとサイズ</summary>

* YOLO-World
  * S、M、L、X、v2-S、v2-M、v2-L、v2-X: 0.1875
* Roboflow Instant
  * 単一サイズ: 0.75
* Grounding DINO
  * Swin-T: 0.75
* OWLv2
  * Large、Large（微調整済み）: 0.75

</details>

## Segment Anything

プロンプト可能なセグメンテーションの基盤モデル。

<table data-search="false"><thead><tr><th>モデル</th><th>画像1,000枚あたりのクレジット</th><th>サイズ</th></tr></thead><tbody><tr><td>SAM 2</td><td>0.3125</td><td>4</td></tr><tr><td>SAM 3</td><td>0.5</td><td>2</td></tr><tr><td>SAM</td><td>0.5</td><td>1</td></tr></tbody></table>

<details>

<summary>Segment Anything のすべてのモデルとサイズ</summary>

* SAM 2
  * Hiera Tiny、Hiera Small: 0.3125
  * Hiera Base+、Hiera Large: 0.5
* SAM 3
  * Base、Large: 0.5
* SAM
  * ViT-H: 0.5

</details>

## OCR

PP-OCR は、ステージごとではなく実行ごとに課金されます。テキスト検出をオフにした呼び出しは認識のみのレートで課金され、検出をオンにしたあらゆる組み合わせは OCR レートで課金されます。

<table data-search="false"><thead><tr><th>モデル</th><th>画像1,000枚あたりのクレジット</th><th>サイズ</th></tr></thead><tbody><tr><td>PP-OCR（認識のみ）</td><td>0.125</td><td>3</td></tr><tr><td>TrOCR</td><td>0.3125</td><td>1</td></tr><tr><td>PP-OCR（検出 + 認識）</td><td>0.375</td><td>3</td></tr><tr><td>DocTR</td><td>0.375</td><td>1</td></tr><tr><td>EasyOCR</td><td>0.375</td><td>1</td></tr></tbody></table>

<details>

<summary>OCR のすべてのモデルとサイズ</summary>

* PP-OCR（認識のみ）
  * Tiny、Small、Medium: 0.125
* TrOCR
  * 単一サイズ: 0.3125
* PP-OCR（検出 + 認識）
  * Tiny、Small、Medium: 0.375
* DocTR
  * 単一サイズ: 0.375
* EasyOCR
  * 単一サイズ: 0.375

</details>

## 埋め込み

<table data-search="false"><thead><tr><th>モデル</th><th>画像1,000枚あたりのクレジット</th><th>サイズ</th></tr></thead><tbody><tr><td>CLIP</td><td>0.125</td><td>3</td></tr><tr><td>Perception Encoder</td><td>0.3125</td><td>1</td></tr></tbody></table>

<details>

<summary>すべての埋め込みモデルとサイズ</summary>

* CLIP
  * ViT-B/16、ViT-B/32: 0.125
  * ViT-L/14: 0.1875
* Perception Encoder
  * 単一サイズ: 0.3125

</details>

## 深度推定

<table data-search="false"><thead><tr><th>モデル</th><th>画像1,000枚あたりのクレジット</th><th>サイズ</th></tr></thead><tbody><tr><td>Depth Anything V3</td><td>0.3125</td><td>2</td></tr><tr><td>Depth Anything V2</td><td>0.3125</td><td>1</td></tr></tbody></table>

<details>

<summary>すべての深度推定モデルとサイズ</summary>

* Depth Anything V3
  * Small: 0.3125
  * Base: 0.75
* Depth Anything V2
  * Small: 0.3125

</details>

## 実行時間の料金

カスタム Python ブロックと視覚言語モデルは、画像ごとではなく実行時間に対して課金されます。1 クレジットで 500 実行秒を購入できます。

<table data-search="false"><thead><tr><th>ワークロード</th><th>1 クレジットあたりの実行秒数</th><th>1 秒あたりのクレジット</th><th>1 時間あたりのクレジット</th></tr></thead><tbody><tr><td>カスタム Python ブロック</td><td>500</td><td>0.002</td><td>7.2</td></tr><tr><td>視覚言語モデル</td><td>500</td><td>0.002</td><td>7.2</td></tr></tbody></table>

### 視覚言語モデル

すべての視覚言語モデルは、プロンプトや出力トークン数に関係なく、上記のレートで実行時間に対して課金されます。

<table data-search="false"><thead><tr><th>モデル</th><th>1 クレジットあたりの実行秒数</th></tr></thead><tbody><tr><td>PaliGemma 2</td><td>500</td></tr><tr><td>Florence 2</td><td>500</td></tr><tr><td>Qwen2.5 VL</td><td>500</td></tr><tr><td>Qwen3 VL</td><td>500</td></tr><tr><td>Qwen3.5</td><td>500</td></tr><tr><td>SmolVLM</td><td>500</td></tr><tr><td>Cosmos 3（Edge）VLM</td><td>500</td></tr><tr><td>Moondream</td><td>500</td></tr><tr><td>Gemma 4</td><td>500</td></tr><tr><td>Mage-VL</td><td>500</td></tr><tr><td>GLM-OCR</td><td>500</td></tr></tbody></table>

画像ごとに 2.5 秒、10,000 画像にわたって視覚言語モデルを実行するステップは、25,000 実行秒、つまり 50 クレジットを使用します。

## ボリューム割引

ボリューム割引は段階制です。各レートはその帯域に入る画像にのみ適用され、しきい値未満の画像は属する帯域のレートのままです。帯域は、カレンダー月ごとのワークスペース全体のすべてのモデル合計で計算されます。帯域を選択すると、その帯域内の画像に適用されるレートを確認できます。

{% tabs %}
{% tab title="最初の 25 万" %}
標準レート。毎月最初の 250,000 画像に対して課金されます。

<table data-search="false"><thead><tr><th>標準レート</th><th>このレートのモデル</th><th>この帯域のレート</th></tr></thead><tbody><tr><td>0.0625</td><td>分類モデル</td><td>0.0625</td></tr><tr><td>0.125</td><td>Nano 検出、CLIP、PP-OCR 認識のみ</td><td>0.125</td></tr><tr><td>0.1875</td><td>Small〜Large 検出、Nano セグメンテーション</td><td>0.1875</td></tr><tr><td>0.25</td><td>XL 検出、Small〜Large セグメンテーション</td><td>0.25</td></tr><tr><td>0.3125</td><td>XL セグメンテーション、SAM 2 Tiny/Small</td><td>0.3125</td></tr><tr><td>0.375</td><td>OCR パイプライン</td><td>0.375</td></tr><tr><td>0.5</td><td>Segment Anything</td><td>0.5</td></tr><tr><td>0.75</td><td>オープンボキャブラリ検出、Depth Anything V3 Base</td><td>0.75</td></tr></tbody></table>
{% endtab %}

{% tab title="25万〜50万" %}
25% 割引。

<table data-search="false"><thead><tr><th>標準レート</th><th>このレートのモデル</th><th>この帯域のレート</th></tr></thead><tbody><tr><td>0.0625</td><td>分類モデル</td><td>0.0469</td></tr><tr><td>0.125</td><td>Nano 検出、CLIP、PP-OCR 認識のみ</td><td>0.0938</td></tr><tr><td>0.1875</td><td>Small〜Large 検出、Nano セグメンテーション</td><td>0.1406</td></tr><tr><td>0.25</td><td>XL 検出、Small〜Large セグメンテーション</td><td>0.1875</td></tr><tr><td>0.3125</td><td>XL セグメンテーション、SAM 2 Tiny/Small</td><td>0.2344</td></tr><tr><td>0.375</td><td>OCR パイプライン</td><td>0.2813</td></tr><tr><td>0.5</td><td>Segment Anything</td><td>0.375</td></tr><tr><td>0.75</td><td>オープンボキャブラリ検出、Depth Anything V3 Base</td><td>0.5625</td></tr></tbody></table>
{% endtab %}

{% tab title="50万〜100万" %}
50% 割引。

<table data-search="false"><thead><tr><th>標準レート</th><th>このレートのモデル</th><th>この帯域のレート</th></tr></thead><tbody><tr><td>0.0625</td><td>分類モデル</td><td>0.0313</td></tr><tr><td>0.125</td><td>Nano 検出、CLIP、PP-OCR 認識のみ</td><td>0.0625</td></tr><tr><td>0.1875</td><td>Small〜Large 検出、Nano セグメンテーション</td><td>0.0938</td></tr><tr><td>0.25</td><td>XL 検出、Small〜Large セグメンテーション</td><td>0.125</td></tr><tr><td>0.3125</td><td>XL セグメンテーション、SAM 2 Tiny/Small</td><td>0.1563</td></tr><tr><td>0.375</td><td>OCR パイプライン</td><td>0.1875</td></tr><tr><td>0.5</td><td>Segment Anything</td><td>0.25</td></tr><tr><td>0.75</td><td>オープンボキャブラリ検出、Depth Anything V3 Base</td><td>0.375</td></tr></tbody></table>
{% endtab %}

{% tab title="100万〜200万" %}
60% 割引。

<table data-search="false"><thead><tr><th>標準レート</th><th>このレートのモデル</th><th>この帯域のレート</th></tr></thead><tbody><tr><td>0.0625</td><td>分類モデル</td><td>0.025</td></tr><tr><td>0.125</td><td>Nano 検出、CLIP、PP-OCR 認識のみ</td><td>0.05</td></tr><tr><td>0.1875</td><td>Small〜Large 検出、Nano セグメンテーション</td><td>0.075</td></tr><tr><td>0.25</td><td>XL 検出、Small〜Large セグメンテーション</td><td>0.1</td></tr><tr><td>0.3125</td><td>XL セグメンテーション、SAM 2 Tiny/Small</td><td>0.125</td></tr><tr><td>0.375</td><td>OCR パイプライン</td><td>0.15</td></tr><tr><td>0.5</td><td>Segment Anything</td><td>0.2</td></tr><tr><td>0.75</td><td>オープンボキャブラリ検出、Depth Anything V3 Base</td><td>0.3</td></tr></tbody></table>
{% endtab %}

{% tab title="200万〜500万" %}
70% 割引。

<table data-search="false"><thead><tr><th>標準レート</th><th>このレートのモデル</th><th>この帯域のレート</th></tr></thead><tbody><tr><td>0.0625</td><td>分類モデル</td><td>0.0188</td></tr><tr><td>0.125</td><td>Nano 検出、CLIP、PP-OCR 認識のみ</td><td>0.0375</td></tr><tr><td>0.1875</td><td>Small〜Large 検出、Nano セグメンテーション</td><td>0.0563</td></tr><tr><td>0.25</td><td>XL 検出、Small〜Large セグメンテーション</td><td>0.075</td></tr><tr><td>0.3125</td><td>XL セグメンテーション、SAM 2 Tiny/Small</td><td>0.0938</td></tr><tr><td>0.375</td><td>OCR パイプライン</td><td>0.1125</td></tr><tr><td>0.5</td><td>Segment Anything</td><td>0.15</td></tr><tr><td>0.75</td><td>オープンボキャブラリ検出、Depth Anything V3 Base</td><td>0.225</td></tr></tbody></table>
{% endtab %}

{% tab title="500万超" %}
80% 割引。

<table data-search="false"><thead><tr><th>標準レート</th><th>このレートのモデル</th><th>この帯域のレート</th></tr></thead><tbody><tr><td>0.0625</td><td>分類モデル</td><td>0.0125</td></tr><tr><td>0.125</td><td>Nano 検出、CLIP、PP-OCR 認識のみ</td><td>0.025</td></tr><tr><td>0.1875</td><td>Small〜Large 検出、Nano セグメンテーション</td><td>0.0375</td></tr><tr><td>0.25</td><td>XL 検出、Small〜Large セグメンテーション</td><td>0.05</td></tr><tr><td>0.3125</td><td>XL セグメンテーション、SAM 2 Tiny/Small</td><td>0.0625</td></tr><tr><td>0.375</td><td>OCR パイプライン</td><td>0.075</td></tr><tr><td>0.5</td><td>Segment Anything</td><td>0.1</td></tr><tr><td>0.75</td><td>オープンボキャブラリ検出、Depth Anything V3 Base</td><td>0.15</td></tr></tbody></table>
{% endtab %}
{% endtabs %}

たとえば、1 か月で RF-DETR Small を通した 600,000 画像は、最初の 250,000 が 0.1875、次の 250,000 が 0.1406、最後の 100,000 が 0.0938 として課金され、合計 91.41 クレジットになります。

## 別途価格設定されているモデル

動画トラッカーの SAM 2 Video と SAM 3 Video は Serverless Video 上で実行され、料金は [Serverless Video Streaming](/deployment/ja/roboflow-cloud/serverless-api/serverless-video-streaming-api.md).
