> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/workflows/ja/burokku/blocks/run-a-model/llama3-2-vision.md).

# Llama 3.2 Vision

## v2

Llama 3.2 Visionモデルに質問してください。

任意のテキストプロンプトまたは事前定義済みのものを指定できます。このブロックは次の種類のプロンプトをサポートしています:

* **オープンプロンプト** (`制約なし`) - 任意のプロンプトを使用して、生の応答を生成します
* **テキスト認識（OCR）** (`ocr`) - モデルが画像内のテキストを認識します
* **視覚的質問応答** (`visual-question-answering`) - モデルがプロンプトで送信された質問に答えます
* **キャプション生成（短い）** (`caption`) - モデルが画像の短い説明を提供します
* **キャプション生成** (`detailed-caption`) - モデルが画像の長い説明を提供します
* **単一ラベル分類** (`classification`) - モデルが画像内容を、提供されたクラスのいずれか1つとして分類します
* **複数ラベル分類** (`multi-label-classification`) - モデルが画像内容を、提供されたクラスの1つまたは複数として分類します
* **プロンプトなしオブジェクト検出** (`object-detection`) - モデルが画像内の目立つオブジェクトを検出し、バウンディングボックスを返します
* **構造化出力生成** (`structured-answering`) - モデルが指定されたフィールドを持つ JSON 応答を返します

#### 🛠️ APIプロバイダーとモデルのバリエーション

Llama 3.2 Visionは次を通じて公開されています [OpenRouter](https://openrouter.ai/)。デフォルトでは、このブロックは次を使用します **Roboflow管理のOpenRouterキー** を使用し、Roboflowクレジットに課金されます。追加設定は不要です。Roboflowの請求を回避するには、独自の `sk-or-...` キーを `api_key` フィールドに入力してください。

この `privacy_level` フィールドは、どのOpenRouterプロバイダーがリクエストを処理できるかを制御します：

* **データ収集なし** *（デフォルト）* – プロバイダーはあなたの入力を学習に使用できません。
* **データ収集を許可** – より広いプロバイダープール。
* **データ保持ゼロ** – 最も厳格で、何も保持しないプロバイダーに制限されます。

#### 💡 参考情報と利用規定

{% hint style="warning" %}
**モデルライセンス**

以下を確認してください [Llama 3.2ライセンス](https://www.llama.com/llama3_2/license/) を使用する前に。
{% endhint %}

### 型識別子

ステップで次の識別子を使用してください `"type"` フィールド： `roboflow_core/llama_vision@v2` ワークフローにこのブロックをステップとして追加するには。

### プロパティ

| **名前**                    | **型**            | **説明**                                                                                                                        | 参照 |
| ------------------------- | ---------------- | ----------------------------------------------------------------------------------------------------------------------------- | -- |
| `name`                    | `str`            | このステップの一意の識別子を入力してください。                                                                                                       | ❌  |
| `api_key`                 | `str`            | OpenRouter APIキー。デフォルトではRoboflowの管理キーが使用され、Roboflow経由でクレジット課金されます。独自の `sk-or-...` キーを使用すると、Roboflowの請求なしでOpenRouterを直接呼び出せます。 | ✅  |
| `privacy_level`           | `str`            | プロバイダーのプライバシーフィルター。より厳しいレベルではプロバイダーの範囲が狭まり、管理キーでの1回あたりのコストが増える場合があります。                                                        | ❌  |
| `max_tokens`              | `整数`             | モデルが応答で生成できる最大トークン数。                                                                                                          | ❌  |
| `temperature`             | `float`          | モデルからサンプリングするための温度。値の範囲は 0.0〜2.0 で、高いほど生成結果はよりランダム／「創造的」になります。。                                                               | ✅  |
| `max_concurrent_requests` | `整数`             | 画像バッチに対する同時リクエスト数。指定がない場合、このブロックはWorkflows Execution Engineでグローバルに設定された値をデフォルトで使用します。レート制限に達する場合は制限してください。                    | ❌  |
| `task_type`               | `str`            | モデルによって実行されるタスクの種類。値によって必要なパラメータと出力応答が決まります。。                                                                                 | ❌  |
| `プロンプト`                   | `str`            | Llamaモデルへのテキストプロンプト。                                                                                                          | ✅  |
| `output_structure`        | `Dict[str, str]` | 期待される JSON 応答の構造を持つ辞書。                                                                                                        | ❌  |
| `classes`                 | `List[str]`      | 使用するクラスのリスト。                                                                                                                  | ✅  |
| `model_version`           | `str`            | 使用するモデル。                                                                                                                      | ✅  |

この **参照** 列は、で利用可能な動的値を使ってプロパティをパラメータ化できる可能性を示します `ワークフロー` 実行時。参照 *バインディング* 詳細は。

### ランタイム互換性

`requires_internet` - エアギャップ／オフライン環境: このブロックは、完全にオフライン／エアギャップ環境から到達できないサービスに依存しています。

### 入力と出力のバインディング

利用可能な接続は、そのバインディング種別によって異なります。どのバインディング種別が `Llama 3.2 Vision` のバージョン `v2` あるか確認してください。

<details>

<summary>入力と出力のバインディング</summary>

* 入力
  * `api_key` (*Union\[*[*`ROBOFLOW_MANAGED_KEY`*](/workflows/ja/gaido/developer-guide/kinds/roboflow-managed-key.md)*,* [*`secret`*](/workflows/ja/gaido/developer-guide/kinds/secret.md)*,* [*`string`*](/workflows/ja/gaido/developer-guide/kinds/string.md)*]*）：OpenRouter APIキー。デフォルトではRoboflowの管理キーが使用され、Roboflow経由でクレジット課金されます。独自の `sk-or-...` キーを使用すると、Roboflowの請求なしでOpenRouterを直接呼び出せます。
  * `temperature` ([*`float`*](/workflows/ja/gaido/developer-guide/kinds/float.md))：モデルからサンプリングするための温度。値の範囲は 0.0〜2.0 で、高いほど生成結果はよりランダム／「創造的」になります。。
  * `images` ([*`image`*](/workflows/ja/gaido/developer-guide/kinds/image.md)): 推論対象の画像です..
  * `プロンプト` ([*`string`*](/workflows/ja/gaido/developer-guide/kinds/string.md)）：Llamaモデルへのテキストプロンプト。
  * `classes` ([*`list_of_values`*](/workflows/ja/gaido/developer-guide/kinds/list-of-values.md))：使用するクラスのリスト。
  * `model_version` ([*`string`*](/workflows/ja/gaido/developer-guide/kinds/string.md))：使用するモデル。
* 出力
  * `出力` (*Union\[*[*`string`*](/workflows/ja/gaido/developer-guide/kinds/string.md)*,* [*`language_model_output`*](/workflows/ja/gaido/developer-guide/kinds/language-model-output.md)*]*)：の文字列値 `string` または LLM / VLM の出力（条件が `language_model_output`.
  * `classes` ([`list_of_values`](/workflows/ja/gaido/developer-guide/kinds/list-of-values.md))：任意の型の値のリスト。

</details>

<details>

<summary>JSON 定義の例</summary>

```json
{
	    "name": "<your_step_name_here>",
	    "type": "roboflow_core/llama_vision@v2",
	    "api_key": "rf_key:account",
	    "privacy_level": "<block_does_not_provide_example>",
	    "max_tokens": "<block_does_not_provide_example>",
	    "temperature": "<block_does_not_provide_example>",
	    "max_concurrent_requests": "<block_does_not_provide_example>",
	    "images": "$inputs.image",
	    "task_type": "<block_does_not_provide_example>",
	    "prompt": "my prompt",
	    "output_structure": {
	        "my_key": "description"
	    },
	    "classes": [
	        "class-a",
	        "class-b"
	    ],
	    "model_version": "11B - OpenRouter"
	}
```

</details>

## v1

視覚機能を備えたLlama 3.2 Visionモデルに質問してください。

任意のテキストプロンプトまたは事前定義済みのものを指定できます。このブロックは次の種類のプロンプトをサポートしています:

* **オープンプロンプト** (`制約なし`) - 任意のプロンプトを使用して、生の応答を生成します
* **テキスト認識（OCR）** (`ocr`) - モデルが画像内のテキストを認識します
* **視覚的質問応答** (`visual-question-answering`) - モデルがプロンプトで送信された質問に答えます
* **キャプション生成（短い）** (`caption`) - モデルが画像の短い説明を提供します
* **キャプション生成** (`detailed-caption`) - モデルが画像の長い説明を提供します
* **単一ラベル分類** (`classification`) - モデルが画像内容を、提供されたクラスのいずれか1つとして分類します
* **複数ラベル分類** (`multi-label-classification`) - モデルが画像内容を、提供されたクラスの1つまたは複数として分類します
* **構造化出力生成** (`structured-answering`) - モデルが指定されたフィールドを持つ JSON 応答を返します

{% hint style="warning" %}
**構造化プロンプトの問題**

構造化出力（今回の場合はJSONドキュメント）が期待されると、モデルはかなり予測不能になりがちです。この問題は次のようなタスクに影響する可能性があります `structured-answering`, `classification` または `multi-label-classification`.

原因は、モデルに組み込まれた不適切なコンテンツに対するかなり敏感な「フィルター」にあるようです。
{% endhint %}

#### 🛠️ APIプロバイダーとモデルのバリエーション

Llama Vision 3.2モデルは次を通じて公開されています [OpenRouter API](https://openrouter.ai/) そして、渡す必要があります [OpenRouter APIキー](https://openrouter.ai/docs/api-keys) を実行するために。

サポートされているモデルには複数のバージョンがあります：

* 小さいバージョン（`11B`）はより高速で安価ですが、次を使用するとより高品質な結果が期待できます `90B` version
* `通常版` 版は有料（通常はより高速）APIです。一方で `無料` はOpenRouterクライアント向けに無料で利用できます（2025-01-01時点）

現時点では、OpenRouterがLlama 3.2 Visionモデルの唯一の提供元ですが、状況が変わり次第お知らせします。

{% hint style="warning" %}
**API利用料金**

OpenRouterはモデルへのアクセスを提供する外部の第三者であり、利用に応じて料金が発生します。ご利用前に料金をご確認ください：

* [Llama 3.2 Vision 11B（通常版）](https://openrouter.ai/meta-llama/llama-3.2-11b-vision-instruct/providers)
* [Llama 3.2 Vision 90B（通常版）](https://openrouter.ai/meta-llama/llama-3.2-90b-vision-instruct/providers)
  {% endhint %}

#### 💡 参考情報と利用規定

{% hint style="warning" %}
**モデルライセンス**

ご確認ください [モデルライセンス](https://github.com/meta-llama/llama-models/blob/main/models/llama3_2/LICENSE) を使用する前に。
{% endhint %}

[こちらをクリック](https://github.com/meta-llama/llama-models/blob/main/models/llama3_2/MODEL_CARD_VISION.md) 元のモデルカードはこちらです。

このモデルの使用はMetaの [利用許諾ポリシー](https://www.llama.com/llama3/use-policy/).

### 型識別子

ステップで次の識別子を使用してください `"type"` フィールド： `roboflow_core/llama_3_2_vision@v1` ワークフローにこのブロックをステップとして追加するには。

### プロパティ

| **名前**                    | **型**            | **説明**                                                                                                                       | 参照 |
| ------------------------- | ---------------- | ---------------------------------------------------------------------------------------------------------------------------- | -- |
| `name`                    | `str`            | このステップの一意の識別子を入力してください。                                                                                                      | ❌  |
| `task_type`               | `str`            | モデルによって実行されるタスクの種類。値によって必要なパラメータと出力応答が決まります。。                                                                                | ❌  |
| `プロンプト`                   | `str`            | Llamaモデルへのテキストプロンプト。                                                                                                         | ✅  |
| `output_structure`        | `Dict[str, str]` | 期待される JSON 応答の構造を持つ辞書。                                                                                                       | ❌  |
| `classes`                 | `List[str]`      | 使用するクラスのリスト。                                                                                                                 | ✅  |
| `api_key`                 | `str`            | お使いのLlama Vision APIキー（提供元に依存します。例：OpenRouter APIキー）。                                                                        | ✅  |
| `model_version`           | `str`            | 使用するモデル。                                                                                                                     | ✅  |
| `max_tokens`              | `整数`             | モデルが応答で生成できるトークンの最大数。。                                                                                                       | ❌  |
| `temperature`             | `float`          | モデルからサンプリングするための温度。値の範囲は 0.0〜2.0 で、高いほど生成結果はよりランダム／「創造的」になります。。                                                              | ✅  |
| `max_concurrent_requests` | `整数`             | 入力画像のバッチが提供されたときに、このブロックで実行できる同時リクエスト数。指定がない場合、このブロックはWorkflows Execution Engineでグローバルに設定された値をデフォルトで使用します。上限に達する場合は制限してください。 | ❌  |

この **参照** 列は、で利用可能な動的値を使ってプロパティをパラメータ化できる可能性を示します `ワークフロー` 実行時。参照 *バインディング* 詳細は。

### ランタイム互換性

`requires_internet` - エアギャップ／オフライン環境: このブロックは、完全にオフライン／エアギャップ環境から到達できないサービスに依存しています。

### 入力と出力のバインディング

利用可能な接続は、そのバインディング種別によって異なります。どのバインディング種別が `Llama 3.2 Vision` のバージョン `v1` あるか確認してください。

<details>

<summary>入力と出力のバインディング</summary>

* 入力
  * `images` ([*`image`*](/workflows/ja/gaido/developer-guide/kinds/image.md)): 推論対象の画像です..
  * `プロンプト` ([*`string`*](/workflows/ja/gaido/developer-guide/kinds/string.md)）：Llamaモデルへのテキストプロンプト。
  * `classes` ([*`list_of_values`*](/workflows/ja/gaido/developer-guide/kinds/list-of-values.md))：使用するクラスのリスト。
  * `api_key` ([*`string`*](/workflows/ja/gaido/developer-guide/kinds/string.md)）：お使いのLlama Vision APIキー（提供元に依存します。例：OpenRouter APIキー）。
  * `model_version` ([*`string`*](/workflows/ja/gaido/developer-guide/kinds/string.md))：使用するモデル。
  * `temperature` ([*`float`*](/workflows/ja/gaido/developer-guide/kinds/float.md))：モデルからサンプリングするための温度。値の範囲は 0.0〜2.0 で、高いほど生成結果はよりランダム／「創造的」になります。。
* 出力
  * `出力` (*Union\[*[*`string`*](/workflows/ja/gaido/developer-guide/kinds/string.md)*,* [*`language_model_output`*](/workflows/ja/gaido/developer-guide/kinds/language-model-output.md)*]*)：の文字列値 `string` または LLM / VLM の出力（条件が `language_model_output`.
  * `classes` ([`list_of_values`](/workflows/ja/gaido/developer-guide/kinds/list-of-values.md))：任意の型の値のリスト。

</details>

<details>

<summary>JSON 定義の例</summary>

```json
{
	    "name": "<your_step_name_here>",
	    "type": "roboflow_core/llama_3_2_vision@v1",
	    "images": "$inputs.image",
	    "task_type": "<block_does_not_provide_example>",
	    "prompt": "my prompt",
	    "output_structure": {
	        "my_key": "description"
	    },
	    "classes": [
	        "class-a",
	        "class-b"
	    ],
	    "api_key": "xxx-xxx",
	    "model_version": "11B（無料）- OpenRouter",
	    "max_tokens": "<block_does_not_provide_example>",
	    "temperature": "<block_does_not_provide_example>",
	    "max_concurrent_requests": "<block_does_not_provide_example>"
	}
```

</details>
