For the complete documentation index, see llms.txt. This page is also available as Markdown.

Florence-2モデル

画像に対してFlorence-2を実行します

v2

専用の推論サーバーが必要です(GPU推奨) - 専用デプロイの使用を検討してください

この Workflow ブロックでは次を紹介します Florence 2、幅広いタスクを実行できる Visual Language Model(VLM)で、以下を含みます:

  • 物体検出

  • インスタンスセグメンテーション

  • 画像キャプション生成

  • 光学文字認識(OCR)

  • など...

以下は、モデルがサポートするタスクの包括的な一覧と、Workflows エコシステム内でその出力をどのように利用するかの説明です:

タスクの説明:

  • カスタムプロンプト (custom) - 自由形式のプロンプトを使って応答を生成します。ファインチューニング済みモデルで便利です。

  • テキスト認識(OCR) (ocr) - モデルが画像内のテキストを認識します

  • テキスト検出と認識(OCR) (ocr-with-text-detection) - モデルが画像内のテキスト領域を検出し、その後検出された各領域に対して OCR を実行します

  • キャプション生成(短) (caption) - モデルが画像の短い説明を提供します

  • キャプション生成 (detailed-caption) - モデルが画像の長い説明を提供します

  • キャプション生成(長) (more-detailed-caption) - モデルが画像の非常に長い説明を提供します

  • プロンプトなしの物体検出 (object-detection) - モデルが画像内の目立つ物体のバウンディングボックスを検出して返します

  • 物体検出 (open-vocabulary-object-detection) - モデルが指定されたクラスのバウンディングボックスを検出して返します

  • 検出とキャプション生成 (object-detection-and-caption) - モデルが目立つ物体を検出し、それらにキャプションを付けます

  • プロンプト指定の物体検出 (phrase-grounded-object-detection) - テキストプロンプトに基づいて、モデルが説明に一致する物体を検出します

  • プロンプト指定のインスタンスセグメンテーション (phrase-grounded-instance-segmentation) - テキストプロンプトに基づいて、モデルが説明に一致する物体をセグメント化します

  • バウンディングボックスのセグメント化 (detection-grounded-instance-segmentation) - モデルが指定されたバウンディングボックス内の物体をポリゴンにセグメント化します

  • バウンディングボックスの分類 (detection-grounded-classification) - モデルが指定されたバウンディングボックス内の物体を分類します

  • バウンディングボックスのキャプション生成 (detection-grounded-caption) - モデルが指定されたバウンディングボックス内の物体にキャプションを付けます

  • バウンディングボックス内のテキスト認識(OCR) (detection-grounded-ocr) - モデルが指定されたバウンディングボックス内のテキストに OCR を実行します

  • 関心領域の提案 (region-proposal) - モデルが画像内の関心領域(バウンディングボックス)を提案します

種別識別子

ステップで次の識別子を使用します "type" フィールド: roboflow_core/florence_2@v2 ワークフローにステップとしてブロックを追加するには。

プロパティ

名前

説明

参照

name

str

このステップの一意の識別子を入力してください。

task_type

str

モデルによって実行されるタスクの種類。値によって必要なパラメータと出力レスポンスが決まります..

プロンプト

str

Florence-2 モデルへのテキストプロンプト。

classes

List[str]

使用するクラスの一覧。

grounding_detection

Optional[List[float], List[int]]

Florence-2 モデルに対するグラウンディング用の検出結果。静的に指定されたバウンディングボックスである場合があります [left_top_x, left_top_y, right_bottom_x, right_bottom_y] または物体検出モデルの結果。後者の場合は、次に基づいて 1 つのボックスが選択されます grounding_selection_mode..

grounding_selection_mode

str

.

model_id

str

使用するモデル。

この 参照 列は、で利用可能な動的値を使用してプロパティをパラメータ化できる可能性を示します ワークフロー 実行時。参照 バインディング 詳細情報

ランタイム互換性

ハード - ランタイム self_hosted_cpu; 実行 ローカル : GPU が必要です。run_locally() は CUDA が必要なモデルを読み込みます。

入出力バインディング

利用可能な接続は、そのバインディング種別によって異なります。どのバインディング種別が Florence-2モデル のバージョン v2 持つか確認してください。

入出力バインディング
  • 入力

    • 画像 (画像):推論対象の画像です。

    • プロンプト (string): Florence-2 モデルへのテキストプロンプト。

    • classes (list_of_values): 使用するクラスの一覧。

    • grounding_detection (Union[instance_segmentation_prediction, keypoint_detection_prediction, list_of_values, object_detection_prediction]): Florence-2 モデルに対するグラウンディング用の検出結果。静的に指定されたバウンディングボックスである場合があります [left_top_x, left_top_y, right_bottom_x, right_bottom_y] または物体検出モデルの結果。後者の場合は、次に基づいて 1 つのボックスが選択されます grounding_selection_mode..

    • model_id (roboflow_model_id): 使用するモデル。

  • 出力

    • raw_output (Union[string, language_model_output]): 文字列値、場合 string または LLM / VLM の出力、場合 language_model_output.

    • parsed_output (辞書):辞書。

    • classes (list_of_values): 任意の型の値のリスト。

JSON 定義の例

v1

専用の推論サーバーが必要です(GPU推奨) - 専用デプロイの使用を検討してください

この Workflow ブロックでは次を紹介します Florence 2、幅広いタスクを実行できる Visual Language Model(VLM)で、以下を含みます:

  • 物体検出

  • インスタンスセグメンテーション

  • 画像キャプション生成

  • 光学文字認識(OCR)

  • など...

以下は、モデルがサポートするタスクの包括的な一覧と、Workflows エコシステム内でその出力をどのように利用するかの説明です:

タスクの説明:

  • カスタムプロンプト (custom) - 自由形式のプロンプトを使って応答を生成します。ファインチューニング済みモデルで便利です。

  • テキスト認識(OCR) (ocr) - モデルが画像内のテキストを認識します

  • テキスト検出と認識(OCR) (ocr-with-text-detection) - モデルが画像内のテキスト領域を検出し、その後検出された各領域に対して OCR を実行します

  • キャプション生成(短) (caption) - モデルが画像の短い説明を提供します

  • キャプション生成 (detailed-caption) - モデルが画像の長い説明を提供します

  • キャプション生成(長) (more-detailed-caption) - モデルが画像の非常に長い説明を提供します

  • プロンプトなしの物体検出 (object-detection) - モデルが画像内の目立つ物体のバウンディングボックスを検出して返します

  • 物体検出 (open-vocabulary-object-detection) - モデルが指定されたクラスのバウンディングボックスを検出して返します

  • 検出とキャプション生成 (object-detection-and-caption) - モデルが目立つ物体を検出し、それらにキャプションを付けます

  • プロンプト指定の物体検出 (phrase-grounded-object-detection) - テキストプロンプトに基づいて、モデルが説明に一致する物体を検出します

  • プロンプト指定のインスタンスセグメンテーション (phrase-grounded-instance-segmentation) - テキストプロンプトに基づいて、モデルが説明に一致する物体をセグメント化します

  • バウンディングボックスのセグメント化 (detection-grounded-instance-segmentation) - モデルが指定されたバウンディングボックス内の物体をポリゴンにセグメント化します

  • バウンディングボックスの分類 (detection-grounded-classification) - モデルが指定されたバウンディングボックス内の物体を分類します

  • バウンディングボックスのキャプション生成 (detection-grounded-caption) - モデルが指定されたバウンディングボックス内の物体にキャプションを付けます

  • バウンディングボックス内のテキスト認識(OCR) (detection-grounded-ocr) - モデルが指定されたバウンディングボックス内のテキストに OCR を実行します

  • 関心領域の提案 (region-proposal) - モデルが画像内の関心領域(バウンディングボックス)を提案します

種別識別子

ステップで次の識別子を使用します "type" フィールド: roboflow_core/florence_2@v1 ワークフローにステップとしてブロックを追加するには。

プロパティ

名前

説明

参照

name

str

このステップの一意の識別子を入力してください。

task_type

str

モデルによって実行されるタスクの種類。値によって必要なパラメータと出力レスポンスが決まります..

プロンプト

str

Florence-2 モデルへのテキストプロンプト。

classes

List[str]

使用するクラスの一覧。

grounding_detection

Optional[List[float], List[int]]

Florence-2 モデルに対するグラウンディング用の検出結果。静的に指定されたバウンディングボックスである場合があります [left_top_x, left_top_y, right_bottom_x, right_bottom_y] または物体検出モデルの結果。後者の場合は、次に基づいて 1 つのボックスが選択されます grounding_selection_mode..

grounding_selection_mode

str

.

model_version

str

使用するモデル。

この 参照 列は、で利用可能な動的値を使用してプロパティをパラメータ化できる可能性を示します ワークフロー 実行時。参照 バインディング 詳細情報

ランタイム互換性

ハード - ランタイム self_hosted_cpu; 実行 ローカル : GPU が必要です。run_locally() は CUDA が必要なモデルを読み込みます。

入出力バインディング

利用可能な接続は、そのバインディング種別によって異なります。どのバインディング種別が Florence-2モデル のバージョン v1 持つか確認してください。

入出力バインディング
  • 入力

    • 画像 (画像):推論対象の画像です。

    • プロンプト (string): Florence-2 モデルへのテキストプロンプト。

    • classes (list_of_values): 使用するクラスの一覧。

    • grounding_detection (Union[instance_segmentation_prediction, keypoint_detection_prediction, list_of_values, object_detection_prediction]): Florence-2 モデルに対するグラウンディング用の検出結果。静的に指定されたバウンディングボックスである場合があります [left_top_x, left_top_y, right_bottom_x, right_bottom_y] または物体検出モデルの結果。後者の場合は、次に基づいて 1 つのボックスが選択されます grounding_selection_mode..

    • model_version (string): 使用するモデル。

  • 出力

    • raw_output (Union[string, language_model_output]): 文字列値、場合 string または LLM / VLM の出力、場合 language_model_output.

    • parsed_output (辞書):辞書。

    • classes (list_of_values): 任意の型の値のリスト。

JSON 定義の例

最終更新

役に立ちましたか?