Florence-2モデル
画像に対してFlorence-2を実行します
v2
専用の推論サーバーが必要です(GPU推奨) - 専用デプロイの使用を検討してください
この Workflow ブロックでは次を紹介します Florence 2、幅広いタスクを実行できる Visual Language Model(VLM)で、以下を含みます:
物体検出
インスタンスセグメンテーション
画像キャプション生成
光学文字認識(OCR)
など...
以下は、モデルがサポートするタスクの包括的な一覧と、Workflows エコシステム内でその出力をどのように利用するかの説明です:
タスクの説明:
カスタムプロンプト (
custom) - 自由形式のプロンプトを使って応答を生成します。ファインチューニング済みモデルで便利です。テキスト認識(OCR) (
ocr) - モデルが画像内のテキストを認識しますテキスト検出と認識(OCR) (
ocr-with-text-detection) - モデルが画像内のテキスト領域を検出し、その後検出された各領域に対して OCR を実行しますキャプション生成(短) (
caption) - モデルが画像の短い説明を提供しますキャプション生成 (
detailed-caption) - モデルが画像の長い説明を提供しますキャプション生成(長) (
more-detailed-caption) - モデルが画像の非常に長い説明を提供しますプロンプトなしの物体検出 (
object-detection) - モデルが画像内の目立つ物体のバウンディングボックスを検出して返します物体検出 (
open-vocabulary-object-detection) - モデルが指定されたクラスのバウンディングボックスを検出して返します検出とキャプション生成 (
object-detection-and-caption) - モデルが目立つ物体を検出し、それらにキャプションを付けますプロンプト指定の物体検出 (
phrase-grounded-object-detection) - テキストプロンプトに基づいて、モデルが説明に一致する物体を検出しますプロンプト指定のインスタンスセグメンテーション (
phrase-grounded-instance-segmentation) - テキストプロンプトに基づいて、モデルが説明に一致する物体をセグメント化しますバウンディングボックスのセグメント化 (
detection-grounded-instance-segmentation) - モデルが指定されたバウンディングボックス内の物体をポリゴンにセグメント化しますバウンディングボックスの分類 (
detection-grounded-classification) - モデルが指定されたバウンディングボックス内の物体を分類しますバウンディングボックスのキャプション生成 (
detection-grounded-caption) - モデルが指定されたバウンディングボックス内の物体にキャプションを付けますバウンディングボックス内のテキスト認識(OCR) (
detection-grounded-ocr) - モデルが指定されたバウンディングボックス内のテキストに OCR を実行します関心領域の提案 (
region-proposal) - モデルが画像内の関心領域(バウンディングボックス)を提案します
種別識別子
ステップで次の識別子を使用します "type" フィールド: roboflow_core/florence_2@v2 ワークフローにステップとしてブロックを追加するには。
プロパティ
名前
型
説明
参照
name
str
このステップの一意の識別子を入力してください。
❌
task_type
str
モデルによって実行されるタスクの種類。値によって必要なパラメータと出力レスポンスが決まります..
❌
プロンプト
str
Florence-2 モデルへのテキストプロンプト。
✅
classes
List[str]
使用するクラスの一覧。
✅
grounding_detection
Optional[List[float], List[int]]
Florence-2 モデルに対するグラウンディング用の検出結果。静的に指定されたバウンディングボックスである場合があります [left_top_x, left_top_y, right_bottom_x, right_bottom_y] または物体検出モデルの結果。後者の場合は、次に基づいて 1 つのボックスが選択されます grounding_selection_mode..
✅
grounding_selection_mode
str
.
❌
model_id
str
使用するモデル。
✅
この 参照 列は、で利用可能な動的値を使用してプロパティをパラメータ化できる可能性を示します ワークフロー 実行時。参照 バインディング 詳細情報
ランタイム互換性
ハード - ランタイム self_hosted_cpu; 実行 ローカル : GPU が必要です。run_locally() は CUDA が必要なモデルを読み込みます。
入出力バインディング
利用可能な接続は、そのバインディング種別によって異なります。どのバインディング種別が Florence-2モデル のバージョン v2 持つか確認してください。
入出力バインディング
入力
画像(画像):推論対象の画像です。プロンプト(string): Florence-2 モデルへのテキストプロンプト。classes(list_of_values): 使用するクラスの一覧。grounding_detection(Union[instance_segmentation_prediction,keypoint_detection_prediction,list_of_values,object_detection_prediction]): Florence-2 モデルに対するグラウンディング用の検出結果。静的に指定されたバウンディングボックスである場合があります[left_top_x, left_top_y, right_bottom_x, right_bottom_y]または物体検出モデルの結果。後者の場合は、次に基づいて 1 つのボックスが選択されますgrounding_selection_mode..model_id(roboflow_model_id): 使用するモデル。
出力
raw_output(Union[string,language_model_output]): 文字列値、場合stringまたは LLM / VLM の出力、場合language_model_output.parsed_output(辞書):辞書。classes(list_of_values): 任意の型の値のリスト。
v1
専用の推論サーバーが必要です(GPU推奨) - 専用デプロイの使用を検討してください
この Workflow ブロックでは次を紹介します Florence 2、幅広いタスクを実行できる Visual Language Model(VLM)で、以下を含みます:
物体検出
インスタンスセグメンテーション
画像キャプション生成
光学文字認識(OCR)
など...
以下は、モデルがサポートするタスクの包括的な一覧と、Workflows エコシステム内でその出力をどのように利用するかの説明です:
タスクの説明:
カスタムプロンプト (
custom) - 自由形式のプロンプトを使って応答を生成します。ファインチューニング済みモデルで便利です。テキスト認識(OCR) (
ocr) - モデルが画像内のテキストを認識しますテキスト検出と認識(OCR) (
ocr-with-text-detection) - モデルが画像内のテキスト領域を検出し、その後検出された各領域に対して OCR を実行しますキャプション生成(短) (
caption) - モデルが画像の短い説明を提供しますキャプション生成 (
detailed-caption) - モデルが画像の長い説明を提供しますキャプション生成(長) (
more-detailed-caption) - モデルが画像の非常に長い説明を提供しますプロンプトなしの物体検出 (
object-detection) - モデルが画像内の目立つ物体のバウンディングボックスを検出して返します物体検出 (
open-vocabulary-object-detection) - モデルが指定されたクラスのバウンディングボックスを検出して返します検出とキャプション生成 (
object-detection-and-caption) - モデルが目立つ物体を検出し、それらにキャプションを付けますプロンプト指定の物体検出 (
phrase-grounded-object-detection) - テキストプロンプトに基づいて、モデルが説明に一致する物体を検出しますプロンプト指定のインスタンスセグメンテーション (
phrase-grounded-instance-segmentation) - テキストプロンプトに基づいて、モデルが説明に一致する物体をセグメント化しますバウンディングボックスのセグメント化 (
detection-grounded-instance-segmentation) - モデルが指定されたバウンディングボックス内の物体をポリゴンにセグメント化しますバウンディングボックスの分類 (
detection-grounded-classification) - モデルが指定されたバウンディングボックス内の物体を分類しますバウンディングボックスのキャプション生成 (
detection-grounded-caption) - モデルが指定されたバウンディングボックス内の物体にキャプションを付けますバウンディングボックス内のテキスト認識(OCR) (
detection-grounded-ocr) - モデルが指定されたバウンディングボックス内のテキストに OCR を実行します関心領域の提案 (
region-proposal) - モデルが画像内の関心領域(バウンディングボックス)を提案します
種別識別子
ステップで次の識別子を使用します "type" フィールド: roboflow_core/florence_2@v1 ワークフローにステップとしてブロックを追加するには。
プロパティ
名前
型
説明
参照
name
str
このステップの一意の識別子を入力してください。
❌
task_type
str
モデルによって実行されるタスクの種類。値によって必要なパラメータと出力レスポンスが決まります..
❌
プロンプト
str
Florence-2 モデルへのテキストプロンプト。
✅
classes
List[str]
使用するクラスの一覧。
✅
grounding_detection
Optional[List[float], List[int]]
Florence-2 モデルに対するグラウンディング用の検出結果。静的に指定されたバウンディングボックスである場合があります [left_top_x, left_top_y, right_bottom_x, right_bottom_y] または物体検出モデルの結果。後者の場合は、次に基づいて 1 つのボックスが選択されます grounding_selection_mode..
✅
grounding_selection_mode
str
.
❌
model_version
str
使用するモデル。
✅
この 参照 列は、で利用可能な動的値を使用してプロパティをパラメータ化できる可能性を示します ワークフロー 実行時。参照 バインディング 詳細情報
ランタイム互換性
ハード - ランタイム self_hosted_cpu; 実行 ローカル : GPU が必要です。run_locally() は CUDA が必要なモデルを読み込みます。
入出力バインディング
利用可能な接続は、そのバインディング種別によって異なります。どのバインディング種別が Florence-2モデル のバージョン v1 持つか確認してください。
入出力バインディング
入力
画像(画像):推論対象の画像です。プロンプト(string): Florence-2 モデルへのテキストプロンプト。classes(list_of_values): 使用するクラスの一覧。grounding_detection(Union[instance_segmentation_prediction,keypoint_detection_prediction,list_of_values,object_detection_prediction]): Florence-2 モデルに対するグラウンディング用の検出結果。静的に指定されたバウンディングボックスである場合があります[left_top_x, left_top_y, right_bottom_x, right_bottom_y]または物体検出モデルの結果。後者の場合は、次に基づいて 1 つのボックスが選択されますgrounding_selection_mode..model_version(string): 使用するモデル。
出力
raw_output(Union[string,language_model_output]): 文字列値、場合stringまたは LLM / VLM の出力、場合language_model_output.parsed_output(辞書):辞書。classes(list_of_values): 任意の型の値のリスト。
最終更新
役に立ちましたか?