For the complete documentation index, see llms.txt. This page is also available as Markdown.

SmolVLM2

画像に対してSmolVLM2を実行します。

このワークフローブロックは、マルチモーダルな視覚言語モデルである SmolVLM2 を実行します。画像(文書や写真を含む)について質問すると、自然言語で回答を得られます。

型識別子

ステップで次の識別子を使用してください "type" フィールド: roboflow_core/smolvlm2@v1 ワークフローにこのブロックをステップとして追加するには。

プロパティ

名前

説明

参照

name

str

このステップの一意の識別子を入力してください。

プロンプト

str

SmolVLM2 に追加の文脈を与えるための任意のテキストプロンプトです。指定しない場合は None になります。

model_version

str

推論に使用される SmolVLM2 モデル。

この 参照 列は、で利用可能な動的値を使ってプロパティをパラメータ化できる可能性を示します ワークフロー 実行時。参照 バインディング 詳細は。

ランタイム互換性

ハード - ランタイム self_hosted_cpu;実行 ローカル : GPU が必要です。run_locally() は CUDA を必要とするモデルを読み込みます。

入力と出力のバインディング

利用可能な接続は、そのバインディング種別によって異なります。どのバインディング種別が SmolVLM2 のバージョン v1 あるか確認してください。

入力と出力のバインディング
  • 入力

    • images (image): 推論対象の画像です..

    • model_version (roboflow_model_id):推論に使用される SmolVLM2 モデル。

  • 出力

    • parsed_output (辞書):辞書。

JSON 定義の例

最終更新

役に立ちましたか?