画像に対してSmolVLM2を実行します。
このワークフローブロックは、マルチモーダルな視覚言語モデルである SmolVLM2 を実行します。画像(文書や写真を含む)について質問すると、自然言語で回答を得られます。
ステップで次の識別子を使用してください "type" フィールド: roboflow_core/smolvlm2@v1 ワークフローにこのブロックをステップとして追加するには。
"type"
roboflow_core/smolvlm2@v1
名前
型
説明
参照
name
str
このステップの一意の識別子を入力してください。
❌
プロンプト
SmolVLM2 に追加の文脈を与えるための任意のテキストプロンプトです。指定しない場合は None になります。
model_version
推論に使用される SmolVLM2 モデル。
✅
この 参照 列は、で利用可能な動的値を使ってプロパティをパラメータ化できる可能性を示します ワークフロー 実行時。参照 バインディング 詳細は。
ワークフロー
ハード - ランタイム self_hosted_cpu;実行 ローカル : GPU が必要です。run_locally() は CUDA を必要とするモデルを読み込みます。
ハード
self_hosted_cpu
ローカル
利用可能な接続は、そのバインディング種別によって異なります。どのバインディング種別が SmolVLM2 のバージョン v1 あるか確認してください。
SmolVLM2
v1
入力
images (image): 推論対象の画像です..
images
image
model_version (roboflow_model_id):推論に使用される SmolVLM2 モデル。
roboflow_model_id
出力
parsed_output (辞書):辞書。
parsed_output
辞書
最終更新 4 日前
役に立ちましたか?
{ "name": "<your_step_name_here>", "type": "roboflow_core/smolvlm2@v1", "images": "$inputs.image", "prompt": "この画像には何が写っていますか?", "model_version": "smolvlm2/smolvlm-2.2b-instruct" }