For the complete documentation index, see llms.txt. This page is also available as Markdown.

SmolVLM2

Dedicated Deployment या self-hosted Inference पर HuggingFace के SmolVLM2 विज़न-लैंग्वेज मॉडल का उपयोग करें

SmolVLM2 HuggingFace का एक कॉम्पैक्ट विज़न-लैंग्वेज मॉडल है। यह एक छवि और एक टेक्स्ट प्रॉम्प्ट स्वीकार करता है और एक टेक्स्ट प्रतिक्रिया लौटाता है।

SmolVLM2 Serverless Cloud API पर उपलब्ध नहीं है। इसे एक समर्पित डिप्लॉयमेंट या स्व-होस्टेड Inference.

कोड नमूना

1

अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ ढूँढें Roboflow API सेटिंग्स पेज और इसे अपने शेल में उपलब्ध कराएँ:

export ROBOFLOW_API_KEY="आपकी-कुंजी-यहाँ"
2

निर्भरताएँ इंस्टॉल करें

इंस्टॉल करें Inference SDK:

pip install -U inference-sdk supervision
3

मॉडल चलाएँ

सेट करें api_url को अपने Dedicated Deployment URL या किसी स्थानीय Inference सर्वर पर।

import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="smolvlm2",
    prompt="इस छवि का संक्षेप में वर्णन करें।",
    max_new_tokens=64,
)
print(result["response"])

ऊपर दिया गया कोड मॉडल की प्रतिक्रिया को टर्मिनल पर प्रिंट करता है:

एक आदमी अपने कंधों पर एक कुत्ते को ले जा रहा है।

इन्फरेंस गति

विलंबता मापी गई Roboflow Inference 1x NVIDIA L4 पर, बैच साइज़ 1 के साथ, एक निश्चित प्रॉम्प्ट से greedy decoding का उपयोग करके ठीक 128 टोकन जनरेट करते हुए। लेटेंसी आउटपुट लंबाई के साथ स्केल होती है, इसलिए अन्य लंबाइयों का अनुमान लगाने के लिए tokens/sec का उपयोग करें।

उपनाम
लेटेंसी, 128 टोकन (मि.से.)
टोकन/सेकंड

smolvlm2

3113

41

सेट करें api_url को अपने डिप्लॉयमेंट लक्ष्य से मिलाएँ:

Inference के साथ उपयोग करें (सेल्फ-होस्टेड)

SmolVLM2 को सीधे भी लोड किया जा सकता है inference VQA, दस्तावेज़ OCR, दस्तावेज़ VQA, और ऑब्जेक्ट काउंटिंग के लिए पैकेज।

1

पैकेज इंस्टॉल करें

उपयोग करें inference-gpu[transformers] एक GPU मशीन पर।

2

मॉडल चलाएँ

वर्कफ़्लोज़ में निष्पादन मोड

जब किसी Workflowके साथ, SmolVLM2 दो में से किसी एक मोड में चलता है:

  • स्थानीय निष्पादन: मॉडल आपके Inference सर्वर पर चलता है (GPU अनुशंसित)।

  • दूरस्थ निष्पादन: मॉडल को दूरस्थ Inference सर्वर पर HTTP के माध्यम से infer_lmm() क्लाइंट मेथड के माध्यम से कॉल किया जाता है।

अंतिम अपडेट

क्या यह उपयोगी था?