> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/models/hi/supported-models/smolvlm2.md).

# SmolVLM2

SmolVLM2 HuggingFace का एक कॉम्पैक्ट विज़न-लैंग्वेज मॉडल है। यह एक छवि और एक टेक्स्ट प्रॉम्प्ट स्वीकार करता है और एक टेक्स्ट प्रतिक्रिया लौटाता है।

{% hint style="info" %}
SmolVLM2 Serverless Cloud API पर उपलब्ध नहीं है। इसे एक पर चलाएँ [समर्पित परिनियोजन](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) या [स्व-होस्टेड Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted).
{% endhint %}

## SmolVLM2 एपीआई

{% stepper %}
{% step %}

### अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ खोजें [Roboflow API सेटिंग्स पेज](https://app.roboflow.com/settings/api) और इसे अपने शेल में उपलब्ध कराएँ:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### निर्भरताएँ इंस्टॉल करें

इंस्टॉल करें [इन्फ़रेंस SDK](https://docs.roboflow.com/deployment/self-hosted/self-hosted):

```bash
pip install -U inference-sdk supervision
```

{% endstep %}

{% step %}

### मॉडल चलाएँ

सेट करें `api_url` अपने समर्पित डिप्लॉयमेंट URL या एक स्थानीय इन्फ़रेंस सर्वर पर।

```python
import os
import supervision as sv
from inference_sdk import InferenceHTTPClient, InferenceConfiguration

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
).configure(InferenceConfiguration(api_key_transport="header"))
result = client.infer_lmm(
    image,
    model_id="smolvlm2",
    prompt="इस छवि का संक्षेप में वर्णन करें.",
    max_new_tokens=64,
)
print(result["response"])
```

{% endstep %}
{% endstepper %}

ऊपर दिया गया कोड मॉडल की प्रतिक्रिया टर्मिनल पर प्रिंट करता है:

```
एक आदमी अपने कंधों पर एक कुत्ता उठा रहा है।
```

<figure><img src="/files/43f39eb07a11f2ea0f9cc32a943b6b5bc7d3e756" alt=""><figcaption></figcaption></figure>

## SmolVLM2 इन्फ़रेंस गति

लेटेंसी मापी गई [Roboflow Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 1x NVIDIA L4 पर, बैच आकार 1 के साथ, एक निश्चित प्रॉम्प्ट से greedy decoding का उपयोग करके ठीक 128 टोकन जनरेट करते हुए। लेटेंसी आउटपुट लंबाई के साथ स्केल करती है, इसलिए अन्य लंबाइयों का अनुमान लगाने के लिए tokens/sec का उपयोग करें।

<table data-search="false"><thead><tr><th>उपनाम</th><th>लेटेंसी, 128 टोकन (ms)</th><th>टोकन/सेकंड</th></tr></thead><tbody><tr><td><code>smolvlm2</code></td><td>3113</td><td>41</td></tr></tbody></table>

{% hint style="info" %}
सेट करें `api_url` को अपने परिनियोजन लक्ष्य से मिलाएँ:

* `http://localhost:9001` एक स्थानीय [इन्फ़रेंस](https://docs.roboflow.com/deployment/self-hosted/self-hosted) सर्वर।
* आपका [समर्पित परिनियोजन](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) एक निजी एंडपॉइंट के लिए URL.
  {% endhint %}

## स्व-होस्टेड इन्फ़रेंस के साथ SmolVLM2 चलाएँ

SmolVLM2 को सीधे के साथ भी लोड किया जा सकता है [`inference`](https://docs.roboflow.com/deployment/self-hosted/self-hosted) VQA, दस्तावेज़ OCR, दस्तावेज़ VQA, और ऑब्जेक्ट काउंटिंग के लिए पैकेज।

{% stepper %}
{% step %}

### पैकेज इंस्टॉल करें

```bash
pip install "inference[transformers]"
```

उपयोग करें `inference-gpu[transformers]` एक GPU मशीन पर।
{% endstep %}

{% step %}

### मॉडल चलाएँ

```python
from PIL import Image

from inference.models.smolvlm.smolvlm import SmolVLM

model = SmolVLM(api_key="YOUR_API_KEY")

image = Image.open("dog.jpeg")
result = model.predict(image, "इस छवि में कितने कुत्ते हैं?")

print(result)
```

{% endstep %}
{% endstepper %}

### Workflows में निष्पादन मोड

जब इसे किसी [Workflow](https://docs.roboflow.com/workflows), SmolVLM2 दो मोड में से एक में चलता है:

* **स्थानीय निष्पादन**: मॉडल आपके Inference सर्वर पर चलता है (GPU अनुशंसित)।
* **दूरस्थ निष्पादन**: मॉडल को दूरस्थ Inference सर्वर पर HTTP के माध्यम से `infer_lmm()` क्लाइंट मेथड।
