> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/models/hi/supported-models/qwen3-5.md).

# Qwen3.5

Qwen3.5, Alibaba का विज़न-भाषा मॉडल परिवार है। यह एक छवि और एक पाठ प्रॉम्प्ट स्वीकार करता है और एक पाठ प्रतिक्रिया देता है। दो पूर्व-प्रशिक्षित चेकपॉइंट उपलब्ध हैं:

<table data-search="false"><thead><tr><th>उपनाम</th><th>पैरामीटर</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>0.8B</td></tr><tr><td><code>qwen3_5-2b</code></td><td>2B</td></tr></tbody></table>

## सटीकता

आधिकारिक मॉडल कार्ड से प्रमुख विज़न-भाषा बेंचमार्क (नॉन-थिंकिंग मोड) ([0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B), [2B](https://huggingface.co/Qwen/Qwen3.5-2B)):

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td>बेंचमार्क</td><td><code>qwen3_5-0.8b</code></td><td><code>qwen3_5-2b</code></td></tr><tr><td>MMMU</td><td>47.4</td><td>64.2</td></tr><tr><td>MathVista (मिनी)</td><td>58.6</td><td>73.9</td></tr><tr><td>MMBench (EN v1.1)</td><td>68.0</td><td>81.3</td></tr></tbody></table>

## इनफ़रेंस गति

विलंबता मापी गई [Roboflow Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 1x NVIDIA L4 पर, बैच आकार 1 के साथ, एक निश्चित प्रॉम्प्ट से greedy decoding का उपयोग करके ठीक 128 टोकन उत्पन्न करते समय। आउटपुट लंबाई के साथ विलंबता बढ़ती है, इसलिए अन्य लंबाइयों का अनुमान लगाने के लिए tokens/sec का उपयोग करें।

<table data-search="false"><thead><tr><th>उपनाम</th><th>विलंबता, 128 टोकन (मि.से.)</th><th>टोकन/सेकंड</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>3307</td><td>39</td></tr><tr><td><code>qwen3_5-2b</code></td><td>3688</td><td>35</td></tr></tbody></table>

## Workflows के माध्यम से Qwen 3.5 VL का उपयोग

Qwen 3.5 VL एक पूर्व-कॉन्फ़िगर किए गए [वर्कफ़्लो](https://docs.roboflow.com/workflows) Models पेज के "Open-Source Models" टैब पर उपलब्ध है। "Qwen VL" चुनें, एक मॉडल वैरिएंट और प्रॉम्प्ट चुनें, फिर वर्कफ़्लो को अपने Workspace में फ़ोर्क करने और इन्फ़रेंस चलाना शुरू करने के लिए "Test API" पर क्लिक करें।

वर्कफ़्लो एकीकृत `qwen_vlm@v1` ब्लॉक का उपयोग करता है, जो Qwen VL की कई पीढ़ियों का समर्थन करता है:

<table data-search="false"><thead><tr><th>मॉडल</th><th>पैरामीटर</th></tr></thead><tbody><tr><td>Qwen 3.5 VL 0.8B</td><td>0.8B</td></tr><tr><td>Qwen 3.5 VL 2B</td><td>2B</td></tr><tr><td>Qwen 3 VL 2B</td><td>2B</td></tr><tr><td>Qwen 2.5 VL 7B</td><td>7B</td></tr></tbody></table>

## Inference SDK के माध्यम से Qwen 3.5 VL का उपयोग

{% hint style="info" %}
Qwen3.5 के लिए प्रत्यक्ष Inference SDK कॉल हेतु एक [समर्पित परिनियोजन](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) या [स्व-होस्टेड इनफ़रेंस](https://docs.roboflow.com/deployment/self-hosted/self-hosted). होस्टेड एक्सेस के लिए, ऊपर वर्णित वर्कफ़्लो पथ का उपयोग करें।
{% endhint %}

{% stepper %}
{% step %}

### अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ खोजें [Roboflow API सेटिंग्स पेज](https://app.roboflow.com/settings/api) और इसे अपने shell के लिए उपलब्ध कराएँ:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### निर्भरताएँ इंस्टॉल करें

इंस्टॉल करें [Inference SDK](https://docs.roboflow.com/deployment/self-hosted/self-hosted):

```bash
pip install -U inference-sdk supervision
```

{% endstep %}

{% step %}

### मॉडल चलाएँ

सेट करें `api_url` अपने Dedicated Deployment URL या किसी स्थानीय Inference सर्वर पर।

```python
import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="qwen3_5-2b",
    prompt="इस छवि का संक्षेप में वर्णन करें.",
    max_new_tokens=256,
)
print(result["response"])
```

{% endstep %}
{% endstepper %}

ऊपर दिया गया कोड मॉडल की प्रतिक्रिया को टर्मिनल पर प्रिंट करता है:

```
एक व्यक्ति सफ़ेद टी-शर्ट और लाल शॉर्ट्स पहने हुए अपने कंधे पर एक काला बैकपैक लिए हुए है, और उसके ऊपर एक बीगल कुत्ता बैठा है। यह दृश्य एक आवासीय क्षेत्र में बाहर होता है, जहाँ पृष्ठभूमि में आधुनिक अपार्टमेंट इमारतें और फुटपाथ के किनारे हरियाली है। वह व्यक्ति बड़े खिड़कियों वाली एक इमारत के पास चल रहा या खड़ा दिखाई देता है।
```

<figure><img src="/files/ee74092b69343a6ab6ae83c01510673cee706554" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
सेट करें `api_url` को अपने deployment target से मिलाने के लिए:

* `http://localhost:9001` एक स्थानीय [Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) server के लिए।
* आपका [समर्पित परिनियोजन](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) एक निजी endpoint के लिए URL।
  {% endhint %}

आप Roboflow पर अपना स्वयं का Qwen3.5 चेकपॉइंट प्रशिक्षित कर सकते हैं और इसे उसके प्रति-मॉडल `{workspace}/{model-slug}` आईडी (देखें [Versions, Trainings, and Models](/models/hi/versions-trainings-and-models.md)).

{% embed url="<https://www.youtube.com/watch?v=Y8CR6IzLDaw>" %}

## Inference (self-hosted) के साथ उपयोग करें

Qwen3.5 को सीधे भी [`इनफ़रेंस`](https://docs.roboflow.com/deployment/self-hosted/self-hosted) पैकेज के साथ लोड किया जा सकता है, HTTP के माध्यम से कॉल किए जाने के बजाय।

{% stepper %}
{% step %}

### पैकेज इंस्टॉल करें

```bash
pip install "inference[transformers]"
```

उपयोग करें `inference-gpu[transformers]` एक GPU मशीन पर।
{% endstep %}

{% step %}

### मॉडल चलाएँ

```python
from inference.models.qwen3_5vl.qwen3_5vl_inference_models import (
    InferenceModelsQwen35VLAdapter,
)

model = InferenceModelsQwen35VLAdapter(
    model_id="qwen3_5-0.8b",
    api_key="YOUR_API_KEY",
)

image = "https://media.roboflow.com/dog.jpeg"
prompt = "इस छवि में कितने कुत्ते हैं?"

preprocessed, metadata = model.preprocess(image, prompt)
predictions = model.predict(preprocessed)
result = model.postprocess(predictions, metadata)

print(result[0].response)
```

{% endstep %}
{% endstepper %}

Qwen3.5 एक "थिंकिंग" मोड का भी समर्थन करता है, जिसमें मॉडल उत्तर देने से पहले तर्कशील टोकन उत्पन्न करता है।

### वर्कफ़्लोज़ में निष्पादन मोड

जब इसे एक में उपयोग किया जाता है [वर्कफ़्लो](https://docs.roboflow.com/workflows), Qwen3.5 दो में से किसी एक मोड में चलता है:

* **लोकल निष्पादन**: मॉडल आपके Inference सर्वर पर चलता है (GPU अनुशंसित)।
* **रिमोट निष्पादन**: मॉडल को एक दूरस्थ Inference सर्वर पर HTTP के माध्यम से कॉल किया जाता है।
