> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/models/hi/supported-models/qwen3-5.md).

# Qwen3.5

Qwen3.5, Alibaba का दृष्टि-भाषा मॉडल परिवार है। यह एक image और एक text prompt स्वीकार करता है और एक text response लौटाता है। दो pretrained checkpoints उपलब्ध हैं:

<table data-search="false"><thead><tr><th>उपनाम</th><th>पैरामीटर</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>0.8B</td></tr><tr><td><code>qwen3_5-2b</code></td><td>2B</td></tr></tbody></table>

## Qwen3.5 सटीकता

आधिकारिक मॉडल कार्ड्स से प्रमुख दृष्टि-भाषा बेंचमार्क (नॉन-थिंकिंग मोड) ([0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B), [2B](https://huggingface.co/Qwen/Qwen3.5-2B)):

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td>बेंचमार्क</td><td><code>qwen3_5-0.8b</code></td><td><code>qwen3_5-2b</code></td></tr><tr><td>MMMU</td><td>47.4</td><td>64.2</td></tr><tr><td>MathVista (मिनी)</td><td>58.6</td><td>73.9</td></tr><tr><td>MMBench (EN v1.1)</td><td>68.0</td><td>81.3</td></tr></tbody></table>

## Qwen3.5 इन्फरेंस गति

लेटेंसी मापी गई [Roboflow Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 1x NVIDIA L4 पर, बैच आकार 1 के साथ, एक निश्चित प्रॉम्प्ट से greedy decoding का उपयोग करके ठीक 128 टोकन जनरेट करते हुए। लेटेंसी आउटपुट लंबाई के साथ स्केल करती है, इसलिए अन्य लंबाइयों का अनुमान लगाने के लिए tokens/sec का उपयोग करें।

<table data-search="false"><thead><tr><th>उपनाम</th><th>लेटेंसी, 128 टोकन (ms)</th><th>टोकन/सेकंड</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>3307</td><td>39</td></tr><tr><td><code>qwen3_5-2b</code></td><td>3688</td><td>35</td></tr></tbody></table>

## एक Workflow में Qwen3.5 का उपयोग करें

Qwen 3.5 VL एक पूर्व-कॉन्फ़िगर किए गए [Workflow](https://docs.roboflow.com/workflows) Models पेज के "Open-Source Models" टैब में उपलब्ध है। "Qwen VL" चुनें, एक model variant और prompt चुनें, फिर Workflow को अपने Workspace में fork करने और inference चलाना शुरू करने के लिए "Test API" पर क्लिक करें।

Workflow एकीकृत का उपयोग करता है `qwen_vlm@v1` ब्लॉक, जो Qwen VL की कई पीढ़ियों का समर्थन करता है:

<table data-search="false"><thead><tr><th>मॉडल</th><th>पैरामीटर</th></tr></thead><tbody><tr><td>Qwen 3.5 VL 0.8B</td><td>0.8B</td></tr><tr><td>Qwen 3.5 VL 2B</td><td>2B</td></tr><tr><td>Qwen 3 VL 2B</td><td>2B</td></tr><tr><td>Qwen 2.5 VL 7B</td><td>7B</td></tr></tbody></table>

## Qwen3.5 API

{% hint style="info" %}
Qwen3.5 के लिए Direct Inference SDK कॉल्स के लिए एक [समर्पित परिनियोजन](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) या [स्व-होस्टेड Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted). होस्टेड एक्सेस के लिए, ऊपर वर्णित Workflow पथ का उपयोग करें।
{% endhint %}

{% stepper %}
{% step %}

### अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ खोजें [Roboflow API सेटिंग्स पेज](https://app.roboflow.com/settings/api) और इसे अपने शेल में उपलब्ध कराएँ:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### निर्भरताएँ इंस्टॉल करें

इंस्टॉल करें [इन्फ़रेंस SDK](https://docs.roboflow.com/deployment/self-hosted/self-hosted):

```bash
pip install -U inference-sdk supervision
```

{% endstep %}

{% step %}

### मॉडल चलाएँ

सेट करें `api_url` अपने समर्पित डिप्लॉयमेंट URL या एक स्थानीय इन्फ़रेंस सर्वर पर।

```python
import os
import supervision as sv
from inference_sdk import InferenceHTTPClient, InferenceConfiguration

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
).configure(InferenceConfiguration(api_key_transport="header"))
result = client.infer_lmm(
    image,
    model_id="qwen3_5-2b",
    prompt="इस छवि का संक्षेप में वर्णन करें.",
    max_new_tokens=256,
)
print(result["response"])
```

{% endstep %}
{% endstepper %}

ऊपर दिया गया कोड मॉडल की प्रतिक्रिया टर्मिनल पर प्रिंट करता है:

```
एक सफेद टी-शर्ट और लाल शॉर्ट्स पहने एक व्यक्ति अपने कंधे पर एक काले बैकपैक लिए हुए है, और उसके ऊपर एक बीगल कुत्ता बैठा है। यह दृश्य बाहर एक आवासीय इलाके में है, जहाँ पृष्ठभूमि में आधुनिक अपार्टमेंट इमारतें हैं और फुटपाथ के किनारे हरियाली है। व्यक्ति बड़े खिड़कियों वाली एक इमारत के पास चल रहा या खड़ा दिखाई देता है।
```

<figure><img src="/files/ee74092b69343a6ab6ae83c01510673cee706554" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
सेट करें `api_url` को अपने परिनियोजन लक्ष्य से मिलाएँ:

* `http://localhost:9001` एक स्थानीय [इन्फ़रेंस](https://docs.roboflow.com/deployment/self-hosted/self-hosted) सर्वर।
* आपका [समर्पित परिनियोजन](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) एक निजी एंडपॉइंट के लिए URL.
  {% endhint %}

आप Roboflow पर अपना खुद का Qwen3.5 checkpoint प्रशिक्षित कर सकते हैं और उसे उसके प्रति-मॉडल `{workspace}/{model-slug}` ID बदलें (देखें [संस्करण, प्रशिक्षण, और मॉडल](/models/hi/versions-trainings-and-models.md)).

{% embed url="<https://www.youtube.com/watch?v=Y8CR6IzLDaw>" %}

## self-hosted Inference के साथ Qwen3.5 चलाएँ

Qwen3.5 को सीधे भी the [`inference`](https://docs.roboflow.com/deployment/self-hosted/self-hosted) पैकेज के साथ, HTTP के माध्यम से कॉल किए जाने के बजाय।

{% stepper %}
{% step %}

### पैकेज इंस्टॉल करें

```bash
pip install "inference[transformers]"
```

उपयोग करें `inference-gpu[transformers]` एक GPU मशीन पर।
{% endstep %}

{% step %}

### मॉडल चलाएँ

```python
from inference.models.qwen3_5vl.qwen3_5vl_inference_models import (
    InferenceModelsQwen35VLAdapter,
)

model = InferenceModelsQwen35VLAdapter(
    model_id="qwen3_5-0.8b",
    api_key="YOUR_API_KEY",
)

image = "https://media.roboflow.com/dog.jpeg"
prompt = "इस चित्र में कितने कुत्ते हैं?"

preprocessed, metadata = model.preprocess(image, prompt)
predictions = model.predict(preprocessed)
result = model.postprocess(predictions, metadata)

print(result[0].response)
```

{% endstep %}
{% endstepper %}

Qwen3.5 एक "thinking" मोड का भी समर्थन करता है, जिसमें मॉडल उत्तर देने से पहले तर्क टोकन उत्पन्न करता है।

### Workflows में निष्पादन मोड

जब इसे किसी [Workflow](https://docs.roboflow.com/workflows), Qwen3.5 दो मोडों में से एक में चलता है:

* **स्थानीय निष्पादन**: मॉडल आपके Inference सर्वर पर चलता है (GPU अनुशंसित)।
* **दूरस्थ निष्पादन**: मॉडल को दूरस्थ Inference सर्वर पर HTTP के माध्यम से कॉल किया जाता है।
