> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/roboflow/roboflow-hi/deploy/supported-models/qwen3-5.md).

# Qwen3.5

Qwen3.5, Alibaba का vision-language model परिवार है। यह एक image और एक text prompt स्वीकार करता है और एक text response लौटाता है। दो pretrained checkpoints उपलब्ध हैं:

<table data-search="false"><thead><tr><th>उपनाम</th><th>पैरामीटर</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>0.8B</td></tr><tr><td><code>qwen3_5-2b</code></td><td>2B</td></tr></tbody></table>

## सटीकता

आधिकारिक model cards से प्रमुख vision-language benchmarks (non-thinking mode) ([0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B), [2B](https://huggingface.co/Qwen/Qwen3.5-2B)):

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td>बेंचमार्क</td><td><code>qwen3_5-0.8b</code></td><td><code>qwen3_5-2b</code></td></tr><tr><td>MMMU</td><td>47.4</td><td>64.2</td></tr><tr><td>MathVista (mini)</td><td>58.6</td><td>73.9</td></tr><tr><td>MMBench (EN v1.1)</td><td>68.0</td><td>81.3</td></tr></tbody></table>

## Inference speed

Latency मापी गई [Roboflow Inference](https://inference.roboflow.com/) 1x NVIDIA L4 पर, batch size 1 के साथ, fixed prompt से greedy decoding का उपयोग करके बिल्कुल 128 tokens generate करते हुए। Latency output length के साथ scale होती है, इसलिए अन्य lengths का अनुमान लगाने के लिए tokens/sec का उपयोग करें।

<table data-search="false"><thead><tr><th>उपनाम</th><th>विलंबता, 128 tokens (ms)</th><th>टोकन/सेकंड</th></tr></thead><tbody><tr><td><code>qwen3_5-0.8b</code></td><td>3307</td><td>39</td></tr><tr><td><code>qwen3_5-2b</code></td><td>3688</td><td>35</td></tr></tbody></table>

## Workflows के माध्यम से Qwen 3.5 VL का उपयोग करना

Qwen 3.5 VL एक preconfigured [Workflow](/roboflow/roboflow-hi/workflows/what-is-workflows.md) रूप में Models page के "Open-Source Models" tab पर उपलब्ध है। "Qwen VL" चुनें, एक model variant और prompt चुनें, फिर "Test API" पर क्लिक करके Workflow को अपने Workspace में fork करें और inference चलाना शुरू करें।

यह Workflow unified `qwen_vlm@v1` block का उपयोग करता है, जो कई Qwen VL generations का समर्थन करता है:

<table data-search="false"><thead><tr><th>मॉडल</th><th>पैरामीटर</th></tr></thead><tbody><tr><td>Qwen 3.5 VL 0.8B</td><td>0.8B</td></tr><tr><td>Qwen 3.5 VL 2B</td><td>2B</td></tr><tr><td>Qwen 3 VL 2B</td><td>2B</td></tr><tr><td>Qwen 2.5 VL 7B</td><td>7B</td></tr></tbody></table>

## Inference SDK के माध्यम से Qwen 3.5 VL का उपयोग करना

{% hint style="info" %}
Qwen3.5 के लिए सीधे Inference SDK calls के लिए एक [Dedicated Deployment](/roboflow/roboflow-hi/deploy/dedicated-deployments.md) या [self-hosted Inference](https://inference.roboflow.com/). Hosted access के लिए, ऊपर वर्णित Workflow path का उपयोग करें।
{% endhint %}

{% stepper %}
{% step %}

### अपनी API Key प्राप्त करें

एक Roboflow खाता बनाएं, अपनी key यहाँ पर ढूँढें [Roboflow API settings page](https://app.roboflow.com/settings/api) और इसे अपने shell में उपलब्ध कराएँ:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### निर्भरताएँ इंस्टॉल करें

इंस्टॉल करें [Inference SDK](https://inference.roboflow.com/):

```bash
pip install inference-sdk
```

{% endstep %}

{% step %}

### मॉडल चलाएँ

सेट करें `api_url` को अपने Dedicated Deployment URL या local Inference server पर।

```python
import os
import cv2
import numpy as np
import requests
from inference_sdk import InferenceHTTPClient

content = requests.get("https://media.roboflow.com/quickstart/dog.jpeg").content
image = cv2.imdecode(np.frombuffer(content, np.uint8), cv2.IMREAD_COLOR)

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="qwen3_5-2b",
    prompt="इस image का संक्षेप में वर्णन करें।",
    max_new_tokens=256,
)
print(result["response"])
```

{% endstep %}
{% endstepper %}

ऊपर दिया गया code terminal में model का response प्रिंट करता है:

```
एक सफेद t-shirt और लाल shorts पहने व्यक्ति अपने कंधे पर एक black backpack लिए हुए है, और उसके ऊपर एक beagle dog बैठा हुआ है। यह दृश्य बाहर एक residential area में होता है, जहाँ background में आधुनिक apartment buildings हैं और sidewalk के किनारे हरियाली है। व्यक्ति एक building के पास चल रहा या खड़ा दिखाई देता है, जिसके बड़े windows हैं।
```

<figure><img src="/files/d4365508f39e21578155b56b5e503dc1afec14e3" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
सेट करें `api_url` को अपने deployment target से मिलाएँ:

* `http://localhost:9001` एक local [Inference](https://inference.roboflow.com/) server.
* आपका [Dedicated Deployment](/roboflow/roboflow-hi/deploy/dedicated-deployments.md) एक private endpoint के लिए URL.
  {% endhint %}

आप Roboflow पर अपना Qwen3.5 checkpoint train कर सकते हैं और उसे उसके per-model द्वारा कॉल कर सकते हैं `{workspace}/{model-slug}` ID (देखें [Versions, Trainings, and Models](/roboflow/roboflow-hi/train/versions-trainings-and-models.md)).

{% embed url="<https://www.youtube.com/watch?v=Y8CR6IzLDaw>" %}
