For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.5

Workflows, समर्पित डिप्लॉयमेंट, या स्व-होस्टेड Inference के माध्यम से Alibaba के Qwen3.5-VL विज़न-लैंग्वेज मॉडल का उपयोग करें

Qwen3.5, Alibaba का विज़न-भाषा मॉडल परिवार है। यह एक छवि और एक पाठ प्रॉम्प्ट स्वीकार करता है और एक पाठ प्रतिक्रिया देता है। दो पूर्व-प्रशिक्षित चेकपॉइंट उपलब्ध हैं:

उपनाम
पैरामीटर

qwen3_5-0.8b

0.8B

qwen3_5-2b

2B

सटीकता

आधिकारिक मॉडल कार्ड से प्रमुख विज़न-भाषा बेंचमार्क (नॉन-थिंकिंग मोड) (0.8B, 2B):

बेंचमार्क

qwen3_5-0.8b

qwen3_5-2b

MMMU

47.4

64.2

MathVista (मिनी)

58.6

73.9

MMBench (EN v1.1)

68.0

81.3

इनफ़रेंस गति

विलंबता मापी गई Roboflow Inference 1x NVIDIA L4 पर, बैच आकार 1 के साथ, एक निश्चित प्रॉम्प्ट से greedy decoding का उपयोग करके ठीक 128 टोकन उत्पन्न करते समय। आउटपुट लंबाई के साथ विलंबता बढ़ती है, इसलिए अन्य लंबाइयों का अनुमान लगाने के लिए tokens/sec का उपयोग करें।

उपनाम
विलंबता, 128 टोकन (मि.से.)
टोकन/सेकंड

qwen3_5-0.8b

3307

39

qwen3_5-2b

3688

35

Workflows के माध्यम से Qwen 3.5 VL का उपयोग

Qwen 3.5 VL एक पूर्व-कॉन्फ़िगर किए गए वर्कफ़्लो Models पेज के "Open-Source Models" टैब पर उपलब्ध है। "Qwen VL" चुनें, एक मॉडल वैरिएंट और प्रॉम्प्ट चुनें, फिर वर्कफ़्लो को अपने Workspace में फ़ोर्क करने और इन्फ़रेंस चलाना शुरू करने के लिए "Test API" पर क्लिक करें।

वर्कफ़्लो एकीकृत qwen_vlm@v1 ब्लॉक का उपयोग करता है, जो Qwen VL की कई पीढ़ियों का समर्थन करता है:

मॉडल
पैरामीटर

Qwen 3.5 VL 0.8B

0.8B

Qwen 3.5 VL 2B

2B

Qwen 3 VL 2B

2B

Qwen 2.5 VL 7B

7B

Inference SDK के माध्यम से Qwen 3.5 VL का उपयोग

Qwen3.5 के लिए प्रत्यक्ष Inference SDK कॉल हेतु एक समर्पित परिनियोजन या स्व-होस्टेड इनफ़रेंस. होस्टेड एक्सेस के लिए, ऊपर वर्णित वर्कफ़्लो पथ का उपयोग करें।

1

अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ खोजें Roboflow API सेटिंग्स पेज और इसे अपने shell के लिए उपलब्ध कराएँ:

2

निर्भरताएँ इंस्टॉल करें

इंस्टॉल करें Inference SDK:

3

मॉडल चलाएँ

सेट करें api_url अपने Dedicated Deployment URL या किसी स्थानीय Inference सर्वर पर।

ऊपर दिया गया कोड मॉडल की प्रतिक्रिया को टर्मिनल पर प्रिंट करता है:

सेट करें api_url को अपने deployment target से मिलाने के लिए:

आप Roboflow पर अपना स्वयं का Qwen3.5 चेकपॉइंट प्रशिक्षित कर सकते हैं और इसे उसके प्रति-मॉडल {workspace}/{model-slug} आईडी (देखें Versions, Trainings, and Models).

Inference (self-hosted) के साथ उपयोग करें

Qwen3.5 को सीधे भी इनफ़रेंस पैकेज के साथ लोड किया जा सकता है, HTTP के माध्यम से कॉल किए जाने के बजाय।

1

पैकेज इंस्टॉल करें

उपयोग करें inference-gpu[transformers] एक GPU मशीन पर।

2

मॉडल चलाएँ

Qwen3.5 एक "थिंकिंग" मोड का भी समर्थन करता है, जिसमें मॉडल उत्तर देने से पहले तर्कशील टोकन उत्पन्न करता है।

वर्कफ़्लोज़ में निष्पादन मोड

जब इसे एक में उपयोग किया जाता है वर्कफ़्लो, Qwen3.5 दो में से किसी एक मोड में चलता है:

  • लोकल निष्पादन: मॉडल आपके Inference सर्वर पर चलता है (GPU अनुशंसित)।

  • रिमोट निष्पादन: मॉडल को एक दूरस्थ Inference सर्वर पर HTTP के माध्यम से कॉल किया जाता है।

अंतिम अपडेट

क्या यह उपयोगी था?