For the complete documentation index, see llms.txt. This page is also available as Markdown.

SmolVLM2

Dedicated Deployment या self-hosted Inference पर HuggingFace के SmolVLM2 vision-language model का उपयोग करें

SmolVLM2 HuggingFace का एक कॉम्पैक्ट vision-language model है। यह एक image और एक text prompt स्वीकार करता है और एक text response लौटाता है।

SmolVLM2 Serverless Hosted API पर उपलब्ध नहीं है। इसे एक पर चलाएँ Dedicated Deployment या self-hosted Inference.

कोड नमूना

1

अपनी API Key प्राप्त करें

एक Roboflow खाता बनाएं, अपनी key यहाँ पर ढूँढें Roboflow API settings page और इसे अपने shell में उपलब्ध कराएँ:

export ROBOFLOW_API_KEY="your-key-here"
2

निर्भरताएँ इंस्टॉल करें

इंस्टॉल करें Inference SDK:

pip install inference-sdk
3

मॉडल चलाएँ

सेट करें api_url को अपने Dedicated Deployment URL या local Inference server पर।

import os
import cv2
import numpy as np
import requests
from inference_sdk import InferenceHTTPClient

content = requests.get("https://media.roboflow.com/quickstart/dog.jpeg").content
image = cv2.imdecode(np.frombuffer(content, np.uint8), cv2.IMREAD_COLOR)

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="smolvlm2",
    prompt="इस image का संक्षेप में वर्णन करें।",
    max_new_tokens=64,
)
print(result["response"])

ऊपर दिया गया code terminal में model का response प्रिंट करता है:

एक आदमी अपने कंधों पर एक कुत्ता उठा रहा है।

Inference speed

Latency मापी गई Roboflow Inference 1x NVIDIA L4 पर, batch size 1 के साथ, fixed prompt से greedy decoding का उपयोग करके बिल्कुल 128 tokens generate करते हुए। Latency output length के साथ scale होती है, इसलिए अन्य lengths का अनुमान लगाने के लिए tokens/sec का उपयोग करें।

उपनाम
विलंबता, 128 tokens (ms)
टोकन/सेकंड

smolvlm2

3113

41

सेट करें api_url को अपने deployment target से मिलाएँ:

अंतिम अपडेट

क्या यह उपयोगी था?