For the complete documentation index, see llms.txt. This page is also available as Markdown.

मॉडल प्रबंधन

inference-sdk client के साथ Inference Server पर मॉडलों को pre-load, inspect, और unload करें।

Model weights download

जब self-hosted Inference Server का उपयोग करते हैं, तो inference चलाने से पहले weights डाउनलोड और cache करने के लिए आप models को pre-load कर सकते हैं:

from inference_sdk import InferenceHTTPClient

client = InferenceHTTPClient(
    api_url="http://localhost:9001",
    api_key="YOUR_ROBOFLOW_API_KEY"
)

# मॉडल को pre-load करें (weights को सर्वर cache में डाउनलोड करता है)
client.load_model(model_id="rfdetr-base")

वैकल्पिक रूप से, पहली inference चलाने पर डाउनलोड अपने आप शुरू हो जाएगा।

Workflows के लिए, आपको Workflow में उपयोग होने वाले सभी models को भी pre-load करना चाहिए और उसकी definition को cache करने के लिए Workflow को एक बार चलाना चाहिए।

आप सत्यापित कर सकते हैं कि सर्वर पर कौन-से models loaded हैं:

loaded_models = client.list_loaded_models()
print(f"लोड किए गए models: {loaded_models}")

के बारे में और पढ़ें weights caching, persistent storage, और Docker configuration.

Inference Server को नियंत्रित करने के तरीके

सर्वर जानकारी प्राप्त करना

लोड किए गए models की सूची

Async समकक्ष: list_loaded_models_async()

किसी विशिष्ट model का विवरण प्राप्त करना

यदि allow_loading को सेट किया गया है True, तो यदि model पहले से loaded नहीं है, तो side effect के रूप में उसे load किया जाता है। डिफ़ॉल्ट: True.

Async समकक्ष: get_model_description_async()

किसी model को load करना

संकेतित model load किया जाता है। यदि set_as_default को सेट किया गया है True, तो सफल load के बाद model client के लिए default model के रूप में उपयोग किया जाता है। डिफ़ॉल्ट मान: False.

Async समकक्ष: load_model_async()

किसी model को unload करना

कभी-कभी, सर्वर साइड पर OOM से बचने के लिए, किसी model को unload करना आवश्यक होता है।

Async समकक्ष: unload_model_async()

सभी models को unload करना

Async समकक्ष: unload_all_models_async()

अंतिम अपडेट

क्या यह उपयोगी था?