For the complete documentation index, see llms.txt. This page is also available as Markdown.

Linux पर स्थापित करें

Inference CLI, Docker, या Docker Compose के साथ CPU, GPU, या TensorRT पर Linux में Roboflow Inference Server स्थापित और चलाएँ।

अपनी मशीन के लिए सही कंटेनर को, अच्छे डिफ़ॉल्ट सेटिंग्स (एक कैश वॉल्यूम और एक सुरक्षित, गैर-विशेषाधिकार प्राप्त निष्पादन मोड) के साथ, शुरू करने का सबसे आसान तरीका है CLI को इसे चुनने और इसे इसके साथ शुरू करने देना inference server start. पहले Docker इंस्टॉल करें पहले:

pip install inference-cli
inference server start

कंटेनर को मैन्युअल रूप से शुरू करना

यदि आप कंटेनर सेटिंग्स पर अधिक नियंत्रण चाहते हैं, तो इसे स्वयं शुरू करें।

मुख्य CPU Docker इमेज onnxruntime के माध्यम से x64 CPUs पर OpenVINO acceleration के लिए समर्थन शामिल करती है। SAM2 जैसे भारी मॉडल बहुत धीमे चल सकते हैं (प्रति image कई दर्जन सेकंड) जिससे वे व्यावहारिक नहीं रहते; यदि आपको उनकी आवश्यकता है, तो CUDA-सक्षम GPU का उपयोग करें।

CPU inference के प्राथमिक उपयोग-केस स्थिर चित्रों को प्रोसेस करना (उदाहरण के लिए uploads का NSFW classification या document verification) या वीडियो से frames का कम-आवृत्ति sampling करना (उदाहरण के लिए parking lot की occupancy tracking) हैं।

CPU inference शुरू करने के लिए, उपयोग करें roboflow/roboflow-inference-server-cpu:latest कंटेनर।

sudo docker run -d \\
    --name inference-server \\
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    roboflow/roboflow-inference-server-cpu:latest

GPU कंटेनर NVIDIA-Docker के माध्यम से CUDA को सपोर्ट करने वाले कार्डों पर हार्डवेयर एक्सेलेरेशन जोड़ता है। अनुसरण करें NVIDIA कंटेनर टूलकिट स्थापना मार्गदर्शिका, फिर जोड़ें --gpus all को docker run कमांड:

sudo docker run -d \\
    --name inference-server \\
    --gpus all \
    --read-only \\
    -p 9001:9001 \\
    --volume ~/.inference/cache:/tmp:rw \\
    --security-opt="no-new-privileges" \\
    --cap-drop="ALL" \\
    --cap-add="NET_BIND_SERVICE" \\
    roboflow/roboflow-inference-server-gpu:latest

GPU कंटेनर के साथ आप वैकल्पिक रूप से सक्षम कर सकते हैं TensorRTNVIDIA का मॉडल अनुकूलन रनटाइम। यह भारी संकलन और अनुकूलन चरण (कभी-कभी 15+ मिनट) की कीमत पर आपके मॉडल की गति को बहुत बढ़ा देता है, जो आप प्रत्येक मॉडल को पहली बार लोड करते समय होता है।

TensorRT सक्षम करें यह जोड़कर TensorrtExecutionProvider को ONNXRUNTIME_EXECUTION_PROVIDERS पर्यावरण चर।

Docker Compose

यदि आप अपने एप्लिकेशन के लिए Docker Compose का उपयोग करते हैं, तो समकक्ष YAML है:

Roboflow Enterprise योजनाएँ जोड़ती हैं एक Helm chart Kubernetes परिनियोजनों, OT नेटवर्क के लिए नेटवर्किंग समाधानों, और अनुकूलित सहायता तथा स्थापना पैकेजों के लिए। बिक्री टीम से संपर्क करें अधिक जानने के लिए।

अगले चरण

अंतिम अपडेट

क्या यह उपयोगी था?