For the complete documentation index, see llms.txt. This page is also available as Markdown.

Florence 2

हमारे Serverless Cloud API के माध्यम से Microsoft के Florence 2 मल्टीमोडल मॉडल का उपयोग करें

हम समर्थन करते हैं Microsoft का Florence 2, एक बहु-मोडल दृष्टि-भाषा मॉडल, हमारे माध्यम से सर्वरलेस क्लाउड API के माध्यम से समर्थित करते हैं. Florence 2 कार्य प्रॉम्प्ट के माध्यम से कैप्शनिंग, ऑब्जेक्ट डिटेक्शन, सेगमेंटेशन और OCR का समर्थन करता है (जैसे <CAPTION>, <OD>, <OCR>, <REFERRING_EXPRESSION_SEGMENTATION>).

डिफ़ॉल्ट उपनाम

उपनाम का उपयोग इस रूप में करें model_id अपने अनुरोध में, और रनटाइम इसे संबंधित पूर्व-प्रशिक्षित वज़नों में मैप कर देता है।

उपनाम

florence-2-base

florence-2-large

शुद्धता

आधिकारिक मॉडल कार्डों से प्रमुख ज़ीरो-शॉट मेट्रिक्स (बेस, लार्ज):

बेंचमार्क

florence-2-base

florence-2-large

COCO कैप्शन (CIDEr)

133.0

135.6

COCO डिटेक्शन (mAP)

34.7

37.5

RefCOCO (सटीकता)

53.9

56.3

इन्फरेंस गति

विलंबता मापी गई Roboflow Inference 1x NVIDIA L4 पर, बैच आकार 1 के साथ, greedy decoding का उपयोग करके ठीक 128 टोकन उत्पन्न करते हुए <CAPTION> प्रॉम्प्ट। विलंबता आउटपुट लंबाई के साथ स्केल होती है, इसलिए अन्य लंबाइयों का अनुमान लगाने के लिए टोकन/सेकंड का उपयोग करें।

उपनाम
लेटेंसी, 128 टोकन (मि.से.)
टोकन/सेकंड

florence-2-base

652

198

florence-2-large

1120

115

कोड नमूना

Florence 2 साझा /infer/lmm एंडपॉइंट। इसे सीधे HTTP एंडपॉइंट के माध्यम से इस प्रकार कॉल करें curl, या inference-sdk रैपर के साथ।

1

अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ ढूँढें Roboflow API सेटिंग्स पेज और इसे अपने शेल में उपलब्ध कराएँ:

2

मॉडल चलाएँ

को कॉल करें /infer/lmm एंडपॉइंट को एक कार्य प्रॉम्प्ट के साथ उपयोग करते हुए curl:

1

अपनी API कुंजी प्राप्त करें

एक Roboflow खाता बनाएँ, अपनी कुंजी यहाँ ढूँढें Roboflow API सेटिंग्स पेज और इसे अपने शेल में उपलब्ध कराएँ:

2

निर्भरताएँ इंस्टॉल करें

यह पैकेज मॉडल को कॉल करता है:

3

मॉडल चलाएँ

LMM इनफरेंस एंडपॉइंट को एक कार्य प्रॉम्प्ट के साथ कॉल करें:

सेट करें api_url को अपने डिप्लॉयमेंट लक्ष्य से मिलाएँ:

बदलें <CAPTION> किसी भी समर्थित कार्य प्रॉम्प्ट के लिए (उदाहरण के लिए <DETAILED_CAPTION>, <OD>, <OCR>, <OPEN_VOCABULARY_DETECTION>, <REFERRING_EXPRESSION_SEGMENTATION>) ताकि कैप्शनिंग, डिटेक्शन, OCR और सेगमेंटेशन कार्यों के बीच स्विच किया जा सके।

स्व-होस्टेड परिनियोजन और कार्य प्रॉम्प्टों की पूरी सूची के लिए, देखें इनफ़ेरेंस दस्तावेज़ीकरण.

कार्य प्रॉम्प्ट

Florence 2 प्रॉम्प्ट टोकन के आधार पर कार्य बदलता है। निम्न में से किसी एक को इस रूप में दें प्रॉम्प्ट:

कार्य
प्रॉम्प्ट

ऑब्जेक्ट डिटेक्शन

<OD>

घने क्षेत्र का कैप्शनिंग

<DENSE_REGION_CAPTION>

छवि कैप्शनिंग

<CAPTION>, <DETAILED_CAPTION>, <MORE_DETAILED_CAPTION>

क्षेत्र प्रस्ताव

<REGION_PROPOSAL>

वाक्यांश ग्राउंडिंग

<CAPTION_TO_PHRASE_GROUNDING>

संदर्भित अभिव्यक्ति सेगमेंटेशन

<REFERRING_EXPRESSION_SEGMENTATION>

क्षेत्र से सेगमेंटेशन

<REGION_TO_SEGMENTATION>

खुले शब्दावली डिटेक्शन

<OPEN_VOCABULARY_DETECTION>

क्षेत्र से विवरण

<REGION_TO_DESCRIPTION>

OCR

<OCR>

क्षेत्र के साथ OCR

<OCR_WITH_REGION>

Inference के साथ उपयोग करें (सेल्फ-होस्टेड)

Florence 2 को सीधे इसके साथ भी लोड किया जा सकता है inference पैकेज के साथ भी लोड कर सकते हैं।

1

पैकेज इंस्टॉल करें

उपयोग करें inference-gpu[transformers] एक GPU मशीन पर।

2

मॉडल चलाएँ

बदलें <CAPTION> ऊपर दी गई तालिका के किसी भी कार्य प्रॉम्प्ट के लिए।

वर्कफ़्लोज़ में निष्पादन मोड

जब किसी Workflow, Florence 2 दो मोड में से एक में चलता है:

  • स्थानीय निष्पादन: मॉडल आपके Inference सर्वर पर चलता है (GPU अनुशंसित)।

  • दूरस्थ निष्पादन: मॉडल को किसी रिमोट Inference सर्वर पर HTTP के माध्यम से कॉल किया जाता है।

अंतिम अपडेट

क्या यह उपयोगी था?