For the complete documentation index, see llms.txt. This page is also available as Markdown.

Florence 2

Serverless Hosted API를 통해 Microsoft의 Florence 2 multimodal model을 사용합니다.

지원합니다 Microsoft의 Florence 2, 다중모달 비전-언어 모델인 이를 우리의 Serverless Hosted API. Florence 2는 task prompt(예: <CAPTION>, <OD>, <OCR>, <REFERRING_EXPRESSION_SEGMENTATION>).

기본 alias

alias를 다음의 model_id 요청에 사용하면 runtime이 이를 해당 pretrained weights로 해석합니다.

별칭

florence-2-base

florence-2-large

정확도

공식 model card의 대표 zero-shot metric (base, large):

벤치마크

florence-2-base

florence-2-large

COCO Caption (CIDEr)

133.0

135.6

COCO detection (mAP)

34.7

37.5

RefCOCO (정확도)

53.9

56.3

추론 속도

다음 기준으로 측정한 지연 시간 Roboflow Inference 1x NVIDIA L4에서 batch size 1로, 다음에서 greedy decoding을 사용해 정확히 128 tokens를 생성할 때: <CAPTION> prompt입니다. latency는 output length에 따라 증가하므로, 다른 길이를 추정하려면 tokens/sec을 사용하세요.

별칭
지연 시간, 128 토큰(ms)
Tokens/sec

florence-2-base

652

198

florence-2-large

1120

115

코드 샘플

Florence 2는 공유된 /infer/lmm endpoint입니다. 다음을 사용해 HTTP endpoint를 통해 직접 호출하세요: curl또는 inference-sdk 래퍼를 사용하세요.

1

API Key를 받으세요

Roboflow 계정을 만들고, 다음에서 키를 찾으세요: Roboflow API 설정 페이지 그리고 이를 셸에서 사용할 수 있도록 설정하세요:

2

모델을 실행하세요

다음에 호출하세요. /infer/lmm 다음 task prompt를 사용해 endpoint를 호출하세요: curl:

설정 api_url 을 배포 대상에 맞게 설정하세요:

  • https://serverless.roboflow.com Serverless Hosted API용입니다.

  • http://localhost:9001 로컬 Inference 서버용입니다.

  • 귀하의 Dedicated Deployment 비공개 엔드포인트용 URL입니다.

다음으로 바꾸세요 <CAPTION> 지원되는 any task prompt로(예: <DETAILED_CAPTION>, <OD>, <OCR>, <OPEN_VOCABULARY_DETECTION>, <REFERRING_EXPRESSION_SEGMENTATION>)를 사용해 captioning, detection, OCR, segmentation 작업 간을 전환하세요.

self-hosted deployment 및 task prompt의 전체 목록은 다음을 참조하세요: Inference 문서.

마지막 업데이트

도움이 되었나요?