For the complete documentation index, see llms.txt. This page is also available as Markdown.

Florence 2

Microsoft의 Florence 2 멀티모달 모델을 Serverless Cloud API를 통해 사용하세요.

지원합니다 Microsoft의 Florence 2, 멀티모달 비전-언어 모델을, 우리의 Serverless Cloud API. Florence 2는 작업 프롬프트(예: <CAPTION>, <OD>, <OCR>, <REFERRING_EXPRESSION_SEGMENTATION>).

기본 별칭

별칭을 다음과 같이 사용하세요 model_id 요청에 사용하면 런타임이 이를 해당 사전 학습 가중치로 매핑합니다.

별칭

florence-2-base

florence-2-large

정확도

공식 모델 카드의 대표적인 제로샷 지표(베이스, 라지):

벤치마크

florence-2-base

florence-2-large

COCO 캡션(CIDEr)

133.0

135.6

COCO 탐지(mAP)

34.7

37.5

RefCOCO(정확도)

53.9

56.3

추론 속도

지연 시간 측정 기준: Roboflow Inference 1x NVIDIA L4에서, 배치 크기 1로, 다음에서 greedy 디코딩을 사용해 정확히 128개 토큰을 생성하며 <CAPTION> 프롬프트를 사용합니다. 지연 시간은 출력 길이에 따라 달라지므로, 다른 길이는 토큰/초로 추정하세요.

별칭
지연 시간, 128 토큰(ms)
토큰/초

florence-2-base

652

198

florence-2-large

1120

115

코드 예시

Florence 2는 공유된 /infer/lmm 엔드포인트를 통해 실행됩니다. HTTP 엔드포인트를 통해 직접 호출하려면 curl, 또는 다음을 사용하여 inference-sdk 래퍼.

1

API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요. Roboflow API 설정 페이지 에서 다음과 같이 셸에서 사용할 수 있도록 합니다:

2

모델 실행

다음을 호출합니다. /infer/lmm 다음 작업 프롬프트를 사용하여 엔드포인트로 curl:

1

API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요. Roboflow API 설정 페이지 에서 다음과 같이 셸에서 사용할 수 있도록 합니다:

2

의존성 설치

이 패키지는 다음 모델을 호출합니다:

3

모델 실행

작업 프롬프트로 LMM 추론 엔드포인트를 호출하세요:

설정 api_url 를 배포 대상에 맞게:

  • https://serverless.roboflow.com 서버리스 클라우드 API용입니다.

  • http://localhost:9001 로컬 Inference 서버용.

  • 당신의 전용 배포 비공개 엔드포인트용 URL.

바꿔 <CAPTION> 지원되는 모든 작업 프롬프트로(예: <DETAILED_CAPTION>, <OD>, <OCR>, <OPEN_VOCABULARY_DETECTION>, <REFERRING_EXPRESSION_SEGMENTATION>)을 사용해 캡션, 탐지, OCR 및 세분화 작업 간에 전환하세요.

셀프 호스팅 배포 및 작업 프롬프트 전체 목록은 다음을 참조하세요: 추론 문서.

작업 프롬프트

Florence 2는 프롬프트 토큰으로 작업을 전환합니다. 다음 중 하나를 프롬프트:

작업
프롬프트

객체 탐지

<OD>

밀집 영역 캡션

<DENSE_REGION_CAPTION>

이미지 캡션

<CAPTION>, <DETAILED_CAPTION>, <MORE_DETAILED_CAPTION>

영역 제안

<REGION_PROPOSAL>

구문 정합

<CAPTION_TO_PHRASE_GROUNDING>

지시 표현 세분화

<REFERRING_EXPRESSION_SEGMENTATION>

영역을 세분화로

<REGION_TO_SEGMENTATION>

개방형 어휘 탐지

<OPEN_VOCABULARY_DETECTION>

영역을 설명으로

<REGION_TO_DESCRIPTION>

OCR

<OCR>

영역 포함 OCR

<OCR_WITH_REGION>

Inference(자가 호스팅)에서 사용

Florence 2는 다음을 사용해 직접 불러올 수도 있습니다: inference 패키지.

1

패키지를 설치하세요

사용 inference-gpu[transformers] GPU 머신에서.

2

모델 실행

바꿔 <CAPTION> 위 표의 모든 작업 프롬프트에 대해.

워크플로의 실행 모드

다음에서 사용될 때 워크플로, Florence 2는 다음 두 가지 모드 중 하나로 실행됩니다:

  • 로컬 실행: 모델이 Inference 서버에서 실행됩니다(GPU 권장).

  • 원격 실행: 모델은 원격 Inference 서버에서 HTTP를 통해 호출됩니다.

마지막 업데이트

도움이 되었나요?