For the complete documentation index, see llms.txt. This page is also available as Markdown.

Florence-2 모델

이미지에서 Florence-2를 실행합니다

v2

전용 추론 서버 필요(GPU 권장) - 전용 배포를 사용하는 것이 좋을 수 있습니다

이 워크플로 블록은 다음을 소개합니다 Florence 2, 다양한 작업을 수행할 수 있는 시각 언어 모델(VLM)로, 다음을 포함합니다:

  • 객체 탐지

  • 인스턴스 분할

  • 이미지 캡셔닝

  • 광학 문자 인식(OCR)

  • 그 외에도...

아래는 모델이 지원하는 작업의 포괄적인 목록과, Workflows 생태계 내에서 해당 출력물을 활용하는 방법에 대한 설명입니다:

작업 설명:

  • 사용자 지정 프롬프트 (custom) - 자유 형식 프롬프트를 사용해 응답을 생성합니다. 미세 조정된 모델에 유용합니다.

  • 텍스트 인식(OCR) (ocr) - 모델이 이미지의 텍스트를 인식합니다

  • 텍스트 탐지 및 인식(OCR) (ocr-with-text-detection) - 모델이 이미지에서 텍스트 영역을 탐지한 다음, 탐지된 각 영역에 OCR을 수행합니다

  • 캡셔닝(짧음) (caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다

  • 캡셔닝 (detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다

  • 캡셔닝(길음) (more-detailed-caption) - 모델이 이미지에 대한 매우 긴 설명을 제공합니다

  • 비프롬프트 객체 탐지 (object-detection) - 모델이 이미지 내 주요 객체의 바운딩 박스를 탐지하여 반환합니다

  • 객체 탐지 (open-vocabulary-object-detection) - 모델이 제공된 클래스의 바운딩 박스를 탐지하여 반환합니다

  • 탐지 및 캡셔닝 (object-detection-and-caption) - 모델이 주요 객체를 탐지하고 캡션을 생성합니다

  • 프롬프트 기반 객체 탐지 (phrase-grounded-object-detection) - 텍스트 프롬프트를 바탕으로 설명에 부합하는 객체를 탐지합니다

  • 프롬프트 기반 인스턴스 분할 (phrase-grounded-instance-segmentation) - 텍스트 프롬프트를 바탕으로 설명에 부합하는 객체를 분할합니다

  • 바운딩 박스 분할 (detection-grounded-instance-segmentation) - 모델이 제공된 바운딩 박스 안의 객체를 폴리곤으로 분할합니다

  • 바운딩 박스 분류 (detection-grounded-classification) - 모델이 제공된 바운딩 박스 안의 객체를 분류합니다

  • 바운딩 박스 캡셔닝 (detection-grounded-caption) - 모델이 제공된 바운딩 박스 안의 객체에 캡션을 생성합니다

  • 바운딩 박스용 텍스트 인식(OCR) (detection-grounded-ocr) - 모델이 제공된 바운딩 박스 내부의 텍스트에 OCR을 수행합니다

  • 관심 영역 제안 (region-proposal) - 모델이 이미지의 관심 영역(바운딩 박스)을 제안합니다

유형 식별자

step에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/florence_2@v2 를 워크플로에 단계로 추가합니다.

속성

이름

유형

설명

참조

name

str

이 단계에 고유 식별자를 입력하세요..

task_type

str

모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..

프롬프트

str

Florence-2 모델에 대한 텍스트 프롬프트.

classes

List[str]

사용할 클래스 목록.

grounding_detection

Optional[List[float], List[int]]

Florence-2 모델의 기준이 되는 탐지 결과입니다. 정적으로 제공된 바운딩 박스일 수 있습니다 [left_top_x, left_top_y, right_bottom_x, right_bottom_y] 또는 객체 탐지 모델의 결과일 수 있습니다. 후자인 경우, 하나의 박스가 다음을 기준으로 선택됩니다 grounding_selection_mode..

grounding_selection_mode

str

.

model_id

str

사용할 모델.

해당 참조 열은 워크플로 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있음을 나타냅니다. 자세한 내용은 워크플로 런타임. 자세한 내용은 바인딩 를 참조하세요.

런타임 호환성

하드 - 런타임 self_hosted_cpu; 실행 로컬 : GPU가 필요합니다. run_locally()는 CUDA가 필요한 모델을 로드합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 종류에 따라 달라집니다. 어떤 바인딩 종류가 있는지 확인하세요 Florence-2 모델 버전 v2 가 있습니다.

입력 및 출력 바인딩
예시 JSON 정의

v1

전용 추론 서버 필요(GPU 권장) - 전용 배포를 사용하는 것이 좋을 수 있습니다

이 워크플로 블록은 다음을 소개합니다 Florence 2, 다양한 작업을 수행할 수 있는 시각 언어 모델(VLM)로, 다음을 포함합니다:

  • 객체 탐지

  • 인스턴스 분할

  • 이미지 캡셔닝

  • 광학 문자 인식(OCR)

  • 그 외에도...

아래는 모델이 지원하는 작업의 포괄적인 목록과, Workflows 생태계 내에서 해당 출력물을 활용하는 방법에 대한 설명입니다:

작업 설명:

  • 사용자 지정 프롬프트 (custom) - 자유 형식 프롬프트를 사용해 응답을 생성합니다. 미세 조정된 모델에 유용합니다.

  • 텍스트 인식(OCR) (ocr) - 모델이 이미지의 텍스트를 인식합니다

  • 텍스트 탐지 및 인식(OCR) (ocr-with-text-detection) - 모델이 이미지에서 텍스트 영역을 탐지한 다음, 탐지된 각 영역에 OCR을 수행합니다

  • 캡셔닝(짧음) (caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다

  • 캡셔닝 (detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다

  • 캡셔닝(길음) (more-detailed-caption) - 모델이 이미지에 대한 매우 긴 설명을 제공합니다

  • 비프롬프트 객체 탐지 (object-detection) - 모델이 이미지 내 주요 객체의 바운딩 박스를 탐지하여 반환합니다

  • 객체 탐지 (open-vocabulary-object-detection) - 모델이 제공된 클래스의 바운딩 박스를 탐지하여 반환합니다

  • 탐지 및 캡셔닝 (object-detection-and-caption) - 모델이 주요 객체를 탐지하고 캡션을 생성합니다

  • 프롬프트 기반 객체 탐지 (phrase-grounded-object-detection) - 텍스트 프롬프트를 바탕으로 설명에 부합하는 객체를 탐지합니다

  • 프롬프트 기반 인스턴스 분할 (phrase-grounded-instance-segmentation) - 텍스트 프롬프트를 바탕으로 설명에 부합하는 객체를 분할합니다

  • 바운딩 박스 분할 (detection-grounded-instance-segmentation) - 모델이 제공된 바운딩 박스 안의 객체를 폴리곤으로 분할합니다

  • 바운딩 박스 분류 (detection-grounded-classification) - 모델이 제공된 바운딩 박스 안의 객체를 분류합니다

  • 바운딩 박스 캡셔닝 (detection-grounded-caption) - 모델이 제공된 바운딩 박스 안의 객체에 캡션을 생성합니다

  • 바운딩 박스용 텍스트 인식(OCR) (detection-grounded-ocr) - 모델이 제공된 바운딩 박스 내부의 텍스트에 OCR을 수행합니다

  • 관심 영역 제안 (region-proposal) - 모델이 이미지의 관심 영역(바운딩 박스)을 제안합니다

유형 식별자

step에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/florence_2@v1 를 워크플로에 단계로 추가합니다.

속성

이름

유형

설명

참조

name

str

이 단계에 고유 식별자를 입력하세요..

task_type

str

모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..

프롬프트

str

Florence-2 모델에 대한 텍스트 프롬프트.

classes

List[str]

사용할 클래스 목록.

grounding_detection

Optional[List[float], List[int]]

Florence-2 모델의 기준이 되는 탐지 결과입니다. 정적으로 제공된 바운딩 박스일 수 있습니다 [left_top_x, left_top_y, right_bottom_x, right_bottom_y] 또는 객체 탐지 모델의 결과일 수 있습니다. 후자인 경우, 하나의 박스가 다음을 기준으로 선택됩니다 grounding_selection_mode..

grounding_selection_mode

str

.

모델 버전

str

사용할 모델.

해당 참조 열은 워크플로 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있음을 나타냅니다. 자세한 내용은 워크플로 런타임. 자세한 내용은 바인딩 를 참조하세요.

런타임 호환성

하드 - 런타임 self_hosted_cpu; 실행 로컬 : GPU가 필요합니다. run_locally()는 CUDA가 필요한 모델을 로드합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 종류에 따라 달라집니다. 어떤 바인딩 종류가 있는지 확인하세요 Florence-2 모델 버전 v1 가 있습니다.

입력 및 출력 바인딩
  • 입력

    • 이미지들 (image): 추론을 수행할 이미지입니다..

    • 프롬프트 (문자열): Florence-2 모델에 대한 텍스트 프롬프트.

    • classes (list_of_values): 사용할 클래스 목록.

    • grounding_detection (Union[instance_segmentation_prediction, keypoint_detection_prediction, list_of_values, object_detection_prediction]): Florence-2 모델의 기준이 되는 탐지 결과입니다. 정적으로 제공된 바운딩 박스일 수 있습니다 [left_top_x, left_top_y, right_bottom_x, right_bottom_y] 또는 객체 탐지 모델의 결과일 수 있습니다. 후자인 경우, 하나의 박스가 다음을 기준으로 선택됩니다 grounding_selection_mode..

    • 모델 버전 (문자열): 사용할 모델.

  • 출력

예시 JSON 정의

마지막 업데이트

도움이 되었나요?