Florence-2 모델
이미지에서 Florence-2를 실행합니다
v2
전용 추론 서버 필요(GPU 권장) - 전용 배포를 사용하는 것이 좋을 수 있습니다
이 워크플로 블록은 다음을 소개합니다 Florence 2, 다양한 작업을 수행할 수 있는 시각 언어 모델(VLM)로, 다음을 포함합니다:
객체 탐지
인스턴스 분할
이미지 캡셔닝
광학 문자 인식(OCR)
그 외에도...
아래는 모델이 지원하는 작업의 포괄적인 목록과, Workflows 생태계 내에서 해당 출력물을 활용하는 방법에 대한 설명입니다:
작업 설명:
사용자 지정 프롬프트 (
custom) - 자유 형식 프롬프트를 사용해 응답을 생성합니다. 미세 조정된 모델에 유용합니다.텍스트 인식(OCR) (
ocr) - 모델이 이미지의 텍스트를 인식합니다텍스트 탐지 및 인식(OCR) (
ocr-with-text-detection) - 모델이 이미지에서 텍스트 영역을 탐지한 다음, 탐지된 각 영역에 OCR을 수행합니다캡셔닝(짧음) (
caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다캡셔닝 (
detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다캡셔닝(길음) (
more-detailed-caption) - 모델이 이미지에 대한 매우 긴 설명을 제공합니다비프롬프트 객체 탐지 (
object-detection) - 모델이 이미지 내 주요 객체의 바운딩 박스를 탐지하여 반환합니다객체 탐지 (
open-vocabulary-object-detection) - 모델이 제공된 클래스의 바운딩 박스를 탐지하여 반환합니다탐지 및 캡셔닝 (
object-detection-and-caption) - 모델이 주요 객체를 탐지하고 캡션을 생성합니다프롬프트 기반 객체 탐지 (
phrase-grounded-object-detection) - 텍스트 프롬프트를 바탕으로 설명에 부합하는 객체를 탐지합니다프롬프트 기반 인스턴스 분할 (
phrase-grounded-instance-segmentation) - 텍스트 프롬프트를 바탕으로 설명에 부합하는 객체를 분할합니다바운딩 박스 분할 (
detection-grounded-instance-segmentation) - 모델이 제공된 바운딩 박스 안의 객체를 폴리곤으로 분할합니다바운딩 박스 분류 (
detection-grounded-classification) - 모델이 제공된 바운딩 박스 안의 객체를 분류합니다바운딩 박스 캡셔닝 (
detection-grounded-caption) - 모델이 제공된 바운딩 박스 안의 객체에 캡션을 생성합니다바운딩 박스용 텍스트 인식(OCR) (
detection-grounded-ocr) - 모델이 제공된 바운딩 박스 내부의 텍스트에 OCR을 수행합니다관심 영역 제안 (
region-proposal) - 모델이 이미지의 관심 영역(바운딩 박스)을 제안합니다
유형 식별자
step에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/florence_2@v2 를 워크플로에 단계로 추가합니다.
속성
이름
유형
설명
참조
name
str
이 단계에 고유 식별자를 입력하세요..
❌
task_type
str
모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..
❌
프롬프트
str
Florence-2 모델에 대한 텍스트 프롬프트.
✅
classes
List[str]
사용할 클래스 목록.
✅
grounding_detection
Optional[List[float], List[int]]
Florence-2 모델의 기준이 되는 탐지 결과입니다. 정적으로 제공된 바운딩 박스일 수 있습니다 [left_top_x, left_top_y, right_bottom_x, right_bottom_y] 또는 객체 탐지 모델의 결과일 수 있습니다. 후자인 경우, 하나의 박스가 다음을 기준으로 선택됩니다 grounding_selection_mode..
✅
grounding_selection_mode
str
.
❌
model_id
str
사용할 모델.
✅
해당 참조 열은 워크플로 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있음을 나타냅니다. 자세한 내용은 워크플로 런타임. 자세한 내용은 바인딩 를 참조하세요.
런타임 호환성
하드 - 런타임 self_hosted_cpu; 실행 로컬 : GPU가 필요합니다. run_locally()는 CUDA가 필요한 모델을 로드합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 종류에 따라 달라집니다. 어떤 바인딩 종류가 있는지 확인하세요 Florence-2 모델 버전 v2 가 있습니다.
입력 및 출력 바인딩
입력
이미지들(image): 추론을 수행할 이미지입니다..프롬프트(문자열): Florence-2 모델에 대한 텍스트 프롬프트.classes(list_of_values): 사용할 클래스 목록.grounding_detection(Union[instance_segmentation_prediction,keypoint_detection_prediction,list_of_values,object_detection_prediction]): Florence-2 모델의 기준이 되는 탐지 결과입니다. 정적으로 제공된 바운딩 박스일 수 있습니다[left_top_x, left_top_y, right_bottom_x, right_bottom_y]또는 객체 탐지 모델의 결과일 수 있습니다. 후자인 경우, 하나의 박스가 다음을 기준으로 선택됩니다grounding_selection_mode..model_id(roboflow_model_id): 사용할 모델.
출력
raw_output(Union[문자열,language_model_output]): 문자열 값, 다음 경우문자열또는 LLM / VLM 출력, 다음 경우language_model_output.파싱된 출력(딕셔너리): 딕셔너리.classes(list_of_values): 모든 유형의 값 목록입니다..
v1
전용 추론 서버 필요(GPU 권장) - 전용 배포를 사용하는 것이 좋을 수 있습니다
이 워크플로 블록은 다음을 소개합니다 Florence 2, 다양한 작업을 수행할 수 있는 시각 언어 모델(VLM)로, 다음을 포함합니다:
객체 탐지
인스턴스 분할
이미지 캡셔닝
광학 문자 인식(OCR)
그 외에도...
아래는 모델이 지원하는 작업의 포괄적인 목록과, Workflows 생태계 내에서 해당 출력물을 활용하는 방법에 대한 설명입니다:
작업 설명:
사용자 지정 프롬프트 (
custom) - 자유 형식 프롬프트를 사용해 응답을 생성합니다. 미세 조정된 모델에 유용합니다.텍스트 인식(OCR) (
ocr) - 모델이 이미지의 텍스트를 인식합니다텍스트 탐지 및 인식(OCR) (
ocr-with-text-detection) - 모델이 이미지에서 텍스트 영역을 탐지한 다음, 탐지된 각 영역에 OCR을 수행합니다캡셔닝(짧음) (
caption) - 모델이 이미지에 대한 짧은 설명을 제공합니다캡셔닝 (
detailed-caption) - 모델이 이미지에 대한 긴 설명을 제공합니다캡셔닝(길음) (
more-detailed-caption) - 모델이 이미지에 대한 매우 긴 설명을 제공합니다비프롬프트 객체 탐지 (
object-detection) - 모델이 이미지 내 주요 객체의 바운딩 박스를 탐지하여 반환합니다객체 탐지 (
open-vocabulary-object-detection) - 모델이 제공된 클래스의 바운딩 박스를 탐지하여 반환합니다탐지 및 캡셔닝 (
object-detection-and-caption) - 모델이 주요 객체를 탐지하고 캡션을 생성합니다프롬프트 기반 객체 탐지 (
phrase-grounded-object-detection) - 텍스트 프롬프트를 바탕으로 설명에 부합하는 객체를 탐지합니다프롬프트 기반 인스턴스 분할 (
phrase-grounded-instance-segmentation) - 텍스트 프롬프트를 바탕으로 설명에 부합하는 객체를 분할합니다바운딩 박스 분할 (
detection-grounded-instance-segmentation) - 모델이 제공된 바운딩 박스 안의 객체를 폴리곤으로 분할합니다바운딩 박스 분류 (
detection-grounded-classification) - 모델이 제공된 바운딩 박스 안의 객체를 분류합니다바운딩 박스 캡셔닝 (
detection-grounded-caption) - 모델이 제공된 바운딩 박스 안의 객체에 캡션을 생성합니다바운딩 박스용 텍스트 인식(OCR) (
detection-grounded-ocr) - 모델이 제공된 바운딩 박스 내부의 텍스트에 OCR을 수행합니다관심 영역 제안 (
region-proposal) - 모델이 이미지의 관심 영역(바운딩 박스)을 제안합니다
유형 식별자
step에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/florence_2@v1 를 워크플로에 단계로 추가합니다.
속성
이름
유형
설명
참조
name
str
이 단계에 고유 식별자를 입력하세요..
❌
task_type
str
모델이 수행할 작업 유형입니다. 값에 따라 필요한 매개변수와 출력 응답이 결정됩니다..
❌
프롬프트
str
Florence-2 모델에 대한 텍스트 프롬프트.
✅
classes
List[str]
사용할 클래스 목록.
✅
grounding_detection
Optional[List[float], List[int]]
Florence-2 모델의 기준이 되는 탐지 결과입니다. 정적으로 제공된 바운딩 박스일 수 있습니다 [left_top_x, left_top_y, right_bottom_x, right_bottom_y] 또는 객체 탐지 모델의 결과일 수 있습니다. 후자인 경우, 하나의 박스가 다음을 기준으로 선택됩니다 grounding_selection_mode..
✅
grounding_selection_mode
str
.
❌
모델 버전
str
사용할 모델.
✅
해당 참조 열은 워크플로 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있음을 나타냅니다. 자세한 내용은 워크플로 런타임. 자세한 내용은 바인딩 를 참조하세요.
런타임 호환성
하드 - 런타임 self_hosted_cpu; 실행 로컬 : GPU가 필요합니다. run_locally()는 CUDA가 필요한 모델을 로드합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 종류에 따라 달라집니다. 어떤 바인딩 종류가 있는지 확인하세요 Florence-2 모델 버전 v1 가 있습니다.
입력 및 출력 바인딩
입력
이미지들(image): 추론을 수행할 이미지입니다..프롬프트(문자열): Florence-2 모델에 대한 텍스트 프롬프트.classes(list_of_values): 사용할 클래스 목록.grounding_detection(Union[instance_segmentation_prediction,keypoint_detection_prediction,list_of_values,object_detection_prediction]): Florence-2 모델의 기준이 되는 탐지 결과입니다. 정적으로 제공된 바운딩 박스일 수 있습니다[left_top_x, left_top_y, right_bottom_x, right_bottom_y]또는 객체 탐지 모델의 결과일 수 있습니다. 후자인 경우, 하나의 박스가 다음을 기준으로 선택됩니다grounding_selection_mode..모델 버전(문자열): 사용할 모델.
출력
raw_output(Union[문자열,language_model_output]): 문자열 값, 다음 경우문자열또는 LLM / VLM 출력, 다음 경우language_model_output.파싱된 출력(딕셔너리): 딕셔너리.classes(list_of_values): 모든 유형의 값 목록입니다..
마지막 업데이트
도움이 되었나요?