For the complete documentation index, see llms.txt. This page is also available as Markdown.

OCR 모델

DocTR 광학 문자 인식을 사용해 이미지에서 텍스트를 추출합니다.

DocTR 광학 문자 인식(OCR)을 사용하여 이미지의 문자를 추출합니다.

이 블록은 이미지 내의 텍스트를 반환합니다.

이 블록을 탐지 기반 블록(예: ObjectDetectionBlock)과 함께 사용하고 싶을 수 있습니다. 객체 탐지 모델은 이미지의 특정 영역(예: 물류 사용 사례의 운송 컨테이너 ID)을 추가 처리를 위해 분리할 수 있습니다. 그런 다음 OCR을 실행하기 전에 DynamicCropBlock을 사용하여 관심 영역을 자를 수 있습니다.

탐지 모델을 사용한 뒤 탐지 결과를 자르면 이미지의 특정 영역에 분석을 집중할 수 있습니다.

유형 식별자

step에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/ocr_model@v1 를 워크플로에 단계로 추가합니다.

속성

이름

유형

설명

참조

name

str

워크플로에서 단계의 고유한 이름입니다.

해당 참조 열은 워크플로 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있음을 나타냅니다. 자세한 내용은 워크플로 런타임. 자세한 내용은 바인딩 를 참조하세요.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 종류에 따라 달라집니다. 어떤 바인딩 종류가 있는지 확인하세요 OCR 모델 버전 v1 가 있습니다.

입력 및 출력 바인딩
  • 입력

    • 이미지들 (image): 추론을 수행할 이미지입니다..

  • 출력

    • 결과 (문자열): 문자열 값.

    • predictions (object_detection_prediction): 감지된 경계 상자를 포함하는 sv.Detections(...) 객체 형식의 예측입니다.

    • parent_id (parent_id): 단계 출력의 부모 식별자입니다.

    • root_parent_id (parent_id): 단계 출력의 부모 식별자입니다.

    • prediction_type (prediction_type): 예측 유형을 나타내는 문자열 값입니다.

예시 JSON 정의

마지막 업데이트

도움이 되었나요?