마지막 업데이트
도움이 되었나요?
DocTR 광학 문자 인식을 사용해 이미지에서 텍스트를 추출합니다.
DocTR 광학 문자 인식(OCR)을 사용하여 이미지의 문자를 추출합니다.
이 블록은 이미지 내의 텍스트를 반환합니다.
이 블록을 탐지 기반 블록(예: ObjectDetectionBlock)과 함께 사용하고 싶을 수 있습니다. 객체 탐지 모델은 이미지의 특정 영역(예: 물류 사용 사례의 운송 컨테이너 ID)을 추가 처리를 위해 분리할 수 있습니다. 그런 다음 OCR을 실행하기 전에 DynamicCropBlock을 사용하여 관심 영역을 자를 수 있습니다.
탐지 모델을 사용한 뒤 탐지 결과를 자르면 이미지의 특정 영역에 분석을 집중할 수 있습니다.
step에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/ocr_model@v1 를 워크플로에 단계로 추가합니다.
이름
유형
설명
참조
name
str
워크플로에서 단계의 고유한 이름입니다.
❌
해당 참조 열은 워크플로 런타임에서 사용할 수 있는 동적 값으로 속성을 매개변수화할 수 있음을 나타냅니다. 자세한 내용은 워크플로 런타임. 자세한 내용은 바인딩 를 참조하세요.
사용 가능한 연결은 바인딩 종류에 따라 달라집니다. 어떤 바인딩 종류가 있는지 확인하세요 OCR 모델 버전 v1 가 있습니다.
입력
이미지들 (image): 추론을 수행할 이미지입니다..
출력
결과 (문자열): 문자열 값.
predictions (object_detection_prediction): 감지된 경계 상자를 포함하는 sv.Detections(...) 객체 형식의 예측입니다.
parent_id (parent_id): 단계 출력의 부모 식별자입니다.
root_parent_id (parent_id): 단계 출력의 부모 식별자입니다.
prediction_type (prediction_type): 예측 유형을 나타내는 문자열 값입니다.
마지막 업데이트
도움이 되었나요?
도움이 되었나요?
{
"name": "<your_step_name_here>",
"type": "roboflow_core/ocr_model@v1",
"images": "$inputs.image"
}