GLM-OCR
이미지에서 텍스트를 인식하기 위해 GLM-OCR을 실행합니다.
이미지 속 텍스트를 Zhipu AI의 광학 문자 인식에 특화된 비전 언어 모델인 GLM-OCR을 사용해 인식합니다.
GLM-OCR은 다음 세 가지 기본 인식 모드를 지원합니다:
텍스트 인식 - 일련번호, 라벨, 장면 텍스트, 문서에 대한 범용 텍스트 인식.
수식 인식 - 수학 공식과 방정식을 인식합니다.
표 인식 - 표 구조와 내용을 인식합니다.
또한 선택할 수 있습니다 사용자 지정 프롬프트 를 선택하여 특수한 인식 작업을 위한 자체 프롬프트를 제공하거나, 구조화된 출력 을 선택하여 사용자가 정의한 스키마가 있는 JSON 문서로 이미지에서 값을 추출할 수 있습니다(JSON Parser 블록과 함께 사용하여 키를 워크플로 출력으로 구체화합니다).
이 블록은 탐지 모델 및 DynamicCropBlock과 함께 사용하면 OCR을 실행하기 전에 관심 영역을 분리하는 데 유용합니다. 예를 들어, 객체 탐지 모델을 사용해 라벨이나 텍스트 영역을 찾고, 잘라낸 다음, 해당 크롭을 GLM-OCR에 전달합니다.
참고: GLM-OCR은 추론에 GPU가 필요합니다.
유형 식별자
단계에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/glm_ocr@v1 워크플로우에 이 블록을 단계로 추가하려면.
속성
이름
유형
설명
참조
name
str
이 단계에 대한 고유 식별자를 입력하세요..
❌
작업 유형
str
수행할 인식 작업입니다. GLM-OCR로 전송되는 프롬프트를 결정합니다. 선택자(예: $inputs.task_type)를 허용하므로 모드를 동적으로 설정할 수 있습니다..
✅
prompt
str
GLM-OCR용 사용자 지정 텍스트 프롬프트입니다. task_type이 'custom'일 때만 사용됩니다..
✅
출력 구조
Dict[str, str]
예상되는 JSON 응답의 구조를 설명하는 사전입니다. 키는 JSON 필드 이름이며, 값은 모델이 각 필드에 무엇을 넣어야 하는지 설명합니다..
❌
max_new_tokens
정수
생성할 최대 토큰 수입니다. 설정하지 않으면 모델의 기본값이 사용됩니다..
❌
model_version
str
추론에 사용할 GLM-OCR 모델입니다..
✅
이 참조 열은 워크플로우 런타임에서 사용 가능한 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다 워크플로우 런타임입니다. 자세한 내용은 바인딩 을 참조하세요.
런타임 호환성
하드 - 런타임 self_hosted_cpu; 실행 로컬 : GPU가 필요합니다; run_locally()는 CUDA가 필요한 모델을 로드합니다.
입력 및 출력 바인딩
사용 가능한 연결은 바인딩 유형에 따라 달라집니다. 어떤 바인딩 유형인지 확인하세요 GLM-OCR 버전 v1 을 가지고 있는지.
입력 및 출력 바인딩
입력
이미지(이미지): 추론할 이미지입니다..작업 유형(string): 수행할 인식 작업입니다. GLM-OCR로 전송되는 프롬프트를 결정합니다. 선택자(예: $inputs.task_type)를 허용하므로 모드를 동적으로 설정할 수 있습니다..prompt(string): GLM-OCR용 사용자 지정 텍스트 프롬프트입니다. task_type이 'custom'일 때만 사용됩니다..model_version(roboflow_model_id): 추론에 사용할 GLM-OCR 모델입니다..
마지막 업데이트
도움이 되었나요?