For the complete documentation index, see llms.txt. This page is also available as Markdown.

분류용 LMM

분류를 위해 ChatGPT-4v와 같은 대형 멀티모달 모델을 실행합니다.

대규모 멀티모달 모델(LMM)을 사용하여 이미지를 하나 이상의 범주로 분류합니다.

LMMBlock에 임의의 클래스를 지정할 수 있습니다.

LLMBlock은 두 개의 LMM을 지원합니다:

  • Vision 기능이 있는 OpenAI의 GPT-4.

GPT-4 with Vision 모델을 사용하려면 OpenAI API 키를 제공해야 합니다.

유형 식별자

단계에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/lmm_for_classification@v1 워크플로우에 이 블록을 단계로 추가하려면.

속성

이름

유형

설명

참조

name

str

이 단계에 대한 고유 식별자를 입력하세요..

lmm_type

str

사용할 LMM의 유형.

클래스

List[str]

LMM이 분류할 클래스 목록.

lmm_config

LMMConfig

LMM의 구성.

remote_api_key

str

LMM 모델을 호출하는 데 필요한 API 키를 보유합니다 - 현재 개발 상태에서는 OpenAI 키가 필요할 때 lmm_type=gpt_4v..

참조 열은 워크플로우 런타임에서 사용 가능한 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다 워크플로우 런타임입니다. 자세한 내용은 바인딩 을 참조하세요.

런타임 호환성

인터넷 필요 - 에어갭 / 오프라인 배포 : 이 블록은 완전히 오프라인 / 에어갭된 배포에서는 접근할 수 없는 서비스에 의존합니다.

하드 - 런타임 호스팅 서버리스; 실행 원격 : Roboflow Hosted Serverless에서 LMM_ENABLED=False: /llm_v1 엔드포인트가 등록되지 않아 run_remotely()가 404를 반환합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 유형에 따라 달라집니다. 어떤 바인딩 유형인지 확인하세요 분류용 LMM 버전 v1 을 가지고 있는지.

입력 및 출력 바인딩
  • 입력

    • 이미지 (이미지): 추론할 이미지입니다..

    • lmm_type (string): 사용할 LMM의 유형.

    • 클래스 (list_of_values): LMM이 분류할 클래스 목록.

    • remote_api_key (Union[secret, string]): LMM 모델을 호출하는 데 필요한 API 키를 보유합니다 - 현재 개발 상태에서는 OpenAI 키가 필요할 때 lmm_type=gpt_4v..

  • 출력

    • 원시 출력 (string): 문자열 값.

    • 상위 (top_class): 분류 모델이 예측한 최상위 클래스를 나타내는 문자열 값.

    • parent_id (parent_id): 단계 출력의 상위 ID 식별자.

    • root_parent_id (parent_id): 단계 출력의 상위 ID 식별자.

    • 이미지 (image_metadata): supervision에 필요한 이미지 메타데이터가 담긴 딕셔너리.

    • 예측 유형 (예측 유형): 예측 유형을 나타내는 문자열 값.

예시 JSON 정의

마지막 업데이트

도움이 되었나요?