For the complete documentation index, see llms.txt. This page is also available as Markdown.

LMM

ChatGPT-4v와 같은 대규모 멀티모달 모델을 실행합니다.

이미지와 텍스트를 사용하여 대규모 멀티모달 모델(LMM)에 질문하세요.

LMMBlock에 임의의 텍스트 프롬프트를 지정할 수 있습니다.

LLMBlock은 두 개의 LMM을 지원합니다:

  • OpenAI의 Vision이 포함된 GPT-4;

GPT-4 with Vision 모델을 사용하려면 OpenAI API 키를 제공해야 합니다.

이미지를 하나 이상의 범주로 분류하려면 전용 LMMForClassificationBlock을 사용하는 것을 권장합니다.

유형 식별자

단계에서 다음 식별자를 사용하세요 "type" 필드: roboflow_core/lmm@v1 워크플로우에 이 블록을 단계로 추가하려면.

속성

이름

유형

설명

참조

name

str

이 단계에 대한 고유 식별자를 입력하세요..

prompt

str

LMM 모드용 제한 없는 텍스트 프롬프트를 보유합니다.

lmm_type

str

사용할 LMM의 유형.

lmm_config

LMMConfig

LMM의 구성.

remote_api_key

str

LMM 모델을 호출하는 데 필요한 API 키를 보유합니다 - 현재 개발 상태에서는 OpenAI 키가 필요할 때 lmm_type=gpt_4v..

json_output

Dict[str, str]

요청된 출력 필드 이름을 해당 설명에 매핑하는 딕셔너리를 보관합니다.

참조 열은 워크플로우 런타임에서 사용 가능한 동적 값으로 속성을 매개변수화할 수 있는 가능성을 나타냅니다 워크플로우 런타임입니다. 자세한 내용은 바인딩 을 참조하세요.

런타임 호환성

인터넷 필요 - 에어갭 / 오프라인 배포 : 이 블록은 완전히 오프라인 / 에어갭된 배포에서는 접근할 수 없는 서비스에 의존합니다.

하드 - 런타임 호스팅 서버리스; 실행 원격 : Roboflow Hosted Serverless에서 LMM_ENABLED=False: /llm_v1 엔드포인트가 등록되지 않아 run_remotely()가 404를 반환합니다.

입력 및 출력 바인딩

사용 가능한 연결은 바인딩 유형에 따라 달라집니다. 어떤 바인딩 유형인지 확인하세요 LMM 버전 v1 을 가지고 있는지.

입력 및 출력 바인딩
  • 입력

    • 이미지 (이미지): 추론할 이미지입니다..

    • prompt (string): 제한 없는 텍스트 프롬프트를 LMM 모드에 보유합니다.

    • lmm_type (string): 사용할 LMM의 유형.

    • remote_api_key (Union[secret, string]): LMM 모델을 호출하는 데 필요한 API 키를 보유합니다 - 현재 개발 상태에서는 OpenAI 키가 필요할 때 lmm_type=gpt_4v..

  • 출력

    • parent_id (parent_id): 단계 출력의 상위 ID 식별자.

    • root_parent_id (parent_id): 단계 출력의 상위 ID 식별자.

    • 이미지 (image_metadata): supervision에 필요한 이미지 메타데이터가 담긴 딕셔너리.

    • 구조화된 출력 (딕셔너리): 딕셔너리.

    • 원시 출력 (string): 문자열 값.

    • * (*): 어떤 요소와도 동일한 값.

예시 JSON 정의

마지막 업데이트

도움이 되었나요?