For the complete documentation index, see llms.txt. This page is also available as Markdown.

SmolVLM2

HuggingFace의 SmolVLM2 비전-언어 모델을 Dedicated Deployment 또는 자체 호스팅 Inference에서 사용하세요.

SmolVLM2는 HuggingFace의 소형 비전-언어 모델입니다. 이미지를 입력과 텍스트 프롬프트를 받아 텍스트 응답을 반환합니다.

SmolVLM2는 Serverless Cloud API에서 사용할 수 없습니다. a에서 실행하세요 전용 배포 또는 자가 호스팅 추론.

코드 예시

1

API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요. Roboflow API 설정 페이지 에서 다음과 같이 셸에서 사용할 수 있도록 합니다:

export ROBOFLOW_API_KEY="your-key-here"
2

의존성 설치

다음을 설치하세요 Inference SDK:

pip install -U inference-sdk supervision
3

모델 실행

설정 api_url 전용 배포 URL 또는 로컬 Inference 서버로.

import os
import supervision as sv
from inference_sdk import InferenceHTTPClient

image = sv.load_image_from_url("https://media.roboflow.com/quickstart/dog.jpeg")

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="smolvlm2",
    prompt="이 이미지를 간단히 설명해 주세요.",
    max_new_tokens=64,
)
print(result["response"])

위 코드는 모델 응답을 터미널에 출력합니다:

한 남자가 어깨에 개를 메고 있습니다.

추론 속도

지연 시간 측정 기준: Roboflow Inference 1x NVIDIA L4, 배치 크기 1, 고정된 프롬프트에서 greedy 디코딩으로 정확히 128개의 토큰을 생성하여 측정했습니다. 지연 시간은 출력 길이에 따라 달라지므로, 다른 길이를 추정하려면 토큰/초를 사용하세요.

별칭
지연 시간, 128 토큰(ms)
토큰/초

smolvlm2

3113

41

설정 api_url 를 배포 대상에 맞게:

Inference(자가 호스팅)에서 사용

SmolVLM2는 또한 다음을 사용해 직접 로드할 수도 있습니다. inference VQA, 문서 OCR, 문서 VQA, 객체 카운팅을 위한 패키지.

1

패키지를 설치하세요

사용 inference-gpu[transformers] GPU 머신에서.

2

모델 실행

워크플로의 실행 모드

다음에서 사용될 때 워크플로, SmolVLM2는 두 가지 모드 중 하나로 실행됩니다:

  • 로컬 실행: 모델이 Inference 서버에서 실행됩니다(GPU 권장).

  • 원격 실행: 모델이 infer_lmm() 클라이언트 메서드를 통해 원격 Inference 서버에서 HTTP로 호출됩니다.

마지막 업데이트

도움이 되었나요?