For the complete documentation index, see llms.txt. This page is also available as Markdown.

SmolVLM2

Dedicated Deployment 또는 self-hosted Inference에서 HuggingFace의 SmolVLM2 vision-language model을 사용합니다.

SmolVLM2는 HuggingFace의 컴팩트한 비전-언어 모델입니다. 이 모델은 이미지와 텍스트 프롬프트를 받아 텍스트 응답을 반환합니다.

SmolVLM2는 Serverless Hosted API에서 사용할 수 없습니다. 다음에서 실행하세요 Dedicated Deployment 또는 자체 호스팅 Inference.

코드 샘플

1

API Key를 받으세요

Roboflow 계정을 만들고, 다음에서 키를 찾으세요: Roboflow API 설정 페이지 그리고 이를 셸에서 사용할 수 있도록 설정하세요:

export ROBOFLOW_API_KEY="your-key-here"
2

종속성을 설치하세요

다음을 설치하세요 Inference SDK:

pip install inference-sdk
3

모델을 실행하세요

설정 api_url 를 Dedicated Deployment URL 또는 로컬 Inference server에.

import os
import cv2
import numpy as np
import requests
from inference_sdk import InferenceHTTPClient

content = requests.get("https://media.roboflow.com/quickstart/dog.jpeg").content
image = cv2.imdecode(np.frombuffer(content, np.uint8), cv2.IMREAD_COLOR)

client = InferenceHTTPClient(
    api_url="https://your-deployment.roboflow.cloud",
    api_key=os.environ["ROBOFLOW_API_KEY"],
)
result = client.infer_lmm(
    image,
    model_id="smolvlm2",
    prompt="이 이미지를 간단히 설명하세요.",
    max_new_tokens=64,
)
print(result["response"] )

위의 코드는 모델 응답을 터미널에 출력합니다:

한 남자가 어깨에 개를 태우고 있습니다.

추론 속도

다음 기준으로 측정한 지연 시간 Roboflow Inference 1x NVIDIA L4에서 배치 크기 1로, 고정 프롬프트에서 greedy decoding을 사용해 정확히 128개의 토큰을 생성할 때의 결과입니다. 지연 시간은 출력 길이에 따라 증가하므로, 다른 길이를 추정할 때는 tokens/sec를 사용하세요.

별칭
지연 시간, 128 토큰(ms)
Tokens/sec

smolvlm2

3113

41

설정 api_url 을 배포 대상에 맞게 설정하세요:

마지막 업데이트

도움이 되었나요?