For the complete documentation index, see llms.txt. This page is also available as Markdown.

Grounding DINO

Dedicated Deployment 또는 자체 호스팅 Inference에서 텍스트 프롬프트 기반 객체 감지를 위해 Grounding DINO를 사용하세요.

Grounding DINO는 오픈 보캐뷸러리 객체 탐지기입니다. 이미지를 하나와 텍스트 클래스 목록을 전달하면, 모델은 학습 없이 일치하는 영역의 바운딩 박스를 반환합니다.

Grounding DINO는 Serverless Cloud API에서 사용할 수 없습니다. 다음에서 실행하세요 전용 배포 또는 자가 호스팅 추론.

코드 예시

1

API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요. Roboflow API 설정 페이지 에서 다음과 같이 셸에서 사용할 수 있도록 합니다:

export ROBOFLOW_API_KEY="your-key-here"
2

의존성 설치

이 패키지들은 API를 호출하고 결과를 그립니다:

pip install -U requests supervision opencv-python
3

모델 실행

설정 URL 전용 배포 URL 또는 로컬 Inference 서버로.

import base64
import os
import cv2
import numpy as np
import requests
import supervision as sv

URL = "https://your-deployment.roboflow.cloud"
image = sv.load_image_from_url("https://media.roboflow.com/notebooks/examples/dog.jpeg")
_, buffer = cv2.imencode(".jpg", image)
image_base64 = base64.b64encode(buffer).decode("utf-8")

response = requests.post(
    f"{URL}/grounding_dino/infer",
    json={
        "api_key": os.environ["ROBOFLOW_API_KEY"],
        "image": {"type": "base64", "value": image_base64},
        "text": ["dog", "person", "backpack"],
    },
)
preds = response.json()["predictions"]

xyxys = [
    [p["x"] - p["width"] / 2, p["y"] - p["height"] / 2,
     p["x"] + p["width"] / 2, p["y"] + p["height"] / 2]
    for p in preds
]
detections = sv.Detections(
    xyxy=np.array(xyxys, dtype=float),
    class_id=np.array([p.get("class_id", 0) for p in preds]),
    confidence=np.array([p["confidence"] for p in preds], dtype=float),
    data={"class_name": np.array([p["class"] for p in preds])},
)
labels = [f"{p['class']} {p['confidence']:.2f}" for p in preds]
annotated = sv.BoxAnnotator().annotate(image.copy(), detections)
annotated = sv.LabelAnnotator().annotate(annotated, detections, labels=labels)
cv2.imwrite("dog_annotated.png", annotated)

추론 속도

지연 시간 측정 기준: Roboflow Inference 1x NVIDIA L4, 배치 크기 1에서 워밍업 후 평균값.

모델
지연 시간(ms)

grounding-dino

165.4

두 개의 텍스트 프롬프트로 측정되었습니다.

설정 URL 를 배포 대상에 맞게:

Inference(자가 호스팅)에서 사용

또한 Grounding DINO를 다음을 사용해 직접 자신의 Python 프로세스에 로드할 수도 있습니다. inference 패키지를 사용해, HTTP 단계를 완전히 건너뜁니다.

1

패키지를 설치하세요

pip install "inference[grounding-dino]"
2

모델 실행

from inference.models.grounding_dino import GroundingDINO

model = GroundingDINO(api_key="YOUR_API_KEY")

results = model.infer(
    {
        "image": {
            "type": "url",
            "value": "https://media.roboflow.com/fruit.png",
        },
        "text": ["apple"],
        # 선택적 임계값, 둘 다 기본값은 0.5
        "box_threshold": 0.5,
        "text_threshold": 0.5,
    }
)

print(results)

바꾸세요 사과 감지하려는 객체로 바꾸고, 조정하세요 box_thresholdtext_threshold 사용 사례에 맞게. 다음을 참조하세요: Grounding DINO README 임계값에 대한 설명은.

Grounding DINO는 일반적인 객체(자동차, 사람, 개)에 가장 효과적입니다. 좁고 세밀한 범주에는 약하므로, 프롬프트 표현을 실험해 보세요. 흔한 패턴은 Grounding DINO로 데이터를 자동 라벨링한 다음, 그 결과로 더 작고 빠른 탐지기를 학습시키는 것입니다.

마지막 업데이트

도움이 되었나요?