> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/models/ko/supported-models/perception-encoder.md).

# Perception Encoder

Perception Encoder는 Meta의 비전-언어 임베딩 모델입니다. 이미지를 텍스트와 함께 공유 임베딩 공간으로 매핑하여 유사도 검색, 제로샷 분류, 검색에 사용합니다.

{% hint style="info" %}
Perception Encoder는 Serverless Hosted API에서 사용할 수 없습니다. 다음에서 실행하세요 [전용 배포](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) 또는 [자가 호스팅 Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted).
{% endhint %}

다음과 같은 세 가지 Perception Encoder 엔드포인트를 지원합니다:

* `/perception_encoder/embed_image` - 이미지를 임베드합니다
* `/perception_encoder/embed_text` - 문자열을 임베드합니다
* `/perception_encoder/compare` - 이미지와 텍스트 프롬프트 목록 간의 유사도를 계산합니다

## 코드 샘플

{% stepper %}
{% step %}

### API 키 받기

Roboflow 계정을 만들고, 다음에서 키를 찾으세요 [Roboflow API 설정 페이지](https://app.roboflow.com/settings/api) 그리고 셸에서 사용할 수 있도록 설정하세요:

```bash
export ROBOFLOW_API_KEY="your-key-here"
```

{% endstep %}

{% step %}

### 의존성 설치하기

이 패키지들은 이미지를 가져와 API를 호출합니다:

```bash
pip install -U requests opencv-python supervision
```

{% endstep %}

{% step %}

### 모델 실행하기

아래 샘플은 이미지를 `/perception_encoder/embed_image` 로 보내고 임베딩 형태를 출력합니다. 다음을 설정하세요 `URL` 전용 배포 URL 또는 로컬 추론 서버로.

```python
import base64
import os
import cv2
import requests
import supervision as sv

URL = "https://your-deployment.roboflow.cloud"

image = sv.load_image_from_url("https://media.roboflow.com/notebooks/examples/dog.jpeg")

_, buffer = cv2.imencode(".jpg", image)
image_base64 = base64.b64encode(buffer).decode("utf-8")

response = requests.post(
    f"{URL}/perception_encoder/embed_image",
    json={
        "api_key": os.environ["ROBOFLOW_API_KEY"],
        "image": {"type": "base64", "value": image_base64},
    },
)
result = response.json()
embedding = result["embeddings"][0]
print(f"임베딩 길이: {len(embedding)}")
print(f"첫 값들: {embedding[:5]}")
```

{% endstep %}
{% endstepper %}

위 코드는 터미널에 임베딩 형태를 출력합니다:

```
임베딩 길이: 1024
첫 값들: [0.0545, -0.0338, -0.0355, -0.0062, 0.0154]
```

## 추론 속도

다음을 사용해 측정한 지연 시간 [Roboflow Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 1x NVIDIA L4, 배치 크기 1, 워밍업 후 평균.

<table data-search="false"><thead><tr><th>모델</th><th>지연 시간(ms)</th></tr></thead><tbody><tr><td><code>perception-encoder</code></td><td>25.2</td></tr></tbody></table>

다음으로 측정: `embed_image` 에서 `PE-Core-L14-336` 체크포인트(이미지 임베딩 전용).

{% hint style="info" %}
설정하세요 `URL` 배포 대상에 맞게 설정하세요:

* `http://localhost:9001` 로컬 [Inference](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 서버.
* 사용자 [전용 배포](https://docs.roboflow.com/deployment/roboflow-cloud/dedicated-deployments) 비공개 엔드포인트용 URL.
  {% endhint %}

## Inference(자가 호스팅)와 함께 사용

Perception Encoder는 다음과 함께 직접 로드할 수 있습니다 [`inference`](https://docs.roboflow.com/deployment/self-hosted/self-hosted) 패키지이며, 로컬에서 많은 이미지나 비디오 프레임을 임베딩할 때 가장 빠른 방법입니다.

{% stepper %}
{% step %}

### 패키지 설치하기

```bash
pip install "inference[transformers]"
```

사용 `inference-gpu[transformers]` 를 GPU 머신에서 사용하세요.
{% endstep %}

{% step %}

### 로컬에서 임베딩하고 비교하기

```python
from inference.core.utils.postprocess import cosine_similarity
from inference.models import PerceptionEncoder

pe = PerceptionEncoder(model_id="perception_encoder/PE-Core-B16-224")

image_embedding = pe.embed_image("https://media.roboflow.com/inference/people-walking.jpg")
text_embedding = pe.embed_text("a crowd of people walking")

print(cosine_similarity(image_embedding[0], text_embedding[0]))
```

{% endstep %}
{% endstepper %}

### 사용 가능한 체크포인트

`model_id` 백본을 선택합니다:

* `perception_encoder/PE-Core-B16-224`
* `perception_encoder/PE-Core-L14-336`
* `perception_encoder/PE-Core-G14-448`

CLIP 스타일 인터페이스만 지원되며, 언어 정렬 및 공간 정렬 Perception Encoder 변형은 아직 사용할 수 없습니다.

{% hint style="info" %}
Perception Encoder는 다음과 동일한 API 형식을 사용합니다 [CLIP](/models/ko/supported-models/clip.md): `embed_image`, `embed_text`, 및 `compare` 동일한 인수를 받고 동일한 응답 형식을 반환하므로, CLIP에 맞춰 작성된 코드는 모델만 바꾸면 Perception Encoder와 함께 작동합니다.
{% endhint %}

### 워크플로에서 사용

Perception Encoder는 [워크플로](https://docs.roboflow.com/workflows) 를 통해 **Perception Encoder 임베딩 모델** 블록에서 사용할 수 있으며, 코드를 작성하지 않고 이미지 또는 텍스트 임베딩을 생성합니다.
