> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/ko/choosing-a-deployment.md).

# 배포 옵션 선택

Roboflow의 배포 옵션 - Serverless Cloud API, Dedicated Deployments, Batch Processing, Self-Hosted Inference, 엣지 장치 - 을 비교하고 사용 사례에 맞는 것을 선택합니다.

Roboflow는 모델을 실행하는 여러 가지 방법과 [워크플로](https://docs.roboflow.com/workflows)을 제공합니다. 완전 관리형 클라우드 API부터 자체 하드웨어에서의 추론까지 가능합니다. 적절한 선택은 워크로드가 실시간인지 대량 처리인지, 어느 정도의 지연 시간을 허용할 수 있는지, 데이터가 어디에 있어도 되는지, 그리고 얼마나 많은 인프라를 관리하고 싶은지에 따라 달라집니다.

표를 사용해 옵션을 한눈에 비교한 다음, 아래의 결정 흐름을 따라 범위를 좁혀 보세요.

## Roboflow Cloud

Roboflow가 인프라를 운영합니다. API 엔드포인트로 데이터를 보내면 예측 결과를 돌려받습니다.

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/deployment/ko/roboflow-cloud/serverless-api.md">서버리스 클라우드 API</a></td><td><a href="/deployment/ko/roboflow-cloud/dedicated-deployments.md">전용 배포</a></td><td><a href="/deployment/ko/roboflow-cloud/batch-processing.md">배치 처리</a></td></tr><tr><td>실행 위치</td><td>Roboflow 클라우드 (<code>serverless.roboflow.com</code>)</td><td>Roboflow가 관리하는 프라이빗 클라우드 서버 (<code>*.roboflow.cloud</code>)</td><td>Roboflow 클라우드, 작업별로 인프라가 자동 프로비저닝됨</td></tr><tr><td>GPU</td><td>예: GPU 가속 및 자동 확장</td><td>CPU (<code>dev-cpu</code> / <code>prod-cpu</code>) 또는 GPU (<code>dev-gpu</code> / <code>prod-gpu</code>)</td><td>작업별로 선택되는 CPU 또는 GPU</td></tr><tr><td>지연 시간 특성</td><td>실시간, 동기식입니다. 아직 로드되지 않은 모델에 대한 첫 요청은 몇 초의 워밍업이 발생하며, 이후에는 모델이 캐시된 동안 요청이 빠르게 처리됩니다.</td><td>일관된 전용 성능. 배포는 일정 시간 비활성 상태가 되면 자동으로 일시 중지되며( <code>dev-cpu</code> / <code>dev-gpu</code>에 대해 1시간으로 고정), 요청을 보내면 다시 시작됩니다.</td><td>비동기식으로, 실시간 처리에는 적합하지 않습니다. 리소스를 사용할 수 있을 때 보통 몇 분 후에 머신이 프로비저닝되며, 정확한 시작 시간은 보장되지 않습니다.</td></tr><tr><td>가격</td><td>모델이 설정한 요율에 따라 이미지당 크레딧으로 과금됩니다.  <a href="/deployment/ko/roboflow-cloud/serverless-api/model-pricing.md">모델 가격</a>.</td><td>시간당 요금이며, 1분 단위로 청구됩니다: GPU 1크레딧/시간, CPU 0.25크레딧/시간. 요청 기반 과금은 요청 시 이용 가능합니다.</td><td>CPU와 GPU 요금은 다릅니다. GPU 작업은 더 빠르지만 더 비쌉니다.  <a href="https://roboflow.com/pricing">가격 페이지</a>.</td></tr><tr><td>지역</td><td><a href="https://roboflow.com/sales">영업팀에 문의하세요</a> 기본 API의 경우.  <a href="/deployment/ko/roboflow-cloud/serverless-api/serverless-video-streaming-api.md">비디오 스트리밍 API</a> 는 <code>미국</code>, <code>유럽</code>, <code>아시아 태평양</code>.</td><td>미국 기반 데이터 센터만 지원합니다.</td><td><a href="https://roboflow.com/sales">영업팀에 문의하세요</a>.</td></tr><tr><td>플랜 이용 가능 여부</td><td><a href="https://roboflow.com/sales">영업팀에 문의하세요</a>.</td><td>Core 및 Enterprise.  <a href="https://roboflow.com/pricing">가격</a>.</td><td>Growth 및 Enterprise.</td></tr><tr><td>추천 대상</td><td>배포 장치에 지속적인 인터넷 연결이 있을 때, 실시간 단일 이미지 또는 워크플로 추론을 빠르게 시작하고 자동으로 확장하려는 경우.</td><td>예측 가능하거나 프로덕션용 워크로드, 리소스 격리, 그리고 GPU 가속이 필요한 대형 모델(예: Florence-2, SAM2).</td><td>워크플로를 사용해 저장된 대량의 이미지와 비디오를 비용 효율적으로 처리할 때.</td></tr></tbody></table>

## 자가 호스팅

자체 하드웨어에서 추론을 실행하므로, 데이터가 네트워크 밖으로 나갈 필요가 없습니다.

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/deployment/ko/self-hosted/self-hosted.md">자가 호스팅 추론</a></td><td><a href="/deployment/ko/self-hosted/enterprise/deployment-manager.md">엣지(Deployment Manager)</a></td></tr><tr><td>실행 위치</td><td>자체 하드웨어: 엣지 장치, 온프레미스 서버, 또는 자체 클라우드(Docker 또는 <code>pip</code>)</td><td>Roboflow가 원격으로 관리하는 엣지 장치</td></tr><tr><td>GPU</td><td>CPU, CUDA GPU, 또는 NVIDIA Jetson</td><td>장치에 따라 다름(NVIDIA Jetson, NVIDIA GPU가 있는 x86, 또는 Roboflow 제공 하드웨어)</td></tr><tr><td>지연 시간 특성</td><td>로컬에서, 네트워크 왕복 없이 지연 시간이 낮습니다. 충분한 하드웨어에서는 실시간 처리가 가능합니다.</td><td>로컬 엣지, 실시간. 장치의 원격 관리 및 모니터링을 위해 지속적인 인터넷 접속이 필요합니다.</td></tr><tr><td>가격</td><td>무료 오픈 소스: 인프라는 사용자가 제공하고 관리합니다. 프라이빗 모델용 TensorRT 최적화 패키지는 Enterprise가 필요합니다.</td><td><a href="https://roboflow.com/sales">영업팀에 문의하세요</a>.</td></tr><tr><td>지역</td><td>어디서나(자체 인프라).</td><td>장치의 위치.</td></tr><tr><td>플랜 이용 가능 여부</td><td>모든 플랜(오픈 소스). TensorRT 프라이빗 모델 패키지와 둘 이상의 장치에서 실행하기 위한 라이선스는 Enterprise가 필요합니다.</td><td>Enterprise 전용.</td></tr><tr><td>추천 대상</td><td>환경과 지연 시간에 대한 최대한의 제어가 필요한 온프레미스, 엣지, 에어갭, 또는 VPC 제한 워크로드.</td><td>대규모로 엣지 장치 군을 설정, 배포, 모니터링하는 작업.</td></tr></tbody></table>

## 한눈에 보는 기능

|                                          | 서버리스 | 전용  | 자가 호스팅                                              |
| ---------------------------------------- | ---- | --- | --------------------------------------------------- |
| 파인튜닝 및 사전 학습된 모델                         | 예    | 예   | 예                                                   |
| 워크플로                                     | 예    | 예   | 예                                                   |
| 대형 파운데이션 모델(SAM2, Florence-2, PaliGemma) | 아니요  | 예   | 예                                                   |
| 클라우드 호스팅 VLM(GPT, Claude, Gemini 블록)     | 예    | 예   | 예                                                   |
| 비디오 스트리밍                                 | 아니요  | 예   | 예                                                   |
| 사용자 정의 Python 블록 및 추가 종속성                | 아니요  | 예   | 예                                                   |
| 오프라인에서 실행                                | 아니요  | 아니요 | 예                                                   |
| 청구                                       | 호출당  | 시간당 | 무료 + [사용량 기반](https://roboflow.com/pricing) 클라우드 기능 |

확장 방식도 다릅니다: 서버리스 클라우드 API는 유휴 상태에서 0으로 축소되었다가, 부하가 걸리면 몇 초의 콜드 스타트 후 다시 확장됩니다. 반면 전용 배포는 시작하는 데 1\~2분이 걸립니다. 에페메랄 `dev-cpu` 및 `dev-gpu` 배포는 짧은 세션으로 제한되며, 더 높은 우선순위 작업에 용량이 필요할 때 제거될 수 있습니다. 반면 지속적인 `prod-*` 유형은 보장된 용량이 있으며 세션 제한이 없습니다.

## 자체 클라우드 사용

컴플라이언스 정책상 워크로드를 자체 인프라 내부에 유지해야 한다면, 자체 AWS, Azure, 또는 GCP 계정에서 추론을 실행할 수 있습니다: [자체 클라우드에 배포](/deployment/ko/self-hosted/inference-server/install/cloud.md). 청구는 엣지 장치에서 자가 호스팅하는 것과 동일하며, 머신 비용은 클라우드 제공업체에 지불합니다.

## 결정 흐름

1. **실시간 또는 대량 처리?** 데이터가 도착하는 대로 결과가 필요하다면 - 라이브 비디오, 인터랙티브 앱, 요청당 추론 - 실시간 경로를 선택하세요. 저장된 이미지나 비디오의 큰 대기열을 처리하는 경우에는 [배치 처리](/deployment/ko/roboflow-cloud/batch-processing.md).
2. **동기식 또는 비동기식?** 실시간 추론은 동기식입니다: 요청을 보내고 응답을 받습니다. 배치 처리는 비동기식입니다: 작업을 제출하고 완료되면 결과를 수집하므로, 정확한 시작 시간에 의존하지 마세요.
3. **클라우드 또는 온프레미스?** 데이터가 네트워크를 벗어나도 되고 관리할 인프라가 전혀 없기를 원한다면 Roboflow 호스팅 클라우드 옵션을 사용하세요. 워크로드가 온프레미스, 엣지, 또는 에어갭 상태로 유지되어야 한다면, [자가 호스팅 추론](/deployment/ko/self-hosted/self-hosted.md).
4. **관리형 또는 자체 관리형?**
   * 클라우드에서는 [전용 배포](/deployment/ko/roboflow-cloud/dedicated-deployments.md) 예측 가능한 전용 성능이나 고정된 GPU 유형이 필요할 때 선택하세요. 그렇지 않다면 [서버리스 클라우드 API](/deployment/ko/roboflow-cloud/serverless-api.md) 가 가장 간단한 기본값입니다.
   * 자체 하드웨어에서는 [Deployment Manager](/deployment/ko/self-hosted/enterprise/deployment-manager.md) (Enterprise)를, Roboflow가 엣지 장치 군을 대신 관리하고 모니터링해 주길 원할 때 사용하세요. 그렇지 않다면 [자가 호스팅 추론](/deployment/ko/self-hosted/self-hosted.md) 서버를 직접 관리하세요.

옵션을 선택했다면, 다음을 확인하세요. [프로덕션 준비 체크리스트](/deployment/ko/production-checklist.md) 오류 처리, 재시도, 속도 제한, 복제본 크기 조정에 대해.

## Inference와 다른 배포 스택 비교

Roboflow Inference는 여러 다른 도구와 겹칩니다. 이 표는 다른 스택이 더 적합한 경우와, 그 선택으로 무엇을 포기하게 되는지를 요약합니다.

### 추론 서버

| 도구                     | 비교                                                                                                                                   | 다음 경우 선택                                                                  |
| ---------------------- | ------------------------------------------------------------------------------------------------------------------------------------ | ------------------------------------------------------------------------- |
| **NVIDIA Triton**      | 대규모 배포를 하는 ML 전문가를 위한 강력한 도구로, NVIDIA 하드웨어에서 극도로 최적화된 파이프라인에 집중합니다. 단순성과 반복 속도를 희생하는 대신 원시 속도를 얻으며, 모델 앙상블은 Workflows보다 더 경직되어 있습니다. | 당신은 범위가 명확히 정의된 프로젝트에서 일하는 ML 전문가이며, 무엇보다 NVIDIA GPU에서의 속도를 가장 중요하게 여깁니다. |
| **Lightning LitServe** | 가볍고, 사용자 정의가 가능하며, 작업에 구애받지 않습니다(NLP, 오디오, 표 형식 데이터, 비전 포함). 따라서 컴퓨터 비전용 기능은 그다지 풍부하지 않고, 내장된 비디오 스트리밍이나 모델 체이닝 추상화도 없습니다.           | 범용 ML 작업을 하고 있으며, 서버를 직접 처음부터 만들기보다 기능이 풍부한 출발점을 원합니다.                    |
| **TensorFlow Serving** | 여러 모달리티에 걸쳐 TensorFlow에 깊이 투자해 왔다면 좋습니다. 설정이 복잡할 수 있고, 사전/사후 처리 같은 기본적인 기능이 부족하여 보통 사용자 정의 코드가 필요합니다.                                | TensorFlow 생태계가 매우 중요하고, 수고를 들일 의향이 있습니다.                                 |
| **TorchServe**         | PyTorch에 해당하는 도구로, 비전, NLP, 표 형식 데이터, 오디오 전반에서 PyTorch 모델 서빙에 최적화되어 있습니다. 대규모 클라우드 배포용으로 설계되었으며, 비디오 스트리밍 같은 비전 특화 기능은 적습니다.         | PyTorch 모델 배포를 확장하고 사용자 정의하고 싶으며, 비전 특화 기능은 필요하지 않습니다.                    |
| **FastAPI 또는 Flask**   | 직접 만드는 방식입니다. Inference의 HTTP 인터페이스 자체가 FastAPI 위에 구축되어 있으므로, 처음부터 시작한다는 것은 이미 해결된 문제를 다시 만드는 것과 같습니다.                               | 주요 목표가 추론 서버 구축의 복잡성을 배우는 것입니다.                                           |

### 엣지 배포

| 도구                    | 비교                                                                                                                                          | 다음 경우 선택                                           |
| --------------------- | ------------------------------------------------------------------------------------------------------------------------------------------- | -------------------------------------------------- |
| **Edge Impulse**      | 전력 소모가 매우 낮은 엣지 장치와 임베디드 시스템에 집중하며, 마이크로컨트롤러에 특히 뛰어납니다. TinyML에 초점을 맞추기 때문에 비디오 처리와 최신 최첨단 모델에는 덜 적합하고, Workflows에 해당하는 기능도 없습니다.           | 더 강력한 모델을 실행할 수 없는 IoT 또는 웨어러블 장치를 만들고 있습니다.       |
| **NVIDIA DeepStream** | TensorRT와 CUDA를 사용한 고도로 최적화된 비디오 파이프라인을 위한 NVIDIA의 플랫폼으로, Inference와 많은 동일한 문제를 대상으로 합니다. 학습 곡선이 가파르고 NVIDIA 도구에 대한 익숙함이 필요하며, 오픈 소스가 아닙니다. | 처리량을 최우선 목표로 하는 단일 프로젝트 최적화에 크게 투자할 의향이 있는 전문가입니다. |
