> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/ko/choosing-a-deployment.md).

# 배포 옵션 선택

Roboflow는 모델을 실행할 수 있는 여러 가지 방법을 제공합니다. [워크플로우](https://docs.roboflow.com/workflows)완전 관리형 클라우드 API부터 자체 하드웨어에서의 추론까지 있습니다. 적절한 선택은 워크로드가 실시간인지 대량인지, 허용할 수 있는 지연 시간이 어느 정도인지, 데이터가 어디에 있어도 되는지, 그리고 관리하고 싶은 인프라가 얼마나 되는지에 따라 달라집니다.

표를 사용해 옵션을 한눈에 비교한 다음, 아래의 결정 흐름을 따라 범위를 좁혀 보세요.

## Roboflow 클라우드

Roboflow가 인프라를 운영합니다. 데이터를 API 엔드포인트로 보내면 예측 결과를 돌려받습니다.

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/pages/fa38b5d50e4a20fa682f65f5d06657bc30acfc2d">서버리스 클라우드 API</a></td><td><a href="/pages/6c5ca7f7c7965ede37538c2b4d2cf7b074670bab">전용 배포</a></td><td><a href="/pages/edf3038f80090d1a6c0e224af863cf720de13e4c">배치 처리</a></td></tr><tr><td>실행 위치</td><td>Roboflow 클라우드 (<code>serverless.roboflow.com</code>)</td><td>Roboflow가 관리하는 프라이빗 클라우드 서버 (<code>*.roboflow.cloud</code>)</td><td>작업마다 인프라가 자동으로 프로비저닝되는 Roboflow 클라우드</td></tr><tr><td>GPU</td><td>예: GPU 가속 및 자동 확장 지원</td><td>CPU (<code>dev-cpu</code> / <code>prod-cpu</code>) 또는 GPU (<code>dev-gpu</code> / <code>prod-gpu</code>)</td><td>작업마다 선택되는 CPU 또는 GPU</td></tr><tr><td>지연 시간 특성</td><td>실시간, 동기식입니다. 아직 로드되지 않은 모델에 대한 첫 요청은 몇 초의 웜업이 필요하며, 이후 요청은 모델이 캐시에 유지되는 동안 빠르게 처리됩니다.</td><td>일관된 전용 성능. 배포는 일정 시간 비활성 상태가 되면 자동으로 일시 중지되며(의 경우 1시간으로 고정) <code>dev-cpu</code> / <code>dev-gpu</code>), 요청을 보내면 다시 시작됩니다.</td><td>비동기식이며 실시간 용도에는 적합하지 않습니다. 리소스를 사용할 수 있게 되면 보통 몇 분 후에 머신이 프로비저닝되며, 정확한 시작 시간은 보장되지 않습니다.</td></tr><tr><td>요금</td><td>처리 시간을 기준으로 추론당 크레딧으로 계량됩니다. 참조: <a href="https://roboflow.com/credits">roboflow.com/credits</a> 및 <a href="/pages/81b109c3b034dcc21c13bf4275a8b870849746f9">서버리스 요금</a>.</td><td>시간당 과금, 1분 단위 청구: GPU 1크레딧/시간, CPU 0.25크레딧/시간. 요청 시 요청 기반 청구도 가능합니다.</td><td>CPU와 GPU 요금은 다릅니다. GPU 작업은 더 빠르지만 더 비쌉니다.  <a href="https://roboflow.com/pricing">요금 페이지</a>.</td></tr><tr><td>리전</td><td><a href="https://roboflow.com/sales">영업팀에 문의</a> 기본 API의 경우.  <a href="/pages/a45cb5325555615ecf62a09278a3181c584aa976">비디오 스트리밍 API</a> 지원하는 <code>미국(us)</code>, <code>유럽(eu)</code>, <code>아시아 태평양(ap)</code>.</td><td>미국 소재 데이터 센터만 지원합니다.</td><td><a href="https://roboflow.com/sales">영업팀에 문의</a>.</td></tr><tr><td>플랜 제공 여부</td><td><a href="https://roboflow.com/sales">영업팀에 문의</a>.</td><td>Core 및 Enterprise. 참조: <a href="https://roboflow.com/pricing">요금</a>.</td><td>Growth 및 Enterprise.</td></tr><tr><td>적합한 용도</td><td>배포 장치가 지속적인 인터넷 연결을 갖고 있을 때, 실시간 단일 이미지 또는 Workflow 추론을 빠르게 시작하고 자동으로 확장하는 경우.</td><td>예측 가능한 또는 운영 환경의 워크로드, 리소스 격리, 그리고 GPU 가속이 필요한 대형 모델(예: Florence-2, SAM2).</td><td>Workflow를 사용해 저장된 대량의 이미지와 비디오를 비용 효율적으로 처리할 때.</td></tr></tbody></table>

## 자체 호스팅

자체 하드웨어에서 추론을 실행하므로 데이터가 네트워크를 벗어날 필요가 없습니다.

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/pages/478fbdc159a367bacfa5b94ff60f21724a6234a0">자체 호스팅 추론</a></td><td><a href="/pages/b45032c28a4d173d28c2edbe5448e0366c0654f5">엣지(배포 관리자)</a></td></tr><tr><td>실행 위치</td><td>자체 하드웨어: 엣지 디바이스, 온프레미스 서버, 또는 자체 클라우드(Docker 또는 <code>pip</code>)</td><td>Roboflow가 원격으로 관리하는 엣지 디바이스</td></tr><tr><td>GPU</td><td>CPU, CUDA GPU, 또는 NVIDIA Jetson</td><td>장치에 따라 다름(NVIDIA Jetson, NVIDIA GPU가 있는 x86, 또는 Roboflow 제공 하드웨어)</td></tr><tr><td>지연 시간 특성</td><td>로컬에서 네트워크 왕복 없이 낮은 지연 시간으로 동작하며, 충분한 하드웨어에서는 실시간 처리가 가능합니다.</td><td>로컬 엣지, 실시간. 장치의 원격 관리와 모니터링을 위해서는 지속적인 인터넷 접속이 필요합니다.</td></tr><tr><td>요금</td><td>무료 오픈 소스: 인프라를 제공하고 관리하는 것은 사용자입니다. 비공개 모델용 TensorRT 최적화 패키지는 Enterprise가 필요합니다.</td><td><a href="https://roboflow.com/sales">영업팀에 문의</a>.</td></tr><tr><td>리전</td><td>어디서나(사용자 인프라).</td><td>장치가 있는 위치.</td></tr><tr><td>플랜 제공 여부</td><td>모든 플랜(오픈 소스). TensorRT 비공개 모델 패키지와 여러 대의 장치에서 실행하기 위한 라이선스는 Enterprise가 필요합니다.</td><td>Enterprise 전용.</td></tr><tr><td>적합한 용도</td><td>환경과 지연 시간에 대한 최대 제어가 필요한 온프레미스, 엣지, 에어갭, 또는 VPC 종속 워크로드.</td><td>대규모 엣지 디바이스 집단의 설정, 배포, 모니터링.</td></tr></tbody></table>

## 기능 한눈에 보기

|                                       | 서버리스 | 전용  | 자체 호스팅                                           |
| ------------------------------------- | ---- | --- | ------------------------------------------------ |
| 파인튜닝 및 사전 학습된 모델                      | 예    | 예   | 예                                                |
| 워크플로우                                 | 예    | 예   | 예                                                |
| 대형 기반 모델(SAM2, Florence-2, PaliGemma) | 아니요  | 예   | 예                                                |
| 클라우드 호스팅 VLM(GPT, Claude, Gemini 블록)  | 예    | 예   | 예                                                |
| 비디오 스트리밍                              | 아니요  | 예   | 예                                                |
| 사용자 지정 Python 블록 및 추가 종속성             | 아니요  | 예   | 예                                                |
| 오프라인 실행                               | 아니요  | 아니요 | 예                                                |
| 과금                                    | 호출당  | 시간당 | 무료 + [계량식](https://roboflow.com/pricing) 클라우드 기능 |

확장 방식도 다릅니다: Serverless Cloud API는 유휴 상태일 때 0까지 확장되었다가 부하가 걸리면 몇 초의 콜드 스타트 후 다시 확장되는 반면, Dedicated Deployment는 시작하는 데 1\~2분이 걸립니다. 임시 `dev-cpu` 및 `dev-gpu` 배포는 짧은 세션으로 제한되며, 더 높은 우선순위의 작업에 용량이 필요하면 축출될 수 있습니다. 지속적인 `prod-*` 유형은 보장된 용량이 있으며 세션 제한이 없습니다.

## 자체 클라우드 사용

규정 준수 정책상 워크로드가 반드시 자체 인프라 안에 있어야 한다면, 자체 AWS, Azure 또는 GCP 계정에서 Inference를 실행할 수 있습니다:  [자체 클라우드에 배포](/deployment/ko/self-hosted/inference-server/install/cloud.md). 과금은 엣지 디바이스에서 자체 호스팅하는 것과 동일하며, 머신 비용은 클라우드 제공업체에 지불합니다.

## 결정 흐름

1. **실시간인가, 대량 처리인가?** 데이터가 들어오는 대로 결과가 필요하다면 - 라이브 비디오, 인터랙티브 앱, 요청별 추론 - 실시간 경로를 선택하세요. 저장된 이미지나 비디오의 큰 대기열을 처리하는 중이라면,  [배치 처리](/deployment/ko/roboflow-cloud/batch-processing.md).
2. **동기식인가, 비동기식인가?** 실시간 추론은 동기식입니다: 요청을 보내면 응답을 받습니다. Batch Processing은 비동기식입니다: 작업을 제출하고 완료되면 결과를 수집하므로 정확한 시작 시간에 의존하지 마세요.
3. **클라우드인가, 온프레미스인가?** 데이터가 네트워크를 벗어나도 되고 관리할 인프라를 0으로 유지하고 싶다면 Roboflow가 호스팅하는 클라우드 옵션을 사용하세요. 워크로드가 온프레미스, 엣지, 또는 에어갭 환경에 있어야 한다면,  [자체 호스팅 추론](/deployment/ko/self-hosted/self-hosted.md).
4. **관리형인가, 자체 관리형인가?**
   * 클라우드에서는 다음을 선택하세요: [전용 배포](/deployment/ko/roboflow-cloud/dedicated-deployments.md) 예측 가능한 전용 성능이나 고정된 GPU 유형이 필요할 때는; 그렇지 않으면  [서버리스 클라우드 API](/deployment/ko/roboflow-cloud/serverless-api.md) 가 가장 간단한 기본값입니다.
   * 자체 하드웨어에서는 다음을 사용하세요: [배포 관리자](/deployment/ko/self-hosted/enterprise/deployment-manager.md) (Enterprise) Roboflow가 엣지 디바이스 집단을 대신 관리하고 모니터링하도록 하고 싶을 때 사용하세요. 그렇지 않으면 [자체 호스팅 추론](/deployment/ko/self-hosted/self-hosted.md) 서버를 직접 관리하세요.

옵션을 선택한 뒤에는 다음을 참조하세요: [프로덕션 준비 체크리스트](/deployment/ko/production-checklist.md) 오류 처리, 재시도, 속도 제한, 복제본 수 조정을 위해

## Inference와 다른 배포 스택 비교

Roboflow Inference는 여러 다른 도구와 기능이 겹칩니다. 이 표는 다른 스택이 더 적합한 경우와, 그것을 선택했을 때 포기하는 부분을 요약합니다.

### 추론 서버

| 도구                     | 비교 방식                                                                                                                             | 다음과 같은 경우 선택                                                       |
| ---------------------- | --------------------------------------------------------------------------------------------------------------------------------- | ------------------------------------------------------------------ |
| **NVIDIA Triton**      | 대규모 배포를 하는 ML 전문가를 위한 강력한 도구로, NVIDIA 하드웨어에서 극도로 최적화된 파이프라인에 집중합니다. 단순성과 반복 속도를 원시 속도와 맞바꾸며, 모델 앙상블은 Workflows보다 더 경직되어 있습니다.     | 당신은 ML 전문가이며, NVIDIA GPU에서의 속도가 무엇보다 중요한 명확하게 정의된 프로젝트를 진행하고 있습니다. |
| **Lightning LitServe** | 가볍고, 사용자 정의가 가능하며, 작업에 구애받지 않습니다(NLP, 오디오, 표 데이터뿐 아니라 비전도 포함). 그래서 컴퓨터 비전용 기능이 풍부하지 않고, 내장된 비디오 스트리밍이나 모델 체이닝 추상화가 없습니다.          | 범용 ML 작업을 진행하고 있으며, 서버를 직접 구현하는 대신 기능이 풍부한 출발점을 원합니다.              |
| **TensorFlow Serving** | 여러 모달리티에 걸쳐 TensorFlow에 깊이 투자했다면 적합합니다. 설정이 복잡할 수 있고, 사전/사후 처리 같은 기본적인 기능이 부족해 커스텀 코드가 필요한 경우가 많습니다.                              | TensorFlow 생태계가 매우 중요하고, 수고를 감수할 의향이 있습니다.                         |
| **TorchServe**         | PyTorch에 해당하는 도구로, 비전, NLP, 표 데이터, 오디오 전반에서 PyTorch 모델을 서빙하도록 최적화되어 있습니다. 대규모 클라우드 배포를 염두에 두고 설계되었으며, 비디오 스트리밍 같은 비전 특화 기능은 적습니다. | PyTorch 모델 배포를 확장하고 커스터마이즈하고 싶으며, 비전 특화 기능은 필요하지 않습니다.             |
| **FastAPI 또는 Flask**   | 직접 만드는 방식입니다. Inference의 HTTP 인터페이스 자체가 FastAPI 위에 구축되어 있으므로, 처음부터 시작한다는 것은 이미 해결된 문제를 다시 만드는 것과 같습니다.                            | 당신의 주된 목표는 추론 서버를 구축하는 복잡한 과정을 배우는 것입니다.                           |

### 엣지 배포

| 도구                    | 비교 방식                                                                                                                                      | 다음과 같은 경우 선택                                                 |
| --------------------- | ------------------------------------------------------------------------------------------------------------------------------------------ | ------------------------------------------------------------ |
| **Edge Impulse**      | 매우 저전력 엣지 디바이스와 임베디드 시스템에 집중하며, 마이크로컨트롤러에 특히 강합니다. TinyML에 초점을 맞추기 때문에 비디오 처리와 최신 최첨단 모델에는 덜 적합하고, Workflows에 해당하는 기능도 없습니다.               | 더 강력한 모델을 실행할 수 없는 IoT 또는 웨어러블 장치를 만들고 있습니다.                 |
| **NVIDIA DeepStream** | TensorRT와 CUDA를 사용해 고도로 최적화된 비디오 파이프라인을 위한 NVIDIA의 플랫폼으로, Inference와 많은 동일한 문제를 대상으로 합니다. 학습 곡선이 가파르고 NVIDIA 도구에 대한 이해가 필요하며, 오픈 소스가 아닙니다. | 당신은 처리량을 최우선 목표로 하는 단일 프로젝트를 최적화하는 데 많은 투자를 할 의향이 있는 전문가입니다. |
