> For the complete documentation index, see [llms.txt](https://docs.roboflow.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.roboflow.com/deployment/ko/choosing-a-deployment.md).

# 배포 옵션 선택

Roboflow는 모델을 실행하는 여러 가지 방법과 [워크플로](https://docs.roboflow.com/workflows), 완전 관리형 클라우드 API부터 자체 하드웨어에서의 추론까지 제공합니다. 적절한 선택은 워크로드가 실시간인지 대량 처리인지, 허용할 수 있는 지연 시간이 얼마나 되는지, 데이터가 어디에 있어도 되는지, 그리고 얼마나 많은 인프라를 직접 관리하고 싶은지에 따라 달라집니다.

표를 사용해 옵션을 한눈에 비교한 다음, 아래의 의사 결정 흐름을 따라 선택지를 좁혀 보세요.

## Roboflow 클라우드

Roboflow가 인프라를 운영합니다. 데이터는 API 엔드포인트로 전송하고, 예측 결과를 돌려받습니다.

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/pages/fa38b5d50e4a20fa682f65f5d06657bc30acfc2d">서버리스 호스팅 API</a></td><td><a href="/pages/6c5ca7f7c7965ede37538c2b4d2cf7b074670bab">전용 배포</a></td><td><a href="/pages/edf3038f80090d1a6c0e224af863cf720de13e4c">배치 처리</a></td></tr><tr><td>실행 위치</td><td>Roboflow 클라우드 (<code>serverless.roboflow.com</code>)</td><td>Roboflow가 관리하는 프라이빗 클라우드 서버 (<code>*.roboflow.cloud</code>)</td><td>Roboflow 클라우드, 작업별로 인프라가 자동 프로비저닝됨</td></tr><tr><td>GPU</td><td>예: GPU 가속 및 자동 확장</td><td>CPU (<code>dev-cpu</code> / <code>prod-cpu</code>) 또는 GPU (<code>dev-gpu</code> / <code>prod-gpu</code>)</td><td>작업별로 선택되는 CPU 또는 GPU</td></tr><tr><td>지연 시간 프로필</td><td>실시간, 동기식. 이미 로드되지 않은 모델에 대한 첫 요청은 몇 초의 웜업이 필요하며, 이후 요청은 모델이 캐시된 동안 빠릅니다.</td><td>일관된 전용 성능. 배포는 일정 기간 비활성 상태가 지속되면 자동으로 일시 중지되며(1시간으로 고정된 <code>dev-cpu</code> / <code>dev-gpu</code>) 요청을 보내면 다시 시작됩니다.</td><td>비동기식으로, 실시간에는 적합하지 않습니다. 리소스가 확보되면 머신이 프로비저닝되며, 보통 몇 분 후에 시작하지만 정확한 시작 시각은 보장되지 않습니다.</td></tr><tr><td>요금</td><td>처리 시간에 따라 크레딧 기준으로 추론당 과금됩니다. 참고: <a href="https://roboflow.com/credits">roboflow.com/credits</a> 및 <a href="/pages/81b109c3b034dcc21c13bf4275a8b870849746f9">Serverless 요금</a>.</td><td>시간당 요금, 1분 단위로 청구: GPU 1 크레딧/시간, CPU 0.25 크레딧/시간. 요청 기반 청구는 요청 시 제공됩니다.</td><td>CPU와 GPU 요금은 다릅니다. GPU 작업이 더 빠르지만 더 비쌉니다. 다음을 참조하세요: <a href="https://roboflow.com/pricing">요금 페이지</a>.</td></tr><tr><td>리전</td><td><a href="https://roboflow.com/sales">영업팀에 문의</a> 기본 API에 대해 <a href="/pages/a45cb5325555615ecf62a09278a3181c584aa976">비디오 스트리밍 API</a> 지원합니다 <code>미국</code>, <code>유럽</code>, <code>아시아 태평양</code>.</td><td>미국 기반 데이터 센터만.</td><td><a href="https://roboflow.com/sales">영업팀에 문의</a>.</td></tr><tr><td>플랜 제공 여부</td><td><a href="https://roboflow.com/sales">영업팀에 문의</a>.</td><td>Core 및 Enterprise. 참고 <a href="https://roboflow.com/pricing">요금</a>.</td><td>Growth 및 Enterprise.</td></tr><tr><td>추천 대상</td><td>배포 장치가 지속적인 인터넷 연결을 갖추고 있을 때, 실시간 단일 이미지 또는 Workflow 추론을 빠르게 시작하고 자동으로 확장하는 경우.</td><td>예측 가능하거나 운영 환경의 워크로드, 리소스 격리, 그리고 GPU 가속이 필요한 대형 모델(예: Florence-2, SAM2).</td><td>Workflow를 사용해 저장된 대량의 이미지와 비디오를 비용 효율적으로 처리할 때.</td></tr></tbody></table>

## 셀프 호스팅

자체 하드웨어에서 추론을 실행하므로, 데이터가 네트워크를 벗어날 필요가 없습니다.

<table data-header-hidden data-search="false"><thead><tr><th></th><th></th><th></th></tr></thead><tbody><tr><td></td><td><a href="/pages/478fbdc159a367bacfa5b94ff60f21724a6234a0">Self-Hosted Inference</a></td><td><a href="/pages/b45032c28a4d173d28c2edbe5448e0366c0654f5">엣지(Deployment Manager)</a></td></tr><tr><td>실행 위치</td><td>자체 하드웨어: 엣지 장치, 온프레미스 서버, 또는 자체 클라우드(Docker 또는 <code>pip</code>)</td><td>Roboflow가 원격으로 관리하는 엣지 장치</td></tr><tr><td>GPU</td><td>CPU, CUDA GPU, 또는 NVIDIA Jetson</td><td>장치에 따라 다름(NVIDIA Jetson, NVIDIA GPU가 있는 x86, 또는 Roboflow 제공 하드웨어)</td></tr><tr><td>지연 시간 프로필</td><td>네트워크 왕복 없이 로컬에서 낮은 지연 시간으로 동작하며, 충분한 하드웨어에서는 실시간 처리도 가능합니다.</td><td>로컬 엣지, 실시간. 원격 관리 및 모니터링을 위해 장치에 지속적인 인터넷 액세스가 필요합니다.</td></tr><tr><td>요금</td><td>무료 및 오픈 소스: 인프라를 직접 제공하고 관리해야 합니다. 프라이빗 모델용 TensorRT 최적화 패키지는 Enterprise가 필요합니다.</td><td><a href="https://roboflow.com/sales">영업팀에 문의</a>.</td></tr><tr><td>리전</td><td>어디서나(자체 인프라).</td><td>장치 위치.</td></tr><tr><td>플랜 제공 여부</td><td>모든 플랜(오픈 소스). TensorRT 프라이빗 모델 패키지와 1대 이상의 장치에서 실행하기 위한 라이선스에는 Enterprise가 필요합니다.</td><td>Enterprise 전용.</td></tr><tr><td>추천 대상</td><td>환경과 지연 시간을 최대한 제어하고 싶은 온프레미스, 엣지, 에어갭, 또는 VPC 제한 워크로드.</td><td>대규모 엣지 장치 플릿을 설정, 배포, 모니터링하는 작업.</td></tr></tbody></table>

## 한눈에 보는 기능

|                                          | 서버리스 | 전용  | 셀프 호스팅                                           |
| ---------------------------------------- | ---- | --- | ------------------------------------------------ |
| 파인튜닝 및 사전 학습된 모델                         | 예    | 예   | 예                                                |
| 워크플로                                     | 예    | 예   | 예                                                |
| 대형 파운데이션 모델(SAM2, Florence-2, PaliGemma) | 아니요  | 예   | 예                                                |
| 클라우드 호스팅 VLM(GPT, Claude, Gemini 블록)     | 예    | 예   | 예                                                |
| 비디오 스트리밍                                 | 아니요  | 예   | 예                                                |
| 커스텀 Python 블록 및 추가 종속성                   | 아니요  | 예   | 예                                                |
| 오프라인에서 실행                                | 아니요  | 아니요 | 예                                                |
| 과금                                       | 호출당  | 시간당 | 무료 + [종량제](https://roboflow.com/pricing) 클라우드 기능 |

확장 동작도 다릅니다: Serverless Hosted API는 유휴 상태일 때 0으로 축소되었다가 부하가 걸리면 몇 초의 콜드 스타트 후 다시 확장되는 반면, Dedicated Deployment는 시작하는 데 1\~2분이 걸립니다. 임시 `dev-cpu` 및 `dev-gpu` 배포는 짧은 세션으로 제한되며, 더 높은 우선순위 작업에 용량이 필요할 때 축출될 수 있습니다. 지속형 `prod-*` 유형은 보장된 용량과 세션 제한이 없습니다.

## 자체 클라우드 사용

규정 준수 정책상 워크로드를 자체 인프라 안에 유지해야 한다면, 자신의 AWS, Azure, 또는 GCP 계정에서 Inference를 실행할 수 있습니다: 다음을 참조하세요. [자체 클라우드에 배포](/deployment/ko/self-hosted/inference-server/install/cloud.md). 요금은 엣지 장치에서 셀프 호스팅하는 경우와 동일하며, 머신 비용은 클라우드 제공업체에 지불합니다.

## 의사 결정 흐름

1. **실시간인가, 대량 처리인가?** 데이터가 도착하는 즉시 결과가 필요하다면 — 라이브 비디오, 인터랙티브 앱, 요청별 추론 — 실시간 경로를 선택하세요. 저장된 이미지나 비디오의 대기열이 많다면 [배치 처리](/deployment/ko/roboflow-cloud/batch-processing.md).
2. **동기식인가, 비동기식인가?** 실시간 추론은 동기식입니다. 요청을 보내면 응답을 받습니다. 배치 처리는 비동기식입니다. 작업을 제출하고 완료되면 결과를 수집하므로, 정확한 시작 시각에 의존하지 마세요.
3. **클라우드인가, 온프레미스인가?** 데이터가 네트워크를 벗어나도 되고 인프라 관리가 전혀 필요 없다면, Roboflow가 호스팅하는 클라우드 옵션을 사용하세요. 워크로드를 온프레미스, 엣지, 또는 에어갭 환경에 두어야 한다면, 다음을 실행하세요. [Self-Hosted Inference](/deployment/ko/self-hosted/self-hosted.md).
4. **관리형인가, 자체 관리형인가?**
   * 클라우드에서는 다음을 선택하세요. [전용 배포](/deployment/ko/roboflow-cloud/dedicated-deployments.md) 예측 가능한 전용 성능이나 고정된 GPU 유형이 필요할 때는 [서버리스 호스팅 API](/deployment/ko/roboflow-cloud/serverless-api.md) 가 가장 단순한 기본값입니다.
   * 자체 하드웨어에서는 다음을 사용하세요. [Deployment Manager](/deployment/ko/self-hosted/enterprise/deployment-manager.md) (Enterprise) Roboflow가 엣지 장치 플릿을 대신 관리하고 모니터링해 주길 원할 때는, 그렇지 않으면 [Self-Hosted Inference](/deployment/ko/self-hosted/self-hosted.md) 서버를 직접 관리하세요.

옵션을 선택한 후에는 다음을 참조하세요. [프로덕션 준비 상태 체크리스트](/deployment/ko/production-checklist.md) 오류 처리, 재시도, 속도 제한, 그리고 복제본 수 조정을 위해

## Inference와 다른 배포 스택 비교

Roboflow Inference는 여러 다른 도구와 겹칩니다. 이 표는 다른 스택이 더 적합한 경우와, 그 선택으로 인해 포기하게 되는 부분을 요약합니다.

### Inference 서버

| 도구                     | 비교                                                                                                                                    | 다음과 같은 경우 선택                                               |
| ---------------------- | ------------------------------------------------------------------------------------------------------------------------------------- | ---------------------------------------------------------- |
| **NVIDIA Triton**      | NVIDIA 하드웨어에서 극도로 최적화된 파이프라인에 집중하며, 대규모 배포를 하는 ML 전문가를 위한 강력한 도구입니다. 단순성과 반복 속도를 희생하는 대신 원시 속도를 얻으며, 모델 앙상블은 Workflows보다 더 경직되어 있습니다. | 당신은 NVIDIA GPU에서의 속도를 무엇보다 중시하는, 명확하게 정의된 프로젝트의 ML 전문가입니다. |
| **Lightning LitServe** | 가볍고, 사용자 정의가 가능하며, 작업에 구애받지 않습니다(NLP, 오디오, 표 형식 데이터뿐 아니라 비전도 포함). 그래서 컴퓨터 비전용 기능은 덜 풍부하고, 내장된 비디오 스트리밍이나 모델 체이닝 추상화도 없습니다.            | 범용 ML 작업을 다루고 있으며, 서버를 직접 만드는 대신 풍부한 기능을 갖춘 출발점을 원합니다.     |
| **TensorFlow Serving** | 여러 모달리티에 걸쳐 TensorFlow에 깊이 투자했다면 좋습니다. 설정이 복잡할 수 있고, 사전/사후 처리 같은 기본적인 기능이 부족해 종종 사용자 정의 코드가 필요합니다.                                    | TensorFlow 생태계가 매우 중요하고, 손이 좀 가더라도 괜찮습니다.                  |
| **TorchServe**         | PyTorch에 해당하는 도구로, 비전, NLP, 표 형식 데이터, 오디오 전반에서 PyTorch 모델을 서빙하도록 최적화되어 있습니다. 대규모 클라우드 배포용으로 설계되었으며, 비디오 스트리밍 같은 비전 전용 기능은 적습니다.       | PyTorch 모델 배포를 확장하고 커스터마이즈하고 싶지만, 비전 전용 기능은 필요하지 않습니다.     |
| **FastAPI 또는 Flask**   | 직접 만드는 방식입니다. Inference의 자체 HTTP 인터페이스는 FastAPI를 기반으로 하므로, 처음부터 시작한다는 것은 이미 해결된 문제를 다시 만드는 것과 같습니다.                                   | 당신의 주된 목표가 추론 서버 구축의 복잡한 세부를 배우는 것입니다.                     |

### 엣지 배포

| 도구                    | 비교                                                                                                                                           | 다음과 같은 경우 선택                                          |
| --------------------- | -------------------------------------------------------------------------------------------------------------------------------------------- | ----------------------------------------------------- |
| **Edge Impulse**      | 아주 저전력 엣지 장치와 임베디드 시스템에 초점을 맞추며, 마이크로컨트롤러에 특히 강합니다. TinyML 중심이라 비디오 처리와 최신 최첨단 모델에는 덜 적합하고, Workflows에 해당하는 기능도 없습니다.                        | 더 강력한 모델을 실행할 수 없는 IoT 또는 웨어러블 장치를 만들고 있습니다.          |
| **NVIDIA DeepStream** | TensorRT와 CUDA를 사용한 고도로 최적화된 비디오 파이프라인을 위한 NVIDIA의 플랫폼으로, Inference와 많은 동일한 문제를 대상으로 합니다. 학습 곡선이 가파르고, NVIDIA 도구에 대한 익숙함이 필요하며, 오픈 소스가 아닙니다. | 처리량이 최우선 목표인 단일 프로젝트를 최적화하는 데 많은 투자를 할 의향이 있는 전문가입니다. |
