배포 옵션 선택
Roboflow의 배포 옵션 - 서버리스 클라우드 API, 전용 배포, 배치 처리, 자체 호스팅 추론, 엣지 디바이스 - 를 비교하고 사용 사례에 맞는 것을 선택하세요.
Roboflow는 모델을 실행할 수 있는 여러 가지 방법을 제공합니다. 워크플로우완전 관리형 클라우드 API부터 자체 하드웨어에서의 추론까지 있습니다. 적절한 선택은 워크로드가 실시간인지 대량인지, 허용할 수 있는 지연 시간이 어느 정도인지, 데이터가 어디에 있어도 되는지, 그리고 관리하고 싶은 인프라가 얼마나 되는지에 따라 달라집니다.
표를 사용해 옵션을 한눈에 비교한 다음, 아래의 결정 흐름을 따라 범위를 좁혀 보세요.
Roboflow 클라우드
Roboflow가 인프라를 운영합니다. 데이터를 API 엔드포인트로 보내면 예측 결과를 돌려받습니다.
실행 위치
Roboflow 클라우드 (serverless.roboflow.com)
Roboflow가 관리하는 프라이빗 클라우드 서버 (*.roboflow.cloud)
작업마다 인프라가 자동으로 프로비저닝되는 Roboflow 클라우드
GPU
예: GPU 가속 및 자동 확장 지원
CPU (dev-cpu / prod-cpu) 또는 GPU (dev-gpu / prod-gpu)
작업마다 선택되는 CPU 또는 GPU
지연 시간 특성
실시간, 동기식입니다. 아직 로드되지 않은 모델에 대한 첫 요청은 몇 초의 웜업이 필요하며, 이후 요청은 모델이 캐시에 유지되는 동안 빠르게 처리됩니다.
일관된 전용 성능. 배포는 일정 시간 비활성 상태가 되면 자동으로 일시 중지되며(의 경우 1시간으로 고정) dev-cpu / dev-gpu), 요청을 보내면 다시 시작됩니다.
비동기식이며 실시간 용도에는 적합하지 않습니다. 리소스를 사용할 수 있게 되면 보통 몇 분 후에 머신이 프로비저닝되며, 정확한 시작 시간은 보장되지 않습니다.
요금
처리 시간을 기준으로 추론당 크레딧으로 계량됩니다. 참조: roboflow.com/credits 및 서버리스 요금.
시간당 과금, 1분 단위 청구: GPU 1크레딧/시간, CPU 0.25크레딧/시간. 요청 시 요청 기반 청구도 가능합니다.
CPU와 GPU 요금은 다릅니다. GPU 작업은 더 빠르지만 더 비쌉니다. 요금 페이지.
적합한 용도
배포 장치가 지속적인 인터넷 연결을 갖고 있을 때, 실시간 단일 이미지 또는 Workflow 추론을 빠르게 시작하고 자동으로 확장하는 경우.
예측 가능한 또는 운영 환경의 워크로드, 리소스 격리, 그리고 GPU 가속이 필요한 대형 모델(예: Florence-2, SAM2).
Workflow를 사용해 저장된 대량의 이미지와 비디오를 비용 효율적으로 처리할 때.
자체 호스팅
자체 하드웨어에서 추론을 실행하므로 데이터가 네트워크를 벗어날 필요가 없습니다.
실행 위치
자체 하드웨어: 엣지 디바이스, 온프레미스 서버, 또는 자체 클라우드(Docker 또는 pip)
Roboflow가 원격으로 관리하는 엣지 디바이스
GPU
CPU, CUDA GPU, 또는 NVIDIA Jetson
장치에 따라 다름(NVIDIA Jetson, NVIDIA GPU가 있는 x86, 또는 Roboflow 제공 하드웨어)
지연 시간 특성
로컬에서 네트워크 왕복 없이 낮은 지연 시간으로 동작하며, 충분한 하드웨어에서는 실시간 처리가 가능합니다.
로컬 엣지, 실시간. 장치의 원격 관리와 모니터링을 위해서는 지속적인 인터넷 접속이 필요합니다.
리전
어디서나(사용자 인프라).
장치가 있는 위치.
플랜 제공 여부
모든 플랜(오픈 소스). TensorRT 비공개 모델 패키지와 여러 대의 장치에서 실행하기 위한 라이선스는 Enterprise가 필요합니다.
Enterprise 전용.
적합한 용도
환경과 지연 시간에 대한 최대 제어가 필요한 온프레미스, 엣지, 에어갭, 또는 VPC 종속 워크로드.
대규모 엣지 디바이스 집단의 설정, 배포, 모니터링.
기능 한눈에 보기
파인튜닝 및 사전 학습된 모델
예
예
예
워크플로우
예
예
예
대형 기반 모델(SAM2, Florence-2, PaliGemma)
아니요
예
예
클라우드 호스팅 VLM(GPT, Claude, Gemini 블록)
예
예
예
비디오 스트리밍
아니요
예
예
사용자 지정 Python 블록 및 추가 종속성
아니요
예
예
오프라인 실행
아니요
아니요
예
확장 방식도 다릅니다: Serverless Cloud API는 유휴 상태일 때 0까지 확장되었다가 부하가 걸리면 몇 초의 콜드 스타트 후 다시 확장되는 반면, Dedicated Deployment는 시작하는 데 1~2분이 걸립니다. 임시 dev-cpu 및 dev-gpu 배포는 짧은 세션으로 제한되며, 더 높은 우선순위의 작업에 용량이 필요하면 축출될 수 있습니다. 지속적인 prod-* 유형은 보장된 용량이 있으며 세션 제한이 없습니다.
자체 클라우드 사용
규정 준수 정책상 워크로드가 반드시 자체 인프라 안에 있어야 한다면, 자체 AWS, Azure 또는 GCP 계정에서 Inference를 실행할 수 있습니다: 자체 클라우드에 배포. 과금은 엣지 디바이스에서 자체 호스팅하는 것과 동일하며, 머신 비용은 클라우드 제공업체에 지불합니다.
결정 흐름
실시간인가, 대량 처리인가? 데이터가 들어오는 대로 결과가 필요하다면 - 라이브 비디오, 인터랙티브 앱, 요청별 추론 - 실시간 경로를 선택하세요. 저장된 이미지나 비디오의 큰 대기열을 처리하는 중이라면, 배치 처리.
동기식인가, 비동기식인가? 실시간 추론은 동기식입니다: 요청을 보내면 응답을 받습니다. Batch Processing은 비동기식입니다: 작업을 제출하고 완료되면 결과를 수집하므로 정확한 시작 시간에 의존하지 마세요.
클라우드인가, 온프레미스인가? 데이터가 네트워크를 벗어나도 되고 관리할 인프라를 0으로 유지하고 싶다면 Roboflow가 호스팅하는 클라우드 옵션을 사용하세요. 워크로드가 온프레미스, 엣지, 또는 에어갭 환경에 있어야 한다면, 자체 호스팅 추론.
관리형인가, 자체 관리형인가?
클라우드에서는 다음을 선택하세요: 전용 배포 예측 가능한 전용 성능이나 고정된 GPU 유형이 필요할 때는; 그렇지 않으면 서버리스 클라우드 API 가 가장 간단한 기본값입니다.
옵션을 선택한 뒤에는 다음을 참조하세요: 프로덕션 준비 체크리스트 오류 처리, 재시도, 속도 제한, 복제본 수 조정을 위해
Inference와 다른 배포 스택 비교
Roboflow Inference는 여러 다른 도구와 기능이 겹칩니다. 이 표는 다른 스택이 더 적합한 경우와, 그것을 선택했을 때 포기하는 부분을 요약합니다.
추론 서버
NVIDIA Triton
대규모 배포를 하는 ML 전문가를 위한 강력한 도구로, NVIDIA 하드웨어에서 극도로 최적화된 파이프라인에 집중합니다. 단순성과 반복 속도를 원시 속도와 맞바꾸며, 모델 앙상블은 Workflows보다 더 경직되어 있습니다.
당신은 ML 전문가이며, NVIDIA GPU에서의 속도가 무엇보다 중요한 명확하게 정의된 프로젝트를 진행하고 있습니다.
Lightning LitServe
가볍고, 사용자 정의가 가능하며, 작업에 구애받지 않습니다(NLP, 오디오, 표 데이터뿐 아니라 비전도 포함). 그래서 컴퓨터 비전용 기능이 풍부하지 않고, 내장된 비디오 스트리밍이나 모델 체이닝 추상화가 없습니다.
범용 ML 작업을 진행하고 있으며, 서버를 직접 구현하는 대신 기능이 풍부한 출발점을 원합니다.
TensorFlow Serving
여러 모달리티에 걸쳐 TensorFlow에 깊이 투자했다면 적합합니다. 설정이 복잡할 수 있고, 사전/사후 처리 같은 기본적인 기능이 부족해 커스텀 코드가 필요한 경우가 많습니다.
TensorFlow 생태계가 매우 중요하고, 수고를 감수할 의향이 있습니다.
TorchServe
PyTorch에 해당하는 도구로, 비전, NLP, 표 데이터, 오디오 전반에서 PyTorch 모델을 서빙하도록 최적화되어 있습니다. 대규모 클라우드 배포를 염두에 두고 설계되었으며, 비디오 스트리밍 같은 비전 특화 기능은 적습니다.
PyTorch 모델 배포를 확장하고 커스터마이즈하고 싶으며, 비전 특화 기능은 필요하지 않습니다.
FastAPI 또는 Flask
직접 만드는 방식입니다. Inference의 HTTP 인터페이스 자체가 FastAPI 위에 구축되어 있으므로, 처음부터 시작한다는 것은 이미 해결된 문제를 다시 만드는 것과 같습니다.
당신의 주된 목표는 추론 서버를 구축하는 복잡한 과정을 배우는 것입니다.
엣지 배포
Edge Impulse
매우 저전력 엣지 디바이스와 임베디드 시스템에 집중하며, 마이크로컨트롤러에 특히 강합니다. TinyML에 초점을 맞추기 때문에 비디오 처리와 최신 최첨단 모델에는 덜 적합하고, Workflows에 해당하는 기능도 없습니다.
더 강력한 모델을 실행할 수 없는 IoT 또는 웨어러블 장치를 만들고 있습니다.
NVIDIA DeepStream
TensorRT와 CUDA를 사용해 고도로 최적화된 비디오 파이프라인을 위한 NVIDIA의 플랫폼으로, Inference와 많은 동일한 문제를 대상으로 합니다. 학습 곡선이 가파르고 NVIDIA 도구에 대한 이해가 필요하며, 오픈 소스가 아닙니다.
당신은 처리량을 최우선 목표로 하는 단일 프로젝트를 최적화하는 데 많은 투자를 할 의향이 있는 전문가입니다.
마지막 업데이트
도움이 되었나요?