
오픈 모델을 위한 처리량 보장 서비스
필요한 처리량을 PTU로 계약하면, 트래픽이 몰리는 시간에도 그 처리량이 그대로 유지돼요. 엔진과 GPU 운영은 VESSL Cloud가 맡아요.
몰려도 그대로
되는 만큼이 아니라 계약한 만큼
더 낮은 비용
꾸준히 많은 트래픽에서 프론티어 API보다 저렴
코드 한 줄 변경
OpenAI, Anthropic 호환 API로 연동
모니터링
VESSL Cloud에서 사용량과 성능을 바로 확인해요
모델별 최대 사용량을 계약한 처리량과 비교해 볼 수 있어요. 아래 데모를 직접 눌러 보세요.
해결하는 문제
믿고 서비스를 만들 수 있는 처리량
코딩 에이전트, 채팅 서비스, 에이전트 플랫폼, 사내 AI 워크로드처럼 분당 토큰 처리량이 곧 품질인 팀을 위해 만들었어요.
계약한 처리량은 몰리는 시간에도 유지돼요
처리량, 안정성, 출력 토큰 하나당 시간(TPOT) 목표를 계약서에 적어요.
프론티어 API보다 토큰당 비용이 낮아요
트래픽이 꾸준히 많아 PTU를 충분히 쓰면 동급의 프론티어 모델보다 토큰당 비용이 낮아요. 월 비용은 PTU 수량으로 미리 계산해요.
운영은 VESSL Cloud가 맡아요
쓰던 OpenAI, Anthropic 클라이언트는 그대로 두고 접속 정보만 바꿔요.
코드는 한 줄만 바꾸면 돼요
API 키는 VESSL Cloud에서, 모델 ID는 모델 페이지에서 복사해요.
PTU
PTU는 처리량을 계약하는 단위예요
PTU(Provisioned Throughput Unit)는 모든 모델에 같은 기준으로 적용되는 서빙 용량 단위예요.
1 PTU
1분에 처리하는 토큰량은 모델마다 달라요.
Z.ai
GLM 5.3 Flash
분당 토큰
- 입력333,333
- 캐시된 입력1,666,667
- 출력100,000
DeepSeek
DeepSeek V4.1 Flash
분당 토큰
- 입력166,667
- 캐시된 입력7,142,857
- 출력41,667
PTU 1개는 1분에 위 세 값 중 하나만큼 처리해요. 실제 트래픽은 세 유형이 섞여 있고, 계약에서 값을 따로 정할 수 있어요.
찾는 모델이 없나요? 쓰려는 모델을 알려주시면 추가할 수 있는지 함께 살펴볼게요.
가격
PTU 단가는 모든 모델이 같아요
계약 용량 안에서는 보낸 토큰 수가 아니라 PTU 수량으로 과금하고, 요금은 매달 정산해요.
$0.05
PTU 1개를 1분 쓸 때
$2,190
PTU 1개를 한 달(730시간) 쓸 때
개별 협의
PTU 수량과 계약 기간
워크로드별 월 비용: VESSL Cloud PTU(GLM 5.3 Flash)와 Claude Opus 5.5, GPT-6.1 Sol
가정 기반 예시GLM 5.3 Flash 기준으로 한 달(730시간) 내내 트래픽이 들어온다고 가정하고, 필요한 PTU 비용($0.05/분)을 Claude Opus 5.5와 GPT-6.1 Sol의 종량제 공개 단가와 비교했어요. 두 모델 모두 effort를 최고 단계(max)로 올려도 단가는 같아요. 요청 형태는 계산 가정에서 볼 수 있어요.
Coding Agent
- VESSL Cloud PTU$11K
- Claude Opus 5.5$155K14.1배
- GPT-6.1 Sol$77K7.1배
Chat (single turn)
- VESSL Cloud PTU$7K
- Claude Opus 5.5$74K11.2배
- GPT-6.1 Sol$37K5.6배
Agentic workflow (multi turn)
- VESSL Cloud PTU$9K
- Claude Opus 5.5$123K14.0배
- GPT-6.1 Sol$61K7.0배
GLM 5.3 Flash 1 PTU가 분당 처리하는 토큰량
| 입력 | 출력 | 캐시된 입력 | |
|---|---|---|---|
| 토큰/분 | 333,333 | 100,000 | 1,666,667 |
공개 단가(100만 토큰당 달러)
| 입력 | 출력 | 캐시된 입력 | |
|---|---|---|---|
| Claude Opus 5.5 | $4 | $20 | $0.20 |
| GPT-6.1 Sol | $2 | $10 | $0.10 |
워크로드별 요청 형태
| 워크로드 | 요청당 입력 토큰 | 요청당 출력 토큰 | 캐시 적중률 | 요청당 캐시된 토큰 | 초당 요청 |
|---|---|---|---|---|---|
| Coding Agent | 55,000 | 300 | 80% | 44,000 | 1 |
| Chat (single turn) | 1,000 | 500 | 20% | 200 | 2 |
| Agentic workflow (multi turn) | 20,000 | 1,000 | 70% | 14,000 | 1 |
합계 계산
- Coding Agent: VESSL Cloud 5 PTU = $10,950Claude Opus 5.5 입력 $115,632 + 캐시된 입력 $23,126 + 출력 $15,768 = $154,526GPT-6.1 Sol 입력 $57,816 + 캐시된 입력 $11,563 + 출력 $7,884 = $77,263
- Chat (single turn): VESSL Cloud 3 PTU = $6,570Claude Opus 5.5 입력 $21,024 + 캐시된 입력 $0 + 출력 $52,560 = $73,584GPT-6.1 Sol 입력 $10,512 + 캐시된 입력 $0 + 출력 $26,280 = $36,792
- Agentic workflow (multi turn): VESSL Cloud 4 PTU = $8,760Claude Opus 5.5 입력 $63,072 + 캐시된 입력 $7,358 + 출력 $52,560 = $122,990GPT-6.1 Sol 입력 $31,536 + 캐시된 입력 $3,679 + 출력 $26,280 = $61,495
PTU 단가 $0.05/분은 참고용이고 바뀔 수 있어요. 캐시 적중률과 요청 형태는 가정값이에요. Claude Opus 5.5와 GPT-6.1 Sol 단가는 Anthropic과 OpenAI의 표준 공개 가격 기준이고, Batch, Flex, Fast 모드는 넣지 않았어요(OpenAI는 입력 272K 토큰 이하 요청 기준). 두 회사 모두 일정 길이보다 짧은 프롬프트는 캐시하지 않아요(Claude Opus 5.5는 512토큰, GPT-6.1 Sol은 1,024토큰). 그래서 요청당 캐시되는 토큰이 이보다 적은 워크로드는 해당 모델에서 캐시 없이 계산했어요. 모든 모델에 같은 토큰량을 적용했어요. effort를 높이면 같은 단가로 토큰을 더 쓰게 되는데, 이 추가 토큰과 두 회사의 캐시 쓰기 요금은 넣지 않았으니 Claude Opus 5.5와 GPT-6.1 Sol 금액은 최소치예요. 필요한 PTU는 토큰 유형별로 따로 계산해 정수로 올림한 뒤 더해요. 실제 계약 수량은 영업팀과 개별 협의로 정해요. 이 예시는 견적이 아니에요.
출처: Anthropic pricing, OpenAI pricing, Anthropic prompt caching, OpenAI prompt caching
내 트래픽으로 계산해 보세요
피크 트래픽을 입력하면 필요한 PTU가 나와요.
예시로 시작하기
모델
5PTU
예상 월 비용$10,950/월
피크 기준 분당 토큰
- 캐시 미적중 입력
- 660,000
- 캐시된 입력
- 2,640,000
- 출력
- 18,000
견적이 아니라 계획용 수치예요. 공개된 PTU당 처리량과 $0.05/분 단가로 730시간 한 달을 기준으로 계산했어요. 계약에 따라 PTU당 처리량이 달라질 수 있고, PTU 수량과 계약 기간은 영업팀과 협의로 정해요.
성능
실제 요청에서 어떻게 동작하는지 보세요
OpenCode 에이전트가 엔드포인트로 실제 작업하는 세션이에요. 첫 토큰까지 걸린 시간(TTFT)과 출력 토큰 하나당 시간(TPOT)이 작업하는 동안 화면에 그대로 찍혀요.
화면의 수치는 이 세션에서 잰 값이고, 계약으로 보장하는 목표치가 아니에요.
서빙 스택 성능
vLLM 권장 설정 = 1배같은 하드웨어에서 같은 지연 시간 기준을 지키면서 저희 서빙 스택을 vLLM 권장 설정과 비교했어요.
7.3배
최대 분당 처리 토큰
2.4배
초당 출력 토큰
2.2배
초당 입력 토큰
약 11배
KV 캐시 용량
2.22배
입력 처리(prefill) 속도, 공개 Triton 커널 대비
KV 캐시가 크면 긴 문맥을 메모리에 더 많이 올려 둘 수 있어요. 그래서 부하가 커져도 첫 토큰을 기다리는 시간이 짧게 유지되고, 트래픽이 무거울수록 차이가 커져요.
두 스택을 같은 하드웨어에서 같은 지연 시간 기준을 지키면서, 실제 서비스 트래픽 패턴을 본뜬 부하로 실행했어요. 처리량 수치는 그 기준을 지키면서 각 스택이 처리한 최대치예요. 입력 처리 속도는 같은 하드웨어에서 저희 커널과 공개 Triton 커널을 비교한 커널 단위 값이에요.
직접 측정해 보세요
저희 엔드포인트의 TTFT, TPOT, 토큰 사용량을 재는 측정 도구를 공개 데이터셋, 지표 정의, 요청별 원본 결과와 함께 드려요. 쓰시는 트래픽으로 직접 확인해 보세요.
상담
모델, 트래픽 규모와 형태, TPOT 목표를 같이 정리해요.
계약
보장할 처리량과 SLA, 계약 기간을 정해요.
PoC
VESSL Cloud가 목표에 맞춰 최적화하면, 실제 트래픽으로 성능과 비용을 직접 확인해요.
운영 시작
계약 시작일에 프로덕션 API 키를 드려요. base URL, API 키, 모델 ID를 넣으면 돼요.
상담 때 알려주실 정보
모델
서빙하려는 기반 모델(base model)
트래픽 규모
예상 일일 토큰량과 최대 분당 토큰 수(TPM)
트래픽 형태
요청당 평균 입력 길이와 출력 길이, 예상 캐시 적중률
목표 SLA
필요한 출력 토큰 하나당 시간(TPOT)
자주 묻는 질문
지금 바로 쓸 수 있나요?
네, Provisioned Throughput은 정식 출시됐어요. 문의해 주시면 필요한 용량을 같이 계산하고 조건을 정한 뒤, 실제 트래픽으로 PoC를 거쳐 사용을 시작해요.
어떤 모델을 쓸 수 있나요?
Z.ai, DeepSeek 같은 오픈 모델 개발사의 최신 모델을 제공해요. 라인업은 수요에 맞춰 늘려 가니, 필요한 모델이 있다면 알려주세요.
어떤 API를 지원하나요?
OpenAI Chat Completions API와 Anthropic Messages API를 모두 지원해요. 쓰던 클라이언트나 SDK는 그대로 두고 접속 정보만 바꾸면 돼요. 필요한 값은 엔드포인트를 만들 때 전달해 드려요.
요금은 어떻게 되나요?
PTU 1개를 1분 쓰는 데 $0.05이고, 모든 모델에 같은 단가를 적용해요. PTU 수량과 계약 기간은 영업팀과 개별 협의로 정하고, 요금은 매달 정산해요.
SLA는 무엇을 보장하나요?
세 가지를 보장해요. 계약한 PTU가 보장하는 처리량, 매월 SLA 적용 대상 요청 가운데 정해진 비율 이상의 정상 처리, 출력 토큰 하나당 시간(TPOT) 목표예요. 구체적인 목표치와 미달 시 보상은 계약할 때 워크로드에 맞춰 정해요.
프롬프트와 출력을 저장하나요?
기본적으로 요청 처리가 끝나면 프롬프트와 출력을 남기지 않아요. 콘텐츠 로깅은 직접 신청한 경우에만 하고, 어뷰징, 사기, 보안, 법적 요구에 따른 제한적인 예외는 서비스 약관에 적혀 있어요.
고객 데이터로 모델을 학습하나요?
아니요. 서면으로 동의하지 않으면 입력과 출력을 어떤 모델의 학습, 파인튜닝, 업데이트에도 쓰지 않아요.
보안 인증을 받았나요?
VESSL AI는 SOC 2 Type II 인증을 받았어요. 최신 통제 항목과 리포트는 trust.vessl.ai에서 확인할 수 있어요.
