
에이전트 시대의 토큰 인프라
긴 컨텍스트 워크로드에 꼭 맞는 캐시 인식형(cache-aware) 라우팅과 전용 추론 엔드포인트를 준비하고 있어요. 지금 먼저 써보실 디자인 파트너(design partner)를 모집 중이에요. 곧 정식으로 만날 수 있어요.
토큰을 많이 쓰는 제품 팀을 위해
코딩 에이전트, 상담 에이전트나 캐릭터 챗봇 같은 서비스, 자체 모델을 대규모로 서빙하는 팀까지요.
코드 한 줄만 바꾸면 돼요
Anthropic, OpenAI 호환 API를 지원해서 엔드포인트 URL만 바꾸면 기존 앱이 그대로 동작해요. SDK를 새로 갈아끼우거나 코드를 다시 짤 필요가 전혀 없어요.
긴 컨텍스트에 맞춘 캐시 인식형(cache-aware) 서빙
코딩 에이전트나 대화형 챗봇처럼 입력이 길어질수록 캐시를 잘 살리는 게 비용과 속도의 핵심이에요. VESSL Cloud는 여러 클러스터의 캐시 적중률을 끌어올려, 첫 토큰 응답은 더 빠르게 하고 토큰당 비용은 확 낮췄어요.
성능이 일정한 전용 엔드포인트
공용 인프라처럼 다른 사람의 트래픽 때문에 성능이 오락가락하지 않아요. 전용 엔드포인트를 써서 첫 토큰 응답과 생성 속도가 늘 일정하고, 트래픽이 수십억 토큰으로 뛰어도 여러 클러스터가 든든하게 받쳐줘요.
투명한 토큰 정산
캐시된 입력과 그렇지 않은 입력, 그리고 출력 토큰을 따로따로 집계해서 요금을 매겨요. 캐시된 토큰만큼 비용을 아낄 수 있고, 전체 사용량은 대시보드에서 거의 실시간으로 볼 수 있어요.
키 발급부터 결제까지 한 곳에서
API 키 발급, 사용량 추적, 결제까지 VESSL Cloud 안에서 직접 처리하면 돼요. 추론 하나 쓰자고 여러 시스템을 오갈 필요가 없어요.
자주 묻는 질문
지금 바로 쓸 수 있나요?
아직은요. Inference Endpoints는 곧 출시될 예정이고, 지금은 먼저 써볼 design partner를 모집하고 있어요. 미리 써보고 싶으면 팀에 문의하세요.
그럼 지금 추론은 어떻게 실행하나요?
지금도 빌린 GPU 위에서 직접 추론을 실행할 수 있어요. GPU Workspace나 Job에 vLLM 같은 서버로 LLM을 띄우면 돼요. Inference Endpoints는 여기에 관리형 엔드포인트와 토큰 단위 과금을 더하는 거예요.
어떤 API를 지원하나요?
Anthropic, OpenAI 호환 API로 제공할 예정이에요. 쓰던 클라이언트에서 엔드포인트 URL만 바꾸면 코드는 그대로 둬도 돼요.
어떤 팀에 맞나요?
토큰을 많이 쓰는 AI 제품 팀에 맞아요. 코딩 에이전트, 상담 에이전트나 캐릭터 챗봇 같은 에이전틱 서비스, 자체 모델을 대규모로 서빙하려는 모델 개발사요.
