
초 단위
약정 없이 쓴 만큼만 내는 GPU 과금
수백 TB
Object Storage에 보관하는 시연 데이터
InfiniBand
멀티노드 VM Cluster
Physical AI를 만드는 팀들이 함께해요.
로봇 학습 루프를 중심으로
현장에서 직접 검증하고, 데이터를 모아 골라내고, 다시 학습시켜 로봇에 올려요. Physical AI에서 오래가는 경쟁력은 모델 자체보다 그 뒤의 데이터 플라이휠이고, 이 루프의 대부분은 모델이 아니라 인프라예요. 데모 성공률은 이 루프가 얼마나 빨리 도느냐에 달려 있어요.
데이터는 옮기지 말고, GPU 옆에 착
현장 세션 한 번마다 카메라 영상, 언어 지시문, 관절 궤적이 동기화된 채로 쌓이고, 데이터셋은 어느새 수백 TB가 돼요.
루프를 답답하게 만드는 건 용량이 아니라 느린 '이동'이에요. 노드로 복사하고, 가공하고, 체크포인트를 로봇 쪽으로 내려받는 시간이죠. 여러 워크로드가 볼륨 하나를 동시에 마운트하면, 팀원마다 데이터를 복사하던 수고가 사라져요.

$0.03
GiB당 월 요금, 데이터셋 아카이브는 Cold 티어 Object Storage에
동시 마운트
여러 워크로드가 같은 볼륨을 함께 읽고 써요
어느 클러스터든
워크로드 실행 시점에 볼륨을 바로 연결해요
실험은 한 번에, 비용은 쓴 만큼만
레시피 찾기는 증강 기법, 액션 헤드, 학습률을 바꿔가며 짧은 학습 여러 개를 한꺼번에 실행하는 병렬 작업이에요. GPU 수요가 확 몰렸다가 순식간에 빠져나가죠.
초 단위로 과금하는 온디맨드 GPU가 이런 작업 방식에 딱 맞아요. CLI에서 필요한 만큼 스윕을 띄워 쓰다가, 루프가 끝나면 전부 반납하세요. 학습 패턴이 어느 정도 일정해지면 그때 예약형으로 갈아타면 돼요.

$3.19/hr
H100 SXM 온디맨드: 스윕 단위로 바로 띄우기
초 단위
약정 없는 GPU 과금
명령 한 줄
vesslctl로 필요한 GPU에 스윕을 한 번에 펼쳐요
본학습은 VM Cluster에서
레시피가 정해지고 백본(backbone) 본학습에 들어가면 단일 노드로는 부족해요. 이때부터 성능을 가르는 스펙은 GPU가 아니라 노드 사이 연결이에요.
VM Cluster에서는 성능 좋은 머신을 통째로 쓸 수 있어요. 노드당 GPU 8장을 H100부터 최신 Blackwell까지 골라 쓰고, 노드 간 InfiniBand 연결은 물론 root 권한까지 드려요. 꽉 막힌 환경에선 쓰기 힘들었던 ROS 2, 커스텀 드라이버, 자체 스케줄러 같은 로보틱스 툴체인을 맘껏 올려보세요.

노드당 8장
H100부터 Blackwell까지, 1~8노드
InfiniBand
노드 간 연결, 기본 제공
root SSH
모든 노드에서 ROS 2, 드라이버, Slurm, Kubernetes까지
로봇은 학습 루프를 한 바퀴 돌 때마다 조금씩 좋아져요. 루프가 멈춰 있는 시간만큼, 로봇이 똑똑해질 기회도 사라지는 거죠.
LLM 학습과는 다른 워크로드
현실에서 실제로 움직이는 모델을 학습시킬 땐, LLM 학습과는 전혀 다른 곳에서 과부하가 걸리기 쉬워요.
기본이 멀티모달
학습 샘플 하나가 단순한 문장이 아니라 시각 정보, 언어 지시문, 로봇 상태가 빈틈없이 동기화된 묶음이에요. 텍스트 학습보다 데이터 파이프라인과 전처리가 훨씬 중요하죠.
수백 TB의 실제 환경 데이터
시연 데이터는 웹에서 긁어오는 게 아니라 실제 로봇을 움직여가며 모아요. 실험이 조금만 쌓여도 금세 수백 TB가 되고, 이 거대한 데이터가 로봇과 GPU 사이를 끊임없이 오가야 해요.
지도학습만이 아니라, 시뮬레이션과 RL
로봇 학습의 상당 부분은 시뮬레이션 속 강화학습(RL)이에요. 수백~수천 개 환경을 동시에 실행하는 짧은 작업이 한꺼번에 몰렸다가, 정책을 로봇에서 검증하는 동안엔 잠잠해지죠. 모델은 온디바이스 추론을 위해 작게 유지하니, GPU 수요도 일정하지 않고 파도처럼 밀려와요.
학습은 클라우드에서, 동작은 로봇에서
추론은 로봇 자체에서 동작해야 해요. 지연이 곧 안전 문제니까요. 클라우드는 학습 처리량을 감당하고, 새 모델을 로봇에 빠르게 내려보내는 체크포인트 왕복을 맡아요.
GPU 인프라가 발목을 잡을 때
로보틱스 팀들이 말하는 병목은 GPU 연산 속도가 아닌 경우가 많아요.
실험 속도를 못 따라가는 GPU 확보
오늘은 8장, 내일은 2장. 하루하루 다르게 필요한 게 바로 스윕(sweep) 작업이에요. 대기 줄, 쿼터 승인, 껐다 켜면 다시 구하기 힘든 자원 탓에 로봇 학습의 리듬이 뚝뚝 끊겨요.
체크포인트와 데이터셋 왕복
매번 시연 데이터를 올리고 체크포인트를 내려받아 로봇에서 직접 테스트해야 해요. 이때 속도를 결정짓는 건 GPU보다 스토리지나 네트워크 품질일 때가 더 많아요.
아무도 계산에 안 넣은 CPU 병목
이미지 전처리와 시뮬레이션 렌더링은 CPU를 정말 많이 써요. GPU가 아무리 빨라도 CPU가 모자라면 학습 루프 전체가 멈춰버리거든요.
학습을 멈추는 건 GPU가 아니라 환경 셋업
로보틱스 스택은 CUDA, 드라이버, Isaac Sim, MuJoCo, ROS 2, PhysX 같은 도구의 버전을 정확히 맞춰야 작동해요. 하나라도 어긋나면 학습이 느려지는 게 아니라 아예 시작을 못 하죠. GPU가 일을 시작하기도 전에 환경 잡느라 며칠을 날리기도 해요.
VESSL Cloud는 이렇게 해결해요
연산에 워크플로우를 얹어, 로봇 학습에 실제로 필요한 것들에 맞췄어요.
초 단위 과금, 바로 쓰는 GPU
스윕이 시작될 때 GPU를 잡고 끝나면 반납하세요. 직접 띄워 쓰니까 쿼터 승인을 기다릴 필요가 없어요. 학습이 일정해지면 3개월 약정부터 예약형으로 물량을 확보할 수 있어요.
root 권한까지 주는 VM Cluster
전용 멀티노드 클러스터로 확장하세요. InfiniBand로 묶인 GPU 노드에 root SSH와 드라이버 전체 제어까지 제공해요. 클라우드에서 베어메탈에 가장 가까운 형태예요.
재현 가능한 로보틱스 환경
CUDA, 시뮬레이터, ROS 2 스택을 컨테이너 이미지에 한 번만 고정해 두세요. 모든 Job과 Workspace가 같은 환경에서 시작하니, 어제 되던 학습이 오늘도 똑같이 재현되고, 팀원도 다시 만들 필요 없이 같은 환경에서 바로 시작해요.
로봇 스케일 데이터를 위한 스토리지
수백 TB 시연 데이터셋은 Object Storage에 저렴하게 보관하고, 동시에 실행되는 워크로드 간 파일 공유는 빠른 Cluster Storage가 맡아요. 볼륨은 어떤 Job에든 붙일 수 있어요.
명령어 한 줄로 학습 스윕
vesslctl로 Job을 한 번 정의하고 필요한 GPU에 한꺼번에 펼치세요. 로그, 지표, 아티팩트는 한 화면에서 따라가요.
개발 루프를 위한 Workspace
VS Code나 Cursor를 지속되는 GPU Workspace에 연결해 대화형으로 실험하고, 쉴 땐 일시정지해서 GPU 비용 없이 환경을 그대로 유지하세요.
Physical AI × VESSL Cloud, 자주 묻는 질문
Physical AI 팀은 어떤 GPU로 학습하나요?
요즘 로봇 파운데이션 모델 학습은 대부분 H100급 GPU에서 이뤄져요. VESSL Cloud에서는 H100 SXM을 시간당 $3.19부터 바로 띄워 쓸 수 있고, H200과 Blackwell GPU는 문의 후 이용할 수 있어요. 추론은 보통 로봇의 엣지 하드웨어에서 실행하기 때문에, 클라우드 비용은 온전히 학습에 들어가요.
수백 TB 로봇 데이터는 어떻게 옮기나요?
Object Storage 볼륨을 만들고 웹 또는 vesslctl CLI로 데이터를 올린 뒤, 실행 시점에 Job에 붙이면 돼요. 동시에 실행되는 워크로드 간 빠른 파일 공유는 Cluster Storage가 맡아요.
장기 계약 없이도 학습할 수 있나요?
네. 온디맨드 GPU는 약정 없이 초 단위로 과금해요. 학습이 일정해지면 3개월 약정부터 시작하는 예약형으로 최대 15%까지 아낄 수 있어요.
VESSL Cloud에서 Isaac Sim, MuJoCo, ROS 2를 돌릴 수 있나요?
네. 시뮬레이터와 미들웨어는 일반 GPU Job으로 실행돼요. CUDA, 시뮬레이터, ROS 2 버전을 컨테이너 이미지에 고정하면 모든 Job과 Workspace가 똑같은 환경에서 시작해요. NVIDIA의 Isaac-GR00T 같은 오픈소스 VLA 모델도 멀티 GPU Job으로 같은 방식으로 파인튜닝해요.
