
쿼터 승인 없이
GPU 바로 시작
초 단위
대기 시간이 아니라 쓴 만큼만 과금
InfiniBand
멀티노드 VM Cluster
전 세계 대학의 연구자들이 함께해요.
연구 현장에서의 VESSL Cloud
VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents
“Special thanks to OpenRouter and VESSL AI for their support in evaluation and training.”
optimize_anything: A Universal API for Optimizing any Text Parameter
“This research is supported in part by gifts from … and VESSL AI.”
Quantifying the Utility of User Simulators for Building Collaborative LLM Assistants
“This work was supported in part by the Google Research Scholar Program and by compute resources from the Center for Human-Compatible AI (CHAI) and VESSL AI.”
Graph-Based Alternatives to LLMs for Human Simulation
“This work was supported by compute resources from VESSL AI, the Center for Human-Compatible AI at Berkeley, and the BAIR-Google Commons program.”
SAE-RNA: A Sparse Autoencoder Model for Interpreting RNA Language Model Representations
“This work was made possible by the VESSL AI GPU platform, with the support from A100 GPUs and external storage.”
The Age of Curiosity Meets the Age of AI: Benchmarking Child Safety in Large Language Models
“We thank VESSL AI for supporting this research with GPU compute resources.”
연구 사이클을 중심으로
혼자 프로토타입을 만들고, 마감 전엔 팀 전체가 스윕을 실행하고, 논문에 실릴 결과를 위해 규모를 키워요. 이 사이클을 늦추는 건 대부분 아이디어가 아니라 인프라예요.
GPU 한 장으로 프로토타입
초기 연구는 대부분 반복이에요. 아이디어를 시도하고, 실패를 겪고, 하나를 바꾸고, 다시 실행하고. 초 단위로 과금되는 GPU 한 장이면 아이디어 하나 테스트하는 데 쿼터 승인을 기다릴 필요 없이 몇 분이면 충분해요.
Workspace는 계속 대화형이에요. VS Code나 노트북을 연결하고, 세션 사이엔 일시정지해서 GPU 비용 없이 환경을 그대로 유지하세요.

$1.39/hr
A100 SXM 온디맨드: 약정 없이 바로 시작
초 단위
과금이라 짧은 테스트는 그만큼만 내면 돼요
일시정지
GPU는 끄고 Workspace 상태는 그대로
마감 전엔 스윕으로
제출 일주일 전은 몇 달 전과는 완전히 달라요. 시드, 아키텍처, 하이퍼파라미터를 바꿔가며 수십 개 실험을 한꺼번에 띄우고 결과를 기다리죠.
CLI에서 필요한 만큼 스윕을 띄우고, 실제로 쓴 GPU 초만큼만 내고, 결과가 나오는 즉시 전부 반납하세요.

명령 한 줄
vesslctl로 필요한 GPU에 스윕을 한 번에 펼쳐요
최소 약정 없음
오후 한나절, 주말 몰아치기도 바로 시작
초 단위
과금이라 몰렸다 빠지는 수요에도 딱 맞아요
논문용 본학습은 크게
논문에 실릴 결과는 보통 스윕 때 테스트한 것보다 훨씬 커요. 이때부터는 노드 하나로는 부족하죠.
VM Cluster는 InfiniBand로 연결된 GPU 노드 여러 대와 root 권한을 함께 드려요. 새로 구매 승인을 받지 않아도 마지막 학습을 그대로 확장할 수 있어요.

노드당 8장
H100부터 Blackwell까지, 1~8노드
InfiniBand
노드 간 연결, 기본 제공
root SSH
모든 노드에서 원하는 스케줄러나 스택 그대로
부족한 건 대부분 GPU가 아니에요. 대기열, 쿼터 승인, 켜지지 않는 환경에 날려버린 일주일이죠.
연구는 일정한 리듬으로 흘러가지 않아요
대학 연구의 GPU 수요는 마감, 수업 일정, 클러스터 차례에 따라 몰렸다 빠지길 반복해요.
마감 앞에 몰아치는 실험
학회나 과제 마감이 다가오면 조용하던 연구실이 하룻밤 사이 수십 개 실험으로 가득 차요. 시드, 아키텍처, 하이퍼파라미터를 바꿔가며 스윕을 실행하고, 결과를 정리하는 동안엔 다시 잠잠해지죠.
작은 팀, 흩어진 도구들
대학원생 한 명이 실험 추적, 모델 허브, 컨테이너, 버전 관리를 혼자 챙겨야 해요. 따로 세팅해준 사람이 없다 보니 결국 엑셀 같은 곳에 실험 기록을 손으로 남기게 되죠.
공유되고 부딪히는 인프라
교내 클러스터와 연구실 GPU는 학생, 수업, 프로젝트가 함께 나눠 써요. 누군가 무거운 작업을 오래 붙잡고 있으면, 다른 사람의 다음 실험이 기약 없이 밀리기도 해요.
모든 프로젝트가 0에서 시작
새로 들어온 학생도, 새 논문도 시작은 늘 같아요. CUDA를 다시 깔고, 드라이버 버전이 안 맞는 걸 잡고, 진짜 연구가 시작되기도 전에 환경부터 다시 만들어야 하죠.
GPU 인프라가 연구 시간을 갉아먹을 때
연구자들이 말하는 병목은 대부분 GPU 시간당 가격 문제가 아니에요.
대기열
공유 클러스터에서는 Job 하나가 시작하기까지 며칠씩 기다리기도 해요. 하필 마감이 하루하루를 아쉽게 만드는 그 시점에요.
예산을 갉아먹는 셋업
환경 설정과 데이터 이동에만 학습 자체만큼의 컴퓨트 예산이 새어나가기도 해요.
누가 뭘 쓰는지 안 보임
GPU 하나를 켜놓고 방치하거나, 한 수업이 몫보다 훨씬 많이 쓰는 상황은 전담 관리자 없이는 알아채기도, 고치기도 어려워요.
연구자가 아니라 인프라 엔지니어를 위한 인터페이스
CLI만 있는 클러스터는 모델에 집중하고 싶은 학생들에게 진짜 장벽이에요. 노트북이나 웹 UI는 있으면 좋은 게 아니라 기본이어야 하죠.
VESSL Cloud는 이렇게 해결해요
연산에 워크플로우를 얹어, 연구가 실제로 진행되는 방식에 맞췄어요.
쿼터 승인 없이 바로 쓰는 GPU
스윕이 시작되는 순간 GPU를 잡으세요. 쿼터 티켓이나 승인 절차 없이 초 단위로 과금되고, 끝나면 바로 반납하면 돼요.
재현 가능한 환경
CUDA, 프레임워크, 라이브러리 버전을 컨테이너 이미지에 한 번만 고정하세요. 모든 Job과 Workspace가 같은 환경에서 시작하니, 랩메이트도 다시 만들 필요 없이 내 실험을 그대로 재현할 수 있어요.
대화형 작업을 위한 Workspace
노트북, VS Code, SSH를 지속되는 GPU Workspace에 연결하세요. 인프라보다 모델에 집중하고 싶은 학생에게 CLI만 있는 장벽은 없어요.
본학습은 크게 확장
논문의 핵심 결과를 위한 본학습을 준비할 때가 되면, InfiniBand와 root 권한을 갖춘 멀티노드 VM Cluster로 옮겨가세요.
가격과 속도, 둘 다 잡는 스토리지
스윕 사이엔 저렴한 Object Storage에 데이터셋을 두고, 동시에 실행되는 여러 Job 사이에서는 빠른 Cluster Storage로 파일을 공유하세요. 어떤 Job에든 볼륨을 붙일 수 있어요.
Academia × VESSL Cloud, 자주 묻는 질문
학술 연구용으로 어떤 GPU를 쓸 수 있나요?
A100과 H100은 시간당 $1.39, $3.19부터 쿼터 티켓 없이 셀프서브로 시작할 수 있어요. H200과 Blackwell GPU(B200, B300, GB300)는 문의 후 이용할 수 있고, 더 큰 연구실이나 연구 과제 단위 프로젝트는 필요한 일정에 맞춰 물량을 미리 예약할 수 있어요.
시작하려면 장기 계약이나 과제 승인이 필요한가요?
아니요. 온디맨드 GPU는 약정 없이 초 단위로 과금되니 개인 카드나 소규모 과제비로도 시작할 수 있어요. 사용량이 꾸준해지면 3개월 약정부터 시작하는 예약형으로 온디맨드 대비 최대 15%까지 아낄 수 있어요.
연구실 구성원 여러 명이 같은 환경을 쓸 수 있나요?
네. 세팅을 컨테이너 이미지에 한 번만 고정하면 모든 팀원의 Job과 Workspace가 같은 환경에서 시작해요. 랩메이트끼리 버전이 안 맞아 생기는 문제가 사라져요.
실험 사이에 데이터셋은 어떻게 옮기나요?
실험 사이 저렴하게 보관하려면 Object Storage 볼륨을, 여러 Job에서 동시에 빠르게 접근하려면 Cluster Storage를 만드세요. 실행 시점에 어떤 Job이나 Workspace에든 붙일 수 있어요.
