VESSL CloudUse case

대규모 언어 모델 학습

1,000+ GPU

노드 한 대로 시작해 재계약 없이 스케일 확장

멀티 프로바이더

GPU를 미리 예약해 필요한 시점에 물량 보장

InfiniBand

MoE도 노드를 늘린 만큼 확장되도록 튜닝한 멀티노드 연결

24시간 SRE

장애 감지, 무중단 노드 증설, 상시 대응

LLM과 파운데이션 모델을 학습하는 팀들이 함께해요.

SubquadraticNuance LabsUpstageMotif TechnologiesTrillion LabsScatterLab

대규모 언어 모델 학습 과정을 중심으로

파운데이션 모델 프로그램의 대부분은 모델이 아니라 인프라예요. 그리고 멈춰 선 클러스터만큼 비싼 낭비도 없어요.

물량과 일정을 안전하게 확보해보세요

연구가 준비된 바로 그 주에 GPU 수백 장이 필요해요. 공급사에 여유가 생길 때까지 기다릴 수는 없으니까요. 미리 예약해 두면 필요한 시점에 그 물량이 확실히 준비돼요.

연구가 방향을 틀면 컴퓨트 계획도 함께 움직여요. 언젠가 벗어나야 할 한 공급사 계약이 아니라, 지금 하는 그 학습에 맞춰 약정하면 돼요.

멀티 프로바이더

한 공급사에 묶이지 않는 소싱으로 물량 확보

200~1,000+ GPU

고정 쿼터가 아니라 학습 한 건에 맞춰 배정

예약 후 보장

학습 일정에 맞춰 물량을 미리 확보

풀스택 클러스터, 구축부터 운영까지 맡겨보세요

토폴로지, 스케줄링, 스토리지, 그리고 NCCL까지 내려가는 소프트웨어 스택 전체. 이 티 안 나는 중노동은 연구자가 아니라 저희 몫이에요. 조립할 VM 더미가 아니라, 바로 학습할 수 있는 클러스터를 받아보세요.

머신만 던져주고 사라지는 GPU 클라우드와, 인프라 공급사와 팀 사이에서 학습을 받치는 플랫폼을 직접 책임지는 파트너의 차이예요.

Slurm 또는 K8s

스케줄링 구축부터 튜닝까지 대신

PB급

공유 스토리지를 클러스터에 바로 연결

풀스택

토폴로지, 드라이버, NCCL까지 구축과 운영

멈춤 없이 안정적으로 확장하세요

FSDP와 HSDP, 다차원 병렬화(multi-dimensional parallelism), 끝까지 맞춘 NVLink와 InfiniBand. 이런 처리량 튜닝 덕분에 GPU를 늘린 만큼 처리량도 선형적으로 올라가요. 하드웨어를 바꾸지 않고도요. 같은 클러스터를 단일 노드에서 1,000+ GPU까지, 재계약 없이 확장해요.

그다음은 SRE(사이트 신뢰성 엔지니어링)가 학습이 멈추지 않도록 지켜요. 자동 장애 감지, 무중단 노드 증설, 24시간 장애 대응으로, 노드 하나 때문에 몇 주짜리 학습이 며칠씩 밀리지 않게요.

거의 선형

FSDP/HSDP와 다차원 병렬화로 확장

무중단

학습이 이어지는 중에 노드 증설

24시간

SRE 장애 감지와 대응

결국 최고 수준의 모델을 세상에 내보내는 연구실은 GPU가 가장 많은 곳이 아니라, 클러스터가 멈춰 있는 시간이 없는 곳이에요.

파운데이션 모델 팀과 나눈 대화가 한결같이 가리키는 결론이에요

클러스터 전체가 시험대에 오르는 워크로드

대규모로 파운데이션 모델을 학습하면 GPU 한 장이 아니라, GPU와 코드 사이의 모든 층에 부하가 걸려요.

MoE는 병목 지점이 달라져요

MoE는 토큰마다 여러 노드에 흩어진 몇몇 전문가(expert)로 보내기 때문에, 모든 노드가 서로 주고받는 all-to-all 통신이 폭증해요. 노드 간 연결 대역폭이 부족하면, GPU 성능을 다 쓰기도 전에 확장이 벽에 부딪혀요.

사전학습만이 아니라 RL 사후학습

요즘 파운데이션 모델은 강화학습(RL)으로 마무리해요. 생성, 보상 채점, 정책 업데이트가 한 루프 안에서 맞물리죠. 잔잔하게 이어지는 사전학습과 달리 부하가 들쭉날쭉한데, 이 세 단계가 같은 클러스터를 함께 써요.

클러스터가 발목을 잡을 때

대규모 모델 팀이 말하는 병목은 GPU 연산 속도가 아닌 경우가 많아요.

필요한 시점에 물량 확보하기

GPU 수백 장이 필요한 건 한 분기 뒤가 아니라 학습을 시작하는 바로 그 주예요. 한 공급사만 바라보면 필요한 물량이 일정에 맞는 경우가 드물어서, 기다리는 만큼 진도가 밀려요.

처리량이 새는 멀티노드 확장

노드 하나에서 백 대로 넘어갈 때 효율이 슬그머니 낮아지기 시작해요. 노드 간 연결의 대역폭이 부족하거나 NCCL이 튜닝되지 않으면, GPU를 두 배로 늘려도 처리량은 두 배에 한참 못 미쳐요. MoE가 이걸 가장 먼저 체감하죠.

티 안 나지만 꼭 해야 하는 클러스터 관리

Slurm이나 Kubernetes 스케줄링, PB급(페타바이트) 공유 스토리지, NCCL과 토폴로지(topology) 튜닝. 어느 것도 모델을 학습시켜 주진 않지만, 전부 제대로여야 해요. 이런 플랫폼 작업에 몇 주씩 매달리다 보면 정작 연구할 시간이 사라지죠.

큰 클러스터를 안정적으로 유지하기

규모가 커지면 노드 장애는 예외가 아니라 일상이에요. 자동 감지와 깔끔한 증설이 없으면, 장애 난 노드 하나하나와 물량을 늘릴 때마다 학습 전체가 다운타임으로 비용을 치러요.

VESSL Cloud는 이렇게 해결해요

인프라 공급사와 팀 사이에 서는 풀스택 컴퓨트 파트너예요. VM 한 대 던져주고 끝나는 곳이 아니라요.

1

멀티 프로바이더 GPU 물량

여러 공급사에서 GPU 수백에서 수천 장을 소싱해, 계획한 물량이 일정에 맞춰 도착하게 해요. 미리 예약해 물량을 보장하고, 한 공급사에 묶이지 않아요.

2

풀스택 클러스터 구축

토폴로지 설계, Slurm이나 Kubernetes 스케줄링, PB급 공유 스토리지, 소프트웨어 스택 전체까지. 부품 상자가 아니라 바로 학습할 수 있는 클러스터로 만들어 드려요.

3

학습 처리량 최적화

FSDP와 HSDP, 다차원 병렬화, NVLink와 InfiniBand까지 끝까지 튜닝해요. 그래서 대규모 모델도 MoE도, GPU를 늘린 만큼 처리량이 선형적으로 늘어요. 하드웨어는 그대로고요.

4

학습을 지키는 상시 SRE

자동 장애 감지, 무중단 노드 증설, 24시간 대응으로 몇 주짜리 학습이 멈추지 않게 지켜요. 노드 하나가 말썽이어도 며칠을 날리지 않게요.

5

재계약 없는 확장

같은 클러스터를 프로그램 진행에 맞춰 단일 노드에서 1,000+ GPU까지 확장해요. 새 계약도, 이전(migration)도, 스택 재시작도 없어요.

6

SOC 2 Type II

SOC 2 Type II 인증을 받은 인프라에서 운영돼요. 민감한 파운데이션 모델 작업을 위한 전용 클러스터와 Workspace 격리도 제공해요.

NLP와 파운데이션 모델 × VESSL Cloud, 자주 묻는 질문

VESSL Cloud는 얼마나 큰 학습 클러스터를 운영할 수 있나요?

클러스터 하나를 노드 한 대에서 1,000+ GPU까지 확장할 수 있어요. 연구 규모가 커져도 재계약은 필요 없어요. 물량은 여러 공급사에서 소싱해 미리 예약해 두니, 필요한 GPU 수백 장이 학습 일정에 맞춰 준비돼요.

MoE 같은 대규모 모델 아키텍처도 다룰 수 있나요?

네. MoE, 밀집(dense) 트랜스포머, 100B에서 300B+ 파라미터 학습은 모두 노드 간 연결에 크게 의존해요. 그래서 클러스터를 InfiniBand로 묶고 NCCL과 토폴로지, 다차원 병렬화까지 끝까지 튜닝해, 노드를 늘린 만큼 처리량도 선형적으로 늘어요.

Slurm이나 스토리지, NCCL을 저희가 직접 관리해야 하나요?

아니요. VESSL Cloud가 스택 전체를 구축하고 운영해요. Slurm이나 Kubernetes 스케줄링, PB급 공유 스토리지, 드라이버, NCCL 튜닝까지요. 그래서 연구자는 플랫폼 프로젝트가 아니라 바로 학습할 수 있는 클러스터를 받아요.

몇 주짜리 학습 중에 노드가 고장 나면 어떻게 되나요?

상시 SRE가 맡아요. 자동 장애 감지, 무중단 노드 증설, 24시간 대응이 학습이 멈추지 않게 해서, 노드 장애나 물량 증설이 며칠짜리 다운타임으로 번지지 않아요.

AI 모델이
GPU를 만나는 곳

  • 몇 분 만에 개발 환경 세팅
  • 멀티노드 클러스터까지 확장
  • 필요한 시점에 맞춘 물량 확보
  • 전담 기술 지원