About the role VESSL AI GPU Cluster Architect 는 CSP/데이터센터 파트너와 전력, 냉각, 네트워크 등 기술적 조건에 대한 협상을 직접 진행하며, 신규 사이트의 Qualification, 클러스터 아키텍처 설계, 하드웨어 구매, 그리고 완성된 클러스터의 검증까지 인프라가 플랫폼에 최적의 구성으로 전달되는 전 과정을 기술적으로 책임집니다. 이 과정은 단순한 페이퍼 기반의 스펙 검토로 끝나지 않습니다. 설비의 도면과 장비 사양을 직접 들여다보고, 건설 중이거나 운영 중인 데이터센터 현장을 방문해 CSP·시공사·벤더와 대면하여 협의하는 일들이 이 역할의 핵심입니다. 대규모 GPU 클러스터/데이터센터의 구축에서 의사 결정 과정은 클러스터 아키텍처와 시스템 레벨의 기술적 이해가 필수적입니다. 협업할 CSP/데이터센터를 기술적으로 검증하고, 인프라가 어떤 스펙으로 구축·검증될지에 대한 기술 기준을 수립함으로서 GPU 공급망의 기술적 품질과 안정성을 담보하는 핵심 역할을 해나갑니다. VESSL AI는 전 세계 여러 CSP와 데이터센터 파트너의 GPU 자원을 하나의 플랫폼으로 연결해 고객에게 제공합니다. 이를 위해서는 우선 플랫폼이 구축될 데이터센터 캠퍼스가 대규모 GPU Workload를 실제로 감당할 수 있는 부분일지, 계약 전력과 수전 방식, 냉각 용량, 랙당 전력 밀도 등 여러 방면에서 기술적으로 검증하는 일이 필수적입니다. 또한 구축할 클러스터의 Network Topology를 설계하고, 실제 구축이 완료된 클러스터가 설계 스펙대로 동작하는지 Slurm, Kubernetes 기반 스케줄링 환경에서 직접 검증하는 과정을 수행합니다. 이 모든 과정은 하드웨어 구매 단계의 의사결정부터 CSP, 벤더사, 현지 운영사(OpCo), 내부 Sales 조직의 다양한 이해관계자 간 기술적 이견 조율을 요구하는 고도의 기술 역량이 필요합니다. What you will do DC/CSP Qualification : 신규·기존 데이터센터가 대규모 GPU 클러스터를 수용할 수 있는지 계약 전력, 수전 방식, 냉각 용량(공랭/액랭, PUE), 랙당 전력 밀도 등을 도면과 장비 사양 레벨에서 직접 검토하고 Go/No-go 판단 기준을 수립 Cluster Architecture Design : IP Plan, Network Topology(Rail-optimized, Fat-tree 등), InfiniBand/RoCEv2 기반 High-speed Network 구성을 설계 Cluster Validation : 구축 완료된 클러스터를 Slurm, Kubernetes 등 스케줄링 환경 위에서 벤치마크·Burn-in 테스트로 검증하고, 하드웨어·OS·드라이버·네트워크 전 레이어에 걸친 성능·안정성 이슈를 직접 진단 Hardware Procurement : GPU 서버, 스위치, 케이블링 등 하드웨어 스펙을 정의하고 벤더/OEM/ODM과 구매·납품 일정을 조율 기술 협상 및 Stakeholder 조율 : CSP, 데이터센터, 네트워크/전력 벤더, 내부 Infra·Sales 팀 등 다양한 이해관계자와의 기술 협상을 리드 Qualifications 전기전자, 컴퓨터공학 등 관련 전공 학사 이상 학위 보유 GPU/HPC 클러스터 설계 또는 구축·운영 경력 4년 이상 보유 데이터센터 현장 방문·출장이 가능하며, 현장에서 CSP·운영사(OpCo)·벤더와 직접 대면 협의하는 데 익숙하신 분 InfiniBand, RoCEv2 등 High-speed Fabric 및 Network Topology 설계 경험 데이터센터 구축/운영 관련 실무 경험 중 아래 2개 이상 충족하신 분 Slurm, Kubernetes 등 스케줄러/오케스트레이션 환경에서 클러스터를 검증·운영해 보신 경험 데이터센터의 전력(수전, UPS, PDU), 냉각(공랭/수랭) 등 Facility 요구사항을 이해하고 CSP/데이터센터와 직접 기술 협의를 해보신 경험 수배전·변압기, UPS/PDU, CDU·냉각배관, 배전반 등 DC MEP(전력·냉각·기계) 설비에 대한 실무적 이해 및 엔지니어링 현장 경험 GPU, NIC, PCIe 등 서버·GPU 하드웨어 전반과 OS/드라이버 레벨까지 아우르는 Full-stack 트러블슈팅 능력 NVIDIA Scalable Unit 기준 4SU (Blackwell 2,048장) 규모 이상 단일 GPU 클러스터를 설계·구축·운영해 보신 경험 Helpful experience (not required) Python, Go 등을 활용한 인프라 자동화 및 텔레메트리 파이프라인(예측적 장애 탐지 등) 구축 경험 KVM, QEMU, libvirt 등 가상화 기술에 대한 이해 Colocation, Powered Shell 등 데이터센터 계약 형태에 대한 이해 다수 글로벌 지역의 데이터센터/CSP와 협업해 보신 경험 비즈니스 레벨의 영어 커뮤니케이션 역량을 보유한 분 정해진 스코프에 갇히기보다, 문제 해결을 위해 필요하면 네트워크·전력·SWE 등 인접 영역까지 넘나드는 extra mile에 거부감이 없으신 분 모호하거나 답이 정해지지 않은 문제를 마주했을 때, 스스로 구조화해서 답을 찾아가는 것에 익숙하신 분 Life & Benefit 함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass) 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용 구성원 간의 1on1 음료 지원 업무 생산성을 높여 몰입할 수 있는 환경 오전 8시~11시 사이 선택하는 시차출퇴근제 운영 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식 월 1회 Allhands + Team Gathering 통한 업무 공유 늦은 시간까지 근무 시, 야근식대/택시비 지원 구성원 간의 1on1 음료 지원 몰입한 만큼 휴식과 생활 편의 지원 개인 간식비 지원 (월 한도) 장기근속자 리프레시 휴가 제공 종합건강검진비 및 휴가 지원 (연 1회) 입사 N주년 축하 선물 제공 생일 반차 휴가 제공 명절 선물, 각종 휴가 및 경조금 지원 본인 및 배우자 출산휴가비 지원 Joinning Process 서류전형 → Coding Test → Technical Interview → Resume/Culture Interview → CEO Interveiw 순으로 진행됩니다. 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다. 지원서 (경력 세부 기술) 및 포트폴리오 (또는 Git 링크)를 필수로 제출해주세요. (양식 자유) Technical Interview 는 개발 실무자가 참여하며, 구조 설계 및 구현 방식 등 기술 중심의 대화로 문제 해결 역량을 파악하는 시간으로 최대 2시간 정도 소요됩니다. Resume/Culture Interview 는 유관 경험 중심의 기술 역량 및 문화적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다. 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check 를 진행하고 있습니다. 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다. 근무 형태 정규직 (수습 3개월) 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.
Field Applications Engineer (Altium)
Renesas Electronics
Backend Engineer (Junior)
Vessl AI
Backend Engineer (Senior)
Vessl AI
AI Engineer - FDE (Forward Deployed Engineer)
Databricks
Delivery Solutions Architect
Databricks
Technical Architect
Salesforce