에스케이바이오팜(주), AI Platform Engineering 구성원 채용 에스케이바이오팜(주)이 AI Platform Engineering 구성원 영입을 위한 경력직 채용을 진행한다. 이번 채용은 Cloud-native MLOps 플랫폼과 GPU 분산컴퓨팅 환경을 안정적으로 운영할 인력을 찾는 자리로, AI Platform을 실제 서비스 환경으로 전환하고 운영하는 역할을 맡게 된다. 내부 AI 조직과 Core IT, MSP, GPU·Platform Vendor를 연결하는 기술적 구심점 역할도 함께 요구된다. 실제 업무는 AI Platform을 위한 Cloud-native ML Ops Architecture를 설계·구축·운영하고, 개발·테스트·운영 환경을 분리해 표준 Configuration과 Infrastructure를 구축하는 일부터 시작된다. Model Registry, Artifact, Feature, Data 연계 및 Lifecycle 관리체계를 구현하고, 모델 Training, Validation, Packaging, Deployment, Monitoring 및 Rollback Pipeline을 구축·운영하며 AI 개발부서와의 협업을 통해 모델 운영 전환과 운영요건 정의를 담당하게 된다. 이와 함께 ML Workflow 기반 CI/CD, Version 관리, Approval Gate 및 Release 이력을 구축하고, GPU Cluster, Scheduler, Queue, Partition, Quota, Storage 및 분산컴퓨팅 환경을 설계·운영하는 업무도 수행한다. 또한 GPU·Storage 사용률, Job 상태, Idle 자원, Capacity 및 비용을 분석·개선하고, Alert, Log, Metric, Trace 및 Dashboard 기반 Observability 체계를 구축·운영하며 Incident·장애·변경관리와 가용성, 복구 Runbook 운영, 상용 Enterprise LLM 및 관련 서비스의 유지 보수·운영 관리까지 담당하게 된다. 지원 자격은 학사 이상의 학력을 갖추고 Cloud Platform, DevOps, MLOps 또는 SRE 설계·구축·운영 경력 8년에서 13년을 보유한 경우로 정리된다. 전공은 전산/컴퓨터공학, 소프트웨어, 데이터, AI 관련 전공이 우대되며, Kubernetes, Docker, Linux 및 Cloud(AWS 등) 환경에 대한 이해와 실무 경험, GPU 및 분산컴퓨팅 환경에 대한 이해도, MLflow, Kubeflow, Argo, Jenkins, GitHub Actions 등 MLOps·CI/CD 도구 중 1개 이상의 실무 경험이 요구된다. 모델 Training·Deployment Pipeline, Registry, Version 관리 및 Rollback 설계 경험과 Prometheus, Grafana, OpenTelemetry 등 Monitoring·Observability 도구 활용 경험, GPU Driver, CUDA, NCCL, Scheduler(Slurm 등), Storage 및 Network 성능에 대한 이해도, SRE·Incident·RCA·Capacity·Availability 및 Change Management 관련 실무 역량, 해외법인 또는 Global Vendor와 원활한 업무 협의가 가능한 영어 역량도 함께 요구된다. 우대사항으로는 Enterprise AI Platform 또는 대규모 GPU Cluster 구축·운영 경험, 분산학습 또는 GPU Training·Inference 성능 최적화 경험, MLOps Platform의 Production 전환과 24×365 운영체계 구축 경험, 제약·바이오 R&D 모델 또는 규제산업 데이터 환경 경험, AWS, Kubernetes, DevOps, SRE, NVIDIA 관련 자격 또는 이에 준하는 전문성을 보유한 경우가 꼽힌다. 근무지는 경기도 판교로 확인된다. 자세한 내용은 '에스케이바이오팜(주)'의 홈페이지에서 확인할 수 있다.
IT개발·데이터>AI·빅데이터>AIOps엔지니어|IT개발·데이터>AI·빅데이터>MLOps엔지니어|IT개발·데이터>AI·빅데이터>프롬프트엔지니어