대기업 계열사 의료제약
AI Platform Engineering & Infra
- 판교
- 책임급
- ~ 2026-08-25
- 업종화학,에너지,의료제약,소비재
- 직종정보 통신직
대기업 계열사 의료제약
***관리자메모 필독 요망***
AI Platform Engineering & Infra
당사의 AI Platform을 Production 환경으로 전환하고 안정적으로 운영할 Platform Engineering & SRE(Infra) Lead를 찾고 있습니다.
GPU·분산컴퓨팅 환경과 AI 개발 모델을 연결하고, Cloud-native MLOps, Training·Deployment Pipeline, ML CI/CD, Observability 및 Reliability 체계를 구축합니다.
내부 AI 조직, Core IT, MSP, GPU·Platform Vendor를 연결하는 기술 Owner로서 자동화와 운영표준을 내재화하는 역할입니다.
- MLOps Platform 설계/운영, 모델 학습/배포(운영환경), GPU/분산
- Computing, 운영환경 성능 최적화, AI서비스 운영/모니터링
❑ 담당업무 및 역할 (필요 시 더 추가 하셔도 됩니다.) - Cloud-native MLOps Platform
✓ AI Platform 을 위한 Cloud-native MLOps Architecture를 설계, 구축, 운영합니다.
✓ 개발, 테스트, 운영 환경을 분리하고 표준 Configuration과 Infrastructure를 구축합니다.
✓ Model Registry, Artifact, Feature, Data 연계 및 Lifecycle 관리체계를 구현합니다. - Model Training, Deployment Automation
✓ 모델 Training, Validation, Packaging, Deployment, Monitoring 및 Rollback Pipeline을 구축/운영합니다.
✓ AI 개발부서 인원과 협업해 모델을 운영으로 전환하고 운영요건을 정의합니다.
✓ ML Workflow에 대한 CI/CD, Version 관리, Approval Gate 및 Release 이력을 구축합니다.
- GPU, Distributed Computing
✓ GPU Cluster, Scheduler, Queue, Partition, Quota, Storage 및 분산컴퓨팅 환경을 설계, 운영합니다.
✓ GPU, Storage 사용률, Job 상태, Idle 자원, Capacity와 비용을 분석하고 개선합니다.
✓ 각 영역(GPU Cluster, Managed Service, Core IT) 별 전문 Vendor와 기술 RACI 및 Escalation 체계를 운영합니다.
- SRE, Reliability, Observability
✓ Alert, Log, Metric, Trace 및 Dashboard 기반 Observability 체계를 구축합니다.
✓ Incident, 장애, 변경관리, 가용성 및 복구 Runbook을 운영합니다.
✓ Core IT부서와 협업하여 IAM, Network, 보안, ITSM, 변경통제 및 Audit 요구사항을 Platform에 적용합니다.
✓ 상용 Enterprise LLM/서비스 유지보수 및 관리를 담당합니다.
{필수사항}
- 학력 : 학사 이상
- 전공 : 전산/컴퓨터공학, 소프트웨어, 데이터, AI 관련 전공 우대
- 경력 : Cloud Platform, DevOps, MLOps 또는 SRE 설계·구축·운영 경력 8년 이상
- Skill & Knowledge : Kubernetes, Docker, Linux, Cloud(AWS 등), GPU·분산컴퓨팅 환경 이해.
MLflow, Kubeflow, Airflow, Argo, Jenkins, GitHub Actions 등 MLOps·CI/CD 도구
중 하나 이상의 실무 경험.
Model Training·Deployment Pipeline, Registry, Version, Rollback 설계 경험.
Prometheus, Grafana, OpenTelemetry 또는 유사 Monitoring·Observability 경험.
GPU Driver, CUDA, NCCL, Scheduler(Slurm 등), Storage 및 Network 성능에 대한 이해.
SRE, Incident, RCA, Capacity, Availability, Change Management 실무 역량. 상용 Enterprise LLM/서비스 유지보수 및 관리 역량. (ChatGPT, Snowflake 등)
Language 해외법인 또는 글로벌 벤더와 업무 Communication 가능 수준
{우대사항]
Enterprise AI Platform 또는 대규모 GPU Cluster 구축·운영 경험 / 분산학습 또는 GPU Training·Inference 성능 최적화 경험 / MLOps Platform의 Production 전환과 24×365 운영체계 구축 경험 / 제약·바이오 R&D 모델 또는 규제산업 데이터 환경 경험 / AWS, Kubernetes, DevOps, SRE, NVIDIA 관련 자격 또는 이에 준하는 전문성
- 병역필 또는 면제자로서 해외 여행에 결격 사유가 없는 분에 한하여 지원이 가능
서류-필기시험(인/적성)-실무진 면접(영어면접)-임원면접-CEO면접
HR맨파워그룹 양식 이력서 혹은 이에 준하는 자유양식(국문)
표준 추천인력 요약 양식(엑셀 파일 양식 변경됨_200928 )
이력서 제출 ▶ E-mail : ksk@hrman.co.kr
Mobile : 010-3251-9317