·
Platform본부는 메디컬에이아이의 AI 분석 서비스가 안정적으로 제공될 수 있도록 인프라와 플랫폼 을 구성하고 운영합니다.
·
Multi-region 클라우드 환경을 구축해서 다양한 국가에서 서비스를 제공하고, 병원 내부의 onpremise 환경에서도 사용 가능하도록 서비스를 패키징하고 모니터링 환경을 구성합니다.
·
사내 서비스 운영과 모델 학습을 위한 on-premise Kubernetes 클러스터들을 운영하며, 기반이 되는 GPU 서버·네트워크·스토리지 등 물리 인프라를 직접 관리합니다.
·
클라우드와 on-premise 환경에서 의료 서비스에 요구되는 각종 보안 인증에 대응합니다.
Cloud 리소스 관리 및 서비스 운영
·
Multi-region landing zone 구성 및 region 확장
·
메트릭·로그·트레이스 기반 알림 시스템 구축 및 장애 대응 자동화
·
서비스 가용성·성능 관리 (HA 구성, 부하테스트 및 리소스 산정)
·
IaC(OpenTofu) 기반 클라우드 리소스 코드화 및 관리
Kubernetes 관리 및 운영
·
Azure AKS 및 경량 kubernets 기반 AI 분석 서비스 환경 구성·패키징
·
Kubernetes 기반 AI 모델 학습 환경 구성
·
KEDA 기반 오토스케일링 및 서비스 가용성·성능 관리 (HA 구성, 부하테스트 및 리소스 산정)
·
Kubespray 기반 클러스터 설치·업그레이드·노드 구성 등 클러스터 운영 전반 • Helm/helmfile 기반 서비스 배포 및 버전·breaking changes 관리
물리 인프라 관리
·
NVIDIA DGX A100 및 개발 서버 운영 관리
보안 인증 대응
·
Cloud 및 on-premise 환경 인프라 보안 인증 대응
·
3년 이상의 경력이 있거나 그에 준하는 역량을 가지신 분
·
Kubernetes, Docker 등 컨테이너 기반 환경에 대한 이해가 있으신 분
·
오픈소스 도구를 이해하고 내재화한 경험이 있으신 분
·
문제를 정확히 이해하고 적절한 해결 방법을 도출할 수 있는 분
·
Cloud 환경에서 Kubernetes 기반으로 서비스를 설계·운영해 본 경험이 있으신 분
·
무중단 배포·고가용성 시스템 설계·운영 경험이 있으신 분
·
IaC 기반 클라우드 리소스 관리 경험이 있으신 분
·
클라우드 비용 최적화 및 부하테스트 기반 리소스 관리 경험이 있으신 분
·
언어: Python, JavaScript, Shell script
·
저장소: MySQL, DocumentDB, MinIO
·
인프라: Azure, Kubernetes, Kubespray, k3s, Helm, Kustomize, OpenTofu, ArgoCD, GitHub, Actions, Ansible, Docker
·
관측: Azure managed services, Elasticsearch, Prometheus, Grafana, k6
·
고용 형태: 정규직 (필요 시 인턴십 후 정규직 전환 가능)
·
근무 제도: 주 5일 / 일 8시간 자율 유연근무제
·
지원서명 : [포지션_지원자 성명]으로 부탁드립니다.