조직 혁신 및 End-to-End 체계
조직 단위 AI 체계 구축
실제 운영 가능 수준 기술
결과물 검증·문서화
모델 성능 최적화
AI 서비스 End-to-End 운영체계 구축 2기
25일 과정
이수시간 80시간
미션 10개 · 문제 96개
프로젝트 정보
- 난이도
-
전문가
- 수행 형태
-
4인 팀
- 교육일수
- 25일
- 이수시간
- 80시간
- 분야
-
조직 혁신 및 End-to-End 체계,
조직 단위 AI 체계 구축,
실제 운영 가능 수준 기술,
결과물 검증·문서화,
모델 성능 최적화
프로젝트 소개
앞선 프로젝트에서 만든 모델·서비스 하나를 골라 실제로 운영할 수 있는 체계를 만든다. 학습부터 배포, 감시, 재학습, 폐기까지의 고리를 완성하는 것이 목표다.
AI 과제의 성패는 대개 모델 정확도가 아니라 운영에서 갈린다. 배포 후 3개월이면 데이터가 바뀌어 성능이 떨어지고, 만든 사람이 전출하면 아무도 손대지 못하고, 어떤 버전이 지금 돌고 있는지 모르게 된다. 이 프로젝트는 그 문제를 정면으로 다룬다.
다루는 범위는 실험 추적, 데이터·모델 버전 관리, 학습 파이프라인 자동화, 서비스 배포, 성능·드리프트 감시, 자동 재학습, 사고 대응, 그리고 인수인계와 조직 차원의 표준화까지다. 마지막 두 미션은 코드가 아니라 체계와 문서를 만드는 일이다. 전문가 수준 프로젝트에서 이 부분을 빼면 의미가 없다.
4인 1팀. 파이프라인·서비스·감시·문서화로 역할을 나누되 서로의 영역을 검토한다.
미션 여정
미션 10개 · 문제 96개
-
1
1. 운영 대상 선정과 현재 상태 진단
반복 수행
-
2
2. 실험 추적 — 무엇으로 무엇을 얻었는지 남기기
반복 수행
-
3
3. 데이터·모델 버전 관리
건너뛸 수 있음
반복 수행
-
4
4. 학습 파이프라인 자동화
건너뛸 수 있음
반복 수행
-
5
5. 서비스 배포와 롤백
건너뛸 수 있음
반복 수행
-
6
6. CI/CD — 커밋에서 배포까지
건너뛸 수 있음
반복 수행
-
7
7. 감시 — 성능 저하와 드리프트 잡기
건너뛸 수 있음
반복 수행
-
8
8. 자동 재학습과 승인 게이트
건너뛸 수 있음
반복 수행
-
9
9. 사고 대응과 훈련
건너뛸 수 있음
반복 수행
-
10
10. 인수인계 검증과 조직 표준화
건너뛸 수 있음
반복 수행
수행 조건과 산출물
- 선수학습
- · 선수 : 중급 프로젝트 2개 이상 수료. 특히 모델을 만들어 평가해 본 경험이 필수다.
· 선수 스킬 : 「AI 기술 확장 Level 4」, 「성과 개선 Level 4」, 「업무 표준화 Level 3」 진단 통과.
· 기술 기초 : Git, 컨테이너, CI 개념, 리눅스 기본 조작.
· 준비물 : 교육용 쿠버네티스 또는 컨테이너 실행 환경, Git 저장소, 실험 추적 도구, 객체 저장소.
· 대상 선정 : 앞선 프로젝트 산출물 중 하나를 운영 대상으로 가져와야 한다. 없으면 제공되는 기준 모델을 쓴다.
- 제약조건
- · 실습 환경 안에서만 배포한다. 실제 부대 인프라에 배포하지 않는다.
· 비밀 값(API 키·DB 접속 정보)을 코드나 저장소에 넣지 않는다. 발견 시 해당 미션은 미수행 처리한다.
· 모든 배포는 되돌릴 수 있어야 한다. 롤백 절차가 없는 배포는 완성으로 인정하지 않는다.
· 자동 재학습은 사람 승인 지점을 반드시 포함한다. 승인 없이 모델이 교체되는 구조는 제출 불가.
· 개인정보를 포함한 데이터는 가명·비식별 처리 후 사용한다.
- 산출물
- 1. 학습 파이프라인 — 데이터 준비부터 모델 등록까지 자동 실행
2. 실험 추적 기록 — 모든 학습 실행의 데이터·코드·파라미터·성능
3. 데이터·모델 버전 관리 체계
4. 서비스 배포 — 컨테이너 이미지, 배포 설정, 롤백 절차
5. CI/CD 파이프라인 — 커밋에서 배포까지
6. 감시 체계 — 서비스 지표, 모델 성능, 데이터 드리프트
7. 자동 재학습 파이프라인 + 승인 게이트
8. 사고 대응 절차서 + 사고 훈련 기록
9. 인수인계 문서 + 외부 인원 검증 결과
10. 조직 표준 제안서 — 다음 과제가 재사용할 템플릿과 지침
- 평가기준
- [통과 기준]
· 10개 미션 필수 문제를 모두 제출한다.
· 코드 커밋에서 배포까지 사람 손이 거치지 않고 이어지는 파이프라인이 동작해야 한다.
· 성능 저하를 감지해 알리는 감시가 실제로 작동하는 것을 시연해야 한다.
· 배포된 모델의 예측 하나를 지목했을 때 어떤 데이터·코드·모델 버전에서 나왔는지 추적할 수 있어야 한다.
· 팀 외부 인원이 인수인계 문서만으로 재학습·재배포를 수행할 수 있어야 한다. 이 항목은 실제로 시험한다.
[배점]
· 미션 수행 35%
· 파이프라인 자동화 15%
· 감시·대응 체계 15%
· 재현성·추적성 15%
· 인수인계 검증 결과 10%
· 조직 표준화 산출물 10%
- 참고자료
- · 실습 환경 : 컨테이너 오케스트레이션 환경, Git 저장소, 객체 저장소, 실험 추적 서버
· 참고 : 「AI 서비스 운영 표준(초안)」(사내), MLOps 성숙도 모델 자료
· 기준 모델 : 정비 수요 예측 모델(9104 산출물 기준본) — 자체 산출물이 없는 경우 사용
· 드리프트 시험용 데이터 : 분포가 변화한 3개월분 추가 데이터
개설 차수
-
AI 서비스 End-to-End 운영체계 구축 2기
신청
2026.01.01 ~
2026.12.31
학습
2026.01.01 ~
2026.12.31
-
AI 서비스 End-to-End 운영체계 구축 1기
신청
2026.01.01 ~
2026.06.30
학습
2026.01.01 ~
2026.06.30
목록으로