프로젝트 상세

sample님
조직 혁신 및 End-to-End 체계 조직 단위 AI 체계 구축 실제 운영 가능 수준 기술 결과물 검증·문서화 모델 성능 최적화

AI 서비스 End-to-End 운영체계 구축 2기

25일 과정 이수시간 80시간 미션 10개 · 문제 96개

프로젝트 정보

난이도
전문가
수행 형태
4인 팀
교육일수
25일
이수시간
80시간
분야
조직 혁신 및 End-to-End 체계, 조직 단위 AI 체계 구축, 실제 운영 가능 수준 기술, 결과물 검증·문서화, 모델 성능 최적화

프로젝트 소개

앞선 프로젝트에서 만든 모델·서비스 하나를 골라 실제로 운영할 수 있는 체계를 만든다. 학습부터 배포, 감시, 재학습, 폐기까지의 고리를 완성하는 것이 목표다. AI 과제의 성패는 대개 모델 정확도가 아니라 운영에서 갈린다. 배포 후 3개월이면 데이터가 바뀌어 성능이 떨어지고, 만든 사람이 전출하면 아무도 손대지 못하고, 어떤 버전이 지금 돌고 있는지 모르게 된다. 이 프로젝트는 그 문제를 정면으로 다룬다. 다루는 범위는 실험 추적, 데이터·모델 버전 관리, 학습 파이프라인 자동화, 서비스 배포, 성능·드리프트 감시, 자동 재학습, 사고 대응, 그리고 인수인계와 조직 차원의 표준화까지다. 마지막 두 미션은 코드가 아니라 체계와 문서를 만드는 일이다. 전문가 수준 프로젝트에서 이 부분을 빼면 의미가 없다. 4인 1팀. 파이프라인·서비스·감시·문서화로 역할을 나누되 서로의 영역을 검토한다.

미션 여정

미션 10개 · 문제 96개
  1. 1. 운영 대상 선정과 현재 상태 진단

    반복 수행
    • 6시간
    • 문제 9개
    • 250 크레딧
  2. 2. 실험 추적 — 무엇으로 무엇을 얻었는지 남기기

    반복 수행
    • 7시간
    • 문제 9개
    • 260 크레딧
  3. 3. 데이터·모델 버전 관리

    건너뛸 수 있음 반복 수행
    • 7시간
    • 문제 9개
    • 270 크레딧
  4. 4. 학습 파이프라인 자동화

    건너뛸 수 있음 반복 수행
    • 8시간
    • 문제 10개
    • 280 크레딧
  5. 5. 서비스 배포와 롤백

    건너뛸 수 있음 반복 수행
    • 8시간
    • 문제 10개
    • 290 크레딧
  6. 6. CI/CD — 커밋에서 배포까지

    건너뛸 수 있음 반복 수행
    • 8시간
    • 문제 10개
    • 300 크레딧
  7. 7. 감시 — 성능 저하와 드리프트 잡기

    건너뛸 수 있음 반복 수행
    • 8시간
    • 문제 10개
    • 310 크레딧
  8. 8. 자동 재학습과 승인 게이트

    건너뛸 수 있음 반복 수행
    • 8시간
    • 문제 10개
    • 320 크레딧
  9. 9. 사고 대응과 훈련

    건너뛸 수 있음 반복 수행
    • 7시간
    • 문제 9개
    • 330 크레딧
  10. 10. 인수인계 검증과 조직 표준화

    건너뛸 수 있음 반복 수행
    • 7시간
    • 문제 10개
    • 340 크레딧

수행 조건과 산출물

선수학습
· 선수 : 중급 프로젝트 2개 이상 수료. 특히 모델을 만들어 평가해 본 경험이 필수다. · 선수 스킬 : 「AI 기술 확장 Level 4」, 「성과 개선 Level 4」, 「업무 표준화 Level 3」 진단 통과. · 기술 기초 : Git, 컨테이너, CI 개념, 리눅스 기본 조작. · 준비물 : 교육용 쿠버네티스 또는 컨테이너 실행 환경, Git 저장소, 실험 추적 도구, 객체 저장소. · 대상 선정 : 앞선 프로젝트 산출물 중 하나를 운영 대상으로 가져와야 한다. 없으면 제공되는 기준 모델을 쓴다.
제약조건
· 실습 환경 안에서만 배포한다. 실제 부대 인프라에 배포하지 않는다. · 비밀 값(API 키·DB 접속 정보)을 코드나 저장소에 넣지 않는다. 발견 시 해당 미션은 미수행 처리한다. · 모든 배포는 되돌릴 수 있어야 한다. 롤백 절차가 없는 배포는 완성으로 인정하지 않는다. · 자동 재학습은 사람 승인 지점을 반드시 포함한다. 승인 없이 모델이 교체되는 구조는 제출 불가. · 개인정보를 포함한 데이터는 가명·비식별 처리 후 사용한다.
산출물
1. 학습 파이프라인 — 데이터 준비부터 모델 등록까지 자동 실행 2. 실험 추적 기록 — 모든 학습 실행의 데이터·코드·파라미터·성능 3. 데이터·모델 버전 관리 체계 4. 서비스 배포 — 컨테이너 이미지, 배포 설정, 롤백 절차 5. CI/CD 파이프라인 — 커밋에서 배포까지 6. 감시 체계 — 서비스 지표, 모델 성능, 데이터 드리프트 7. 자동 재학습 파이프라인 + 승인 게이트 8. 사고 대응 절차서 + 사고 훈련 기록 9. 인수인계 문서 + 외부 인원 검증 결과 10. 조직 표준 제안서 — 다음 과제가 재사용할 템플릿과 지침
평가기준
[통과 기준] · 10개 미션 필수 문제를 모두 제출한다. · 코드 커밋에서 배포까지 사람 손이 거치지 않고 이어지는 파이프라인이 동작해야 한다. · 성능 저하를 감지해 알리는 감시가 실제로 작동하는 것을 시연해야 한다. · 배포된 모델의 예측 하나를 지목했을 때 어떤 데이터·코드·모델 버전에서 나왔는지 추적할 수 있어야 한다. · 팀 외부 인원이 인수인계 문서만으로 재학습·재배포를 수행할 수 있어야 한다. 이 항목은 실제로 시험한다. [배점] · 미션 수행 35% · 파이프라인 자동화 15% · 감시·대응 체계 15% · 재현성·추적성 15% · 인수인계 검증 결과 10% · 조직 표준화 산출물 10%
참고자료
· 실습 환경 : 컨테이너 오케스트레이션 환경, Git 저장소, 객체 저장소, 실험 추적 서버 · 참고 : 「AI 서비스 운영 표준(초안)」(사내), MLOps 성숙도 모델 자료 · 기준 모델 : 정비 수요 예측 모델(9104 산출물 기준본) — 자체 산출물이 없는 경우 사용 · 드리프트 시험용 데이터 : 분포가 변화한 3개월분 추가 데이터

개설 차수

  • AI 서비스 End-to-End 운영체계 구축 2기
    신청 2026.01.01 ~ 2026.12.31 학습 2026.01.01 ~ 2026.12.31
  • AI 서비스 End-to-End 운영체계 구축 1기
    신청 2026.01.01 ~ 2026.06.30 학습 2026.01.01 ~ 2026.06.30
목록으로