SSAEMAll Courses
Log inSign up

Programming · 중급~고급 · 김강사

AIOps 강의 시리즈 — 시스템을 '이해'하는 능력

DevOps 수료자를 위한 통계·ML·LLM 운영 실무 (125강)

About This Course

AIOps 강의자료 — DevOps와 겹치지 않는 부분만

인프라·DevOps 실무 경험은 있지만 통계와 ML은 처음인 엔지니어를 위한 8주 과정입니다. Prometheus 설치, Grafana 대시보드, K8s, CI/CD, Terraform, Alertmanager 설정처럼 DevOps에서 이미 배우는 내용은 의도적으로 전부 제외했습니다.

한 줄 정의 — DevOps는 시스템을 "변경"하는 능력을 다루고, AIOps는 시스템을 "이해"하는 능력을 다룹니다.


목차

#모듈한 줄 요약난이도시간
0오리엔테이션AIOps와 DevOps의 경계 긋기★☆☆☆☆1.5h
0.5[데이터 기초 브릿지](./00.5_데이터 기초 브릿지.md)pandas·분포·검정·ML 어휘 — 본편을 위한 베이스캠프★★☆☆☆9h
1시계열 통계 기초"정상"을 숫자로 정의하는 법★★★☆☆10h
2이상 탐지임계값 없이 이상을 찾는 법★★★★☆10h
3로그 데이터 처리비정형 텍스트를 학습 가능한 데이터로★★★☆☆8h
4이벤트 상관분석알림 200개를 사건 1개로★★★☆☆6h
5RCA와 인과추론"같이 움직임"과 "원인임"을 구분★★★★★14h
6예측과 용량 관리터지기 전에 알기★★★☆☆8h
7LLM 기반 운영언어 모델을 운영 루프에 넣기★★★☆☆8h
8평가 방법론이 모든 게 작동한다고 증명하기★★☆☆☆8h
A부록: 로드맵과 자료8주 계획 · 실습 프로젝트 · 데이터셋 · 논문

총 약 82시간(모듈 0.5와 선택 ★★★★ 절 포함). 주당 8시간 기준 10주 과정입니다. 시간이 빠듯하면 두 가지 단축이 있습니다 — 건너뛰기 판정을 통과하면 모듈 0.5(9h)를 생략하고, 각 모듈의 "선택 ★★★★" 표시 절(1-6-5, 3-5-4, 5-5 후반, 6-6 후반, 8-6 후반)을 건너뛰면 약 8시간이 더 줄어 8주로 완주할 수 있습니다. 선택 절은 뒤 모듈 진행에 지장이 없도록 설계되어 있습니다.


전체 흐름

[원시 텔레메트리]  메트릭 · 로그 · 트레이스 · 이벤트
        │  ◀── 모듈 1
        ▼
[정상 상태 모델링]  "평소엔 이렇게 생겼다"
        │  ◀── 모듈 2 (메트릭) · 모듈 3 (로그)
        ▼
[이상 신호]  아직 흩어진 점들
        │  ◀── 모듈 4
        ▼
[사건(Incident)]  알림 200개 → 사건 1개
        │  ◀── 모듈 5
        ▼
[근본 원인]
        │  ◀── 모듈 7 (요약 · 조치 제안)
        ▼
[조치]      ◀── 모듈 6 (미리 예측) · 모듈 8 (성과 측정)

읽는 방법

  • 순서대로 가세요. 특히 모듈 1을 건너뛰고 모듈 2로 가면 반드시 막힙니다.
  • 모듈 0.5는 건너뛰기 판정이 있습니다. 첫머리 5문항을 풀어 전부 맞으면 바로 모듈 1로 가세요. pandas나 p값이 처음이라면 0.5부터 — 여기를 건너뛰면 모듈 1의 첫 코드 블록에서 막힙니다.
  • 모듈 3은 모듈 2를 마친 뒤 시작하세요. 3장의 로버스트 z-score가 모듈 2에서 배우는 MAD 방식을 그대로 사용합니다.
  • 각 모듈은 왜 배우는가(실패 장면) → 개념 → 코드 → 함정 → 체크리스트 → 셀프 체크 순서입니다.
  • 코드는 읽기만 해도 이해되게 썼지만 반드시 한 번씩 실행해보세요. 특히 모듈 1~2는 그래프를 직접 그려봐야 감이 옵니다.
  • 표시 규칙: > **비유** 는 직관을 잡는 곳, > ⚠️ **함정** 은 실무에서 반드시 밟는 지뢰, > 🔀 **DevOps와의 경계** 는 이미 아는 것과 새로 배우는 것의 경계선입니다.

실습 환경

python -m venv aiops && source aiops/bin/activate
pip install numpy pandas scipy scikit-learn matplotlib \
            statsmodels ruptures drain3 networkx

모듈별로 추가 패키지(stumpy, lifelines, prophet 등)가 필요한 경우 해당 모듈에 안내가 있습니다.

이 자료가 다루지 않는 것

Prometheus/OTel Collector 운영, Grafana 대시보드 제작, PromQL 문법, Alertmanager 라우팅, 온콜 로테이션, K8s/Terraform/CI-CD/GitOps, SLO 정의 문화 — 전부 DevOps 영역이며 이미 알고 있다고 가정합니다.

경계가 애매한 회색지대(OpenTelemetry 스키마 설계, Kafka/Flink, 카디널리티 관리)는 부록 A-1에서 "AIOps 관점으로 다시 보기"로 따로 다룹니다.

Curriculum12 chapters · 125 lessons

11 lessons marked [Preview] are free to watch.

Chapter 1. 오리엔테이션 — AIOps와 DevOps의 경계 긋기9 lessons
  • 모듈 0. 오리엔테이션 — AIOps는 DevOps의 연장선이 아니다Preview
  • 0-1. 시작하기 전에: 흔한 오해 세 가지Locked
  • 0-2. 한 문장 정의Locked
  • 0-3. 왜 사람이 아니라 알고리즘이어야 하는가 — 규모의 문제Locked
  • 0-4. AIOps 파이프라인 — 전체 지도Locked
  • 0-5. 겹치는 것과 안 겹치는 것 — 명확한 선긋기Locked
  • 0-6. 이 강의의 사전 지식 요구사항Locked
  • 0-7. 학습 순서와 소요 시간Locked
  • 0-8. 셀프 체크Locked
Chapter 2. 모듈 0.5 데이터 기초 브릿지 — 본편을 위한 베이스캠프10 lessons
  • 모듈 0.5. 데이터 기초 브릿지 — Grafana 바깥에서 데이터 만지는 법Preview
  • 0.5-0. 왜 이걸 배우는가 — 실패 장면 하나Locked
  • 0.5-1. Series와 DataFrame — Grafana 패널의 정체Locked
  • 0.5-2. 분포 — 임계값 80%의 통계적 정체Locked
  • 0.5-3. 가설검정 — "배포 후 에러가 늘었다"를 판정하기Locked
  • 0.5-4. 상관과 회귀 — 두 메트릭의 관계를 숫자 하나로Locked
  • 0.5-5. fit과 predict — 머신러닝의 동사 두 개Locked
  • 0.5-6. Prometheus → DataFrame — 여러분의 최대 강점을 실습 진입로로Locked
  • 0.5-7. matplotlib 최소 — 그래프 세 종류면 본편이 끝난다Locked
  • 0.5-8. 마무리 — 전체 셀프 체크와 다음 갈 곳Locked
Chapter 3. 모듈 1 시계열 통계 기초 — "정상"을 숫자로 정의하기10 lessons
  • 모듈 1. 시계열 통계 기초 — "정상"을 숫자로 정의하기Preview
  • 1-0. 왜 이걸 배우는가 — 실패 장면 하나Locked
  • 1-1. 시계열 데이터의 구조 — 순서가 곧 데이터다Locked
  • 1-2. 시계열 분해 — 원본이 아니라 잔차를 보라Locked
  • 1-3. 정상성과 자기상관 — 규칙이 안 변한다는 약속Locked
  • 1-4. 분포 가정의 함정과 로버스트 통계Locked
  • 1-5. 데이터가 임계값을 정하게 — 극단값 이론(EVT)Locked
  • 1-6. 변화점 탐지와 다중 비교 문제Locked
  • 1-7. 실무 적용 체크리스트Locked
  • 1-8. 셀프 체크Locked
Chapter 4. 모듈 2 이상 탐지 — 임계값 없이 이상을 찾기10 lessons
  • 모듈 2. 이상 탐지 — 임계값 없이 이상을 찾는 법Preview
  • 2-0. 왜 이걸 배우는가 — 실패 장면 하나Locked
  • 2-1. 이상의 세 가지 종류Locked
  • 2-2. 잘 맞혔다는 게 무슨 뜻인가 — 평가 지표 미리보기Locked
  • 2-3. 통계적 기법 계열 — 예측하고, 남은 것을 본다Locked
  • 2-4. 거리·밀도·구조 기반 — 데이터의 모양을 본다Locked
  • 2-5. 딥러닝 계열 — 그리고 정직한 경고Locked
  • 2-6. 실전 운영 — 다변량, 개념 표류, 라벨 없는 세상Locked
  • 2-7. 실무 적용 체크리스트Locked
  • 2-8. 셀프 체크Locked
Chapter 5. 모듈 3 로그 데이터 처리 — 비정형 텍스트를 데이터로11 lessons
  • 모듈 3. 로그 데이터 처리 — 비정형 텍스트를 학습 가능한 데이터로Preview
  • 이 모듈이 다루는 범위 — 먼저 선을 긋습니다Locked
  • 3-0. 왜 이걸 배우는가 — 실패 장면 하나Locked
  • 3-1. 로그는 왜 다루기 어려운가Locked
  • 3-2. 로그 파싱 = 템플릿 추출Locked
  • 3-3. 템플릿 시계열 분석 — 이제부터는 모듈 1~2의 세계Locked
  • 3-4. 로그 임베딩 — 문장을 벡터로Locked
  • 3-5. 로그 시퀀스 이상 탐지 — 순서가 이상하다Locked
  • 3-6. 로그 + 메트릭 + 트레이스 결합Locked
  • 3-7. 실무 적용 체크리스트Locked
  • 3-8. 셀프 체크Locked
Chapter 6. 모듈 4 이벤트 상관분석 — 알림 200개를 사건 1개로12 lessons
  • 모듈 4. 이벤트 상관분석과 알림 노이즈 감축 — 알림 200개를 사건 1개로Preview
  • 4-0. 왜 이걸 배우는가 — 새벽 2시, 슬랙에 알림 340개Locked
  • 4-1. 문제를 정확히 정의하기 — 하나가 아니라 네 개Locked
  • 4-2. 알림을 데이터로 표현하기 — 벡터와 유사도Locked
  • 4-3. 시간 기반 상관 — 같이 뜨는 것들 찾기Locked
  • 4-4. 토폴로지 기반 상관 — 구조가 우연을 걸러낸다Locked
  • 4-5. 그룹을 발견하는 두 계열 — 클러스터링과 패턴 마이닝Locked
  • 4-6. 알림 폭풍 압축과 피드백 루프 — 운영에 올리기Locked
  • 4-6½. 사건은 스트림이다 — 배치 그룹핑의 한계Locked
  • 4-7. 실무 적용 체크리스트Locked
  • 4-8. 셀프 체크Locked
  • 마무리 — 이 모듈이 멈추는 지점Locked
Chapter 7. 모듈 5 RCA와 인과추론 — "같이 움직임"과 "원인임"의 구분12 lessons
  • 모듈 5. 근본원인 분석과 인과추론 — "같이 움직임"과 "원인임"을 구분하기Preview
  • 5-0. 왜 이걸 배우는가 — 이상 신호 40개, 화살표 0개Locked
  • 5-1. 상관관계 ≠ 인과관계, 운영 버전Locked
  • 5-2. "근본 원인"이라는 말의 함정, 그리고 전통적 방법들Locked
  • 5-3. 의존성 그래프 기반 접근 — 구조가 방향을 준다Locked
  • 5-4. 트레이스 분석 심화 — 가장 신뢰할 수 있는 방향 정보Locked
  • 5-5. 통계적 인과추론과 개입 — 이론의 정점, 그리고 그 한계Locked
  • 5-6. 실무에서 실제로 먹히는 것 — 변화, 조합, 그리고 신뢰Locked
  • 5-7. 실무 적용 체크리스트Locked
  • 5-7½. 실무 라이브러리 지도 — 직접 구현 다음에 잡을 도구Locked
  • 5-8. 셀프 체크Locked
  • 마무리 — 우리가 얻은 것과 얻지 못한 것Locked
Chapter 8. 모듈 6 예측과 용량 관리 — 터지기 전에 알기11 lessons
  • 모듈 6. 예측과 용량 관리 — 터지기 전에 알기Preview
  • 6-0. 왜 이걸 배우는가 — 90초의 공백Locked
  • 6-1. 예측 문제의 네 가지 종류 — 지평이 다르면 다른 문제다Locked
  • 6-2. 예측 모델 계열 — 가장 싼 것부터Locked
  • 6-3. 예측 평가 — 여기가 진짜 중요하다Locked
  • 6-4. 불확실성이 핵심이다 — 점 예측으로는 용량을 못 정한다Locked
  • 6-5. 용량의 물리학과 예측형 오토스케일링Locked
  • 6-6. 장애 예측과 비용 최적화Locked
  • 6-7. 실무 적용 체크리스트Locked
  • 6-8. 셀프 체크Locked
  • 마무리 — 이 모듈이 멈추는 지점Locked
Chapter 9. 모듈 7 LLM 기반 운영 — 언어 모델을 운영 루프에 넣기14 lessons
  • 모듈 7. LLM 기반 운영 — 언어 모델을 운영 루프에 넣기Preview
  • 이 모듈이 다루는 범위 — 먼저 선을 긋습니다Locked
  • 7-0. 왜 이걸 배우는가 — 새벽 3시, 점수 0.83Locked
  • 7-0.5. LLM이라는 부품의 사양서 — 5분 요약Locked
  • 7-1. LLM이 운영에서 잘하는 것과 못하는 것 — 정직한 구분Locked
  • 7-2. 활용 시나리오 1 — 인시던트 요약Locked
  • 7-3. 활용 시나리오 2 — 런북·포스트모템 RAGLocked
  • 7-4. 활용 시나리오 3 — 자연어 → 쿼리 변환Locked
  • 7-5. 활용 시나리오 4 — 에이전트형 자동 조치Locked
  • 7-6. 컨텍스트 엔지니어링과 안전 — 무엇을 넣고, 무엇을 막을 것인가Locked
  • 도입 순서 제안 — 조직이 실제로 밟아야 하는 계단Locked
  • 7-7. 실무 적용 체크리스트Locked
  • 7-8. 셀프 체크Locked
  • 마무리 — 이 모듈이 멈추는 지점Locked
Chapter 10. 모듈 8 평가 방법론 — 작동한다고 증명하기12 lessons
  • 모듈 8. 평가 방법론 — 이 모든 게 실제로 작동한다고 어떻게 증명하는가Preview
  • 8-0. 왜 이걸 배우는가 — 6개월 뒤, 회의실Locked
  • 8-1. 라벨 없음 문제 — AIOps의 원죄Locked
  • 8-2. 분류 지표 기초와 운영에서의 재해석Locked
  • 8-3. 시계열 이상 탐지 특유의 평가 문제Locked
  • 8-4. 오프라인 평가 설계 — 백테스트를 정직하게 하는 법Locked
  • 8-5. 온라인 평가 — 운영에서 진짜로 재기Locked
  • 8-6. 비즈니스 지표로 연결하기 — 경영진을 설득하는 언어Locked
  • 8-7. 숫자가 아닌 출력의 평가 — LLM·예측·그룹핑Locked
  • 8-8. 실무 적용 체크리스트Locked
  • 8-9. 셀프 체크Locked
  • 마무리 — 이 강의 전체를 관통하는 한 문장Locked
Chapter 11. 부록 A — 로드맵 · 실습 프로젝트 · 데이터셋 · 도구12 lessons
  • 부록 A. 데이터 파이프라인 재해석 · 학습 로드맵 · 참고자료Preview
  • A-0. 이 문서의 위치 — "그래서 이제 뭘 하지"Locked
  • A-1. 데이터 엔지니어링을 AIOps 관점으로 다시 보기Locked
  • A-2. 참조 아키텍처Locked
  • A-3. 8주 학습 로드맵Locked
  • A-4. 단계별 실습 프로젝트 4개Locked
  • A-5. 공개 데이터셋 카탈로그Locked
  • A-6. 도구 지도Locked
  • A-7. 읽을거리Locked
  • A-8. 직무로서의 AIOpsLocked
  • A-9. 흔한 실패 패턴 10가지Locked
  • A-10. 마무리 — 이 강의를 마친 뒤의 첫 한 달Locked
Chapter 12. 실습 과제 모음과 용어 색인2 lessons
  • 실습 과제 모음 — 각 모듈의 "실습 X시간"의 실체Locked
  • 용어 색인 — 이 용어, 어디서 처음 정의됐더라?Locked

Reviews

You can leave a review after taking this course.

    Q&A0

    Only students taking this course can post questions.

    No questions yet. Be the first to ask!