AI가 운영 환경의 핵심 구성 요소로 자리 잡으면서, IT 운영 팀이 다뤄야 할 시스템의 복잡성은 이전과 달라지고 있습니다. 애플리케이션은 더 분산되었고, Kubernetes 환경은 계속 확장되고 있으며, 디지털 서비스는 내부 인프라뿐 아니라 외부 API, 서드파티 제공자, AI 모델과 에이전트에 이르기까지 다양한 구성 요소에 의존합니다.
이런 환경에서 운영 팀에게 요구되는 것은 단순히 더 많은 대시보드가 아닙니다. 복잡한 시스템 전반의 신호를 통합하고, 맥락을 파악하고, 빠르게 행동할 수 있도록 돕는 지능형 체계가 필요합니다. 스플렁크(Splunk)는 2026년 6월 Cisco Live를 통해 이 방향성에 맞는 Splunk Observability의 신규 기능을 공개했습니다.
이 글에서는 Cisco Live에서 발표된 Splunk Observability의 주요 기능을 세 가지 영역으로 나눠 정리합니다.
☑️ 에이전틱 옵저버빌리티(Agentic Observability)란 무엇인가
에이전틱 옵저버빌리티(Agentic Observability)는 AI 에이전트가 이상 징후를 탐지하고, 원인을 분석하고, 다음 조치를 제안하는 방식으로 운영 팀의 인시던트 대응을 지원하는 옵저버빌리티 체계입니다. 기존 모니터링이 "무언가가 잘못되었다"는 신호를 전달하는 데 초점을 맞췄다면, 에이전틱 옵저버빌리티는 "무슨 일이 일어났는지, 왜 중요한지, 다음에 무엇을 해야 하는지"를 함께 제공하는 방향으로 발전하고 있습니다.
스플렁크는 이번 발표를 통해 이 접근 방식을 엔터프라이즈 운영 전반에서 구현하기 위한 기능을 공개했습니다. 주요 방향은 세 가지입니다. AI 기반 인시던트 탐지 및 해결 자동화, AI 스택 전반에 대한 옵저버빌리티 확장, 기술 신호와 비즈니스 영향의 통합 연결입니다.
☑️ AI 기반 옵저버빌리티(AI-Powered Observability): 인시던트 탐지부터 해결까지
■ AI SRE: 에이전트형 AI가 인시던트 대응 팀에 합류한다
AI SRE는 Splunk Observability Cloud에 새롭게 도입된 에이전트형 AI 기능으로, 2026년 6월 말 GA(정식 출시) 예정입니다. 이 기능은 이상 탐지, 원인 분석, 조치 계획 수립, 복구 가이드까지 일련의 과정을 자동화합니다.
기존 옵저버빌리티 방식이 수동 모니터링과 대시보드 확인에 의존했다면, AI SRE는 LLM 기반 추론을 통해 문제를 먼저 감지하고 대응 방향을 제시합니다. 운영 팀 입장에서는 초동 대응에 소요되는 시간을 줄이고 복구 과정에 집중할 수 있는 환경이 만들어집니다.

■ Cisco AI Canvas와 ITSI의 통합: 인시던트 조사의 시작점을 바꾼다
인시던트가 발생했을 때 팀이 가장 먼저 하는 일은 상황 파악입니다. 기존에는 알림, KPI 추이, 서비스 상태, 엔티티 정보 등을 여러 화면을 오가며 수집해야 했습니다.
Cisco AI Canvas와 Splunk IT Service Intelligence(ITSI)의 통합은 이 과정을 바꿉니다. ITSI 에피소드를 AI Canvas에서 열면 서비스 구성, KPI, 연관 알림, 유사 에피소드, 연결된 티켓 등의 정보가 자동으로 불러와집니다. 해당 인시던트에 맞는 프롬프트도 함께 제공됩니다. 이 기능은 현재 Alpha 단계입니다.

■ ITSI Event iQ Detect: 분석가의 피드백으로 학습하는 알림 그루핑
Event iQ Detect는 기존에도 머신러닝을 활용해 알림 그루핑을 지원해 왔습니다. 이번 업데이트에서는 분석가의 피드백을 직접 학습에 반영하는 기능이 추가됩니다.
에피소드 리뷰에서 분석가가 잘못 그룹화된 에피소드를 분리하거나, 별도로 나뉜 에피소드를 하나로 묶으면 해당 피드백이 Event iQ 모델 재학습에 반영됩니다. 시간이 지날수록 알림 그루핑 정확도가 높아지고, 에피소드 제목과 상관 요약의 품질도 개선됩니다. 어드민은 재학습 일정, 승인 설정, 자동 학습 옵션을 정책 설정에서 직접 관리할 수 있습니다. 이 기능은 2026년 6월 ITSI 5.0 릴리스에 포함될 예정입니다.

■ ITSI Event iQ Diagnose: 원인 분석 결과를 한 화면에서 확인한다
Event iQ Diagnose는 LLM을 활용해 ITSI 에피소드의 상황 요약을 자동으로 생성합니다. 무슨 일이 발생했는지, 언제 시작되었는지, 주요 기여 이벤트는 무엇인지, 예상 원인과 권장 조치는 무엇인지를 에피소드 리뷰의 Impact 탭에서 단일 화면으로 확인할 수 있습니다. 요약 내용은 팀원과 공유하거나 ServiceNow 같은 외부 도구로 전송할 수도 있습니다.
Event iQ Detect가 알림을 그룹화한다면, Event iQ Diagnose는 그 에피소드를 설명하는 역할을 합니다. 이 기능도 2026년 6월 ITSI 5.0 릴리스에 포함될 예정입니다.

☑️ AI 옵저버빌리티(AI Observability): AI 에이전트도 모니터링 대상이다
■ Splunk Agent Observability: AI 에이전트 운영 품질을 관리한다
AI 에이전트가 프로덕션 환경에 배포되면, 에이전트 자체의 동작 품질을 어떻게 확인할 것인가라는 질문이 생깁니다. Splunk Agent Observability는 이 문제를 다룹니다.
Cisco가 Galileo를 인수 완료하면서 Galileo의 평가 기능, 실시간 가드레일, 저지연 비용 효율적 평가 기술이 Splunk Observability에 통합되었습니다. Splunk Agent Observability는 AI 에이전트의 개발 라이프사이클 전반에 걸쳐 에이전트를 평가하고 모니터링하며, 유해 출력을 차단하고 비용을 제어하는 기능을 제공합니다.

☑️ 통합 옵저버빌리티(Unified Observability): 신호를 연결하고 비즈니스 영향으로 이어간다
■ Observability Cloud Free Edition: 제한 없이 시작할 수 있는 무료 플랜 정식 출시
Splunk Observability Cloud Free Edition이 정식 출시되었습니다. 기존 14일 트라이얼 방식 대신, 15개 호스트 한도 내에서 엔터프라이즈 수준의 기능에 자유롭게 접근할 수 있습니다. 특정 기능이 제한되는 방식이 아니라 호스트 수로 범위를 정한다는 점에서, 개발자나 AI 엔지니어가 초기 단계부터 깊이 있는 통합과 대시보드를 구성할 수 있습니다.

■ ThousandEyes Network Insights와 Synthetic Monitoring 통합: 애플리케이션과 네트워크 계층을 한 곳에서
애플리케이션과 네트워크 모니터링이 분리되어 있으면, 장애 원인이 애플리케이션인지 네트워크인지 파악하는 데 시간이 걸립니다. Splunk Observability Cloud의 Synthetic Monitoring과 ThousandEyes를 통합하면 애플리케이션 계층과 네트워크 계층 테스트를 한 곳에서 생성하고 관리할 수 있습니다.
69개국 271개 도시의 1,000개 이상 클라우드 에이전트를 통한 글로벌 가시성을 제공하며, DNS 해석, BGP 라우팅, 홉별 경로 분석 등 네트워크 심층 진단도 지원합니다. 이 통합은 2026년 7월 Alpha 진입 예정입니다.

■ Runtime Application Attack Detection: 애플리케이션 보안과 옵저버빌리티의 통합
AI가 소프트웨어 개발 속도를 높이는 동시에 코드 내 보안 취약점 발생 가능성도 높아지고 있습니다. Splunk Secure Application은 기존 옵저버빌리티 도구에 보안 기능을 추가합니다. 비즈니스 맥락을 기준으로 애플리케이션 위협과 취약점을 우선순위화하고, 런타임 위협 데이터를 Splunk Enterprise Security와 직접 연결해 애플리케이션 팀과 보안 팀의 협업 기반을 만듭니다. 이 기능은 현재 정식 출시(GA) 상태입니다.

■ Log-Based Charting and Alerting: 로그, 메트릭, 트레이스를 하나의 인터페이스에서
로그 데이터를 메트릭, 트레이스와 별도 도구에서 관리하면 인시던트 대응 시 여러 도구를 오가는 비효율이 생깁니다. Splunk Observability Cloud에 로그 기반 차트 작성 및 알림 기능이 통합되면서 이 문제를 줄일 수 있습니다. SPL 기반 분석과 AI 지원을 함께 활용해 로그 데이터 가시성과 MTTD/MTTR 개선에 활용할 수 있습니다. 이 기능은 2026년 7월 정식 출시 예정입니다.

☑️ 자주 묻는 질문
Q.에이전틱 옵저버빌리티(Agentic Observability)란 무엇인가요?
A. 에이전틱 옵저버빌리티는 AI 에이전트가 시스템 이상을 탐지하고, 원인을 분석하고, 조치 방향을 제안하는 방식으로 운영 팀의 인시던트 대응을 자동화하는 옵저버빌리티 체계입니다. 스플렁크는 이를 AI SRE, Event iQ Detect, Event iQ Diagnose 등의 기능으로 구현하고 있습니다.
Q. AI SRE는 기존 SRE 운영과 어떻게 다른가요?
A. 기존 SRE 운영이 알림 수신 후 수동으로 원인을 분석하는 방식이라면, AI SRE는 LLM 기반 추론으로 이상 탐지, 원인 분석, 조치 계획 수립을 자동화합니다. 운영 팀은 반복적인 초동 대응 과정을 줄이고 실제 복구에 집중할 수 있습니다.
Q. Splunk Agent Observability는 어떤 환경에 필요한가요?
A. AI 에이전트가 프로덕션 환경에서 실제 업무를 처리하는 환경에서 필요합니다. 에이전트의 출력 품질, 유해 응답 발생 여부, 비용 추이를 모니터링하고 실시간 가드레일을 적용해 운영 신뢰성을 높이는 데 활용할 수 있습니다.
Q. Splunk Observability Cloud Free Edition은 누구에게 적합한가요?
A. 개발자, 스타트업, AI 엔지니어처럼 트라이얼 기간 제한 없이 초기부터 통합 환경을 구성하고 싶은 팀에 적합합니다. 15개 호스트 한도 내에서 엔터프라이즈 수준의 기능을 사용할 수 있습니다.
Q. ThousandEyes와 Splunk Synthetic Monitoring 통합의 주요 이점은 무엇인가요?
A. 애플리케이션 계층과 네트워크 계층 테스트를 한 인터페이스에서 관리하고, 장애 원인이 애플리케이션에 있는지 네트워크에 있는지 빠르게 파악할 수 있습니다. DNS, BGP, 홉별 경로 분석 등 심층 네트워크 진단과 애플리케이션 텔레메트리를 함께 활용해 MTTR 개선에 활용할 수 있습니다.
☑️ Splunk Observability 도입을 고민하고 있다면
스플렁크(Splunk)가 이번 발표에서 강조한 방향은 옵저버빌리티(Observability)를 운영 지능 체계로 발전시키는 것입니다. AI 에이전트가 운영에 개입하는 환경에서는 로그와 메트릭을 수집하는 것만으로는 부족합니다. 시스템 신호를 비즈니스 맥락과 연결하고, AI 스택 자체의 동작을 모니터링하고, 탐지부터 조치까지 운영 흐름을 자동화하는 체계가 필요합니다.
클라우드네트웍스는 스플렁크(Splunk) 공식 파트너로서 고객 환경에 맞는 Splunk Observability 도입 검토를 지원할 수 있습니다. 현재 운영 환경에서 옵저버빌리 체계를 어떻게 설계할지, AI 스택 모니터링을 어떻게 시작할지 고민이 있으시다면 아래 링크를 통해 문의해 주시기 바랍니다.
▶ 스플렁크(Splunk) 제품보기
[출처 : Splunk, "Splunk Observability at Cisco Live: Agentic Observability for the AI Era"]