AI 에이전트를 처음 배포하는 것은 그 어느 때보다 빨라졌습니다. 문제는 그 이후입니다. 배포된 에이전트가 실제 운영 환경에서 어떻게 작동하는지 파악하고, 문제를 찾아내고, 원인을 분석하고, 수정 사항을 검증하는 과정은 여전히 대부분 수작업으로 이루어지고 있습니다. 에이전트가 워크플로 자동화와 지식 업무 보조에 점점 더 깊이 활용될수록, 이 개선 과정을 반복 가능한 엔지니어링 프로세스로 만드는 것이 실질적인 과제가 됩니다.
어라이즈 AI(Arize AI)는 연례 컨퍼런스 Arize Observe 2026에서 에이전트 개선 루프를 자동화하고 반복 가능하게 만드는 Arize AX 신기능들을 공개했습니다. 신기능을 살펴보기 전에, 먼저 Arize AX가 어떤 플랫폼인지 짚어보겠습니다.
☑️ Arize AX란 무엇인가
Arize AX는 LLM, RAG, AI 에이전트 기반 서비스의 동작을 추적하고 평가하며 개선하는 엔터프라이즈 AI 엔지니어링 플랫폼입니다. 관찰(Observe), 평가(Evaluate), 개선(Improve)으로 이어지는 과정을 하나의 워크플로로 연결해, 프로덕션 환경의 AI 시스템을 모니터링하고 지속적으로 개선할 수 있도록 지원합니다.
Arize AX는 오픈소스 관찰·평가 도구인 Phoenix와 동일한 오픈 표준 위에 구축되어 있으며, 여기에 관리형 인프라, 고급 에이전트 관찰 가능성, 온라인 평가, 지속적 개선 워크플로를 더한 플랫폼입니다. 트레이스로 에이전트가 무엇을 했는지 확인하고, 평가로 동작의 품질을 측정하며, 실험으로 개선 여부를 검증하는 흐름이 핵심입니다.
☑️ 에이전트 개선에 피드백 루프가 필요한 이유
에이전트의 첫 번째 버전을 출시하는 속도는 그 어느 때보다 빨라졌습니다. 관건은 에이전트 개선을 실제 운영 규모의 AI 시스템에서 반복 가능한 엔지니어링 프로세스로 전환하는 것입니다.
프로덕션 에이전트는 크게 두 가지 방식으로 실패합니다. 하나는 타임아웃, 도구 오류, 5xx 오류처럼 모니터링으로 감지할 수 있는 명시적 실패입니다. 다른 하나는 잘못된 컨텍스트 검색, 잘못된 도구 인수 전달, 단계 누락, 잘못된 추론에 기반한 그럴듯한 답변처럼 에이전트의 전체 진행 과정을 지능적으로 분석해야만 파악할 수 있는 누락형 실패입니다.
오류가 발생하더라도 팀은 트레이스를 조사하고, 변경 사항을 파악하고, 근본 원인을 찾고, 해결책을 결정하고, 결과를 검증하는 과정을 거쳐야 합니다. 이 맥락이 여러 도구에 분산되어 있으면 에이전트 개선은 곧 수동 조사 프로젝트가 됩니다. 엔지니어는 트레이스를 검색하고, 데이터셋을 재구축하고, 평가 코드를 다시 작성하고, 로그를 검사하고, 리포지토리 이력을 확인하고, 실험을 수동으로 실행해야 합니다.
Arize AX는 이 단계들을 하나의 엔지니어링 워크플로로 연결하도록 설계됐습니다. 트레이스는 무슨 일이 일어났는지를 보여주고, 평가자와 판단자는 에이전트 동작을 신호로 변환하며, 관리형 에이전트는 그 신호에서 조사와 수정 제안으로의 전환을 지원하고, 실험은 변경 사항이 실제로 효과가 있었는지를 검증합니다.

☑️ Arize AX의 새로운 기능
Signal: 프로덕션 에이전트에 대한 상시 조사
에이전트 트래픽이 증가할수록 사람의 검토는 그에 맞춰 늘어나지 않습니다. 팀이 하나의 트레이스에서 문제를 발견하는 것은 가능하지만, 수천 또는 수백만 개의 트레이스에서 반복되는 실패 패턴을 찾는 것은 현실적으로 불가능합니다.
Signal은 상시 작동하는 AI 워커로, 새로운 프로덕션 트레이스를 지속적으로 검토하고 이전에 식별된 문제를 기억하며 새로운 실패 패턴이 나타나면 이를 감지합니다. 관련 트레이스를 그룹화하여 요약, 근본 원인 분석, 영향 분석, 권장 조치 사항을 포함한 조사 보고서를 생성합니다. 팀이 모니터링 알림을 기다리는 방식에서 벗어나, 우선순위가 정리된 문제 목록과 증거, 권장 조치를 확인하며 하루를 시작할 수 있는 환경을 만드는 것이 Signal의 목표입니다.
Signal은 Arize AX에서 관리형 에이전트를 시작하는 가장 쉬운 진입점이기도 합니다. 최소한의 설정으로 활성화한 뒤, 시간이 지남에 따라 리포지토리 접근, 사용자 지정 스킬, 자동화, 에이전트 기반 문제 해결로 워크플로를 단계적으로 확장할 수 있습니다.
에이전트 오케스트레이션: 리포지토리를 인식하는 장기 실행 에이전트
장기 실행 에이전트는 AI 팩토리의 새로운 운영 계층으로 부상하고 있습니다. 단일 프롬프트에 답변하는 것이 아니라, 시간을 두고 문제를 조사하고 여러 도구와 코드베이스에서 맥락을 수집한 뒤 권장 사항이나 수정 제안을 내놓는 방식입니다.
Arize AX의 에이전트 오케스트레이션 기능을 통해 팀은 리포지토리를 인식하는 관리형 에이전트를 운영할 수 있습니다. 이 에이전트는 트레이스를 검사하고, 외부 시스템에 접근하고, 코드를 분석하고, 조사 결과물을 생성하며, 사람이 검토할 수 있도록 변경 사항을 풀 리퀘스트로 제안합니다. 회귀 테스트 분류, 프로덕션 동작 디버깅, 데이터셋 관리, 평가 생성, 보안 검토, 코드 수정 등 다양한 엔지니어링 워크플로에 맞게 구성할 수 있습니다.
미리 구축된 워크플로를 사용하거나, 구성 가능한 하네스·샌드박스·리포지토리·스킬·자동화를 조합해 자체 워크플로를 만들 수 있습니다. 이 에이전트들은 자율적으로 프로덕션 변경을 실행하는 것이 아니라, 조사하고 증거를 수집하고 제안을 내놓으며 엔지니어가 검토, 승인, 수정, 거부를 결정합니다.

에이전트 플릿 옵저버빌리티: 증가하는 AI 워커를 한눈에
팀에서 AI 워커를 더 많이 배포할수록, 해당 에이전트들의 활동, 성능, 리소스 소비 현황에 대한 가시성이 필요합니다. 에이전트 플릿 관찰 가능성은 조직 전체에서 운영 중인 관리형 에이전트에 대한 중앙 집중식 뷰를 제공합니다. 에이전트 상태, 활동 내역, 진행 경로(trajectory), 토큰 사용량, 비용을 한 곳에서 확인할 수 있으며, 장기 조사 진행 상황을 추적하고 시간 경과에 따른 에이전트 동작을 파악할 수 있습니다. Claude Code 관리형 에이전트, Vercel, Daytona를 지원합니다.

에이전트 실험: 전체 에이전트 시스템을 대상으로 한 검증
프롬프트 테스트는 유용하지만, 프로덕션 에이전트는 프롬프트만으로 구성되지 않습니다. 도구, 검색, 라우팅, 메모리, 모델, 대체 로직, 애플리케이션 코드, 비즈니스 로직이 복합적으로 얽혀 있는 시스템입니다. 어느 한 계층의 작은 변경이 특정 동작을 개선하는 동시에 다른 동작을 손상시킬 수 있습니다.
Arize AX의 에이전트 실험은 개선 루프에서 검증 단계를 담당합니다. 엄선된 데이터셋을 전체 에이전트 시스템에서 실행하고, 실행 간 출력 결과, 트레이스, 평가 결과를 비교해 변경 사항이 동작을 실제로 개선했는지, 아니면 새로운 회귀를 발생시켰는지 파악할 수 있습니다. 도구 사용이 개선됐는지, 지연 시간은 어떻게 바뀌었는지, 검색 품질은 유지됐는지, 수정 사항이 목표한 오류를 해결하면서 다른 작업에 영향을 주지 않았는지 — 이러한 질문에 답하려면 시스템 전체를 실행하고 실행 결과를 비교하는 과정이 필요합니다.

Harness-as-a-Judge: 사전 정의 없이도 작동하는 평가 신호
기존 LLM 평가 방식은 팀이 어떤 실패를 찾아야 하는지 이미 알고 있을 때 효과적입니다. 그러나 에이전트 실패는 그렇게 예측하기 어렵습니다. 에이전트가 실제 운영 환경에서 도구, 사용자, 변화하는 환경과 상호 작용하면서 사전에 정의하지 못했던 새로운 실패 유형이 등장합니다.
Harness-as-a-Judge는 팀이 사전 정의하지 않은 실패 모드가 프로덕션에서 드러날 때 에이전트 개선 루프가 적응할 수 있도록 지원합니다. 팀이 정상적인 동작을 설명하면, 에이전트 판단자가 트레이스를 검사하고 관련 스팬을 식별하며 문제를 분류하고 향후 모니터링·평가·실험에 재사용할 수 있는 레이블을 생성합니다. 미리 정해진 평가 기준표에 의존하지 않고, 실제로 발생하는 실패에 맞춰 평가 신호가 지속적으로 적응하는 것이 목표입니다.

음성 에이전트 지원: 텍스트와 동일한 관찰·평가 체계를 음성으로
음성 에이전트는 텍스트 기반 에이전트와는 다른 차원의 복잡성을 가집니다. 오디오 스트림, 대화 중단, 음성 지연, 전사 품질, 멀티모달 상호 작용이 모두 에이전트 경험의 일부가 됩니다.
Arize AX audio support for agents
Arize AX는 이제 음성 대화의 관찰, 검색, 재생, 평가를 기본으로 지원합니다. 팀은 음성 세션을 녹취록 및 트레이스와 함께 검토하고, 대화 중단 횟수와 최초 음성 발생 시간(Time-to-First Audio)을 분석하고, 대화를 처음부터 끝까지 재생하며, 음성 상호 작용에 대해 직접 평가를 실행할 수 있습니다. 음성 대화를 텍스트 에이전트와 동일한 관찰 및 평가 워크플로에 통합함으로써, 대화형 AI 시스템에도 동일한 수준의 엄격함을 적용해 디버깅, 모니터링, 개선을 진행할 수 있습니다.
☑️ 자주 묻는 질문
Q. Arize AX Signal은 기존 모니터링과 무엇이 다른가요?
A. 기존 모니터링은 사전에 설정한 임계값이나 조건을 기준으로 알림을 발생시킵니다. Signal은 사전 설정 없이 프로덕션 트레이스를 지속적으로 검토하고, 이전에 식별된 문제를 기억하며 새로운 실패 패턴을 스스로 감지합니다. 팀이 문제를 기다리는 것이 아니라, 우선순위가 정리된 조사 보고서를 받아보는 방식으로 전환됩니다.
Q. 에이전트 실험은 프롬프트 테스트와 어떻게 다른가요?
A. 프롬프트 테스트는 모델의 출력 결과만 확인합니다. Arize AX의 에이전트 실험은 도구 사용, 검색 품질, 지연 시간, 진행 경로(trajectory), 평가 결과를 포함한 전체 에이전트 시스템의 동작을 실행 간 비교합니다. 한 계층의 변경이 다른 계층에 미치는 영향까지 확인할 수 있다는 점에서 범위가 다릅니다.
Q. Harness-as-a-Judge는 기존 LLM 평가 방식과 무엇이 다른가요?
A. 기존 LLM 평가는 팀이 미리 정의한 기준표를 기반으로 작동하기 때문에 사전에 예상하지 못한 실패 유형에는 대응하기 어렵습니다. Harness-as-a-Judge는 에이전트 판단자가 실제 프로덕션 트레이스를 검사해 새로운 실패 모드를 스스로 식별하고 재사용 가능한 레이블을 생성합니다. 평가 신호가 실제 운영 환경의 변화에 맞춰 지속적으로 적응하는 구조입니다.
Q. 음성 에이전트도 텍스트 에이전트와 동일하게 평가할 수 있나요?
A. Arize AX는 음성 대화를 텍스트 에이전트와 동일한 관찰 및 평가 워크플로에 통합합니다. 오디오 세션을 녹취록, 트레이스와 함께 검토하고, 대화 중단 분석, 최초 음성 발생 시간(Time-to-First Audio) 측정, 대화 전체 재생, 음성 상호 작용 직접 평가가 가능합니다.
☑️ AI 엔지니어링 팀에 가져올 변화
에이전트의 역량이 높아질수록 병목은 에이전트를 구축하는 것에서 에이전트를 개선하는 것으로 이동합니다. 핵심 과제는 문제를 찾아내고, 오류를 이해하고, 수정 사항을 검증하고, 동작을 지속적으로 개선하는 신뢰할 수 있는 체계를 만드는 것입니다.
Signal은 프로덕션에서 발생하는 문제를 지속적으로 감지합니다. 에이전트 오케스트레이션은 리포지토리를 인식하는 장기 실행 AI 워커를 엔지니어링 워크플로 전반에서 운영할 수 있게 합니다. Harness-as-a-Judge는 실패 유형이 진화함에 따라 새로운 평가 신호를 생성합니다. 에이전트 실험은 배포 전에 전체 에이전트 시스템 동작을 대상으로 변경 사항을 검증합니다. 에이전트 플릿 관찰 가능성은 이 모든 과정에서 운영 중인 AI 워커에 대한 가시성을 제공합니다. 음성 에이전트 지원은 이 개선 루프를 대화형 AI 시스템으로 확장합니다.
▶ 어라이즈 AI(Arize AI) 자세히보기
[출처 : Arize AI, "Building the AI factory for self-improving agents: What's new in Arize AX"]