기업의 AI 도입이 실험 단계를 지나 실제 서비스로 이어지면서, 재무 부서와 플랫폼 조직이 함께 마주하는 질문이 하나 생겼습니다. AI에 얼마를 쓰고 있는지, 그 비용이 어느 팀과 어느 서비스에서 발생하는지 설명할 수 있는가 하는 질문입니다.
기존 클라우드 비용 관리에서는 인스턴스와 스토리지가 과금 단위였습니다. AI 워크로드에서는 과금 단위가 토큰으로 바뀝니다. 같은 API 호출이라도 프롬프트 길이, 응답 길이, 선택된 모델에 따라 비용이 달라집니다. 여기에 AI 에이전트와 MCP 서버가 더해지면 사람이 직접 호출하지 않는 자동 호출이 반복적으로 발생하면서 비용 예측은 더 어려워집니다.
이 글에서는 AI 비용 통제가 어려운 이유를 세 가지로 정리하고, 콩(Kong)의 AI 게이트웨이 제품인 Kong AI Gateway가 각 지점에서 어떤 통제 수단을 제공하는지 설명합니다.
☑️ AI FinOps란 무엇인가
AI FinOps는 LLM 토큰, AI 에이전트 호출, 관련 API 소비량을 실시간으로 관측하고 조직이 정한 한도 안에서 소비되도록 통제하는 운영 체계입니다. 비용을 사후에 집계해 최적화하는 것이 아니라, 소비가 발생하는 시점에 한도를 적용한다는 점이 기존 클라우드 FinOps와 구분되는 지점입니다.
AI 비용 거버넌스는 두 축으로 나뉩니다. 하나는 LLM, MCP, API, 이벤트 스트림 전반의 소비량을 하나의 지점에서 관측하는 통합 가시성이고, 다른 하나는 정의된 한도를 런타임에서 실제로 강제하는 소비 통제입니다. 가시성만으로는 이미 발생한 비용을 되돌릴 수 없기 때문입니다.
☑️ AI 비용 통제가 어려운 세 가지 이유
AI 비용은 이미 기업의 의사결정을 바꾸는 수준으로 올라와 있습니다. 2026 State of AI Cost Governance Report에 따르면 조사 대상 기업의 62%가 지난 1년간 예상하지 못한 AI 비용 때문에 사업 의사결정이 바뀌었다고 답했고, 40%는 해당 사안이 이사회 보고로 이어졌다고 응답했습니다. 33%는 긴급 지출 동결을 시행했고, 25%는 AI 과제를 지연하거나 취소했습니다. 원인은 예산 규모가 아니라 AI 자원에 연결되는 경로가 흩어져 있다는 데 있습니다.
비용이 보이지 않는 문제
온프레미스 AI 인프라를 비용 리포팅에 포함하는 기업은 44% 수준이고, 개발자용 AI 도구를 리포팅에 포함하는 기업은 42%입니다. 에이전틱 워크로드를 운영하는 기업 가운데 15%는 에이전트 관련 비용을 어느 단위로도 귀속하지 못합니다. 집계 대상에서 빠진 비용은 최적화 논의의 대상이 되지 못합니다.
애플리케이션이 각 LLM 제공자에 직접 연결되어 있으면 소비량 데이터는 제공자별 청구서에 흩어집니다. AI 게이트웨이는 모든 LLM 요청이 지나가는 프록시 계층이므로, 어느 제공자를 쓰든 같은 지점에서 요청 단위 토큰 데이터를 남깁니다.
비용을 예측하지 못하는 문제
AI 비용을 오차 범위 10% 이내로 예측할 수 있다고 답한 기업은 11%에 그쳤고, 89%는 예측이 10%를 넘게 어긋난다고 응답했습니다. 예측 정확도는 전년의 15%에서 오히려 낮아졌습니다. 예측 오차가 클수록 AI 비용을 매출원가 구조에 반영해 계획을 세우기 어려워집니다.
예측을 정교하게 만드는 것보다 확실한 방법은 총량을 미리 나눠두는 것입니다. 게이트웨이에서 팀별, 서비스별 토큰 한도를 배분하면 실제 소비가 그 범위 안에서 결정되므로, 예측 대상이 아니라 설정 대상이 됩니다.
비용을 끊지 못하는 문제
소비량을 대시보드에서 확인할 수 있더라도, 특정 팀이나 특정 모델의 사용량이 급증했을 때 이를 차단할 위치가 없다면 비용은 이미 발생한 뒤에 확인됩니다. 통제 로직이 애플리케이션 코드에 흩어져 있으면 정책을 조직 단위로 일관되게 적용하기도 어렵습니다.
게이트웨이는 요청이 LLM에 도달하기 전 단계에 있습니다. 한도를 초과한 요청을 이 지점에서 거절하면 비용이 발생하지 않습니다.
☑️ AI 게이트웨이가 비용 통제 지점이 되는 이유
AI 게이트웨이는 애플리케이션과 LLM 사이에 위치하는 프록시 계층입니다. Kong AI Gateway는 AI Proxy와 AI Proxy Advanced 플러그인을 통해 여러 AI 제공자를 하나의 표준화된 인터페이스로 묶는 유니버설 API를 제공합니다.
이 구조에서는 클라이언트 애플리케이션이 제공자별 API 규격에 종속되지 않고, 자격 증명이 중앙에서 관리되며, 새로운 모델을 추가할 때 애플리케이션마다 연동을 다시 만들지 않아도 됩니다.
비용 관점에서 이 구조가 갖는 의미는 통제 지점이 하나로 모인다는 것입니다. 애플리케이션마다 개별 구현하던 토큰 제한과 사용량 집계를 게이트웨이 설정으로 옮기면, 정책을 조직 단위로 적용하고 변경할 수 있습니다.
☑️ Kong AI Gateway가 제공하는 비용 통제 기능
토큰과 비용 기준의 레이트 리미팅
LLM 트래픽에서는 요청 수 기준의 레이트 리미팅이 의미를 갖기 어렵습니다. 짧은 질문 한 건과 긴 문서를 요약하는 요청 한 건의 비용이 크게 다르기 때문입니다.
AI Rate Limiting Advanced 플러그인은 LLM 제공자가 반환한 토큰 데이터를 기준으로 한도를 적용합니다. 프롬프트와 응답을 합산하는 방식, 입력 토큰만 세는 방식, 생성된 토큰만 세는 방식, 그리고 모델별 입출력 단가를 반영해 실제 비용을 기준으로 하는 방식을 선택할 수 있습니다.
비용 기준 방식이 재무 관점에서 의미를 갖는 이유는 같은 토큰 수라도 어떤 모델을 썼는지에 따라 비용이 달라지기 때문입니다. 비용 단위로 한도를 걸면 재무 부서가 관리하는 예산 단위와 게이트웨이가 강제하는 한도 단위가 같아집니다.
한도는 컨슈머, 컨슈머 그룹, 모델, 제공자 단위로 정의할 수 있어 특정 팀이 특정 모델을 호출하는 경우에만 별도 한도를 적용하는 구성도 가능합니다.
등급별 한도 배분과 모델 접근 제한
한도를 걸 수 있다는 것과 누구에게 얼마씩 나눌지 정하는 것은 다른 문제입니다. Kong AI Gateway는 컨슈머를 등급으로 나누고 등급별로 다른 토큰 한도를 적용하는 계층적 접근 제어를 지원합니다. 예를 들어 골드 등급은 30초당 1,000토큰, 실버 등급은 30초당 500토큰, 브론즈 등급은 분당 100토큰과 같이 구성할 수 있습니다.
모델 접근 제한도 함께 적용할 수 있습니다. 하위 등급 컨슈머가 상위 모델에 접근하지 못하도록 막으면, 단가가 높은 모델을 실제로 필요한 업무에만 열어둘 수 있습니다. 한도를 초과하거나 허용되지 않은 모델을 호출하면 게이트웨이가 429 응답을 반환합니다.
고객 환경에서는 이 구성이 팀별 예산 배분과 직접 연결됩니다. 어느 조직이 어느 모델을 얼마나 쓸 수 있는지를 게이트웨이 정책으로 정의해두면, 사용량 급증이 예산 초과로 이어지는 경로가 차단됩니다.
시맨틱 캐싱과 모델 라우팅
소비량 자체를 줄이는 수단도 게이트웨이 계층에서 적용할 수 있습니다.
시맨틱 캐싱은 의미가 유사한 프롬프트에 대해 게이트웨이가 직접 응답을 반환합니다. 동일한 질문이 표현만 달리해 반복되는 사내 어시스턴트나 고객 응대 시나리오에서는 LLM 호출 자체가 발생하지 않으므로 토큰 소비가 줄어듭니다.
시맨틱 라우팅은 프롬프트의 의미를 기준으로 요청을 서로 다른 모델에 분배합니다. 모든 요청을 상위 모델로 보내는 대신 작업 난이도에 맞는 모델을 선택하는 방식입니다. 라우팅 기준으로는 비용, 프롬프트 의미, 지연 시간 등을 사용할 수 있습니다.
운영 관점에서는 모델 선택 기준을 코드가 아니라 게이트웨이 설정으로 관리한다는 점이 중요합니다. 신규 모델이 출시되거나 단가가 바뀌었을 때 애플리케이션 배포 없이 라우팅 정책을 조정할 수 있습니다.
MCP와 에이전트 트래픽 비용 제어
MCP 도입은 LLM 호출량을 늘리는 방향으로 작용합니다. MCP 클라이언트가 MCP 서버에 연결되고, 서버가 다시 LLM을 호출하며, 각 접점마다 토큰 소비가 발생하기 때문입니다.
Kong AI Gateway는 MCP 트래픽을 게이트웨이에서 제어하고, MCP 컨텍스트 최적화를 통해 토큰 지출을 줄이는 기능을 제공합니다. 에이전트 간 통신에 대해서도 호출별 지연 시간, 토큰 사용량, 오류 정보를 수집합니다.
에이전트 워크플로에서는 이전 대화 이력과 도구 호출 결과가 계속 프롬프트에 쌓이므로 입력 토큰이 전체 비용의 상당 부분을 차지할 수 있습니다. 게이트웨이 계층에서 컨텍스트를 정리하면 애플리케이션 로직을 수정하지 않고 소비량을 줄일 수 있습니다.
토큰 사용량 데이터와 쿼터 관리
Kong AI Gateway는 감사 로그, LLM 메트릭, OpenTelemetry 기반 트레이싱을 통해 토큰 사용량, 지연 시간, 비용을 추적합니다. 이미 운영 중인 옵저버빌리티 스택으로 데이터를 내보낼 수 있으므로, 별도 분석 환경을 새로 구축하지 않아도 됩니다.
비용 리포팅에 필요한 것은 총액이 아니라 분해된 데이터입니다. 어느 컨슈머가 어느 모델을 얼마나 호출했는지 구분되어야 팀별 사용량 리포트를 만들 수 있습니다.
여기에 사용자, 모델, 기간을 기준으로 한 쿼터를 함께 설정할 수 있습니다. 레이트 리미팅이 30초나 1분처럼 짧은 구간의 사용량 급증을 막는 수단이라면, 쿼터는 월 단위처럼 긴 기간의 총량을 관리하는 수단입니다.
☑️ 자주 묻는 질문
AI FinOps와 기존 클라우드 FinOps는 무엇이 다른가요?
과금 단위와 통제 시점이 다릅니다. 기존 클라우드 FinOps는 인스턴스와 스토리지 사용량을 사후 집계해 최적화하는 방식이 중심이지만, AI FinOps는 토큰이라는 가변적인 단위를 다루며 소비 시점에 한도를 강제하는 런타임 통제가 필요합니다.
왜 요청 수가 아니라 토큰 기준으로 한도를 걸어야 하나요?
LLM 요청은 건별 비용 편차가 크기 때문입니다. 짧은 질문과 긴 문서 요약이 같은 한 건으로 계산되면 실제 지출과 한도가 어긋납니다. 토큰 기준, 특히 모델별 단가를 반영한 비용 기준으로 한도를 걸어야 예산과 통제 단위가 일치합니다.
AI 게이트웨이 없이 애플리케이션 코드에서 토큰 제한을 구현할 수는 없나요?
가능하지만 애플리케이션마다 개별 구현이 필요하고, 조직 전체의 소비량을 합산해 판단할 수 있는 지점이 생기지 않습니다. 게이트웨이 계층에 통제를 두면 여러 애플리케이션과 에이전트에 동일한 정책을 적용할 수 있고, 정책 변경 시 애플리케이션 배포가 필요하지 않습니다.
팀별로 다른 한도를 적용할 수 있나요?
적용할 수 있습니다. 컨슈머를 등급으로 나누고 등급별로 토큰 한도를 다르게 설정할 수 있으며, 등급에 따라 접근 가능한 모델을 제한하는 것도 가능합니다. 이를 통해 단가가 높은 모델을 필요한 조직에만 열어두는 방식으로 예산을 배분할 수 있습니다.
여러 LLM 제공자를 함께 쓰는 환경에서도 적용할 수 있나요?
적용할 수 있습니다. AI Proxy와 AI Proxy Advanced가 제공하는 유니버설 API를 통해 여러 제공자를 하나의 인터페이스로 묶고, 제공자와 모델 단위로 각각 다른 한도를 설정할 수 있습니다. 온프레미스에 배치한 모델과 상용 LLM을 함께 쓰는 환경에서도 같은 지점에서 소비량을 확인할 수 있습니다.
☑️ 마무리
AI 비용 문제는 사용량을 줄이는 문제라기보다, 사용량을 볼 수 있고 끊을 수 있는 지점을 만드는 문제에 가깝습니다. LLM 트래픽이 지나가는 게이트웨이 계층은 토큰 데이터를 실제로 확인할 수 있는 위치이며, 가시성 확보와 한도 강제를 같은 지점에서 처리할 수 있습니다.
클라우드네트웍스는 Kong 파트너로서 AI 게이트웨이 구축을 지원하고 있습니다. 현재 LLM 트래픽 구조와 사용 중인 모델 구성, 팀별 사용량 구분 요건을 함께 확인하면 어떤 통제 정책부터 적용하는 것이 적합한지 검토할 수 있습니다. AI 비용 가시성과 토큰 사용량 통제를 검토 중이시라면 문의해 주시기 바랍니다.
▶ Kong AI Gateway 자세히보기
[출처 : Kong, "AI Cost Governance Solution for FinOps", https://konghq.com/solutions/ai-cost-governance-finops, Mavvrik, Benchmarkit, "2026 State of AI Cost Governance Report", https://www.mavvrik.ai/state-of-ai-cost-governance-report/, Kong, "AI Cost Optimization Solutions", https://konghq.com/solutions/ai-cost-optimization-management, Kong, "Streamline AI Usage with Token Rate-Limiting & Tiered Access in Kong", https://konghq.com/blog/engineering/token-rate-limiting-and-tiered-access-for-ai-usage, Kong, "Secure, Scalable AI Gateway for AI Connectivity", https://konghq.com/products/kong-ai-gateway, Kong Docs, "AI Rate Limiting Advanced", https://developer.konghq.com/plugins/ai-rate-limiting-advanced/]