Skip to content
📊챗봇 분석

챗봇 분석

챗봇 분석은 AI 챗봇이 어떻게 작동하는지를 봇 처리율, 신뢰도, 만족도, 응답 시간 같은 수치로 측정하고, 그 수치를 근거로 다음에 무엇을 고칠지 정하는 일입니다.

챗봇 분석, 무엇인가요?

챗봇 분석은 AI 챗봇이 고객과 대화하며 만들어내는 데이터를 모으고 해석해서, 다음에 무엇을 바꿀지에 대한 결정으로 바꾸는 작업입니다. 수치는 크게 네 갈래로 나뉩니다. 볼륨은 봇이 얼마나 많은 일을 받아내고 있는지 말해 줍니다. 대화 수, 메시지 수, 순 방문자 수입니다. 품질은 얼마나 잘 답했는지 말해 줍니다. 신뢰도 점수, 시스템이 스스로 약하다고 표시한 답변의 비율, 그리고 대화마다 기록된 결과입니다. 경험은 반대편에서 어떻게 느껴졌는지 말해 줍니다. 평가, 감정, 응답 시간입니다. 비즈니스 영향은 나머지를 돈에 연결합니다. 사람 없이 처리된 문의 건수와, 그 문의가 원래대로라면 얼마나 들었을지입니다.

쓸모 있는 구분은 좋은 수치와 나쁜 수치 사이가 아니라, 카운터와 결정 사이에 있습니다. 전체 대화 수는 카운터입니다. 마케팅이 좋은 한 주를 보내면 올라가고, 봇에 대해서는 아무것도 말해 주지 않습니다. 반면 신뢰도 임계값 아래로 떨어진 답변의 비율은 결정입니다. 지식 베이스가 다루지 못하는 질문의 구체적인 목록을 가리키고, 그 하나하나는 누군가 오늘 오후에 쓸 수 있는 한 문단입니다. 카운터로 가득한 대시보드는 정보를 얻은 기분만 주고 아무것도 바꾸지 못합니다. 들일 만한 습관은 화면의 모든 그래프에 이렇게 묻는 것입니다. 이 숫자가 움직이면 나는 무엇을 다르게 하겠는가?

분석은 그대로 두면 일화로 흘러가는 논쟁도 끝냅니다. 동료가 전달한 화난 스크린샷 한 장은 봇이 고장 났다는 증거가 아니고, 만족한 고객 한 명은 봇이 잘 돌아간다는 증거가 아닙니다. 주제별로 묶고 결과로 채점한 한 달치 대화가 증거입니다. 진짜 변화는 여기에 있습니다. 챗봇을 운영하는 일이 의견의 문제이기를 멈추고, 측정 가능한 방식으로 틀리고 그다음 고칠 수 있는 일이 됩니다.

챗봇 분석 작동 방식

측정은 메시지 단위에서 시작합니다. 봇이 답할 때마다 시스템은 질문, 실제로 내놓은 답변, 지식 베이스가 그 질문을 정말 다루고 있었는지에 대한 검색 단계의 확신도, 사용한 문단, 그리고 답변에 걸린 시간을 기록합니다. 여기서 중심을 잡는 신호는 신뢰도입니다. 고객이 반응하기 전에 만들어지기 때문입니다. 아무도 불평하지 않아도 나쁜 답변을 잡아내며, 실제로는 대부분의 경우 아무도 불평하지 않습니다.

대화는 그 고리를 닫습니다. 세션이 끝나면 플랫폼은 메시지들을 하나의 기록으로 접습니다. 몇 번을 주고받았는지, 얼마나 이어졌는지, 사람이 투입되었는지, 무엇에 관한 대화였는지, 고객의 어조는 어땠는지, 평가가 있었다면 몇 점이었는지까지입니다. 대부분의 리포팅은 이 단위를 써야 합니다. 고객은 메시지를 경험하지 않기 때문입니다. 고객이 경험하는 것은 답을 얻었는가, 얻지 못했는가입니다.

집계는 그 기록들을 에이전트별 하루 한 줄로 바꿉니다. 메시지 수, 순 방문자 수, 평균 응답 시간, 평균 만족도, 평균 신뢰도, 상담사 연결 건수입니다. 12개월치 추이를 싸게 조회할 수 있는 이유가 여기에 있습니다. 이 층에는 함정이 둘 있습니다. 작은 수는 거짓말을 합니다. 대화 열두 건에 대한 봇 처리율 40%는 발견이 아니라 동전 던지기입니다. 그러니 어떤 비율이든 반응하기 전에 분모를 확인하십시오. 그리고 평균은 정작 찾고 있는 것을 가립니다. 평균 신뢰도 0.72는 꾸준히 무난한 봇일 수도 있고, 아홉 개 주제에서는 훌륭하고 열 번째에서는 쓸모없는 봇일 수도 있습니다. 대신 분포를 보십시오. 할 일이 있는 곳은 그 열 번째 주제입니다.

추적해야 할 지표

각 수치가 무엇을 측정하는지, 어떻게 계산하는지, 어느 범위를 기대할 수 있는지, 그리고 수치가 흔들릴 때 가장 먼저 확인할 곳을 정리했습니다. 범위는 목표가 아니라 출발점으로 보세요. 유입 구성과 지식 베이스가 실제 질문을 얼마나 담고 있는지에 따라 달라집니다.

  1. 대화 수

    기간 중 봇이 처리한 개별 세션의 수입니다. 아래 모든 비율의 분모이지, 그 자체가 성과는 아닙니다.

    계산 방법
    기간 중 시작된 대화의 건수.
    건강한 범위
    트래픽이 주는 만큼입니다. 기간 중 30건 정도를 밑돈다면 모든 백분율을 방향을 보는 참고 정도로만 읽으십시오.
    흔들릴 때
    위젯 설치 후에도 0에 가깝다면 대개 수요가 아니라 위치 문제입니다. 사람들이 실제로 도착하는 페이지에서 위젯이 로드되는지, 첫 메시지를 유도하는 장치가 있는지 확인하십시오.
  2. 봇 처리율

    사람이 개입하지 않고 끝난 대화의 비율이며, 영어로는 containment라고 합니다. 위로 보고할 숫자는 이것입니다. 업무량에 그대로 대응하기 때문입니다.

    계산 방법
    대화 수에서 상담사에게 연결된 대화 수를 빼고, 대화 수로 나눕니다.
    건강한 범위
    지식 베이스가 담당 주제를 덮고 있는 지원 봇 기준으로 대략 55%에서 80% 사이입니다. 새로 도입한 경우 40% 안팎에서 시작해 빈틈이 메워질수록 올라가는 일이 흔합니다.
    흔들릴 때
    50% 아래라면 그래프가 아니라 상담사에게 연결된 대화를 읽으십시오. 반드시 뭉쳐서 나타나며, 대개 봇에게 한 번도 준 적 없는 두세 개 주제입니다.
  3. 상담사 연결률

    사람에게 넘어간 대화의 비율입니다. 봇 처리율의 반대편이지만 따로 볼 가치가 있습니다. 팀이 실제로 체감하는 숫자가 이것이기 때문입니다.

    계산 방법
    연결된 대화 수를 전체 대화 수로 나눕니다.
    건강한 범위
    대략 20%에서 45% 사이입니다. 0에 가까운 값은 성과가 아니라 경고입니다. 대개 사람에게 닿는 길이 너무 찾기 어렵다는 뜻입니다.
    흔들릴 때
    갑작스러운 상승은 거의 언제나 낡은 콘텐츠입니다. 가격 변경, 갱신된 정책, 또는 봇이 한 번도 들어본 적 없는 신제품입니다.
  4. 평균 답변 신뢰도

    들어온 질문을 지식 베이스가 얼마나 덮고 있었는지를, 고객이 반응하기 전에 시스템이 매긴 점수입니다.

    계산 방법
    기간 중 답변별 신뢰도 점수의 평균, 0에서 1 사이 척도.
    건강한 범위
    대략 0.65에서 0.85 사이입니다. 0.5 아래라면 잘 만들어진 시스템은 추측하는 대신 답변을 보류해야 합니다.
    흔들릴 때
    완만한 하락은 콘텐츠가 아니라 질문이 옮겨갔다는 신호인 경우가 많습니다. 사람들이 새로운 것을 묻기 시작한 것이니 최근 낮은 점수의 답변을 읽으십시오.
  5. 지식 공백 비율

    시스템이 스스로 제대로 다루지 못했다고 표시한 답변의 비율입니다. 이 페이지에서 가장 바로 행동으로 옮길 수 있는 숫자입니다.

    계산 방법
    낮은 신뢰도 임계값 아래의 답변을 전체 답변으로 나눕니다.
    건강한 범위
    대략 15% 미만입니다. 5% 아래라면 성숙한 지식 베이스입니다.
    흔들릴 때
    비율이 아니라 목록을 고치십시오. 신뢰도가 낮은 답변에는 그것을 유발한 고객의 질문이 함께 붙어 있습니다. 질문은 반복되므로 몇 문단을 새로 쓰는 것만으로 숫자 전체가 움직이는 것이 보통입니다.
  6. 고객 만족도(CSAT)

    물었을 때 고객이 그 대화에 대해 남긴 평가이며, 보통 1점에서 5점 척도입니다.

    계산 방법
    평가가 남은 대화에 대해, 매겨진 점수의 평균.
    건강한 범위
    5점 만점에 4점 안팎입니다. 전체 대화의 5%에서 15% 정도만 평가가 남는다고 보십시오. 이는 계측 오류가 아니라 정상입니다.
    흔들릴 때
    별 하나짜리 대화는 처음부터 끝까지 읽으십시오. 낮은 평가의 원인이 답이 틀렸기 때문인 경우는 드뭅니다. 대개는 봇이 확신에 차서 틀렸거나, 사람에게 넘기는 것이 너무 늦었기 때문입니다.
  7. 감정 분포

    대화 전체가 긍정, 중립, 부정 중 어느 쪽으로 읽히는지의 비율입니다.

    계산 방법
    각 감정 분류의 대화 수를 전체 대화 수로 나눕니다.
    건강한 범위
    부정이 대략 15% 미만입니다. 건강한 지원 트래픽은 대부분 중립이며 그것으로 충분합니다. 사람들은 기분이 아니라 용건을 들고 오기 때문입니다.
    흔들릴 때
    부정의 급증은 추세가 아니라 주제입니다. 그 주의 부정 대화만 걸러내면 원인은 대개 망가진 한 가지로 좁혀집니다.
  8. 응답 시간

    고객이 답을 기다린 시간입니다.

    계산 방법
    고객 메시지부터 완성된 답변까지의 평균 시간.
    건강한 범위
    답변이 흘러나오는 방식이라면 첫 글자가 2초 안팎에, 전체 답변은 10초 안에 나와야 합니다. 그보다 길어지면 사람들은 떠납니다.
    흔들릴 때
    갑작스러운 지연은 거의 모델 탓이 아닙니다. 검색 단계가 얼마나 많은 양을 끌어오는지, 경로에 외부 도구 호출이 끼어 있지 않은지 확인하십시오.
  9. 대화당 메시지 수

    어딘가에 도달하기까지 몇 번을 주고받았는지입니다. 답변이 한 번에 꽂히는지를 보는 간접 지표입니다.

    계산 방법
    전체 메시지 수를 대화 수로 나눕니다.
    건강한 범위
    대략 3에서 6 사이입니다. 계속 8을 넘는다면 대개 봇이 거의 답하고 있지만 끝까지는 닿지 못하고 있다는 뜻입니다.
    흔들릴 때
    긴 대화 몇 개를 읽어 보십시오. 패턴은 보통 가격, 기한, 지원 국가처럼 빠진 정보 하나이며, 고객은 그 주변을 계속 맴돕니다.
  10. 품질 점수

    대화마다 하나로 합쳐진 숫자입니다. 그래프 열 개를 읽지 않고도 한 기간을 다른 기간과 비교할 수 있습니다.

    계산 방법
    평가, 사람의 개입 여부, 기록된 결과, 감정, 길이를 가중 결합해 0에서 1 사이로 정규화한 값.
    건강한 범위
    평균적으로 대략 0.6에서 0.8 사이입니다. 추이를 보는 데, 그리고 다시 읽을 대화를 정렬하는 데 쓰십시오. 달성해야 할 목표치가 아닙니다.
    흔들릴 때
    하락은 단서로 받아들이고 나서 구성 요소를 여십시오. 합성된 숫자는 무언가 달라졌다는 것만 알려 줍니다. 무엇이 달라졌는지는 절대 알려 주지 않습니다.

챗봇 분석의 중요성

측정 없이 챗봇을 개선하는 일은 직관이라는 이름을 빌린 어림짐작입니다. 측정이 있으면 순환은 짧고, 좋은 의미로 지루합니다. 신뢰도가 낮은 주제를 찾고, 빠진 콘텐츠를 쓰고, 다음 주에 그 비율이 내려가는 것을 확인하면 됩니다. 사람들이 형편없다고 말하는 봇 대부분은 잘못 만들어진 것이 아니라 한 번도 검토되지 않은 것입니다. 봇이 답하지 못한 질문을 아무도 읽지 않았고, 그래서 같은 구멍이 1년 동안 그 자리에 있었을 뿐입니다.

측정은 또한 챗봇이 비용 항목에서 벗어나 근거를 댈 수 있는 절감으로 바뀌는 길이기도 합니다. 계산은 종이 한 장이면 됩니다. 한 달 동안 봇이 사람 없이 처리한 대화 수를 가져와, 사람이 처리하는 문의 한 건이 회사에 얼마인지, 즉 팀의 평균 처리 시간에 자사의 총원가 기준 시급을 곱한 값을 곱하고, 그 결과를 플랫폼 이용료와 나란히 놓으십시오. 봇 처리율 65%로 1,000건이면 팀이 한 번도 보지 않은 문의가 650건이라는 뜻입니다. 그것이 큰 금액인지 작은 금액인지는 전적으로 여러분 자신의 숫자에 달려 있고, 이 계산의 요점은 이제 그 숫자가 손에 있다는 사실 자체입니다.

이 페이지의 어떤 기준 범위보다 무거운 경고가 하나 있습니다. 봇 처리율이 높다는 것은 자동으로 좋은 소식이 아닙니다. 이 지표는 사람에게 닿지 않은 모든 대화를 셉니다. 포기하고 창을 닫은 고객도, 답을 얻은 고객과 정확히 같은 한 건으로 세어집니다. 봇 처리율을 결코 단독으로 읽으면 안 되는 이유가 여기에 있습니다. 만족도와 대화당 메시지 수 옆에 놓으면 두 경우는 즉시 갈라집니다. 해결된 대화는 짧고 평가가 좋으며, 이탈한 대화는 길게 늘어지고 평가가 아예 남지 않습니다.

Chatloom의 챗봇 분석 활용

Chatloom은 이 모든 것을 부가 기능이 아니라 기본값으로 기록합니다. 모든 답변은 신뢰도 점수와 그 근거가 된 문단을 함께 갖고, 모든 대화는 결과, 의도, 감정, 평가를 함께 갖습니다. 여기에 야간 집계가 에이전트별로 하루 한 줄을 유지합니다. 메시지 수, 순 방문자 수, 평균 응답 시간, 평균 만족도, 평균 신뢰도, 상담사 연결 건수입니다. 1년치 추이를 빠르게 조회할 수 있는 이유가 이 구조입니다.

분석 섹션은 이 수치를 에이전트별로도, 워크스페이스 전체로도 보여 주며, 어떤 숫자든 그 뒤의 대화가 한 번의 클릭 거리에 있습니다. 가장 먼저 열어 볼 만한 것은 낮은 신뢰도 목록입니다. 임계값 아래로 떨어진 답변을, 각각을 유발한 고객 질문과 함께 끌어올립니다. 그래서 “지식 베이스를 개선하세요”라는 막연한 조언이 앞으로 쓸 문단들의 구체적인 목록으로 바뀝니다. 대화는 합성 품질 점수로 정렬해 나쁜 것부터 빠르게 찾을 수 있고, 에이전트끼리 나란히 비교할 수 있으며, 누군가 스프레드시트로 보고 싶어 할 때를 위해 기간을 CSV, JSON, HTML 리포트로 내보낼 수 있습니다.

보관 기간은 나중에 덧붙인 것이 아니라 설계의 일부입니다. 대화 데이터는 에이전트에 설정된 기간, 기본값으로 30일 동안 보관되고, 그 뒤에는 야간 작업이 해당 대화와 메시지를 통째로 삭제합니다. 방문자 IP 주소는 원본이 아니라 해시로 저장합니다. 집계된 일별 데이터는 이 삭제 이후에도 남습니다. 바로 이것이 바람직한 구성입니다. 추이 선은 몇 년을 살아 있고, 그 뒤의 대화 기록은 남지 않습니다.

관련 용어

관련 개념을 함께 살펴보고 이해를 넓혀 보세요.

자주 묻는 질문

챗봇에서 가장 중요한 지표는 무엇인가요?
봇 처리율, 즉 사람 없이 끝난 대화의 비율입니다. 업무량과 비용에 그대로 대응하기 때문입니다. 다만 그것만 놓고 보면 아무 의미가 없습니다. 고객을 지치게 해서 떠나보낸 봇도, 질문에 답해 준 봇과 같은 수치를 받습니다. 만족도와 대화당 메시지 수 옆에 놓고 읽으면 두 경우는 곧바로 갈라집니다.
챗봇 해결률은 어느 정도면 좋은 편인가요?
지식 베이스가 담당 주제를 실제로 덮고 있는 지원 봇이라면 대화의 55%에서 80% 정도가 사람 없이 끝나는 것이 일반적인 범위입니다. 새로 도입한 경우 40%에 가깝게 시작해 빈틈이 메워질수록 올라가는 일이 흔합니다. 이 범위는 담당 범위에 따라 크게 움직입니다. 제품 하나에 대해 답하는 봇은 대형 유통사에 들어오는 모든 문의를 받는 봇보다 훨씬 높은 자리에 앉습니다.
봇 처리율과 해결률은 어떻게 다른가요?
봇 처리율은 이유를 불문하고 사람에게 닿지 않은 대화를 셉니다. 해결률은 고객이 원래 얻으려던 것을 실제로 얻은 대화를 셉니다. 해결된 대화는 모두 봇 처리에 포함되지만, 봇이 처리한 대화가 모두 해결된 것은 아닙니다. 그 차이를 메우고 있는 것은 중간에 포기한 사람들입니다. 봇 처리율은 재기 쉽고 잘못 읽기도 쉽습니다. 해결률이 정직한 숫자가 되려면 평가나 결과 라벨이 필요합니다.
챗봇의 ROI는 어떻게 측정하나요?
봇이 사람 없이 처리한 대화 수에 사람이 처리하는 문의 한 건의 비용을 곱하고, 플랫폼 이용료를 빼십시오. 건당 비용은 자사 팀에서 뽑습니다. 평균 처리 시간에 총원가 기준 시급을 곱한 값입니다. 영업용 봇에는 한 줄이 더 필요합니다. 예약이나 주문으로 이어진 대화이며, 이를 위해서는 챗봇을 따로 세는 대신 기존 전환 추적에 연결해야 합니다.
챗봇 분석이 의미를 가지려면 트래픽이 얼마나 필요한가요?
비율에는 분모가 필요합니다. 기간 중 대화가 30건 정도를 밑돈다면 모든 백분율을 힌트로만 여기고 대신 대화 자체를 읽으십시오. 그 정도 양이면 전부 읽을 수 있고, 어떤 그래프보다 많은 것을 알려 줍니다. 월 100건 안팎이 되면 주간 비율이 판단의 근거로 삼을 만큼 안정되기 시작합니다. 그 아래라면 건수를 지켜보면서 대화 기록을 읽는 편이 낫습니다.
분석으로 챗봇을 실제로 개선하려면 어떻게 하나요?
대시보드가 아니라 낮은 신뢰도 목록을 처리하십시오. 시스템이 제대로 다루지 못했다고 표시한 답변을 정렬하고, 그것을 만들어 낸 질문을 읽고, 질문이 반복된다는 사실을 확인하십시오. 목록의 대부분은 대개 몇 개 주제로 설명됩니다. 그 문단들을 지식 베이스에 쓰고, 일주일 뒤에 같은 비율을 확인하십시오. 그다음에는 상담사에게 연결된 대화로 같은 작업을 하십시오. 이쪽도 같은 방식으로 뭉쳐 있습니다.
챗봇 분석은 얼마나 자주 봐야 하나요?
출시 직후나 큰 콘텐츠 변경 직후 2주 동안은 매일 보십시오. 눈에 띄는 빈틈이 이때 드러나고, 메우는 비용도 쌉니다. 그 뒤에는 주 단위로 봇 처리율, 신뢰도, 낮은 신뢰도 목록의 상단을 봅니다. 월 단위로는 기간을 비교하며 다른 질문을 던지십시오. 사람들이 묻는 주제 자체가 옮겨가지 않았는지입니다. 옮겨갔다면 대개 사업이 바뀌었는데 콘텐츠가 따라가지 않았다는 신호입니다.
챗봇 분석은 개인정보보호법이나 GDPR과 함께 갈 수 있나요?
갈 수 있고, 차이를 만드는 것은 설계 결정입니다. 대화 데이터를 영구 보관하지 말고 정해진 기간 동안만 보관한 뒤 예정대로 삭제하고, 방문자 식별자는 원본이 아니라 해시로 저장하며, 집계된 일별 수치는 남기십시오. 대화 기록이 사라진 뒤의 이 집계값은 더 이상 개인정보가 아니므로 삭제 이후에도 리포팅이 살아남습니다. 그리고 무엇이 저장되는지 방문자에게 알리십시오. EU에서는 이것이 동의의 문제이며, AI와 대화 중이라는 사실을 알리는 의무와는 별개입니다. Chatloom은 기본값으로 30일 보관 기간과 야간 삭제 작업을 사용하고, 방문자 IP를 해시 처리하며, 집계 데이터는 유지합니다.

관련 리소스

챗봇 유지보수를 멈추세요. AI 에이전트를 출시하세요.

첫 번째 에이전트를

한 시간 이내에 구축.

템플릿을 선택하고, 콘텐츠를 연결하고, 모든 채널에 배포하세요. 무료 플랜은 언제든 준비되어 있습니다.

평생 무료 플랜
신용카드 불필요
한 시간 이내에 프로덕션 준비