답변 관측
GEO 성과를 측정할 때 버려야 할 허영 지표 5가지
대시보드 보는 일은 재미있지만 시간을 빼앗을 수도 있습니다
GEO 성과 회의에서 버릴 허영 지표는 한 번 찍힌 순위, 정확도를 구분하지 않은 언급률, 쓰인 내용을 모르는 인용률, 방문 뒤 행동을 뺀 AI 유입 수와 계산법을 모르는 종합 점수입니다. 숫자를 삭제하라는 뜻이 아니라, 그 숫자 하나만 성과로 보고하거나 회의 안건으로 삼지 말라는 뜻입니다.
GEO 업체의 대시보드에 들어가면 이번 주 AI 답변 노출 횟수, 평균 순위, 질문별 순위와 인용률이 한눈에 보입니다. 지난주보다 숫자가 오르고 경쟁사보다 앞선 화면을 보는 일은 분명 재미있습니다. 하지만 회의에서 이 숫자를 하나씩 읽고 있으면 정작 무엇을 고칠지 결정할 시간이 줄어듭니다.
GEO 측정은 대시보드를 열기 전에 시작합니다. 먼저 우리 사업에 중요한 고객 질문을 고르고, 같은 질문을 계속 측정해야 합니다. 질문 하나를 단순한 조회 항목이 아니라 앞으로 달성할 운영 목표로 두는 것입니다.
예를 들어 “서울에서 토요일 저녁에도 진료하는 정형외과를 알려줘”를 목표 질문으로 정했다면, 병원 이름이 한 번 나오는 것으로 끝내지 않습니다. AI가 우리 병원을 실제 후보로 제시하고, 토요일 진료시간을 정확히 설명하며, 그 정보를 확인할 공식 페이지를 출처로 제시하고, 사용자가 예약 페이지까지 이동하는 상태를 목표로 삼습니다. 매주 같은 질문을 확인하면 어느 단계가 좋아졌고 어디에서 막혔는지 볼 수 있습니다.
이제 각 숫자 대신 무엇을 분석해야 하는지 하나씩 살펴보겠습니다.
허영 지표 1. 한 번 찍힌 최고 순위
첫 번째로 회의에서 버릴 숫자는 한 번 찍힌 최고 순위입니다. “이번 주 ChatGPT 2위”라는 숫자는 대시보드에서 현재 상태를 빠르게 확인할 때는 쓸 수 있습니다. 하지만 그 숫자만으로는 다음 작업을 정할 수 없습니다. 어떤 질문에서 나온 순위인지, 같은 질문을 다시 물어도 유지되는지, 추천 이유가 맞는지 모르기 때문입니다.
순위를 회의에 가져가려면 먼저 실제 고객이 구매나 예약 전에 묻는 질문별로 나눕니다. 같은 질문을 같은 언어와 지역 조건에서 여러 번 실행하고, 답변 전체와 출처를 저장합니다. 병원 이름이 2위로 나왔더라도 토요일 진료시간을 틀리게 말했다면 ‘2위’가 아니라 ‘잘못된 추천’으로 분류합니다.
| 대시보드에서 보이는 숫자 | 회의 전에 끝낼 분석 |
|---|---|
| 오늘 2위 | 같은 질문을 반복했을 때 정확한 추천·잘못된 추천·미언급이 각각 몇 번인지 나눕니다. |
| 경쟁사보다 한 단계 상승 | 순서만 바뀌었는지, 우리 추천 이유와 조건도 함께 좋아졌는지 확인합니다. |
| 이번 주 최고 순위 화면 | 좋지 않았던 답변까지 포함해 지난주와 같은 조건으로 비교합니다. |
회의에는 “2위가 됐습니다”가 아니라 “야간 진료 질문 20개 중 정확한 추천이 6개에서 11개로 늘었지만, 4개 답변은 아직 접수 마감 시간을 틀리게 말합니다”라는 분석을 가져갑니다. 그러면 회의에서 순위를 감상하는 대신 접수 마감 정보가 적힌 페이지를 누가 언제 고칠지 결정할 수 있습니다.
허영 지표 2. 정확한 추천과 오류를 합친 언급률
두 번째로 버릴 숫자는 정확한 추천과 잘못된 언급을 한데 더한 언급률입니다. 언급률 45%는 질문 100개 가운데 브랜드 이름이 45번 나왔다는 뜻일 수 있습니다. 그러나 그 45개에는 질문에 브랜드명이 이미 들어간 답변, 긴 목록 끝에 이름만 붙은 답변과 제공하지 않는 서비스를 제공한다고 쓴 답변이 함께 섞일 수 있습니다.
회의 전에 45개 답변을 정확한 추천, 불완전한 언급과 잘못된 언급으로 나눕니다. 질문의 조건에 맞고 가격·시간·대상이 공식 정보와 같으면 정확한 추천입니다. 후보로는 맞지만 고객의 결정에 필요한 조건이 빠졌다면 불완전한 언급이고, 공식 정보와 다르거나 질문에 맞지 않으면 잘못된 언급입니다.
- 정확한 추천이 늘었다면 어떤 질문과 페이지가 변화를 만들었는지 찾습니다.
- 불완전한 언급이 많다면 답변에서 반복해서 빠지는 가격·대상·제한을 공식 페이지에 보강합니다.
- 잘못된 언급이 많다면 더 많이 노출시키기 전에 틀린 설명이 나온 출처부터 바로잡습니다.
언급률은 위 세 결과를 합친 숫자이므로 보고서의 첫 화면에는 둘 수 있습니다. 회의 안건은 그 숫자 아래에서 반복된 문제여야 합니다. “언급률이 10% 올랐다”보다 “가격은 맞아졌지만 지원하지 않는 기능을 말한 답변이 7개 남았다”가 다음 액션을 더 분명하게 만듭니다.
허영 지표 3. 어떤 내용이 쓰였는지 모르는 인용률
세 번째로 버릴 숫자는 어떤 내용이 답변에 쓰였는지 보여 주지 않는 인용률입니다. 인용률이 지난주보다 올랐다는 알림은 기분 좋은 결과입니다. 그러나 회의에서 “이번 주 인용률이 8% 올랐습니다”라고 보고하고 끝내면 다음 주에 더 올릴 방법은 알 수 없습니다. 어떤 질문에서 어떤 사이트가 선택됐고, 그 페이지의 어느 내용이 답변에 쓰였는지를 봐야 합니다.
회의 전에는 우리 페이지뿐 아니라 같은 질문에서 인용된 경쟁사·공공기관·언론·전문 자료를 함께 엽니다. 답이 제목 바로 아래에 있었는지, 구체적인 수치와 확인일이 있었는지, 공식 원본을 출처로 제시했는지, 질문의 조건을 그대로 설명했는지 기록합니다. 우리 페이지가 인용되지 않았다면 선택된 페이지와 무엇이 다른지 나란히 비교합니다.
| 인용 분석에서 남길 내용 | 얻을 수 있는 액션 |
|---|---|
| 어떤 질문에서 선택됐는가 | 우리에게 중요한 질문에서 쓰인 출처만 우선 분석합니다. |
| 답변의 어떤 문장을 뒷받침했는가 | 이름만 인용된 것과 핵심 가격·기능을 설명한 인용을 나눕니다. |
| 인용된 페이지에 반복되는 내용은 무엇인가 | 수치, 기준일, 비교 조건과 공식 근거 중 우리 페이지에 빠진 것을 찾습니다. |
| 우리 페이지와 무엇이 다른가 | 새 글을 만들지, 기존 페이지의 답과 근거를 보강할지 정합니다. |
예를 들어 토요일 진료 질문에서 인용된 병원 페이지들은 모두 제목 아래에 진료시간과 접수 마감 시간을 글자로 적었는데, 우리 사이트는 포스터 이미지에만 넣었다고 해보겠습니다. 이 경우 회의에 가져갈 내용은 인용률 그래프가 아닙니다. 공식 페이지 본문에 진료시간과 접수 마감 시간을 추가하고 다음 측정에서 같은 질문의 출처가 바뀌는지 확인하자는 제안입니다.
생성형 검색의 인용을 분석한 연구도 출처가 선택된 것과 그 출처의 내용이 실제 답변에 쓰인 것을 나누어 측정합니다. 인용 건수는 시작점이고, 선택된 페이지의 특징과 답변에 쓰인 근거를 찾는 일이 분석입니다.
허영 지표 4. 방문 뒤 행동을 뺀 AI 유입 수
네 번째로 버릴 숫자는 방문 뒤 행동을 보여 주지 않는 AI 유입 수입니다. 대시보드에 ‘AI 서비스에서 온 방문 300회’가 찍혔다면 먼저 그 방문이 어떤 질문과 답변에서 시작됐는지 확인합니다. 방문자가 가격을 확인했는지, 예약 조건을 읽었는지, 문의를 남겼는지 모르면 300이라는 숫자로는 어느 페이지를 고칠지 결정할 수 없습니다.
회의 전에는 AI 서비스에서 들어온 방문을 질문과 랜딩 페이지별로 나눕니다. 그다음 가격·비교·예약 페이지로 이동한 비율과 문의 완료율을 함께 봅니다. 문의 폼에서 “처음 어디에서 알게 되었나요?”라고 물으면 AI에서 이름을 본 뒤 회사명을 다시 검색해 들어온 고객도 일부 확인할 수 있습니다.
| 분석에서 발견한 상황 | 회의에서 제안할 액션 |
|---|---|
| 방문은 늘었지만 가격 페이지로 가지 않음 | AI 답변의 질문과 첫 화면의 내용이 맞는지 확인합니다. |
| 가격 페이지까지 보지만 문의하지 않음 | 대상, 비용, 절차와 문의 방법이 충분히 설명됐는지 봅니다. |
| 문의는 늘었지만 맞지 않는 고객이 많음 | AI 답변과 랜딩 페이지에 제외 조건을 더 분명히 씁니다. |
| 정확한 문의와 계약이 함께 늘어남 | 같은 유형의 고객 질문으로 측정과 콘텐츠를 넓힙니다. |
회의에서는 방문자 수를 다시 읽을 필요가 없습니다. “비교 질문에서 들어온 방문자는 늘었지만 가격 조건을 본 뒤 대부분 나가므로, 가격 적용 대상과 상담 절차를 첫 화면에 추가하자”처럼 행동의 원인과 수정안을 논의해야 합니다.
허영 지표 5. 계산법을 알 수 없는 종합 점수
다섯 번째로 버릴 숫자는 계산법을 알 수 없는 종합 점수입니다. 종합 72점은 여러 결과를 한눈에 보는 데에는 편합니다. 하지만 언급이 늘어서 72점인지, 설명 오류가 줄어서 72점인지, 구매에 가까운 질문이 좋아져서 72점인지 모르면 누구에게 어떤 작업을 맡길지 정할 수 없습니다.
회의 전에 72점을 만든 원래 숫자와 질문 목록을 펼칩니다. 업체가 각 항목에 어떤 비중을 줬는지, 답이 나오지 않은 실행을 어떻게 처리했는지와 브랜드명을 넣은 질문이 얼마나 섞였는지도 확인합니다. 계산법을 알 수 없다면 종합 점수는 상태를 보는 화면으로만 쓰고 예산이나 재계약의 근거에서는 뺍니다.
| 72점 아래에서 꺼낼 숫자 | 회의에서 결정할 수 있는 일 |
|---|---|
| 목표 질문 20개 중 정확한 추천 8개 | 정확하지 않았던 12개 질문 가운데 먼저 고칠 영역을 고릅니다. |
| 잘못된 설명 5개 | 가격·운영시간·지원 범위가 틀린 공식 페이지와 외부 출처를 찾습니다. |
| 실제 답변에 쓰인 인용 12개 | 어떤 주장과 페이지가 반복해서 선택됐는지 분석합니다. |
| AI 방문 300회, 대상 고객 문의 6건 | 방문 뒤의 설명과 문의 흐름을 고칠지 판단합니다. |
| 같은 질문 3회 중 정확한 추천 2회 | 다음 측정에서 반복 여부를 확인할 질문으로 남깁니다. |
같은 72점도 업체마다 계산 방식이 다를 수 있습니다. GEO 연구를 검토한 논문에서도 연구와 도구마다 가시성을 계산하는 방식이 다르다고 설명합니다. 점수 이름이 아니라 원래 질문, 답변과 고객 행동을 펼쳐야 지난달과 이번 달을 같은 기준으로 비교할 수 있습니다.
회의에는 숫자가 아니라 액션 후보를 가져갑니다
질문별 순위와 답변 원문을 회의실에서 처음부터 하나씩 읽지 않습니다. 회의 전에 담당자가 목표 질문의 답변을 모두 보고, 반복된 변화와 문제를 묶어야 합니다. 인용된 사이트의 공통점, 우리 설명이 틀린 질문, 방문 뒤 고객이 멈춘 지점과 다음에 바꿀 페이지 후보까지 정리해 둡니다.
| 회의 전에 끝낼 일 | 회의에서 결정할 일 |
|---|---|
| 목표 질문별 답변과 출처 원문 확인 | 이번 주에 해결할 질문을 고릅니다. |
| 지난 측정과 달라진 답변 분류 | 변화가 의미 있는지 팀의 의견을 모읍니다. |
| 인용된 사이트와 페이지의 공통점 분석 | 우리 페이지에 어떤 답과 근거를 추가할지 정합니다. |
| 방문·문의·계약까지 이어진 질문 확인 | 계속 투자할 질문과 멈출 질문을 정합니다. |
| 수정안과 근거 준비 | 담당자, 완료일과 다시 측정할 날짜를 확정합니다. |
예를 들어 “토요일 저녁 진료” 질문에서 정확한 추천은 늘었지만 접수 마감 시간이 계속 틀리고, 경쟁 병원은 시간과 마감 시간을 본문 첫 문단에 함께 적고 있다는 분석을 준비했다고 해보겠습니다. 회의에서는 답변 20개를 다시 읽지 않습니다. 우리 진료 안내 첫 문단을 누가 언제 수정하고, 다음 주 같은 질문을 몇 번 다시 측정할지만 결정합니다.
GEO 업체를 고를 때도 숫자를 많이 보여 주는 곳보다 분석에 필요한 자료를 제공하는지 봐야 합니다. 질문과 답변 원문, 답변에 실제로 쓰인 출처, 인용된 사이트의 공통점, 지난주와 달라진 설명과 액션 후보를 함께 제공한다면 회의 준비 시간을 줄일 수 있습니다.
단순히 “이번 주 인용률이 올랐습니다”라고 확인하는 데서 멈추지 마십시오. 왜 올랐는지, 더 올리려면 어떤 정보가 필요한지, 어떤 질문에서는 오히려 설명이 나빠졌는지를 계속 탐구해야 합니다. 대시보드는 결과를 구경하는 곳이 아니라, 다음에 알아볼 질문과 실행할 일을 더 빨리 찾게 해 주는 도구여야 합니다.