생성형 엔진 최적화(GEO)는 챗GPT, 퍼플렉시티, 구글 AI 개요 같은 AI 답변 엔진이 콘텐츠를 검색하고 종합해 답변 안에 인용하도록 글을 쓰고 구조화하는 작업이다. 프린스턴 대학교 등 공동 연구진은 1만 개 쿼리로 구성된 벤치마크에서 아홉 가지 콘텐츠 수정안을 실험해 최대 40%의 가시성 상승을 확인했다(Aggarwal 외, KDD 2024). 이 글은 그 실험이 측정한 효과를 기준으로 아홉 가지 전략의 순위를 매기고, 기준선보다 오히려 낮은 점수를 받은 전략 하나를 짚는다.
GEO를 다루는 글 대부분은 정의에서 멈춘다. 정의만으로는 마케팅팀이 실행할 수 있는 것이 없다. 실제로 실행 가능한 것은 효과가 검증된 수정안의 순위이고, 이 연구가 만들어낸 결과물이 바로 그것이다.
GEO가 최적화하는 대상
전통적인 검색 최적화는 링크 목록 안에서 위치를 다툰다. 생성형 엔진은 다른 방식으로 작동한다. 후보가 될 만한 문단 몇 개를 검색한 뒤 이를 종합해 답변을 작성하고, 근거로 삼은 출처에 인용을 붙인다. 성공의 단위가 순위에서 포함 여부로 바뀐다. 페이지가 모델이 그대로 옮겨 적고 출처를 밝히고 싶어할 문장을 제공하거나, 아니면 답변에 아예 등장하지 않는다.
이 관점의 전환이 GEO라는 분야 전체를 설명한다. Aggarwal과 동료 연구진은 2024년 '생성형 엔진'이라는 용어를 정식화하고, 여러 도메인과 출처 유형을 아우르는 1만 개 쿼리 벤치마크 GEO-bench를 구축해 웹사이트 콘텐츠를 의도적으로 수정하면 인용에 포함될 수 있는지 검증했다(프린스턴 대학교). 최대 40% 가시성 상승이라는 헤드라인 수치는 평균이 아니라 유리한 조건에서의 최댓값이며, 원래 순위가 낮았던 출처일수록 상승 폭이 더 컸다(Blck Alpaca).
이 흐름을 신경 써야 하는 상업적 이유는 더 이상 추측이 아니다. Similarweb은 2025년 6월 한 달 동안 AI 플랫폼이 상위 1,000개 웹사이트에 11억 3,000만 건 이상의 추천 방문을 발생시켰고, 이는 전년 대비 357% 증가한 수치라고 집계했다. 같은 기간 구글 검색의 추천 방문은 1,910억 건이었다(TechCrunch). 채널 자체는 아직 작지만 성장 곡선은 가파르다.
아홉 가지 전략을 줄 세운 기준
순위를 매기기 전에 기준부터 밝힌다.
- 원 실험에서 측정된 효과. 논문이 보고하는 지표는 위치가중 단어수(Position-Adjusted Word Count)와 주관적 인상 두 가지이며, 두 지표에 동일한 가중치를 두었다.
- 도메인 전반의 일관성. 기술 관련 쿼리에서는 이기고 소비자 쿼리에서는 지는 전략은, 모든 영역에서 고르게 통하는 전략보다 아래에 둔다.
- 작성자의 운에 좌우되지 않는 정도. 실제 통계를 추가하는 것은 매주 반복 가능한 편집 지침이다. "더 권위 있게 들리도록 쓴다"는 그렇지 않다.
- 일반적인 주간 발행 주기 안에서 실행하는 데 드는 비용.
순위에 앞서 밝혀둘 것이 하나 있다. 논문은 가장 강력한 세 가지 방법이 위치가중 단어수 기준으로 기준선 대비 약 30~40%의 상대적 개선을 만들어냈다고 보고한다(Aggarwal 외, 2024). 다만 같은 논문을 다룬 2차 자료들은 전략별 수치를 서로 다르게 인용하고, 그 수치들끼리도 일치하지 않는다. 널리 인용되지만 자료마다 다른 개별 수치는 소수점까지 확정하는 대신 범위와 출처를 함께 제시한다.
1위: 신뢰할 수 있는 출처 인용
가장 강하고 가장 일관된 효과를 보인 전략이다. 자신의 페이지에 신뢰할 수 있는 출처의 인용을 추가하면 생성형 엔진이 해당 문단을 답변에 포함하고 출처를 밝힐 확률이 높아지며, 다른 전략과 결합할 때 효과가 커진다(Aggarwal 외, 2024).
모델이 무엇을 최적화하는지 받아들이면 이 원리는 단순해진다. 종합된 답변은 엔진 입장에서 평판 위험을 안고 있으므로, 이미 검증 가능한 출처를 가진 문단일수록 그대로 반복하기 쉽다. 웬만한 주요 주장에는 모두 출처를 붙인다고 생각하면 된다(Elementera).
2위: 신뢰할 수 있는 출처의 인용문 추가
상위 세 전략 중 두 번째다. 실존하는 출처의 발언을 그대로 직접 인용하면 위치가중 단어수 기준 30~40% 구간의 효과가 나타나며, 이는 1위 전략과 같은 구간이다(Aggarwal 외, 2024).
인용문은 그 자체로 추출하기 좋은 단위다. 발언자, 문장의 경계, 암묵적인 보증이 모두 갖춰져 있기 때문이다. 실무 원칙은 하나다. 실제로 그 표현이 등장하는 URL로 추적할 수 있는 발언만 인용한다. 지어낸 인용문은 독자와 엔진 모두에게 그 페이지를 못 쓰게 만드는 가장 빠른 길이다.
3위: 관련 통계 추가
세 번째 상위 전략이자 시스템화하기 가장 쉬운 전략이다. 정성적인 서술을 구체적인 숫자로 바꾸면 일관된 효과가 나타났다. "많은 기업이 이 문제로 어려움을 겪는다"는 검색 시 재사용될 가치가 거의 없지만, 연도와 정확한 수치가 붙은 특정 연구는 다르다(Elementera).
4위: 문장 유창성 다듬기
데이터에서 나온 뜻밖의 결과다. 새로운 정보를 전혀 추가하지 않고 기존 문장의 가독성과 흐름만 다듬었는데도 실험에서 유의미한 가시성 상승이 나타났다(Aggarwal 외, 2024). 명료한 문장은 언어 모델이 파싱하고 문단을 구분해 정확하게 귀속시키기 쉽다. 반면 밀도가 높거나 뒤엉킨 문장은 사실관계가 탄탄해도 불리하게 작용한다.
또한 이 목록에서 가장 비용이 적게 드는 전략이기도 하다. 이미 갖고 있는 텍스트를 다듬는 일이기 때문이다.
5위: 쉬운 표현으로 바꾸기
유창성 개선과 밀접하게 연관되며 별도로 측정됐다. 단순화한 표현은 좋은 성과를 냈고, 영역별로 뚜렷한 편차가 나타났다. 소비자·일반 관심 주제는 쉬운 표현과 인용문에서 더 큰 효과를 얻었고, 기술 주제는 통계와 출처 인용에서 더 큰 효과를 얻었다(프린스턴 대학교).
6위: 권위 있는 어조
권위 있는 어조는 연구진이 실험한 아홉 가지 전략 중 하나이지만, 논문이 별도로 강조하는 상위 세 전략에는 들지 않는다(Aggarwal 외, 2024). 이 부분은 편집 의견으로 밝혀둔다. 어조는 엔진이 실제로 보상하는 요소인 추적 가능성의 약한 대리 지표에 가깝다. 이미 출처가 잘 갖춰진 초안에 마지막으로 손보는 작업 정도로 다루는 편이 적절하다.
7위: 전문 용어 사용
논문 자체의 결론은 이런 전략들의 효과가 도메인마다 달라진다는 것이며, 그래서 하나의 만능 공식이 아니라 도메인별 최적화가 필요하다고 주장한다(프린스턴 대학교). 전문 어휘는 독자가 그 용어를 찾아온 전문 분야 쿼리에서 제 역할을 하지만, 일반적인 쿼리에서는 얻는 것이 적다.
8위: 고유 어휘 사용
어휘 다양성도 실험 대상에 포함된 아홉 가지 전략 중 하나이며, 논문의 강력한 결과는 다른 전략에 몰려 있다(Aggarwal 외, 2024). 이 전략은 동점을 가릴 때만 참고할 정도로 우선순위가 낮으며, 주간 발행 일정의 자리를 여기에 쓸 필요는 없다.
9위: 키워드 남용, 기준선보다 낮은 유일한 전략
기준선보다 낮은 점수를 받은 유일한 전략이다. 특정 쿼리 표현을 반복해 페이지에 채워 넣는 방식은 위치가중 단어수 기준으로 수정하지 않은 기준선보다 약 8% 낮은 결과를 냈다는 상세 분석이 있고(Elementera), 같은 방향의 결과가 다른 자료에서도 보고됐다(Blck Alpaca).
기존 SEO 플레이북을 그대로 AI 답변 엔진에 적용하면 노력이 낭비되는 정도가 아니라 가시성 자체가 깎일 수 있다.
| 순위 | 전략 | 보고된 효과 | 가장 잘 맞는 영역 |
|---|---|---|---|
| 1 | 신뢰할 수 있는 출처 인용 | 상위권, PAWC 기준 30~40% 상대적 상승 | 전 영역 |
| 2 | 인용문 추가 | 상위권, 30~40% 상대적 상승 | 소비자·의견·뉴스 |
| 3 | 통계 추가 | 상위권, 30~40% 상대적 상승 | 기술·B2B·리서치 |
| 4 | 문장 유창성 다듬기 | 유의미, 새 콘텐츠 불필요 | 전 영역 |
| 5 | 쉬운 표현 | 유의미, 소비자 영역에 유리 | 소비자·설명형 콘텐츠 |
| 6 | 권위 있는 어조 | 상위 3개 전략 밖, 편집 의견 | 마무리 작업 |
| 7 | 전문 용어 | 도메인 의존적, 편집 의견 | 전문 분야 쿼리 |
| 8 | 고유 어휘 | 상위권으로 보고되지 않음, 편집 의견 | 동점 판단용 |
| 9 | 키워드 남용 | 기준선 이하 | 사용하지 않음 |
연구진은 상위 전략들의 쌍 조합도 실험했고, 조합이 단일 전략보다 더 나은 성과를 냈다(Elementera). 위 표는 메뉴가 아니라 쌓아 올리는 스택으로 읽는 편이 맞다.
기존 SEO 권위가 그대로 옮겨오지 않는 이유
Ahrefs는 브랜드 7만 5,000곳을 분석해 브랜드 언급량과 AI 개요 노출도의 스피어만 상관계수가 0.664로 나타난 반면, 백링크 수는 0.218에 그친다고 밝혔다. 브랜드 앵커 텍스트는 0.527, 브랜드 검색량은 0.392로 뒤를 이었다. 상위 세 지표 모두 사이트 바깥에서 형성되는 브랜드 신호다(Ahrefs). Ahrefs 스스로도 이는 상관관계일 뿐이며, 규모가 큰 브랜드는 브랜드 언급량과 AI 노출도를 서로 무관한 이유로도 동시에 축적할 수 있다는 점을 밝히고 있다.
방향성 있는 참고 지표로 받아들이면 된다. 인용을 예측하는 자산은 브랜드가 기계가 읽을 수 있는 텍스트 안에서 얼마나 폭넓고 일관되게 언급되는지이며, 이는 링크를 사들이는 방식이 아니라 꾸준히 발행하고 인용되는 방식으로 쌓인다.
엔진마다 따로 점수를 매겨야 하는 이유
플랫폼 점유율이 빠르게 바뀌고 있어서, 여러 엔진을 합산한 가시성 점수 하나로는 실제 상황을 놓치기 쉽다. Similarweb의 2026년 시장 데이터를 보면 챗GPT가 생성형 AI 웹사이트 방문에서 차지하는 비중은 2025년 6월 약 76%에서 2026년 5월 약 53%까지 떨어졌고, 같은 기간 제미나이는 9% 미만에서 27~28%까지 올라갔다(Similarweb).
여러 엔진을 평균 낸 'AI 가시성 점수'는 퍼플렉시티에서의 노출을 잃고 제미나이에서의 노출을 얻어도 겉으로는 그대로 유지될 수 있다. 정해진 프롬프트 세트를 매주 실행하고 엔진별로 점수를 따로 매기는 편이 안전하다. 우리는 실제로 이렇게 추적하고 있으며, 모니터링 도구를 평가할 때도 가장 먼저 확인하라고 권하는 항목이다. 자세한 기준은 AI 브랜드 언급 모니터링 도구, 무엇을 확인하고 골라야 할까?에서 다뤘다.
1~2인 팀을 위한 3주 실행 계획
1주차, 약 3시간. 실제 구매자가 입력할 법한 프롬프트 15~25개를 카테고리, 비교, 사용 사례 질문으로 나눠 작성한다. 이를 챗GPT, 퍼플렉시티, 제미나이에 각각 실행하고 엔진별로 어떤 브랜드가 언급되고 어떤 URL이 인용되는지 기록한다. 이 인용 목록이 실제 경쟁 구도다.
2주차, 약 4시간. 의도가 가장 강한 페이지 다섯 개를 골라 1~3위 전략을 적용한다. 주요 주장마다 출처를 붙이고, 실존 인용문이 있다면 하나 정도 추적 가능한 형태로 넣고, 모호한 표현마다 연도와 구체적 수치로 바꾼다. 그다음 유창성 다듬기를 진행하고 재발행한다.
3주차 이후, 주 1일 집중. 자사 페이지가 아직 인용되지 않은 프롬프트를 겨냥해 신규 페이지를 한두 개 발행하고 프롬프트 세트를 다시 실행한다. 검색 기반 엔진의 인용 변화는 하루 단위가 아니라 몇 주 단위로 나타나므로, 단일 점검이 아니라 월간 추세로 판단한다. 소규모 마케팅팀은 주간 콘텐츠 루틴을 어떻게 만들까?에서 같은 루틴을 시간 단위 블록으로 나눠 다뤘다.
이 흐름에서 발행 빈도를 일회성 최적화보다 중요하게 다루는 이유는 구조적이다. 인용 권위는 과거의 도메인 권위처럼 축적되는 성질을 가지며, 3월에 손본 페이지는 경쟁사가 지난주에 새로 발행한 페이지와 경쟁해야 한다.
FAQ
GEO와 SEO는 무엇이 다른가?
SEO는 검색 결과 페이지에서 순위를 다툰다. GEO는 종합된 답변 안에 포함되고 출처로 인정받는 것을 다툰다. 크롤링 가능성과 콘텐츠 품질에서는 겹치지만 전술에서는 크게 갈린다. SEO의 대표적인 수단인 키워드 반복은 프린스턴 실험에서 오히려 기준선보다 낮은 점수를 받았다(Elementera).
GEO와 AEO(답변 엔진 최적화)는 같은 개념인가?
대부분의 실무자는 두 용어를 같은 의미로 쓴다. GEO는 학술 문헌에서 나온 명칭이며(ACM SIGKDD 2024), 인용을 동반한 생성적 종합이라는 작동 원리를 그대로 담고 있어 더 정확한 표현에 가깝다.
효과가 나타나기까지 얼마나 걸리나?
챗GPT 검색, 퍼플렉시티, AI 개요처럼 검색 기반으로 작동하는 엔진은 답변 시점에 실시간으로 콘텐츠를 가져오기 때문에, 재발행한 페이지의 인용 행태가 몇 주 안에 바뀔 수 있다. 반면 검색 없이 모델 자체가 알고 있는 정보를 바꾸는 일은 다음 학습 주기에 달려 있고, 이는 발행자가 통제할 수 있는 영역이 아니다. 검색 레이어를 최적화 대상으로 삼는 편이 맞다.
도메인 권위가 낮은 사이트에도 GEO가 통하나?
연구에서는 원래 순위가 낮았던 출처일수록 상위 전략에서 더 큰 폭으로 효과를 얻었고(Blck Alpaca), Ahrefs의 상관관계 표에서도 백링크는 브랜드 언급량보다 AI 노출도 예측력이 훨씬 낮게 나타났다(Ahrefs). 좁은 주제를 촘촘하고 출처가 탄탄하게 다루는 작은 사이트가, 기존 검색에서보다 지금 더 유리한 위치에 있다.
클릭 대신 무엇을 측정해야 하나?
정해진 프롬프트 세트에서 엔진별 인용률, 답변 안에서의 브랜드 언급률, 인용된 URL 중 자사가 소유한 비율이다. 제로클릭 답변은 세션을 남기지 않으므로, 추천 유입만 보는 대시보드는 구조적으로 GEO 성과를 과소평가한다.
우리와 함께 시작하는 방법
이 루프를 직접 구축하지 않고 바로 운영하고 싶다면, Aeolo는 브랜드 URL을 기반으로 블로그 주제를 찾아내고, 주간 프롬프트 세트로 AI 엔진이 브랜드를 얼마나 자주 언급하는지 추적하며, 발행 주기를 유지해 인용 권위가 초기화되지 않고 쌓이도록 돕는다. 이 카테고리의 도구들을 자사 제품을 포함해 어떻게 평가했는지는 인용 사슬 5단계로 채점한 GEO 도구 6종 비교에서 확인할 수 있다.




