为什么关键词堆砌在 AI 搜索里失效了?GEO 的来历与 AI 找答案的机制
AI 到底是怎么找到答案的?为什么有的站能被引到,有的站内容不差、名字却一次都没出现过?"
本文要点
- 生成式引擎的链路是:查询改写成多条子查询、检索、逐条摘要、汇总成一段带内嵌引用的回答。
- 论文把可见性拆成两层:客观的「位置调整词数」与主观的七个维度。
- 九种方法里加引语最有效,关键词堆砌的位置调整词数 17.7,低于无优化基线 19.3。
- 全部来源都被优化时,排名第五的站用标注引用来源涨 115.1%,排名第一的跌 30.3%。
目录
各位好,我是时效GEO博客站的刘效。
GEO 这个词被明确的定义是源自于2024年国际知识发现与数据挖掘大会(KDD)的一篇论文《GEO: Generative Engine Optimization》,该论文是给整个行业定名词的原始文献,后面所有指标与方法的讨论,源头都在这里。
很多朋友做GEO知其然不知其所以然,很多时候项目启动很久了还反过来问老刘,AI 到底怎么找到答案?为什么有的站被引到了,有的站内容做得不差,名字却一次都没出现过?
老刘今天就通过这篇祖师爷级别的文献,给大家把GEO的前世今生好好讲清楚。
一、先把这篇文献说清楚
| 项 | 内容 |
|---|---|
| 中文标题 | 《GEO:生成式引擎优化》 |
| 英文原题 | GEO: Generative Engine Optimization |
| 作者 | 普拉纳贾尔·阿加瓦尔、维什瓦克·穆拉哈里、坦迈·拉杰普罗汉特、阿什温·卡利安、卡尔蒂克·纳拉辛汉、阿米特·德什潘德;六人分别来自印度理工学院德里分校与普林斯顿大学等机构,前两位为共同第一作者 |
| 发表 | 国际知识发现与数据挖掘大会(简称 KDD)第 30 届,2024 年 8 月 25 至 29 日,西班牙巴塞罗那 |
| 编号 | 10.1145/3637528.3671900(预印本 2311.09735) |
| 公开资源 | 代码、数据集、改写指令与评估模板均随论文公开 |
论文自述三项贡献:提出 GEO 这个面向网站主的通用优化框架;提出一套专为生成式引擎设计的可见性指标体系,允许创作者按自己的目标自定义;发布 GEO 基准测试集。
二、AI 找答案的那条流水线
要理解 GEO 为什么必要,先看 AI 是怎么答一道题的。
论文把生成式引擎拆成两大组件:一组生成模型各司其职,有的改写查询,有的做摘要;加上一个搜索引擎,按查询返回一组来源网页。以bing的设计为例:
用户查询,改写成多条子查询、检索,得到排序后的来源集,逐条生成摘要,汇总成回答,最后输出带内嵌引用的答案。
回答的形态是关键。它给的是一段结构化文本,由若干句子组成,每个句子后面可能挂着一组引用。论文用了学界对理想引擎的两条标准:回答里全部陈述都应被相关引用支撑,这叫引用召回合格;全部引用都应准确支撑对应陈述,这叫引用精度合格。论文强调引用的理由很实在,大模型有编造信息的倾向,引用是用户核验的通道。
传统搜索的规则跟这套是两回事。
| 维度 | 传统搜索 / SEO | 生成式引擎 / GEO |
|---|---|---|
| 匹配机制 | 以关键词匹配为基础 | 语言模型理解文本与查询,不限于关键词 |
| 结果形态 | 线性网站列表,排名决定可见性 | 富结构化综合回答,引用以不同长度、位置、样式内嵌其中 |
| 可见性度量 | 平均排名这类简单指标 | 多维多面,需要专门指标体系 |
论文把生成式搜索生态拆成三方:用户受益,更快更准地拿到信息;引擎开发者受益,回答越准,用户越留得住;网站与内容创作者受损,引擎直接给出答案,用户不必再访问网站,自然流量和可见性都可能被冲击。论文还点了一句,数百万小企业和个人靠线上流量谋生,这股冲击会落到创作者经济上。
论文的研究边界是单轮引擎,附录把框架扩到了多轮,输入变成一段对话历史,引擎据此生成下一轮回答。
三、GEO 的定义,和它划的边界
论文给 GEO 的原话定义是:一个面向专有、闭源生成式引擎的灵活黑盒优化框架,输入一个源网站,通过调整和校准其呈现方式、文本风格与内容,输出一个优化版本,以提升其在生成式引擎中的可见度。
「优化」两个字在论文里有精确含义。每一个 GEO 方法,说到底就是一个网页内容改写函数,输入原始网页内容,输出改写后的内容。改动范围从简单的文体调整,到以结构化格式并入新内容,都算。论文特别强调,改写与具体查询无关,做的是对内容的普遍性优化,属于引擎中立的通用策略。
六个关键特征,都取自原文:
| 特征 | 含义 |
|---|---|
| 黑盒优化 | 不用知道引擎内部算法,改写内容即可生效 |
| 与查询无关 | 独立于具体查询,是引擎中立的通用策略 |
| 双向度量 | 客观层(词数、位置)与主观层(相关性等七项)并重 |
| 领域依赖 | 效果随内容领域变化,需要针对性调整 |
| 可自定义 | 允许创作者定义并优化自己的可见性指标 |
| 以指标为目标 | 一切方法以提升可见性指标为优化目标 |
还有一条边界容易被忽略。论文明确把自己的路线和「用对抗性文本序列操纵大模型推荐结果」区分开,GEO 走的是非对抗性策略,用来优化任意网站内容,不去攻击引擎。
四、可见性怎么量:两层指标和七个维度
论文承认「可见性」和「相关性」在生成式引擎语境下还是主观的、没被良好定义,所以紧接着补上定义。指标设计守三条原则:对创作者有实际相关性、可解释、能被广泛的创作者轻松理解。
整套指标分两层。
客观层由回答文本直接算。第一项是词数,引用某来源的句子字数之和,除以回答全部句子字数之和;一个句子同时引用多个来源时,字数由这些来源平均分配。含义就是你的内容占了这段回答多少篇幅。
第二项是位置调整词数,也是论文的主指标。它在词数基础上引入位置权重,每句话按位置乘一个递减权重,越靠前权重越大,递减规律是指数衰减。加位置项的理由来自搜索引擎研究的老结论,点击率随排名呈幂律下降,排得越靠后跌得越狠,先出现的句子更可能被读到。结果就是一个被引在回答开头的站,字数少也可能比引在中后段的站得分高。
主观层由大模型逐项评分,共七个维度:
| 维度 | 含义 |
|---|---|
| 相关性 | 被引用句子与用户查询的相关程度 |
| 影响力 | 回答对该引用的依赖程度 |
| 独特性 | 该引用所呈现材料的独特程度 |
| 主观位置 | 从用户视角看,该来源位置的显著程度 |
| 主观数量 | 用户感知到的、来自该引用的内容量 |
| 点击可能性 | 用户点击该引用的可能性 |
| 多样性 | 该引用呈现材料的多样程度 |
测量用的是当时最先进的大模型评估方法(G-Eval),向模型提供表单式评估模板和含引用的回答,多次采样后给每条引用打分。
两份分数最后做两层处理。响应内归一化,让一段回答里所有引用的印象之和等于 1,每条分数就理解成它在这段回答里的份额。相对提升,比较效果时看的是涨幅,优化后分数减去优化前,再除以优化前,换算成百分比。
五、九种方法实测:谁有效,谁白做
论文跑实验的方式很朴素。用一个大语言模型执行改写,按每种方法的目标特征修改源内容;每条查询随机选一个来源网站,同一条查询在不同方法之间必须用同一个被优化来源,保证对照公平。
被测引擎的搭法跟商业引擎接近:每条查询取谷歌检索的前五个来源,全文交给模型,要求只用这些搜索结果作答,每句话后立刻挂引用;温度 0.7,每条查询采样 5 个回答。数据是论文自建的 GEO 基准集,一万条查询,由 9 个数据集构成,覆盖 25 个领域,拆成 8000 训练、1000 验证、1000 测试,每条带 7 类标注。
九种方法跑下来,主实验表的关键几行是这样:
| 方法 | 位置调整词数 | 主观印象 |
|---|---|---|
| 无优化(基线) | 19.3 | 19.3 |
| 加引语 | 27.2 | 24.7 |
| 加统计数字 | 25.2 | 23.7 |
| 流畅度优化 | 24.7 | 21.9 |
| 标注引用来源 | 24.6 | 21.9 |
| 加专业术语 | 22.7 | 21.4 |
| 通俗化 | 22.0 | 20.5 |
| 加独特词汇 | 20.5 | 20.4 |
| 关键词堆砌 | 17.7 | 20.2 |
三个结论最值得记。加引语、加统计数字、标注引用来源是最有效的三种改动,位置调整词数相对提升 30 到 40%。风格类改动同样有效,流畅度优化、通俗化能带来 15 到 30% 的提升,引擎不仅看内容,也看信息怎么呈现。关键词堆砌低于基线,17.7 对 19.3,论文原话是几乎毫无提升。
换到真实商业引擎 Perplexity 上复测 200 条样本,加引语在位置调整词数上提升 22%,表现好的方法两个指标最高提升 9% 与 37%。
领域差异也大:权威性文体适合辩论、历史、科学类,标注引用来源适合陈述、事实、法律与政府,加引语适合人与社会、解释、历史,加统计数字适合法律与政府、辩论、观点。
组合比单用强。四个最佳方法两两搭配,流畅度优化加统计数字到 35.8%,比任何单一方法高 5.5% 以上;标注引用来源单用一般,跟任何方法联用平均带来 31.4% 提升。
最扎眼的一组数据在竞争场景。论文预设所有来源都被优化的未来格局,结果排名第五的网站用标注引用来源涨了 115.1%,排名第一的反而跌了 30.3%。论文把它叫数字空间民主化:引擎基于内容生成答案,外链数量和域名影响力这些曾让小创作者吃亏的因素不再起决定作用。
当然论文也自述了自己实验的局限性:方法要随引擎演进不断适配,查询性质会变,基准要持续更新;GEO 是文本层面的改动,不动域名和外链,不太可能影响搜索排名本身。
老刘在时效GEO 发布过 12 个国内 AI 入口的引用源梳理的文章,1.09 亿次引用、85.6 万个站点,看到的也是同一件事:同一个内容源在豆包能占 31%,在 DeepSeek 榜上却查不到。论文给的是通用机制,具体到国内各家入口,还得按自家索引库的脾气重新对一遍。
小结
- GEO 出自 KDD 2024 论文《GEO: Generative Engine Optimization》,编号 10.1145/3637528.3671900,作者来自普林斯顿大学与印度理工学院德里分校等机构。
- 它要解决的问题是生成式引擎把答案直接给出后,内容创作者失去流量与可见性。
- 论文把可见性拆成两层指标:客观的位置调整词数,主观的七个维度。
- 九种方法里,加引语、加统计数字、标注引用来源最有效,关键词堆砌低于无优化基线。
常见问题
Q:GEO 和 SEO 差在哪,能直接套用吗?
多数老手法失效。论文实测关键词堆砌的位置调整词数 17.7,低于无优化基线 19.3,在 Perplexity 上复测还比基线差 10%。能留下的共性只有一条,内容本身得立得住。指标口径也全换了,SEO 看排名,GEO 看你占了回答多少篇幅、排在第几句。
Q:小站没权重,做 GEO 有用吗?
有用,而且是论文里最反常识的一条。全部来源都被优化时,排名第五的网站用标注引用来源涨 115.1%,排名第一的跌 30.3%。原因是引擎基于网站内容生成答案,外链数量和域名影响力不再起决定作用。论文的判断是,GEO 让排名靠后的站有机会跟大站正面竞争。
Q:这套 2024 年的方法,现在还能用吗?
能用,但要按领域调。论文自己点出效果随领域变化:事实类适合标注引用来源,观点和辩论类适合加统计数字,叙事和历史类适合加引语。老刘的做法是先按两层指标量出基线,再挑对应领域的方法改,不铺开一整套。
Q:想读原文,从哪下手?
论文编号 2311.09735,在学术搜索里检索这个号,或者搜 GEO: Generative Engine Optimization KDD 2024,都能定位到英文原文。建议先读摘要里的三项贡献和结果章的主实验表,方法细节后面再补。
信息来源
第 30 届国际知识发现与数据挖掘大会发表《GEO: Generative Engine Optimization》