入门 GEO术语 · AI基础

AI 是怎么读到你的:从模型到爬虫的 49 个术语

内容发出去之后,AI 到底看见了什么?从模型怎么生成回答,到爬虫怎么决定抓不抓你,这中间隔着 49 个词。

本文要点

  • AI 读不完你的整个网站,它只能挑几段,所以「哪几段被挑中」才是优化的落点
  • 抓取、索引、检索是三件事,内容在 AI 眼里是空的,多半栽在客户端渲染
  • 爬虫按用途分搜索、训练、用户触发三类,放行要分开判断,不能一刀切
  • robots.txt 管的是抓取许可,不保证收录,更不保证被引用
目录

各位好,我是时效GEO博客站的刘效。

GEO 相关的 120 个术语,老刘在时效GEO 整理成了三篇,这是第一篇。

整理的时候朋友问过老刘:这些术语要全背下来吗?

不用。术语是在用的时候记住的。建议先看带 ★ 的 12 个,剩下的当成词典,遇到再回来查。

这就是老刘整理这三篇的核心目的:做成词典,不做成教材。没人需要通读,也没人需要背,遇到问题时知道翻哪儿就行。

那这一篇收的是哪一侧?机器侧:模型怎么工作、搜索怎么检索、谁在抓你的站、抓取的门怎么开。

这四层共 49 个词,老刘按顺序排好了,拼起来就是一条完整的链路:内容发出去之后,AI 到底看见了什么。

AI 和模型怎么工作

这一组讲模型本身。它们跟「怎么写内容」没有直接关系,但决定了 AI 能不能读懂你。

大语言模型(LLM) ★

ChatGPT、DeepSeek、豆包、文心一言背后跑的都是它,一个读完了半个互联网、专门练「猜下一个词」的模型。跟 GEO 的关系:它就是所有生成式引擎的大脑。你的内容想被引用,前提是它读得懂、抓得住、敢信。

词元(Token)

模型处理文字的最小单位,不是「字」也不是「词」,是一个介于两者之间的碎片。为什么要知道:上下文窗口、API 计费和截断通常按 token 计算,不按「字数」直接计算。

上下文窗口(Context Window)

AI 一次对话里能「同时记住」的内容上限,超出就会被忘掉或截断。跟 GEO 的关系:这解释了一件事,AI 不可能把整个网站读进上下文,它只能挑几段塞进去。所以「哪几段能被挑中」才是关键。

提示词(Prompt) ★

你输给 AI 的那段话。同一个模型,问法不同,答案质量能差出一个量级。跟 GEO 的关系:GEO 时代的「关键词研究」变成了「prompt 研究」,研究重点换了:以前看用户搜什么词,现在看用户会怎么跟 AI 说话。用户问 AI 的方式比问 Google 更长、更口语、更带场景,比如「我想发一篇材料方向的 SCI,找第三方测试机构靠谱吗」。你的监测表就是围绕这些 prompt 建的。

训练 / 推理(Training)

训练 = 造模型的过程(慢、贵、一次);推理 = 用模型回答问题的过程(快、每次都在发生)。跟 GEO 的关系:新发布内容若要以可核验链接进入近期答案,通常依赖搜索、数据库或用户提供上下文;无链接的品牌提及也可能来自训练记忆,两条路径要分开监测。

参数 / 权重(Parameters)

模型内部那几百亿到几万亿个「旋钮」,训练就是拧这些旋钮。模型规模常说「70B」「671B」,分别表示约 700 亿和 6710 亿参数。某个已部署模型版本的权重不会因为你更新网站而即时改变,但厂商可通过新训练、微调或版本替换更新权重;检索结果则可在每次回答时变化。

微调(Fine-tuning)

拿新数据把模型再训练一遍,把新知识「焊」进权重里。跟 GEO 的关系:站长通常无法直接控制模型微调,因此日常重点仍是可检索内容与引用,但无链接品牌提及可能受训练记忆影响。

幻觉(Hallucination)

AI 生成了错误、无依据或与来源不符的内容,却表述得像真的。跟 GEO 的关系:真实、可追溯、彼此一致的来源有助用户核验并可能改善接地质量,但不能保证模型不出错,也不能据此宣称某平台必然更偏爱你的内容。

多模态(Multimodal)

模型不只看得懂文字,还能处理图片、音频、视频。跟 GEO 的关系:图片 alt、视频标题与字幕首先改善无障碍和传统搜索理解,也可能帮助支持这些信号的 AI 产品;不能笼统说所有 AI 都会读取或采用。

推理模型(Reasoning Model)

会「先想一会儿再回答」的模型,擅长复杂比较和推理。跟 GEO 的关系:结构清晰、证据可核验有利于比较任务,但没有统一公开证据证明「推理模型更爱吃某种格式」。

智能体(AI Agent)

不只是聊天,而是能自己动手办事的 AI,会点按钮、填表单、跨网站完成任务。跟 GEO 的关系:这是「未来时」。以后不只是人要能读你的网站,AI 智能体还要能「操作」你的服务。这催生了一个新话题:给机器用的接口(协议文件那组的 MCP 讲的就是它)。

搜索怎么把内容找出来

这一组讲检索。你的内容要先进得了索引,才谈得上被检索;要被检索到,才谈得上被引用。

爬虫 / 蜘蛛(Crawler) ★

搜索引擎派出去的「自动浏览程序」,它会一个链接接一个链接地把整个互联网读一遍。跟 GEO 的关系:自动爬虫是常见入口,不是唯一入口;平台还可能通过第三方索引、API、垂直数据库或用户触发访问获取页面。

抓取(Crawling) ★

爬虫把你的页面内容下载回去这个动作。跟 GEO 的关系:不同 AI 爬虫对 JavaScript 的渲染能力与等待策略差异大且常不公开,所以关键事实最好在初始 HTML 中可见或提供稳定服务端渲染版本。

渲染(Rendering)

把网页代码「画」成你能看到的样子的过程。跟 GEO 的关系:很多站「人看着正常,AI 看到的是空的」,就是栽在这一步。

索引(Indexing) ★

爬虫下载完内容后,判断这一页值不值得存进它的大数据库。存进去了,才可能被搜到。跟 GEO 的关系:先确认目标引擎或上游索引能否发现页面;没进 Google 索引不代表 Bing、百度、平台 API 或用户直访都看不到。

搜索结果页(SERP)

你搜完之后看到的那个结果列表页面。跟 GEO 的关系:AI 概览会改变点击分配并可能增加零点击,但具体流量变化还受查询意图、版位、品牌和设备影响,不能把所有自然流量下滑都归因于它。

排名(Ranking)

用户搜某个词时,引擎决定把你的页面放在第几位。跟 GEO 的关系:原查询的自然排名与 AI 引用并非一一对应,fan-out 还可能从相关子查询结果取材;但 Google 官方仍说其生成式搜索建立在核心搜索系统上。排名是相关信号和基础能力,不是所有引擎统一的硬门槛。

向量 / 嵌入(Embedding)

把一段文字变成一串数字,让机器能「算」两段文字意思像不像。跟 GEO 的关系:语义模型降低了为每个同义说法造一页的必要性,但现代搜索通常是关键词、语义、链接、质量等信号的混合系统;精确术语、实体名和用户语言仍有价值,只是不能堆砌。

语义检索(Semantic Retrieval)

按「意思」找内容,而不是按「字面」找内容。跟 GEO 的关系:好消息是你不用为每种问法改写一遍内容;坏消息是,内容如果没有真实的信息含量,只是词堆得巧,语义检索不会给你任何加分。

关键词检索(Lexical Retrieval)

按字面词是否匹配来找内容,是上一代搜索引擎的老手艺。它快、准、可解释,但不认同义词。现代搜索系统一般把两种检索混着用(跟下一条的混合检索配合使用)。

混合检索(Hybrid Retrieval)

结合字面匹配与语义向量等多种召回/排序信号的检索方式;权重并非固定各占一半。跟 GEO 的关系:准确术语和自然语言都要有,但没有「关键词密度」这把万能扳手。

站点地图(Sitemap.xml)

放在你网站根目录的一个清单文件,列出你希望被收录的所有页面。跟 GEO 的关系:这是很基础的活儿,但漏了会让新内容被发现得慢很多。花十分钟就能补。

日志文件(Log File)

服务器的访问记录,谁什么时候来访问了什么页面,都记在里面。跟 GEO 的关系:日志是确认你的服务器收到了哪些请求的硬证据,但 UA 可伪造,最好结合官方 IP、反向 DNS 或签名验证。一个月零记录只说明该日志范围内没观察到相应请求,可能是爬虫尚未发现、访问了别的节点、经第三方索引取材或根本没抓,不等于「必然进不来」。

向量数据库(Vector Database)

专门存「文本向量」的数据库,按意思相近而不是字面一致来检索。跟 GEO 的关系:RAG 系统用它取材,你的内容进入其数据源才有机会进入候选;系统开发岗 JD 明确要求「了解向量数据库基础」。动手装一个 Chroma,把自己的文章灌进去用不同措辞检索一遍,概念立刻落地。

重排(Rerank)

检索的第二轮筛选:先用便宜的方法召回几十条候选,再用更精细的模型挑出几条最好的。跟 GEO 的关系:这就是「可提取性」的技术视角:结论前置、段落独立成立的片段更容易在重排中存活。JD 里「语义优化经验优先」指的就是这类工作,重排调优是其中最可动手的部分。

知识图谱(Knowledge Graph)

用「实体 + 关系」组织知识的网络:产品—属于—产品线、案例—客户—行业,节点连成图。跟 GEO 的关系:系统开发岗 JD 原话「运用 RAG 技术构建营销知识图谱,整合产品信息、用户画像」。对内容生产的启示:把品牌事实写成实体清楚、关系明确的结构,人和机器都更容易核验与引用。

谁在抓你的站:爬虫与 UA

这一组讲抓取方。同样叫「爬虫」,背后可能是搜索、训练、用户触发三种用途完全不同的东西。

谷歌爬虫(Googlebot) ★

Google 的通用抓取爬虫,负责把网页抓回去供搜索使用。跟 GEO 的关系:Google Search 的 AI Overviews / AI Mode 依赖 Google Search 的抓取与索引基础,没有单独要求站长放行某个「AI Overview Bot」。页面要先满足常规搜索抓取、索引与摘要展示资格;这不等于「Googlebot 本身生成 AI 答案」。

谷歌 AI 使用控制令牌(Google-Extended)

写在 robots.txt 里的产品令牌,不是会单独出现在日志里的爬虫 UA。跟 GEO 的关系:它不控制 AI Overviews / AI Mode,那些属于 Google Search;不要把它叫成独立训练爬虫。

OpenAI 训练爬虫(GPTBot) ★

OpenAI 用来抓取可能用于改进、训练生成式基础模型的内容。跟 GEO 的关系:屏蔽 GPTBot 表示站点内容不应由它用于潜在训练;ChatGPT 搜索自动抓取由 OAI-SearchBot 单独控制。两者设置相互独立,但页面仍可能通过其他合法来源只显示导航链接。

OpenAI 搜索爬虫(OAI-SearchBot) ★

用于在 ChatGPT 搜索结果中展示网站内容的自动抓取爬虫。跟 GEO 的关系:如果你希望页面正文进入 ChatGPT 搜索摘要和引用,应允许它并放行官方 IP;若屏蔽,正文不会进入搜索答案,但 URL 仍可能以导航链接出现。它不用于训练基础模型,因此可以「允许 OAI-SearchBot、禁止 GPTBot」。是否允许取决于你的内容策略,不是绝对命令。

ChatGPT 用户代理(ChatGPT-User)

用户主动让 ChatGPT 访问某个网页时用的标识,不是自动爬取。它不是自动搜索索引爬虫,也不决定页面能否出现在 ChatGPT Search。OpenAI 说明这类用户触发动作中 robots.txt 规则可能不适用;需要强制保护的内容应靠认证与服务端访问控制。

Perplexity 收录爬虫(PerplexityBot) ★

Perplexity 用来把网页收进自己索引的爬虫。跟 GEO 的关系:Perplexity 引用最显性,所以这个爬虫的来访记录最好观察。

Perplexity 用户代理(Perplexity-User) ★

用户提问时,Perplexity 去访问某个具体页面用的标识。这里有个坑:官方文档原话是它「一般会忽略 robots.txt 规则」,因为这是用户主动发起的抓取。也就是说,robots.txt 拦不住它。想真正阻断只能靠服务端 IP 控制,但那会同时影响正常访客。

Anthropic 爬虫(ClaudeBot)

Anthropic 用来收集训练数据的爬虫。跟 GEO 的关系:它主要涉及训练数据抓取,不等同于 Claude 产品的实时搜索或用户触发访问。屏蔽只影响未来由该 UA 进行的抓取,不会撤回既有数据,也不能概括 Claude 所有数据来源;当前产品能力应查 Anthropic 官方文档。

公共爬虫计划(CCBot)

一家非营利机构爬取整个互联网建成的公开数据集,很多 AI 实验室拿它来训练模型。跟 GEO 的关系:你自己用的训练数据跟你无关,但很多小实验室没能力自建爬虫,靠的就是这个数据集。

必应爬虫(Bingbot)

Bing 的抓取爬虫,同时服务于 Bing 搜索和 Copilot。跟 GEO 的关系:Bing 搜索索引服务于 Bing、Copilot 与微软披露的部分合作体验;被 Bing 收录是微软生态可见性的基础之一。AI Performance 提供该生态的一手引用数据,但不能外推到其他引擎。

Meta 爬虫(meta-externalagent)

Meta(Facebook)用于获取用户指定网页的标识。Meta 有多个用途不同的 UA;用户指定 URL 的抓取与训练型 meta-externalagent 不能混为一谈。是否遵守 robots.txt、用于什么目的,应按 Meta 当前官方爬虫文档逐项核对。

抓取的门:协议文件

这一组讲你怎么控制抓取。核心是记住一件事:这些文件管的是允许不允许抓,不是收不收录,更不是引不引用。

机器人协议文件(robots.txt) ★

放在网站根目录的一个纯文本文件,告诉爬虫「哪些能抓、哪些不能抓」。跟 GEO 的关系:要按用途区分搜索、训练和用户触发 UA,并同时检查 WAF;放行也只代表允许抓取,不保证索引或引用。

大模型文本索引(llms.txt)

2024 年才提出的新提议:在网站根目录放一个给 AI 看的「说明书」。Google Search 官方明确说明:不使用 llms.txt,也不要求新的机器可读 AI 文件;文件即使被发现、抓取或索引,也不代表特殊待遇。截至核实日,本手册未找到其他主流引擎把 llms.txt 确认为收录或引用条件。结论:不要把它列为 GEO 必做项;若为特定工具提供,可做但必须写清目标消费者和验证方法。

结构化数据(Structured Data)

用一种机器能直接读懂的格式,把页面里的信息「标注」一遍。跟 GEO 的关系:Google 官方说进入生成式搜索功能没有特殊 schema 要求;既有结构化数据应按传统搜索、知识面板、商品或本地业务等明确用途使用,并与可见文本一致。目前不能把它宣称为 AI 引用加分项。

结构化数据词汇表(schema.org)

一套公开的「名词表」,规定了「作者」「公司」「问答」这些东西机器该怎么叫。跟 GEO 的关系:它能让传统搜索和其他机器消费者更明确地识别实体属性,但具体生成式引擎是否、如何使用并不统一公开;价值首先来自正确表达事实,而非秘密加权。

JSON-LD

写结构化数据最主流的一种格式,把标注塞在一段 JSON 代码里。跟 GEO 的关系:只标注页面真实可见的信息,不要为 AI 另外编一份隐藏事实。

问答结构化标记(FAQPage)

专门用来标注「一问一答」内容的结构化数据。跟 GEO 的关系:先写真实有用的问答;是否保留 schema 取决于其他机器消费者与维护成本。

组织结构化标记(Organization Schema)

用结构化数据告诉机器「你是谁」:公司名、Logo、联系方式、社交账号。跟 GEO 的关系:统一实体信息是合理基础工作,但「加了标记就减少 AI 说错」目前缺少可量化保证;仍需同步维护官网可见内容和第三方权威资料。

规范链接(Canonical)

告诉引擎「这一堆相似页面里,哪一个才是正主」。跟 GEO 的关系:它有助传统搜索整合重复 URL 信号;是否直接改变某个 AI 产品的引用归并方式没有统一保证。

即时推送协议(IndexNow)

你内容一更新,就主动「敲门」通知引擎「我改过了」,不用等它自己来巡。跟 GEO 的关系:对支持 IndexNow 的搜索引擎,它可更快通知 URL 新增、更新或删除;不同 AI 产品是否直接使用这些索引另当别论。注意:它只是发现信号,不保证抓取、索引、排序或引用。

模型上下文协议(MCP) ★

让 AI 能「接上外部工具」的一套通用插头标准,由 Anthropic 在 2024 年底提出。跟 GEO 的关系:这是「未来时」而不是「现在时」。今天你需要做的是「人能读到你的内容」;明天可能需要「AI 智能体能操作你的服务」。业界已经在讨论「给机器看的接口」这件事(比如给机器用的 markdown 版页面、面向智能体的端点)。现在的正确姿势:知道它是什么就行,先别投入。

无障碍标记(ARIA)

给网页元素加「这是个按钮」「这是个菜单」这类说明,让读屏软件能理解页面。跟 GEO 的关系:意外的好处,OpenAI 官方文档提到,ChatGPT 的浏览器智能体就是靠 ARIA 标记来理解页面结构和操作元素的。也就是说,无障碍做得好,等于顺便让 AI 也看得懂你的页面。这是个很划算的「一石二鸟」。

流量来源参数(UTM 参数)

加在网址后面的小标签,用来标记「这个访客是从哪来的」。跟 GEO 的关系:UTM 是归因线索,不是完美真值,还要结合 referrer、服务器日志与转化数据。

小结

  1. AI 读不完你的整个网站,它只挑几段,所以「哪几段能被挑中」才是优化的落点
  2. 抓取、索引、检索是三件事,内容在 AI 眼里是空的,多半栽在客户端渲染
  3. 爬虫按用途分搜索、训练、用户触发三类,放行要分开判断
  4. robots.txt 管的是抓取许可,不保证收录,更不保证被引用

常见问题

Q:为什么把 AI 基础和爬虫放在一篇里?

因为它们回答的是同一个问题:AI 是怎么读到你的。只懂模型不懂抓取,会以为「内容好就够了」;只懂抓取不懂模型,会以为「放行了就会被引用」。两头都要有。

Q:这套跟国内 AI 有区别吗?

有。上面讲的机制是通用的,但国内三家(元宝、千问、Kimi)没有公开独立爬虫 UA,抓取配置换不来答案,思路要换。这部分在系列第三篇。

Q:三篇要按顺序读吗?

三篇是三个视角,可以分开看:机器侧、方法侧、市场侧,每篇都能独立成立。但如果从零开始,建议按顺序走一遍,视角从底层往上抬。

Q:要找的词这里没有怎么办?

这三篇覆盖的是手册里的 120 条基础概念。如果你要查的是某个平台的最新政策或具体参数,术语解释不够用,得去官方文档核对,那类信息会更新。

刘效 作者

资深搜索优化工程师 · GEO 独立研究者

把本站本身当作 GEO 的实验对象,边做边记录,只写可验证的内容。