AI 可见性

Embeddings对比关键词:AI如何匹配含义

搜索和 AI 助手越来越倾向于匹配语义,而不仅仅是精确的字词。因此,制胜的关键在于提供清晰、深刻且条理分明的优质内容,而非堆砌关键词。

提供支持,NYFTY Labs AI 内容引擎

几十年来,搜索意味着匹配词语。您输入一个术语,引擎就会返回包含该精确术语的页面。基于 AI 的检索工作原理则有所不同。它不再询问“该页面是否包含这些词”,而是询问“该段落是否与问题具有相同的含义”。它是通过将文本转换成对含义进行编码的数字(称为 embeddings),然后比较这些数字在空间里的接近程度来实现的。理解这种转变是被 AI 系统发现的基础,因为用不同的词语阐述正确内容现在可以胜出,而充斥着关键词却缺乏实质意义的内容极易落败。

Meaning match, not word match Embeddings place related ideas close together in vector space Vector space Matching content Query unrelated Close together = relevant Old way Keyword matching Needs exact words Misses synonyms Vectors win on meaning
向量空间面板显示了一个蓝色的 Query 点,恰好停在绿色的 Matching-content 虚线簇(彼此接近 = 相关)之外,而零散的灰色点则远离其中表示不相关。在旁边,一个珊瑚色的 Keyword-matching 框被画上了叉,并标明这是旧有的、需要精确字词匹配而会遗误同义词的方法。

关键词匹配寻找的是字词;embeddings 寻找的是含义

传统的关键词搜索通常由名为 BM25 的算法驱动,它根据查询的精确词项出现的频率来为页面评分,并根据这些词项的稀有度进行加权。它的弱点是词义鸿沟:如果搜索者询问“automobile”(轿车),而您的页面仅写着“car”(汽车),那么纯关键词系统极有可能完全错过该匹配。基于 Embedding 的检索机制专为弥合这一鸿沟而构建,其通过对比含义而非表层文字,实现同义词和改写句在词汇零重合的情况下依然能够匹配。这是稠密检索模型有据可查的行为,并非臆测。

AI VISIBILITYKeyword (BM25)Counts exact termsWeights rare wordsMisses 'car' vs 'auto'Lexical gapEmbeddingsCompares meaningMatches synonymsMatches paraphrasesCloses lexical gapvsNYFTYLABS
关键词搜索匹配的是精确的字词,而 embeddings 则能在同义词之间实现含义的匹配。

embedding 是一串数字,用于在语义地图上为文本定位

embedding 模型(通常是像 BERT 风格编码器这样的 transformer)会将一段文本转换为固定长度的数字列表,称为稠密向量(dense vector)。含义相似的文本会产生相似的向量,因此这些数字就像是巨型地图上的坐标,相关的概念在此聚集。具体的维度对人类来说不可读,也没有任何一个数字能映射到单一的概念;相反,语义是分布在整个向量中的。这就是为什么针对同一主题、表述却不同的两句话,即使不包含任何共同的关键词,在地图上的位置也会非常接近。

相似度是通过距离来衡量的,通常是余弦相似度

为了回答问题,系统会将查询进行 embedding 转换为向量,然后寻找与其最接近的存储内容向量。接近度最常通过余弦相似度(cosine similarity)来衡量,它比较的是两个向量之间的夹角而不是它们的长度,或者使用与之相关的点积(dot product)。由于与数百万个向量进行逐一比对极慢,生产系统会使用 Approximate Nearest Neighbor (ANN) 检索,这能比精确扫描更快地找到几乎最接近的向量。这种权衡是以微小、通常可接受的精确度损失换取显著的速度提升。

匹配发生在 chunk 级别,而不是整个网页

AI 检索系统通常不会将整个网页作为一个整体来进行 embedding。它们首先会将文档拆分为更小的 chunk,通常在几百个 token 左右,且不同 chunk 之间往往有一定的重叠,以免在边界处切断语义。每个 chunk 都有自己独立的 embedding,而检索时是以 chunk 为单位进行竞争的。这意味着,即使页面上其他内容并不相关,一段逻辑清晰、内容完备的文章段落也可能被 AI 提取为答案。正因如此,结构良好、主题专注的内容版块,其效果远胜于未做区分的冗长文本。

AI VISIBILITY 1Whole page2Split intochunks3Embed each chunk4Best chunk winsOne clear passage can win on its own NYFTYLABS
网页被拆分为有重叠的 chunk,每个 chunk 自行进行 embedding 并独立参与排序。

大多数实际系统结合使用这两种方法,而不仅仅依靠 embedding

Embeddings 擅长语义表达,但在精确匹配(如特定产品代码、型号或专有名词)上表现较弱。因此,大多数生产环境下的检索系统都会使用混合检索,将关键词检索(BM25)与稠密向量检索相结合,并合并两份排序列表,通常采用一种名为 Reciprocal Rank Fusion 的方法按排名而非不具可比性的分数来合并结果。许多工作流在此之后还会加入重排步骤,利用更高昂的模型对候选热门结果进行重新评分。实践层面的启示在于:在追求语义清晰的同时,精确的词汇依然不可或缺;这绝非是非此即彼的选择。

AI VISIBILITY 1Query2BM25 + vector3Fuse ranks(RRF)4Rerank tophits5Final resultsExact terms and meaning, not either-or NYFTYLABS
混合检索运行关键词检索与向量检索,融合其排名,然后对靠前的结果进行二次重排。
核心要点
  • AI 检索匹配的是语义,而不仅仅是精确的词汇,因此,只要内容能清晰地回答问题,即使使用了与搜索者不同的词汇,依然能被检索到。
  • embedding 是一种稠密向量(即一个数字列表),其中相似的语义会产生相近的向量;接近度通常通过余弦相似度来衡量,并通过 Approximate Nearest Neighbor 检索来加速。
  • 检索匹配通常发生在 chunk 层面,因此与未经结构划分的冗长文本相比,主题专注、内容完备且字数在几百字左右的版块更容易被 AI 系统检索和引用。
  • 大多数生产系统都采用混合检索(关键词加 embeddings),并通常包含一个重排(reranking)步骤,因此,在清晰的语义基础之上,诸如名称和型号等精准的词汇依然非常重要。
  • 对可见性的实际启示:针对实际概念进行自然通顺的写作,将内容组织为结构清晰的 chunk,并保留精确的标识符信息,而不是依赖单调的关键词重复。

← 更多指南

常见问题

疑问,为您解答。

Embedding 将单词、句子或文档转化为一串捕获其含义的数字列表。关于相似事物的文本会获得相似的数字,因此机器可以比较含义,而不仅仅是精准匹配单词。正是这种数学原理,让 AI 能够识别出“降低电费”和“减少能源账单”表达的是同一个意思。

不。你使用的具体词汇仍然是模型所读取的内容,使用受众习惯的自然语言依然有效。改变的是,通过钻空子使关键词达到特定密度的方法已不再奏效,甚至会受到惩罚。我们的目标是清晰地写作并深度覆盖主题,从而自然地融入恰当的语言,而无需刻意堆砌。

深度覆盖你的主题,用通俗易懂的语言写作,并合理规划每个部分的结构,使其能够独立回答一个问题。许多 AI 系统会按区块检索内容,因此一个能够直接回答问题的、清晰且独立的段落,比散落于整页中的同一个观点更容易被提取和引用。

希望这一方案能够服务于您的品牌?
定义

什么是 Embeddings 对比关键词匹配(语义搜索)

关键词匹配只会查找包含你输入精确词汇的页面;而 Embeddings 则让搜索引擎和 AI 助手能够比较含义,从而将一个问题与可能从未出现过该问题精确词汇的页面进行匹配。实际结果是:清晰、有深度且结构良好的内容最终胜出,而堆砌关键词如今已被反噬。

它是如何 工作

Embedding 将单词、句子或文档转化为代表其主题的数字列表,因此即使词汇不同,含义相似的文本最终也会获得相似的数字。现代化系统会在该数字空间中衡量你的内容与用户意图的接近程度,并且在检索时通常会对单个内容块进行嵌入和提取,因此一个完整回答某一个问题的、独立的段落正是被匹配和引用的关键。

适用于 哪些人群

面向那些在搜索向 AI 解答转型期间,希望保持曝光度的营销人员、内容团队和企业主。其好处在于获得持久的曝光和引用:因为真正的清晰和深度比单纯提高关键词密度更难伪造,所以能赢得 AI 提及的内容,也正是那些能够赢得人类信任的内容,这意味着无需靠词汇钻空子即可获得更多精准流量和线索。

实战 案例

一个从未重复过“如何降低电费”这一短语的页面,依然可以成为 AI Overview 所引用的来源,因为一段清晰阐述如何减少能源成本的文字在含义上极为接近该问题,而一个反复堆砌该精确短语的空洞页面只会混淆自身信号,最终败下阵来。