RAG上下文工程(Context Engineering for RAG)是指对RAG系统中"检索什么内容、如何组织内容、以什么顺序呈现给大模型"进行系统性优化的技术领域,是2025-2026年决定GEO效果的核心技术因素。Cornell Tech AI Systems Lab 2026年6月的研究发现,仅上下文排序策略的调整就能使多跳推理任务的准确率波动28%,且这一影响独立于检索质量本身。
核心概念
很多人对GEO的理解停留在"写好内容"层面,但RAG系统不会像人类一样从头到尾阅读整篇文章。实际上,RAG的检索和生成流程包含多个影响最终结果的关键环节:内容如何被切分(分块策略)、分块如何被表示为向量(嵌入模型)、检索时使用什么检索方式(稠密/稀疏/混合)、检索到的多个内容块以什么顺序呈现给LLM(上下文排序)——这些环节共同决定了你的内容是否能被检索到、被正确理解、被准确引用。
上下文工程就是对这些环节进行系统性优化,让品牌内容在RAG流水线的每个环节都获得最高优先级。
文本分块策略
分块(Chunking)是RAG索引的第一步,也是影响检索质量最基础的因素。分块过大,一个块中包含多个主题,向量表示会被"稀释",导致语义不精准;分块过小,上下文碎片化,生成答案时缺乏足够信息。
主流分块方法对比
| 分块方法 | 原理 | 适用场景 | 推荐大小 |
|---|---|---|---|
| 固定大小分块 | 按固定token数切分,可带重叠 | 通用场景,实现简单 | 512 tokens(生产基线) |
| 语义分块 | 根据语义相似度变化点切分 | 主题明确的文档 | 200-400 tokens |
| 结构化分块 | 按标题、段落、列表等文档结构切分 | 有清晰结构的文档(帮助中心、文档站) | 跟随自然段落 |
| 句子窗口分块 | 以句子为中心,前后扩展上下文窗口 | 精确事实检索 | 中心句+前后各1-2句 |
| 父文档分块 | 小块检索,返回对应父大块内容 | 需要精确匹配+完整上下文 | 子块128/父块512 tokens |
GEO分块最佳实践
- 原子段落原则:每个段落只讨论一个核心主题,段落开头先给出结论,再展开解释,这既符合人类阅读习惯,也利于语义分块
- 200-512 tokens为黄金区间:Ziptie的研究建议稠密向量检索使用200-400 tokens分块,512 tokens作为多数场景的生产基线
- 避免语义断裂:不要在句子中间、列表中间、代码块中间分块,利用自然段落边界
- 分块重叠:相邻分块之间保留10-20%的token重叠,避免关键信息被切断
- 元数据附加:每个分块附带文档标题、章节标题、发布日期、实体类型等元数据,提升检索精度
混合检索技术
2025年Applied AI Research的研究表明,混合检索(Hybrid Retrieval)的效果比纯语义检索高15%-30%,已成为RAG系统的标准配置。
稠密检索(Dense Retrieval)
稠密检索使用嵌入模型(如BGE、Cohere Embed、Sentence-BERT)将文本转换为高维向量,通过向量空间中的余弦相似度或点积进行语义匹配,擅长捕捉语义相似性,即使查询和文档使用不同的词语也能匹配。
稠密检索的优势是理解"意思",劣势是对精确关键词匹配(如产品型号、错误代码、专有名词)不够敏感。
稀疏检索(Sparse Retrieval)
稀疏检索即传统的词频检索,代表是BM25算法,通过词频-逆文档频率(TF-IDF)进行关键词匹配,擅长精确匹配专有名词、产品型号、特定术语,但无法理解同义表达和语义关联。
SPLADE是稀疏检索的升级版本,在检索前利用神经网络扩展查询相关术语,在保留精确匹配能力的同时获得一定的语义泛化能力。
混合检索融合
混合检索同时运行稠密检索和稀疏检索,然后使用融合算法合并两个结果列表:
- RRF(Reciprocal Rank Fusion):最常用的融合算法,根据文档在两个列表中的排名而非原始分数计算融合分数,对分数尺度差异鲁棒,公式简单效果好
- 加权融合:根据场景给稠密和稀疏结果分配不同权重,如技术文档场景可提高稀疏检索权重(精确匹配术语),营销内容场景可提高稠密检索权重(语义理解)
- 级联检索:先用稀疏检索快速筛选候选集,再用稠密检索精排,兼顾速度和精度
上下文排序优化
当检索返回多个相关内容块后,以什么顺序排列放入LLM上下文,对最终生成结果有重大影响。
微软Composer"三明治"排序法
微软亚洲研究院2026年3月发表的Composer框架提出了一种简单有效的启发式排序策略:
- 最独特的chunk放在最前面:为模型提供话题的种子表示,建立整体方向
- 最高相关性的chunk放在最后面:利用LLM的"近因效应",确保最相关信息在生成时仍是新鲜上下文
- 其余chunk按相关性+多样性交替放置在中间:兼顾相关性和多样性,防止注意力坍塌
排序方法效果对比
| 排序方法 | 适用场景 | 效果 |
|---|---|---|
| 相关性优先 | 简单单文档查询 | 基线效果 |
| 时间倒序 | 时效性内容查询 | 仅对新闻类有效 |
| 图拓扑排序 | 多文档隐式关系查询 | 多跳推理效果更优 |
| 三明治排序 | 通用复杂查询 | 整体表现最稳定 |
| 多样性重排 | 探索性/总结类查询 | 减少信息重复,提升全面性 |
GEO内容排序适配
- 每篇文章的开头段和结尾段被引用概率最高,务必在这两个位置放置核心结论和关键信息
- 重要信息使用加粗、标题、列表等格式强化,不仅是给人类读者看,也影响分块和排序
- 文章开头使用"一句话定义+核心结论"结构,让分块后的第一个chunk包含最有价值的信息
应用场景
场景一:技术文档GEO优化
技术文档(API文档、帮助中心、开发者文档)包含大量精确术语、代码示例、错误代码,是混合检索的典型场景。GEO要点:精确术语保持一致、代码块独立成块、每个API端点/错误码有独立的解释段落、元数据中标明版本号和适用范围。
场景二:营销内容GEO优化
博客文章、白皮书、案例故事等营销内容侧重语义表达,稠密检索权重更高。GEO要点:使用清晰的标题层级、每个H2章节是一个独立主题、段落开头先给结论、核心概念提供明确定义。
场景三:FAQ内容优化
FAQ是被AI引用概率最高的内容类型之一。GEO要点:每个问答对独立成块、问题使用用户真实提问句式、答案第一句直接回答问题、使用FAQPage Schema标记。
发展趋势
RAG技术在2025-2026年持续快速演进,上下文工程作为GEO的"技术内核"也在不断发展:
- 自适应检索成为主流:FLARE等动态检索机制让RAG不再是"一次检索定终身",而是在生成过程中实时补充信息,内容需要在被部分引用时仍能独立成立
- 上下文压缩技术普及:利用LLM对检索到的内容进行压缩和去重,只保留最相关信息,意味着"信息密度"比"篇幅长度"更重要
- 语义压缩检索新范式:Beyond Nearest Neighbors论文提出的语义压缩检索,不再简单取最相近向量,而是选择查询周围有代表性的向量集,这对内容的语义覆盖度提出更高要求
- 嵌入模型持续进化:BGE-M3、Cohere Embed v3等新一代多语言、长文本嵌入模型不断提升语义表示质量,内容优化需要适配新模型的语义偏好