切片策略

固定大小的切片在遇到表格和代码块时会把语义切断。更好的做法是按文档结构(标题、段落)动态切片。

检索质量

Top-K 检索返回的文档可能不相关。使用重排序模型可以将准确率提升 15-30%。

成本控制

每次查询都调用 Embedding + LLM,频繁查询成本很高。加入缓存层可以显著降低 API 调用次数。

幻觉问题

即使有检索结果,LLM 仍然可能编造不在文档中的内容。提示词中明确要求”只根据提供的文档回答,如果不知道就说不知道”是一个简单有效的方法。

更多技术细节见 RAG 技术综述,实践参考 搭建个人 RAG 知识库