切片策略
固定大小的切片在遇到表格和代码块时会把语义切断。更好的做法是按文档结构(标题、段落)动态切片。
检索质量
Top-K 检索返回的文档可能不相关。使用重排序模型可以将准确率提升 15-30%。
成本控制
每次查询都调用 Embedding + LLM,频繁查询成本很高。加入缓存层可以显著降低 API 调用次数。
幻觉问题
即使有检索结果,LLM 仍然可能编造不在文档中的内容。提示词中明确要求”只根据提供的文档回答,如果不知道就说不知道”是一个简单有效的方法。
更多技术细节见 RAG 技术综述,实践参考 搭建个人 RAG 知识库。