企业 RAG 从 demo 到生产崩盘的 root cause,从来不是模型不行,是工程化细节没做到位。解析、向量库、Prompt、运维这四个坑,跨过去才能算"落地"。

坑一:文档解析碎片化,关键规则被切碎 最隐蔽的坑在解析。demo 用的 20 份文档格式统一、纯文字,分块零误差。真实存量文档里有 PDF 扫描件、合并单元格表格、老旧 Word、截图式制度。 员工问"试用期能不能申请年假",系统只回了通用规则,漏掉了"试用期禁止申请"——因为原制度是表格,"试用期"和"不享受年假"被通用均分块切到了两个文本块。生产设备操作规程要是也被这么切碎,就是安全和合规事故。 解法:放弃无脑均等分块,表格、清单、层级制度单独适配解析规则;结构化内容优先整表、整段绑定分块;强关联信息不切割,从源头杜绝关键信息丢失。

坑二:向量库选型轻敌,小样本流畅、大并发直接崩 demo 用 Chroma 轻量库,几十份文档毫秒级响应,体验拉满。上线接入 800+ 全量文档、开放全员并发后,响应从 200ms 飙到 4–6 秒,高峰频繁超时、加载失败。 根因:轻量向量库只适配本地小样本,没有索引优化和并发调度;文档过百、并发超 10 人后检索延迟指数级飙升。 解法:生产环境换 Milvus、FAISS 等企业级引擎,开启分片索引和增量更新机制,把检索延迟稳定压到 500ms 以内。

坑三:Prompt 一刀切,简单问答翻车、还会编 员工提问五花八门——口语化、碎片化、多问题混合。通用 Prompt 只匹配到关键词,把"试用期请假限制"丢了,还一本正经编出违规制度。更危险的是知识库没收录的小众问题,它不会拒答,只会编。 解法:搭分层专属 Prompt 模板库(常规咨询、流程查询、细节追问、跨领域提问各匹配专属模板);加强制溯源约束——信息不足就说明无法解答,绝不编造内容。

坑四:无增量更新,知识库越用越废 企业制度动态迭代。2025 版新规上线,旧版没下线、没清理,系统随机召回新旧两个版本,答案前后矛盾,员工直接不信了。重复文档、破损文件还持续占用向量库资源,拉低检索精度。 解法:文档加版本标签和生效时间,新规上线自动标记旧规失效;定期批量去重、清洗脏数据;支持单篇增量更新、向量刷新,无需全量重训。

在搭建私有 RAG 时,第一步不是拿 20 份干净文档验收,而是先灌真实存量文档跑一轮压测,把解析错乱、检索不准、并发卡顿这些问题在验收前逼出来。私有化部署的好处是数据不出域,但工程化该踩的坑一个不会少——底座稳了,模型才发挥得出来。

企业 RAG 真正的护城河不在选了哪个大模型,而在"适配脏数据、扛得住并发、跟得上业务迭代、零误导答案"的工程能力。先把这四个坑填平,知识库才不会被员工默默关掉。

Q&A问答总结 Q:企业 RAG 一定要上 Milvus 这种重引擎吗? A:几十份文档的小场景不必;但全量存量文档 + 全员并发的生产环境,轻量库会崩,企业级引擎是必选项。

Q:为什么纯向量检索会漏"劳动合同法第 38 条"这种精确编号? A:向量擅长语义、不擅长精确术语。专业场景要 BM25 关键词打底 + 向量增强的混合检索。

Q:RAG 幻觉能彻底消除吗? A:不能,但能用分层 Prompt + 强制拒答 + 审计把误导率压到业务可接受;关键在"信息不足就别说"。

Q:知识库上线后还要运维吗? A:要。版本标签、增量更新、定期去重清洗,缺一就会越用越废。

山东云管家结合智能体平台、多模型调度与多云 MSP 能力,为企业提供从场景咨询、原型验证到生产部署和持续运营的完整服务。