给AI喂质料那件事知识www.abg11.com。卡点很少正在模子上。

上周帮一家做工业设备售后的团队搭知识库,他们把三年积累的两万条工单塞进背量数据库,回覆精确率不到四成。成绩出正在数据自己,库搭统一台设备正在文档里被写成“XX-200”“XX200”“200型”三种叫法,检索时互相不认。科技工具再强,也救不了净数据。脱手前先做清洗。把PDF、Word、群聊记载统一转成纯文本了,建实净数据清检索去掉页眉页脚和重复水印。按语义切块,不要按固定字数硬切是一份操做手册里,“安然正告”和“参数表”必须分隔的,否则模子会把正告当参数念给用户听。
每个块加上滥觞、操从程设备型号、生效日期那些元数据。后面过滤时能免却年夜量无效召回。我给客户定的切块长度是400到600字,堆叠80字。实测比一刀切1000字混合的效果好很多。检索环节别只靠背量。AI语义婚配擅长找“意义附近”的,对型号、编号、专有名词经常翻车。把很重要词检索和背量检索并止跑,缺流各自取前20条的,再用重排模子兼并打分排序了。
那套组合正一家医疗器械公司的AI知识库上。把首条射里面率52%拉还有79%。价格呢?多花不到200毫秒。
知识库不是建完就完事。设个每周巡检。
统计零功效查询词了,倒推缺了哪些文档呢?把用户点“没用”的回覆捞出来,看是切块断了上下文。仍是本文自己过时。有个做跨境电商的客户,靠那份清单两个月补了三百多条FAQ,客服转人工率降了三成。工具选型反而简单的,Dify、FastGPT、RAGFlow都能起步,实正拉开差距的是你愿不情愿每周花两小时服侍数据。






