肯德拉测评:按这套流程避开四个坑
肯德拉测评不能只搜几个关键词就下结论。Amazon Kendra 真正容易踩坑的地方,是测试资料太干净、权限没带进去、只看命中不看错误结果,以及试用结束忘记清理资源。下面按准备、导入、检索、核算四步推进,每一步都给出可落地的检查办法。
第一步:先定测评边界,别拿演示当实战
先选一个具体业务,例如员工制度查询或客服产品手册,不要把法务、人事、销售资料一次全塞进去。为现有搜索方案留下基线,同一组问题分别测试,结果才有比较价值。
第一个坑是测试问题由实施人员临时编。正确做法是从搜索日志、工单和员工访谈中整理五十到一百条真实问法,并标明预期文档、可见人员以及允许返回「没有答案」的问题。
第二步:导入脏数据,专门检查解析
测评资料要故意保留现实中的麻烦:长 PDF、扫描件、重复版本、缩写和不规范标题。只放十篇整理过的样板文档,任何搜索产品看起来都会很聪明。
第二个坑是同步成功就等于解析正确。应抽查正文、页码、日期和表格,尤其留心 OCR 把金额、年份识别错。重复制度还要标记生效时间,否则旧文件可能压过新文件。
第三步:分轮测试相关性与权限
第一轮测精确词,第二轮测自然语言,第三轮测简称、错别字和模糊问题。记录前几条结果里是否出现正确文档,同时统计无结果、错误置顶和本应拒答却返回内容的情况。
第三个坑只用管理员账号测试。至少建立普通员工、部门成员和管理者三类身份,逐条检查敏感资料。搜索结果再准,只要出现一次跨部门泄露,就不能进入生产环境。
第四步:核算总成本并清理环境
把索引运行、容量、数据同步、开发接入、日志监控和人工治理都记进成本表。不要只截取某一天账单,也不要拿试点流量直接推算生产效果;应按业务高峰、资料增长和全年运行估算。
最后一个坑是试验结束后只关页面。按资源清单逐一删除不再使用的索引、数据源及配套资源,再检查账单和预算告警。测评结论也别只写「好用」,要留下命中率、权限问题和维护工作量。
常见问题
- 肯德拉测评应该看哪些指标?
- 至少看前几条结果的有效性、无结果率、错误置顶、权限泄露、查询响应表现、同步成功率和整体费用,不能只看能否搜到。
- 肯德拉测试数据越多越好吗?
- 不是。先选边界清楚、能人工核验的资料集,再逐步放大。数据太多却没有标准答案,出了偏差也不知道从哪里查。
- 肯德拉测评多久能有结论?
- 取决于数据清理和权限复杂度。功能跑通可能很快,但可靠结论至少应覆盖一次完整同步、多人权限测试和一批真实查询。