肯德拉怎么用?一次完整上手记录
肯德拉怎么用?我按 AWS 控制台的实际操作顺序走了一遍,最短路径不是急着接企业全部资料,而是先建索引、导入一小批干净文档,再用真实问题检验结果。这里把数据源、同步、检索调优和资源清理几个关键动作说透,新手照着做不容易乱。
先说结论:小样本跑通再扩容
肯德拉的界面并不算难,难的是资料和权限。我上手时更愿意先拿一个独立资料集测试,例如二十份员工制度,而不是第一天就连接整套企业网盘。范围越小,越容易看清问题出在文档还是配置。
开始前先确定 AWS 区域、IAM 权限和预算提醒。创建索引时要按控制台当前提供的选项选择版本或容量,并留意索引持续运行可能产生费用。
建立索引并接入第一批文档
新手最省事的路径是先把测试文件放进 S3,再创建数据源并执行同步。文件名别用「最终版2」这类含糊写法,最好同时整理标题、部门、发布日期和文档类型等元数据。
同步完成后先看失败记录,不要急着搜。加密文件、损坏文档、图片型扫描件都可能拖后腿;扫描件应先做 OCR,并抽查日期、数字和表格有没有识别错。
用真实问法测试并调结果
我会准备三类问题:原文关键词、员工口语问法、故意模糊的问题。比如同一条报销制度,分别搜「差旅标准」「出差住酒店能报多少」「住宿」。三种问法都测,才看得出语义检索是否真有帮助。
结果不准时,先查文档版本和元数据,再考虑相关性调优、同义词或 FAQ 内容。别一看到错误就反复改参数,很多时候排在前面的其实是已经作废、却没标记失效的旧文件。
接入应用并做好收尾
控制台验证通过后,可通过 AWS SDK 或相关查询接口接进内部网页;若要做问答机器人,再把检索片段交给模型生成答案。正式上线前必须用不同身份测试访问控制,管理员搜得到不代表普通员工也该看到。
我的总体感受是:创建索引只占一小段工作,后面的数据治理才是大头。试验结束若不继续使用,要删除不需要的索引、数据源和相关资源,并回看账单,别让测试环境悄悄跑下去。
常见问题
- 肯德拉怎么导入 PDF?
- 可把 PDF 放入受支持的数据源,例如 S3,再配置数据源并执行同步。图片型 PDF 应先做 OCR,否则可检索文本可能很少。
- 肯德拉同步后为什么搜不到?
- 先查看同步任务是否成功,再检查文件格式、解析结果、语言、访问控制和查询词。也要确认文档没有被元数据过滤条件排除。
- 肯德拉可以接聊天机器人吗?
- 可以把它作为检索层:先找出相关内容,再由大语言模型整理回答。应用端应保留来源链接,并限制模型只依据检索资料回答。