Kubernetes 上做 RAG:先跑通一条可观测的检索链路
·
Kubernetes 上做 RAG:先跑通一条可观测的检索链路
检索增强系统的第一版不需要先堆齐缓存、异步队列和多路召回。先确认文档怎么入库、谁负责召回、上下文在哪里拼装、模型调用失败后返回什么;这条窄链路跑清楚,再谈扩展。
把边界写在一张说明里
对每个调用写明输入、输出、依赖和失败动作。文档分片、向量库、重排服务和模型服务的配置应相互对应;暂时没有验证的推断明确标注。
实现顺序保持克制
先完成解析输入、调用一个检索依赖、拼装上下文并返回可判断结果。每一步加上日志或指标,失败时保留请求标识。等这条路径稳定后,再评估缓存、批处理和异步化是否真有必要。
并发资源别悬着
创建 client、channel 或 goroutine 的地方,要写清关闭和退出条件,并在测试中覆盖取消场景。云原生系统要能在异常时收束。
更多推荐


所有评论(0)