RAG 怎么验收:Hit@K、Ragas 和线上指标
拆成两层再谈框架
检索层看有没有把对的 chunk 拿上来:Hit@K、MRR、Context Recall / Precision。生成层看有没有按资料说话:Ragas 的 Faithfulness、Answer Relevancy。工具叫 Ragas、Langfuse 还是 LangSmith 不重要,指标定义乱了,实验就不可比。
离线怎么跑
- 先做一份业务问答集,人工标「应召回的文档 ID」,不要只用大模型互评。
- Ragas 适合回归:改 chunk、改召回、改 Prompt 后看忠实度有没有掉。
- Hit@K 掉了先别调 LLM,回头查分块和多路召回。
线上才是验收
踩率、追问率、转人工率、空回答率、会话解决率。闭环是:离线测评 → 上线 → 线上观测 → 离线复现 → 再上线。量化评估、Ragas 专稿和「评估方法」三份草稿并进这一篇。
RAG 怎么验收:Hit@K、Ragas 和线上指标
https://lautung.com/archives/rag-evaluation
评论