评估与测试您的 LLM 用例
学习目标
识别评估和测试您的大语言模型用例的方法。
您已经历了从理解 LLM 基础知识与 SAP 的生成式 AI 战略,到将 LLM 集成到业务应用程序,再到掌握提示工程、用于基础化的 RAG 以及为提升效率而进行的提示优化。您现在已具备构建强大且与上下文相关的生成式 AI 解决方案的知识。
然而,关键问题依然存在:您如何知道由 LLM 驱动的应用程序是否真正按预期运行、可靠地交付价值,并符合企业标准?
与传统软件的输出通常是确定性的不同,LLM 因其概率性质而带来了新的复杂性。这意味着仅靠传统测试方法是不够的。本课将帮助您全面理解严格评估和测试 LLM 用例所需的专门方法与策略。
评估 LLM 用例的重要性
对于企业应用程序而言,LLM 的评估和测试不仅仅是功能正确性。它关乎确保:
可靠性与信任: LLM 能否被信任用于关键业务流程?它的输出是否始终准确且没有幻觉,尤其是在以实时 SAP 数据为基础时?
安全性与负责任的 AI: LLM 是否遵循道德准则、避免延续偏见,并防止生成有害或不适当的内容?这直接关联到 SAP 的“负责任”AI 原则。
规模化性能: LLM 应用程序能否以高效、经济且可接受的延迟处理所需数量的查询,而不降低用户体验或产生过高的运营成本?
业务价值一致性: LLM 是否真正解决了已识别的业务问题并带来了预期的投资回报?
合规性与可审计性: 对于受监管行业,是否有清晰的方法来证明 AI 系统的质量和行为?
评估 LLM 用例的方法
有效的评估结合了定性(以人为中心)和定量(基于指标)两种方法。这种评估通常发生在您的 LLM 应用程序部署到生产环境以对真实世界数据进行预测之后。
人在环中的评估(定性且必不可少):
专家评审/人工评估: 与领域专家和质量保证团队等人类专家协作,针对关键或高风险用例人工评审 LLM 输出的事实准确性。
用户反馈机制: 将简单的“点赞/点踩”、星级评分或自由文本评论字段直接融入应用程序的用户界面。这提供了宝贵的真实世界性能数据,并有助于发现自动化指标可能遗漏的细微问题。
A/B 测试: 将您 LLM 应用程序的不同版本(例如使用不同的提示、模型或 RAG 配置)部署到不同的用户组,并根据用户参与度、满意度或任务完成率比较性能。
自动化/基于指标的评估(定量且可扩展):
困惑度(Perplexity): 衡量语言模型预测给定词序列的能力。较低的困惑度表明预测序列中下一个词的表现更好。虽然它更适用于基础模型评估,但在处理与您领域相关的文本时,它可以提供有关模型流畅性或“意外程度”的洞察。
双语评估替补(BLEU): 主要通过将机器生成的翻译与人工参考译文进行比较来评估其质量。它计算 n-gram(词序列,通常为 1 到 4)的精确率。虽然常用于翻译,BLEU 也可以衡量生成文本(例如摘要)与人工参考文本的相似度。
面向召回的摘要评估替补(ROUGE): 评估文本摘要系统的质量。它衡量系统生成的摘要与参考摘要之间的重叠程度,重点关注召回率。
分类准确率、精确率、召回率和 F1 分数: 当 LLM 执行分类任务时,这些指标至关重要,例如将客户评论归类为正面/负面情感、识别特定类型的文档。
准确率: 正确预测的实例占总数的比例。
精确率: 量化预测为正类的实例中有多少实际上是正类,有助于避免假正例。
召回率(灵敏度): 衡量实际正类实例中有多少被正确预测,有助于避免假负例。
F1 分数: 精确率和召回率的调和平均数,用于平衡这两个指标,尤其是在不平衡数据集中很有用。
词错误率(WER): 主要用于通过将系统生成的转写与人工转写进行比较,来评估自动语音识别系统的准确性。虽然它特定于自动语音识别(ASR),但衡量与“正确”序列偏差的概念广泛适用于语言模型评估。
语义相似度指标: 余弦相似度、Jaccard 指数和词移距离(WMD)等指标衡量句子或文档之间的语义相似度。它们评估超越简单关键词重叠的含义,适用于问答等任务,或判断生成的回答是否传达了与参考相同的意图。
LLM 即评审(LLM-as-a-Judge): 使用能力更强的 LLM 来评估另一个 LLM 的输出。“评审”LLM 评估提示、生成的回答,有时还有参考内容,然后评分或提供反馈。
自定义基于规则的检查: 针对特定要求实施程序化检查,例如格式验证(JSON、XML)、关键词存在/缺失、长度约束,或输出中的 PII/敏感数据检测。
基础性/事实核查指标: 对 RAG 应用程序至关重要。这些指标验证 LLM 的回答是否得到所检索源文档的支持,通常通过将 LLM 的答案分解为若干主张,并逐一对照所提供的上下文进行检查。
性能与运营指标:
延迟: LLM 生成响应所需的时间。
吞吐量: 单位时间内处理的请求数。
Token 用量: 每个请求的输入和输出 token 数量,直接影响成本。
错误率: API 错误或格式错误响应的出现频率。
资源消耗: 如果在内部运行模型,则为 CPU、GPU、内存使用量。
指标的用例
选择正确的评估策略意味着根据应用程序的用途组合这些方法。以下是几个示例:
场景 1:为 SAP Service Cloud 开发 AI 驱动的客户支持助手。
设想您正在构建一个聊天机器人,它基于您的 SAP 知识库回答客户查询。
开发期间: 您会使用语义相似度指标来确保聊天机器人从知识库中检索到最相关的信息。自定义基于规则的检查会确认回答格式正确(例如,在被要求时提供工单号)。
内部测试: 由支持代理进行专家评审/人工评估对于验证事实准确性、语气和公司政策合规性至关重要。基础性/事实核查指标会自动确认 AI 的回答是否直接得到其来源的支持。
部署之后: 用户反馈机制(例如“这有帮助吗?”)直接收集用户满意度。您可以针对不同的提示策略进行 A/B 测试,看看哪个版本带来更好的解决效果,同时监控延迟和 token 用量等性能与运营指标,以管理成本和响应速度。
场景 2:基于 SAP ERP 数据自动生成财务报告摘要。
考虑一个从 SAP ERP 中生成的复杂财务报告自动生成执行摘要的应用程序。
开发期间: 您会主要依靠 ROUGE 来衡量 AI 摘要与人工撰写摘要相比捕捉关键信息的程度。困惑度可以帮助确保生成的文本流畅、读起来自然。
内部验证: 由财务分析师进行专家评审/人工评估不可或缺,用于检查绝对的事实准确性、完整性和对报告标准的遵循情况。他们还可以使用语义相似度指标来确认 AI 摘要传达了与原报告相同的核心见解。
上线之后: 来自高管或经理的用户反馈机制会评估摘要的实用性和可读性。您会跟踪性能与运营指标,以确保报告快速高效地生成。
通过策略性地组合这些定性和定量方法,您可以全面了解 LLM 的性能,并确保它带来真正的业务价值。
LLM 应用程序的综合测试策略
除了单项评估方法之外,请在整个开发生命周期中考虑这些结构化的测试方法:
单元/组件测试: 关注单个提示模板、特定的 LLM 调用,或与 LLM 交互的小型函数。为这些组件测试多样的输入和边界情况。
集成测试: 验证应用程序的端到端流程,从用户输入到数据检索(RAG 管道)、提示构建、LLM 交互和最终输出处理。这确保与现有 SAP 系统和外部服务的无缝集成。
回归测试: 建立一套已知提示及其预期输出(真值)。定期运行这些测试,以确保新的代码更改、模型更新或提示改进不会对先前已验证的功能产生负面影响或引入新问题。
对抗测试(红队演练): 通过使用恶意或刁钻的输入(例如试图绕过安全的提示注入、范围外的问题)主动尝试“攻破”LLM 应用程序,以发现漏洞、偏见或意外行为。这是对提示加固(Prompt Hardening)知识的直接应用。
负载与压力测试: 模拟高用户流量,以评估应用程序在真实世界生产负载下的性能、可扩展性和成本影响。
评估方法的用例
让我们考虑一个从 SAP ERP 获取复杂财务报告并自动生成执行摘要的应用程序。
单元/组件测试 会验证各个部分,例如从 ERP 数据中提取关键指标的模块,或用于摘要长度的提示模板。集成测试 随后会验证完整流程:来自 SAP ERP 的原始财务数据、LLM 摘要,以及用于呈现的最终格式。
随着应用程序的演进,回归测试 会涉及重新运行一组过去的财务报告及其已批准的摘要,以检查新的代码或提示更改是否改变了先前正确的摘要。对抗测试(红队演练) 会包括尝试让 LLM 总结它不应总结的敏感信息,或注入歪曲财务数字的提示。
最后,负载与压力测试 会模拟许多用户同时请求摘要,以评估高峰需求下的性能,包括响应时间和资源使用情况。
利用机器学习运维实现持续评估与测试
机器学习运维(MLOps)在企业环境中系统化测试和评估 LLM 性能方面发挥着不可或缺的作用,确保形成持续的改进与可靠性循环:
自动化基准测试: MLOps 管道支持通过 CI/CD(持续集成/持续交付)运行多样化的测试用例,以在不同模型、版本和代码更改之间对准确性、延迟和可解释性等能力进行基准测试。
集中式性能日志记录: 训练、验证和推理期间的所有评估指标都以聚合方式记录,用于分析和模型比较,并提供丰富的分析仪表盘来跟踪进展。
规模化错误分析: 来自所有运行实例的日志被汇总,以识别模型需要通过反馈回路或架构调整来解决的系统性缺陷。这包括检测幻觉、越狱和数据泄露等关键安全威胁,从而实现对安全措施的持续监控与增强。
渐进式发布: 模型首先只服务于一小部分流量(例如通过 A/B 测试框架),以安全方式在全面发布到更高的生产流量之前测试稳定性和性能。
自动化警报: 与监控工具的集成允许针对指标偏差设置警报,确保对性能下降或安全事件做出及时响应。
通过标准化 LLM 测试协议并使用自动化,MLOps 使长期运行的实验之间更容易比较、模型升级更安全,并提供丰富的分析来跟踪进展。这对于性能严谨性至关重要的业务关键型 AI 而言极为宝贵。
评估方法的用例
考虑您在 SAP Service Cloud 中的 AI 助手。MLOps 确保它持续演进。
自动化基准测试 通过 CI/CD 定期测试新模型更新的响应质量和速度。所有评估结果和用户反馈都进入 集中式性能日志记录, 提供性能仪表盘。
规模化错误分析 持续扫描实时日志以发现幻觉或提示注入,识别系统性缺陷。
新的助手版本经历 渐进式发布,从小规模用户组开始(A/B 测试)。如果关键指标出现偏差,自动化警报 会立即通知 MLOps 团队进行及时干预,维持高质量的服务。
本课小结
您现在已识别出一套用于评估和测试 LLM 用例的稳健方法。您看到评估生成式 AI 应用程序需要结合定性的人工评审和定量的自动化指标,超越传统的软件测试。通过系统地采用人在环中的评估、多样化的自动化质量与性能指标,以及回归测试和对抗测试等综合测试策略,您可以确保您的 LLM 解决方案在企业环境中始终准确、可靠、经济且安全。这一持续评估循环在 MLOps 实践的大力支持下,对于您 AI 计划的长期成功与可信度至关重要。