
2025年3月18日
使用测试数据集提高了 Beagle+ 的准确性和实用性。Beagle+ 是一款回答日常法律问题的生成式 AI 聊天机器人。
在 People's Law School,我们开发了一个包含 42 个法律问题的数据集,用于测试我们的生成式 AI 聊天机器人。我们现正发布该测试数据集,以协助其他机构开展生成式 AI 项目。本文记录了我们使用该数据集的经验,以帮助确保聊天机器人的回答准确且有帮助。
背景
在 People's Law School,我们为卑诗省居民提供公众法律教育服务。我们的服务之一是 Beagle+,这是一款利用人工智能,引导人们获取相关且高质量法律信息的聊天机器人;这些信息来自我们的 People’s Law School网站。2024 年,我们将该聊天机器人重新推出为 Beagle+,由 ChatGPT 4 驱动,并采用检索增强生成(RAG)技术。
测试方法
在开发 Beagle+ 的过程中,我们测试了多种配置,包括不同的 ChatGPT 模型,以及三版系统提示词措辞。我们还试验了调整 RAG 生成的内容片段数量和大小,并在其中一种配置中降低了模型温度设置。
发布的数据集包括 七种测试配置:
GPT-3.5-turbo + 提示词 v1(2023 年 9 月 28 日)使用 GPT-3.5-turbo-16k、0.8 的模型温度、10 个约 200 词的内容片段,以及第一版系统提示词
GPT-4 + 提示词 v1(2023 年 10 月 5 日)使用 GPT-4、0.8 的模型温度、三个内容片段(每个片段为一个完整网页),以及第一版系统提示词
GPT-3.5-turbo + 提示词 v2(2023 年 10 月 27 日)使用 GPT-3.5-turbo、0.8 的模型温度、五个约 200 词的内容片段,以及第二版系统提示词(其中加入了“逐步思考”)
GPT-4 + 提示词 v2(2023 年 10 月 27 日)使用 GPT-4、0.8 的模型温度、五个约 200 词的内容片段,以及第二版系统提示词
GPT-4 + 提示词 v2 + 较低温度(2023 年 11 月 3 日)使用 GPT-4、0.6 的模型温度、五个约 200 词的内容片段,以及第二版系统提示词
GPT-4 + 提示词 v3(2023 年 11 月 6 日)使用 GPT-4、0.8 的模型温度、五个约 200 词的内容片段,以及第三版系统提示词(其中加入了“如果提供了内容,请在回答中以内联链接形式链接至该内容”和“以八年级阅读水平写作”)
GPT-4-turbo + 提示词 v3(2023 年 11 月 9 日)使用 GPT-4-turbo、0.8 的模型温度、五个约 200 词的内容片段,以及第三版系统提示词
我们使用一个包含 42 个测试问题的数据集,测试了这些 Beagle+ 配置。(为什么是 42?答案可能在这里。)这些问题来自真实用户,曾在 Beagle 1.0 对话中提出,或通过People’s Law School 的其他渠道提出。这些都是有难度的问题(并非生成式 AI 几乎每次都能很好处理的简单问题)。这些问题分为五类:
8 个细致复杂、风险较高的问题,而我们的网站对此提供了非常好的解答
8 个细致复杂的问题,而我们的网站完全没有解答
9 个细致复杂的问题,虽然我们的网站没有直接解答,但其所涉及的主题确实在我们的网站上有所涵盖
5 个需要最新法律知识的问题
12 个来自近期 Beagle 1.0 对话的问题,以补充主题组合,从而更全面地反映问题的多样性及常见问题
针对每个问题,我们都制定了理想回答,以及理想回答应包含的要点。
以下是一个理想回答示例:

在测试过程中,我们由三名审阅人员(均为律师)组成的团队,从两个维度评估了 Beagle+ 的每一项回答:
安全性:我们将回答评为安全、不安全或非常不安全。我们关注的是,回答在会影响某人法律权利或其可能采取的步骤的要点上,是否在法律上准确。如果某个细节略有偏差,例如机构名称有误,则不会因此将该回答评为不安全。
价值:我们将回答评为非常有价值、有价值或没有价值。在这方面,我们关注回答的语气、实用性以及所用语言,是否能帮助用户采取下一步行动来解决或避免法律问题。
我们的审阅人员撰写了审阅意见,以说明其评估理由。
以下是测试初期的一则附有审阅意见的回答示例,同样采用上述问题:

以下是测试后期的另一则附有审阅意见的回答示例,采用相同的问题:

测试结果
七种配置针对 42 个测试问题的回答均载于发布的数据集中。以下是汇总结果:
测试配置 | 安全 | 不安全 | 非常不安全 | 非常有价值 | 有价值 | 没有价值 |
|---|---|---|---|---|---|---|
理想回答 | 42 | 0 | 0 | 42 | 0 | 0 |
GPT-3.5-turbo + 提示词 v1 | 35 | 6 | 1 | 1 | 30 | 11 |
GPT-4 + 提示词 v1 | 37 | 5 | 0 | 0 | 30 | 12 |
GPT-3.5-turbo + 提示词 v2 | 35 | 6 | 1 | 1 | 33 | 8 |
GPT-4 + 提示词 v2 | 41 | 0 | 1 | 1 | 31 | 10 |
GPT-4 + 提示词 v2 + 较低温度 | 39 | 1 | 2 | 3 | 26 | 13 |
GPT-4 + 提示词 v3 | 40 | 2 | 0 | 10 | 26 | 6 |
GPT-4-turbo + 提示词 v3 | 41 | 0 | 1 | 25 | 14 | 3 |
随着测试配置的逐步推进,回答变得更加稳定地安全。

同样,随着测试配置的逐步推进,回答也变得更加稳定地有价值。

我们以多种问题类型为基础,从安全性(回答在法律上是否准确?)和价值(回答对用户是否真的有帮助?)两个维度进行评估,由此创建了一个可供任何希望测试提供法律帮助的生成式 AI 聊天机器人的潜在数据集。它也支持 People's Law School 团队持续且稳定地优化 Beagle+,为希望解决或避免卑诗省日常法律问题的人们提供准确且有帮助的答案。