视频网站哪个做的好,黑客入侵网课,中山网站建设文化公司,ai代码生成器知识注入以对抗大型语言模型#xff08;LLM#xff09;的幻觉 摘要1 引言2 问题设置和实验2.1 幻觉2.2 生成响应质量 3 结果和讨论3.1 幻觉3.2 生成响应质量 4 结论和未来工作 摘要
大型语言模型#xff08;LLM#xff09;内容生成的一个缺点是产生幻觉#xff0c;即在输… 知识注入以对抗大型语言模型LLM的幻觉 摘要1 引言2 问题设置和实验2.1 幻觉2.2 生成响应质量 3 结果和讨论3.1 幻觉3.2 生成响应质量 4 结论和未来工作 摘要
大型语言模型LLM内容生成的一个缺点是产生幻觉即在输出中包含错误信息。对于需要可靠、基于事实的、可控的大规模文本生成的企业应用案例这尤为危险。为了减轻这一问题本文利用一种称为知识注入KI的技术将与文本生成任务相关的实体的上下文数据从知识图谱映射到文本空间中以便在LLM提示中包含这些数据。以回应在线客户对零售店铺的评论为例我们发现KI可以增加生成文本中包含的正确断言的数量。在定性评估中具有KI的经过微调的bloom560m模型表现优于OpenAI的未经微调的text-davinci-003模型尽管text-davinci-003模型的参数数量是后者的300倍。因此KI方法可以增加企业用户对利用LLM替代繁琐的手动文本生成的信心并使较小、更便宜的模型表现更好。
1 引言
大型语言模型LLM内容生成的一个限制是幻觉即在生成的文本中存在虚假断言。企业使用案例需要可靠、以事实为基础的大规模文本生成因此对LLM生成的文本进行投资具有风险。为了减轻幻觉问题我们利用一种称为知识注入KI的技术将与任务相关的实体的上下文数据从知识图谱映射到文本空间中以便在LLM提示中包含这些数据。在我们回应在线零售店铺客户评论的用例中KI增加了正确断言的比例同时提高了整体文本质量。
尽管LLM的参数包含了知识但它们仍然容易产生幻觉因为 1并非所有当前数据都可以在模型训练期间提供例如训练后对业务信息进行的更新以及 2将所有知识编码到模型参数中是困难的。KI从包含与任务相关的实体以及与其他实体的连接相关的知识图谱开始。KI旨在生成带有业务信息的可控文本该信息不是通用知识例如商家的电话号码可能不是LLM从基础训练中获知的常识。可控文本生成CTG受控制约束的影响例如情感或者在我们的用例中与真实业务信息的对齐。 从知识图谱中提取的文本字段被插入到一个模板化的提示中以将基于图谱的上下文映射到文本空间形成LLM的输入。这在图1中进行了演示其中请求了LLM对在线客户评论的生成响应。相关实体Review 1及其邻居例如Location 1在知识图谱中被映射到一个模板化的提示中。
2 问题设置和实验
2.1 幻觉
我们旨在确定KI是否减少LLM生成的对在线客户评论的响应中的幻觉。使用bloom-560m 的LLM经过微调使用人工客户服务代理撰写的评论和回复进行训练。对比评估了仅使用评论信息作者、评分和内容进行微调的仅评论模型生成的响应与使用添加的实体上下文进行KI提示的模型生成的响应。这些模型在约35,000个评论-回复对的数据集上进行了微调。
领域专家统计了每个生成的响应中的正确和错误断言。断言包括指定位置名称可通过电话号码或网址联系由品牌名称所有并位于位置地址。不正确即幻觉的断言包含与知识图谱相矛盾的不真实信息例如指示客户拨打虚构的电话号码。事实性断言是指其他没有标记为不正确的断言。
2.2 生成响应质量
除了测试KI对幻觉的影响外我们还测试了其对生成的评论响应整体质量的影响。主题专家根据3级评分标准表1对非KI提示的OpenAI的text-davinci-003文本生成模型即GPT-3 和KI提示的bloom-560m生成的响应进行了评分。
3 结果和讨论
3.1 幻觉
KI增加了正确断言的数量同时减少了错误断言的数量表2这表明在像评论回复这样的企业任务中KI是有用的。这些任务在人工完成时既费时又昂贵但需要关于业务的事实背景才能生成可信赖的文本。
3.2 生成响应质量
KI模型在生成的响应质量上获得了更高的评分这表明KI对于帮助模型与业务品牌标准保持一致是有用的表3。尽管text-davinci-003的参数数量是bloom-560m的约300倍但经过KI微调的较小模型表现优于较大的OpenAI模型。因此通过使用KI进行微调企业可以在训练和托管较小模型的同时产生更高质量的生成响应从而节省成本。此外使用较小的模型还可以提高推理速度。
4 结论和未来工作
在幻觉和生成响应质量方面的实验表明KI可以帮助企业从LLM中生成更可靠、基于事实且质量更高的文本。为了充分利用这一点企业需要具有与其业务相关的实体的事实和健壮的知识图谱如位置、评论、产品、文件等。
为了减轻这一限制在未来的实验中我们打算继续研究通过利用LLM进行实体和边缘提取来建立业务的健壮知识图谱的方法。