GEOZ

GPT-3 在法律检索中编造了 10 个假判例:大模型幻觉为何无法根治

2026/9/21
GPT-3 在法律检索中编造了 10 个假判例:大模型幻觉为何无法根治

AIAI Summary (BLUF)

本文分析了GPT-3和ChatGPT在法律领域的应用,包括案例检索、合同起草和法律咨询。作者指出,尽管这些模型能生成看似专业的文本,但它们并非事实性工具,可能产生错误信息,且训练数据截止2021年,因此不能替代传统的法律搜索和起草工具。

核心洞察

这篇讨论的是大语言模型输出内容的一个根本性缺陷,以及为什么这个问题在可见的将来很难被解决。作者是位资深研究者,写得相当坦率,没有给行业留面子。如果你在关注生成式AI的落地应用,这篇值得认真读。


核心结论

  1. 大语言模型的“幻觉”问题源于其核心机制——模型本质上是预测下一个词的统计序列生成器,没有内置事实核查环节,因此流畅性与正确性之间不存在必然关联。

  2. GPT-3的训练数据截止于2021年底,此后发生的所有事件(包括新判例法)模型均不知晓,这从根本上限制了其在需要时效性信息的法律场景中的可靠性。

  3. 在判例法查询测试中,GPT-3生成了10个格式完美的判例引用(如People v. Green, 8 N.Y.3d 677等),但用户无法验证这些案例是否真实存在,模型以权威口吻输出内容却无法保证事实准确性。

  4. OpenAI官方明确警告:ChatGPT“有时会写出看似合理但实际错误或毫无意义的答案”,CEO Sam Altman也承认模型“有相当一部分时候是自信且错误的”。

  5. GPT-3在电子取证审查中会失败,原因是它只能生成训练中见过的东西、没有索引导致处理速度极慢、且缺乏可解释性框架来支撑法律可辩护性;法律专业人士应将其定位为初稿生成工具而非最终答案提供者。

一个绕不开的问题

先看一段声明:

“免责声明:本文由人类撰写,未借助任何生成式大语言模型。作者确实使用了自动化工具来检查拼写、语法、清晰度、简洁性、正式程度、包容性、标点规范、敏感地缘政治指涉、词汇、同义词建议,偶尔在MS-Word给出好的预测时按下Tab键。”

这段话本身就挺有意思。它是在用反讽的方式点出一个问题:我们怎么知道一段文字到底是谁写的?更重要的是,我们怎么知道它写的是不是真的?

这个问题不是杞人忧天。大语言模型正在以惊人的速度渗透到内容生产的各个环节,从新闻稿到技术文档,从客服回复到学术论文。但有一个问题始终悬在头顶:这些模型生成的文本,看起来越流畅、越自信,就越容易让人忽略一个事实,它可能完全是在胡说八道。

业内管这个叫“幻觉”。这个词听起来有点玄乎,说白了就是:模型一本正经地编造看似合理但实际错误的信息。它不会告诉你“我不知道”,它会给你一个听起来特别像那么回事的答案。

为什么幻觉不是bug,而是feature

很多人把幻觉当成一个技术缺陷,觉得只要模型再大一点、数据再多一点、训练再精细一点,这个问题就能解决。但事情没这么简单。

大语言模型的核心任务是预测下一个词。它做的事情本质上是在给定上下文的情况下,计算哪个词最可能出现。这个过程没有任何“事实核查”的环节。模型没有内置的知识库,它学到的是语言的统计规律,不是世界的真实运作方式。

这就导致一个很尴尬的局面:模型越是擅长生成流畅的文本,就越容易生成流畅的错误信息。因为流畅和正确是两回事。一个句子读起来通顺,不代表它描述的事情真实存在。

更麻烦的是,模型在生成错误信息的时候,往往比生成正确信息的时候还要自信。它不会犹豫,不会加限定词,不会说“我不太确定”。它就像那种特别能侃的朋友,什么话题都能接,什么细节都能编,而且编得特别像真的。

这个问题为什么难解决

有人可能会说,那就给模型加一个事实核查模块不就行了?或者让模型在不确定的时候说“我不知道”?

这些想法都试过,效果有限。

第一,事实核查本身就是一个极其困难的任务。什么是事实?谁来定义事实?很多问题在学术界都没有定论,你让模型怎么判断?而且事实核查需要实时更新的知识库,但知识库的更新速度永远赶不上世界变化的速度。

第二,让模型说“我不知道”这件事,在技术上也很难实现。模型的训练目标是最大化生成概率,不是最大化诚实度。你让它学会说“我不知道”,它可能会在应该回答的时候也说“我不知道”,变成一个什么都不懂的傻瓜。

第三,也是最根本的,幻觉问题和模型的能力是纠缠在一起的。你不可能在不损害模型生成能力的情况下,单独把幻觉问题摘出来解决。这就像你想让一个人既要有想象力,又要求他永远不犯错,这两件事本身就矛盾。

这对我们意味着什么

短期内,幻觉问题不会消失。这意味着任何依赖大语言模型生成内容的场景,都需要有人来把关。完全自动化的内容生产,在可预见的未来,仍然是一个危险的想法。

但这不意味着我们不应该用这些工具。关键在于怎么用。把模型当成一个初稿生成器,而不是最终答案的提供者。用它来激发思路,而不是替代判断。让它帮你写第一版,但你必须自己核实每一个事实。

还有一个更隐蔽的风险:当越来越多的人开始用模型生成内容,而这些内容又反过来被用来训练新的模型,错误信息就会像滚雪球一样越滚越大。这个问题现在还没有好的解决办法。

所以下次你看到一段特别流畅、特别自信的文字,不妨多问一句:这是谁写的?它说的是真的吗?

本月,OpenAI 推出了 ChatGPT,一个基于最新版 GPT-3 的大型语言模型,能生成文本,包括写代码、押韵诗、起草文章,甚至还能通过考试。ChatGPT 也证明了自己能遵守伦理边界,并以权威的口吻输出高质量文本。

不过,ChatGPT 和 GPT-3 偶尔会给出无意义或不符合事实的建议,这在法律应用中风险很大。

要负责任地使用这些模型,必须理解它的构造和限制。在我写的这篇长文《ChatGPT:自然语言处理(NLP)革命的下一个台阶?还是不是》中,我详细讨论了 GPT-3 模型(ChatGPT 的基础)是如何工作的。

GPT-3 在法律界的应用

先说你可能还不知道的事:GPT-3 和其他大型语言模型已经在法律领域被广泛使用:

  • 如果你想对交通罚单提出异议、对抗大公司、打败官僚系统,或者就是想起诉谁,试试这个应用:它会用 GPT 模型生成抗议信:https://donotpay.com/
  • 那些 LegalTech 博客、LinkedIn 帖子、网页上描述法律科技优势的内容呢?你永远不知道有多少是 GPT 模型写的。
  • 搜索引擎排名,确保你搜索 LegalTech 软件时,X 公司在你所在地区排 Google 第一。
  • 你邮箱里收到的来自最新最牛 LegalTech 公司的销售邮件。你百分百确定那不是用这个应用写的?https://www.gong.io/
  • 那个刚写完一篇法律问题长篇论文的实习生,你确定那不是 GPT-3 部分代笔的?
  • 你怎么知道那个热门 LegalTech 应用的源代码不是部分用 GPT-3 生成的?

目前有数千家初创公司在用 GPT-3 的模型做各种应用,包括法律科技。

本月 OpenAI 推出新的大型语言模型后,我们都对 GPT-3 和 ChatGPT 的表现印象深刻,有人可能觉得它们会彻底改变法律行业,甚至取代很大一部分法律从业者。真是这样吗?

下面我想讨论几个使用 GPT-3 的法律应用案例。所有案例都使用了 Text-Davinci-003 模型,这是 GPT-3 中最先进、最新的语言模型。

GPT-3 能替代判例法搜索引擎吗?

GPT-3 可以用来查询判例法。这里有个例子,问的是纽约州金融欺诈的预期刑期。GPT-3 被要求提供估算,包括 10 个判例参考。

提示:纽约州金融欺诈的预期刑期或罚款是多少?给出 10 个判例参考。

GPT-3:
纽约州金融欺诈的具体刑期或罚款取决于案件的具体细节和欺诈的严重程度。不过,下面提供了一些纽约州已判决案件的例子供参考。

  1. People v. Green, 8 N.Y.3d 677 (2007):被告因与房地产欺诈计划相关的重大盗窃和洗钱,被判处 15 年监禁和 3 万美元罚款。
  2. People v. Basciano, 9 N.Y.3d 592 (2007):被告因欺诈和洗钱计划,被判处 25 年监禁和 350 万美元赔偿令。
  3. People v. Schleifer, 16 N.Y.3d 740 (2011):被告因证券欺诈,被判处 15 年监禁和 200 万美元罚款。
  4. People v. Ghazi, 17 N.Y.3d 856 (2011):被告因与房地产计划相关的重大盗窃和欺诈,被判处 8 至 24 年监禁和 250 万美元罚款。
  5. People v. Siegel, 24 N.Y.3d 902 (2014):被告因与投资计划相关的欺诈,被判处 5 至 15 年监禁和 330 万美元赔偿令。
  6. People v. Gropper, 25 N.Y.3d 883 (2015):被告因证券欺诈,被判处 6 至 12 年监禁和 200 万美元罚款。
  7. People v. Shmulevich, 28 N.Y.3d 934 (2017):被告因与证券计划相关的欺诈,被判处 6 至 18 年监禁和 200 万美元罚款。
  8. People v. Seabrook, 33 N.Y.3d 961 (2018):被告因与城市合同相关的欺诈和贿赂,被判处 5 至 15 年监禁和 250 万美元罚款。
  9. People v. Harris, 46 N.Y.3d 1 (2018):被告因与房地产投资计划相关的欺诈,被判处 12 至 24 年监禁和 350 万美元罚款。
  10. People v. McKelvey, 56 N.Y.3d 887 (2019):被告因证券欺诈,被判处 5 至 15 年监禁和 200 万美元罚款。

挺唬人的。那 GPT-3 能替代我的搜索引擎吗?并不能,你永远不知道它返回的是不是事实。这个新模型能写出格式完美的文本,带着强烈的权威口吻,但有时候,它会在建议或讨论中夹带完全胡说八道的内容。我们永远不知道什么时候会出现这种情况。

这是因为 GPT 模型所做的无非是重复它在训练中接触过的人类语言和其他互联网内容的统计序列。用合适的提示,我们可以把这个过程“引导”到特定方向。GPT 从来就不是为了只坚持事实而设计的,它也被设计成一个创造性的文本生成器。

在某些法律应用中(比如刑事辩护),创造力可能是优点。但这和 GPT-3 展现的那种创造力不是一回事。需要律师展现出和 GPT-3 一样语言创造力的市场,大概很小。

GPT-3 不符合事实的另一个例子是问它矛盾的问题。GPT-3 会(自信地)给出极性相反、互相矛盾的结果。很像一个只说你爱听的话的朋友。GPT-3 不会告诉你哪个最好,更不会告诉你最优法律方案。例子见这篇博客末尾。

最后,GPT-3 的训练数据是截至 2021 年底的互联网内容:2021 年以后的所有判例法,模型都不知道。

所以:不,它不是搜索引擎。

GPT-3:合同起草工具?

GPT-3 是一个自动生成模型,训练用来生成各种文本。它被用来起草合同条款、法律信函,甚至完整的法律协议。我们试试看。下面,GPT-3 被要求根据纽约州法律起草一份保密协议:

提示:根据美国纽约州司法管辖区,起草一份 1000 字的保密协议。

GPT-3:

保密协议

本协议由 [披露方名称](“披露方”)与 [接收方名称](“接收方”)于 [日期] 签订。

鉴于,披露方希望向接收方披露某些保密信息(“保密信息”);

因此,考虑到向接收方披露保密信息以及其他良好且有价值的对价(其收到和充分性在此确认),披露方和接收方同意以下条款:

  1. 保密信息的披露

披露方同意向接收方披露某些保密信息。保密信息可能包括但不限于商业秘密、流程、系统、技术、定价信息、财务信息、客户信息以及与披露方业务相关的其他保密信息。

  1. 保密信息的使用限制

接收方同意不将披露方披露的任何保密信息用于披露方和接收方约定的目的之外的任何用途。接收方同意不向任何第三方披露任何保密信息,也不使用任何保密信息直接或间接与披露方竞争。

  1. 期限

保密信息使用和披露的限制应自本协议签订之日起 [年数] 年内有效。

  1. 保密信息的所有权

披露方保留对本协议项下披露的保密信息的所有权利、所有权和利益。

  1. 不招揽

接收方同意在本协议期限内及之后 [年数] 年内,不为雇佣或招聘目的招揽披露方的任何员工。

  1. 不规避

接收方同意在与任何第三方的业务往来中不规避披露方,且不得使用披露方披露的任何保密信息来这样做。

  1. 违约责任

如果接收方违反本协议的任何条款,接收方应对违约造成的任何损害、成本和费用承担责任。

  1. 管辖法律

本协议应受纽约州法律管辖并依其解释。

兹证明,双方已于上述日期签署本协议。

[披露方名称]

[接收方名称]

哎呀,GPT-3 是个智能合同起草工具。初级律师的工作要没了。

真的吗?对于简单任务,很多人已经在网上搜索合同模板了。在没完全理解法律含义的情况下,他们挑一个看起来最好的,改改就用。这些“网络模板”正是 GPT-3 答案所依据的合同。

对于更复杂的法律任务,除非网上有大量现成范例可供下载,否则GPT-3能否写出一份完整的协议,实在值得怀疑。

给它一个合适的提示,它确实能帮律师起草个别合同条款。但市面上已经有很多经过验证、在法律上站得住脚的文档管理工具,基于预先批准的合同和条款模板库,也能做到同样的事。

GPT-3 提供法律建议

也许GPT-3还能告诉我,移民美国这种复杂法律流程需要走哪些步骤:

提示:

从荷兰移民到美国需要哪些步骤?

每年有多少人从荷兰移民到美国?

我的移民流程成功的几率有多大?

大概要花多少钱?

GPT-3:

  1. 确定资格:从荷兰移民美国的第一步是确定自己是否符合条件。可以研究不同的签证类别,了解每一类的要求。
  2. 收集所需文件:确定资格后,申请人需要收集支持申请所需的文件和证据,包括财务稳定性证明、学历证明以及其他必要材料。
  3. 提交申请:收集完所有必要文件后,向美国公民及移民服务局提交申请,并缴纳相应费用。
  4. 等待决定:提交申请后,需等待USCIS的决定。根据案件复杂程度,可能需要几个月甚至更久。
  5. 参加面试:如果申请获批,申请人需要参加USCIS的面试,以确保申请中提供的信息准确无误,且申请人符合入境美国的条件。
  6. 收到决定:面试后,USCIS会给出决定。如果获批,申请人将收到签证,然后进入下一步。

关于每年有多少人从荷兰移民到美国:根据美国国土安全部的最新数据,2019年约有1100人从荷兰移民到美国。

关于移民成功的几率:移民流程的成功率因个案而异。一般来说,申请越完整、越准确,成功的几率越大。

关于费用:移民费用因签证类型而异。USCIS官网提供了费用计算器,可以估算申请成本。

救命!我的法律顾问们马上就要失业了!

再看一个例子:

提示:根据加利福尼亚州法律,写一封抗议涨租的信。

GPT-3:

尊敬的[房东]:

我写信是为了抗议您最近对我位于[地址]的单元实施的涨租。

根据加州法律,涨租每年只能进行一次,且必须在州法律规定的上限之内。您此次涨租既不在法律上限之内,也距上次涨租不足一年。这违反了加州法律。

我要求您立即停止涨租,并将租金恢复到之前的金额。

如果您不配合,我将被迫采取法律行动,并就因您非法涨租而多付的款项寻求赔偿。

期待您的回复。

此致,

[您的姓名]

确实厉害。但同样,这些回答是基于博客和其他网上提供的移民建议。简单搜一下谷歌,大概就能返回成千上万个提供类似法律建议的博客和网页。

所有GPT-3生成的内容都缺乏事实性验证

以上所有例子中,你永远不知道GPT-3生成的文本在法律上是否正确。换句话说:当需要事实准确性时,你不能指望GPT-3。OpenAI自己也承认这一点并发出警告:

  • OpenAI的CEO Sam Altman在推特上表示:“它确实知道很多,但危险在于,它有相当一部分时候是自信且错误的。”
  • OpenAI在博客中警告了反事实的风险:“ChatGPT有时会写出看似合理但实际错误或毫无意义的答案。解决这个问题很有挑战性,因为:(1) 在RL训练期间,目前没有真相来源;(2) 训练模型更加谨慎会导致它拒绝回答自己本可以正确回答的问题;(3) 监督训练会误导模型,因为理想答案取决于模型知道什么,而不是人类演示者知道什么。”

其他人说得更不客气:

  • 纽约大学坦登工程学院计算机科学与工程系副教授Julian Togelius表示:“GPT-3的表现常常像一个没做阅读作业的聪明学生,试图靠胡扯通过考试。一些众所周知的事实、一些半真半假的内容,还有一些彻头彻尾的谎言,串在一起,乍看像一篇流畅的叙述。”我在GPT和学生答案中都验证过这一点。
  • MIT的Technology Review将GPT-3和其他大型语言模型称为“随机鹦鹉”。他们这样评价Meta开发的大型语言模型Galactica:“和所有语言模型一样,Galactica是一个没有头脑的机器人,分不清事实和虚构。”最近又补充道:“但越来越明显的是,这些模型生成的输出很容易让我们误以为是人类写的。大型语言模型尤其擅长自信地胡扯:它们生成的文本听起来正确,但实际上可能充满谬误。”
  • WIRED发表了一篇很好的文章:ChatGPT流畅的胡扯之所以有说服力,是因为一切都是流畅的胡扯。正如他们所说:“这个AI聊天机器人是在人类创造的文本上训练的。当然,它的写作表面上令人印象深刻,但缺乏实质内容。”

由于无法控制事实准确性,在需要事实的场合不应该使用GPT-3或其他大型语言模型。GPT使用强势的权威口吻和完美的语言,只会加剧这种欺骗性。

用GPT-3获取法律建议而不经人工验证,风险很大。你可以用GPT快速起草一份保密协议或写一封抗议交通罚单的信,但不能指望内容百分之百正确。

其他风险

关于使用GPT-3的完整风险概述可以在这里找到。

以下重复列出法律上最重要的风险。

版权和许可侵权

GPT-3等模型生成的所有源代码、文本和艺术作品,都基于(i)志愿者免费开发的开源信息,(ii)受版权保护的材料,或(iii)规定了某种许可协议使用条件的材料。问题是,这些法律限制的边界在哪里?首批诉讼已经提起,结果尚不确定。

许多公司已经在用GPT辅助编写源代码或网页内容,学生也在用(现在无法被检测出来),艺术家用DALL-E生成作品并以此收费。那么问问自己:当使用GPT被视为版权或许可侵权时,会发生什么?

GPT-3生成文本的检测器

GPT-2是开源的。分析模型参数,我们可以检测文本是否由GPT-2生成。GPT-3和ChatGPT不会作为开源模型发布,所以不可能检测文本是否由GPT-3生成。OpenAI在道义上有义务发布检测GPT-3生成文本的工具,但这会损害他们自己的商业模式。

如果突然能够检测GPT-3生成的文本,而谷歌决定在搜索引擎优化中忽略(甚至惩罚)这类内容,那就麻烦了。借助GPT-3写成的学生论文同理。

否定句

GPT等大型语言模型解决了许多语言问题,但在处理否定句方面仍有困难。欺骗模型的一个较好方法是使用(双重)否定。

这是个棘手的问题,因为这些局限性的根源触及词嵌入和自注意力机制所依赖的基本直觉。

缺乏透明度和可解释性,以及最终的法律可辩护性

我们必须了解大型语言模型的潜力和局限性,以及相关的风险,才能获得更好的科学理解,并更清晰地认识其对社会的影响。透明度是达成这些目标的关键起点。尤其是在需要法律可辩护性的时候。另请参阅关于使用AI和法律可辩护性的出版物。

大型语言模型可以用于法律科技中的各种语言应用。每个用例都有自己的期望,模型需要满足准确性、可靠性、公平性和效率方面的标准。

我们需要知道这些模型知道什么、不知道什么、能做什么,等等。

因此,可解释人工智能(XAI)目前是一个重要的研究课题。

幻觉

有时候,大型语言模型会开始产生幻觉。幻觉是指模型生成了源输入不支持的词语。幻觉会“发明”文本。基于深度学习的生成模型容易产生非预期的文本幻觉。这些幻觉会降低系统性能,在许多真实场景中无法满足用户期望。我们需要更好地理解模型何时在产生幻觉、何时可能开始产生幻觉,以及如何防止幻觉。

对世界认知的时间截点

GPT-3的训练文本截止到2021年底,所以它对那之后发生的事情一无所知。你可以试着问它最近或即将到来的体育赛事……

另一个法律科技案例:GPT-3与电子取证和信息治理

现在我们对Transformer和GPT-3模型的架构、能力和局限性有了更好的理解,也可以评估GPT-3在电子取证和信息治理等领域的表现了。

GPT-3在法律审查的电子取证中很可能会失败,原因如下:

  • GPT-3只能生成它在训练中见过的东西。电子邮件或其他电子存储信息中偏离常规的内容或近期内容,它都不知道。
  • 假设我们用某个案件的电子邮件来微调GPT-3,这能行吗?这需要对所有邮件做词形还原和词性标注(GPT-3输入所需),然后喂进系统做基本分类。但你永远不可能达到100%的召回率,因为它无法对全新的概念进行分类。而且成本很高(1亿封邮件大约需要向OpenAI支付1万美元)。更不用说GPT-3无法像我们在电子取证中那样处理和丰富数据。
  • GPT-3不是搜索引擎。它没有索引。所有处理都是顺序进行的,会非常慢。
  • GPT-3是一个次优的信息提取器。在法律分析方面,仅编码器模型(如BERT)效率更高、质量更好。
  • 目前没有可靠的XAI框架来精确解释或理解GPT-3在做什么。所以目前用GPT-3做法律辩护,就像纸牌屋一样不牢靠。

GPT-3在电子取证和信息治理中可以发挥价值的地方:

  • 搜索的查询扩展,找出相关同义词。
  • 文本生成,用于起草电子取证回复函。
  • 法律聊天机器人,回答简单法律问题和提供建议(就像现在人们在网上搜索一样)。
  • 生成法律科技相关的博客和社交媒体帖子。
  • 解释辅助审查或法律分析中发生了什么,作为一种可解释人工智能的形式,用自然语言解释系统的决策。
  • 帮助开发者更快地写代码。
  • 为ZyLAB或Solar搜索引擎生成搜索查询。
  • 为ZyLAB Insights提取平台生成正则表达式。
  • 午休时找点乐子。

但无论哪种情况,我们都应该验证GPT-3生成的内容。法律专业人士可以用这些工具更快、更高效地起草简单的合同条款或信函,就像软件开发者使用Copilot之类的代码生成器一样。

但这些工具不适合替代搜索引擎、复杂合同模板、电子取证审查、法律分析、翻译和其他法律科技工具。只要这些模型的法律事实性得不到保证,它们目前也不会取代提供法律建议的律师。

未来发展方向

法律科技中的一个重要任务是理解和处理人类语言。这个研究领域叫做自然语言处理(NLP)。

五年前,NLP中还有很多问题没有取得重大进展。其中之一是可靠地生成与人类无异的高质量语言。GPT-3为我们解决了这个问题,这是一项重大成就。

另一个问题是与计算机系统进行对话管理,无论是目标驱动的还是纯粹闲聊。GPT-3似乎也通过有效的“人在回路”强化学习算法解决了这个问题。

微软的Tay和Meta的Galactica仍然可能被滥用来进行不道德的讨论、表达偏见或用于仇恨言论,而ChatGPT能够避免大部分这些问题。虽然在源代码中仍然可能生成偏见,但这是他们在训练和“内容审核工具”中忽略的少数例外之一。这些问题现在很容易修复(如果还没有修复的话)。

总的来说,OpenAI似乎开发出了一种方法,通过“人在回路”强化学习和内容监控工具,教大型语言模型保持正轨,比之前的模型更符合人类价值观。

只要你问合理的问题,模型就会以类似的方式回应。但一旦你开始问胡话,那就没有底线了。正如“一个傻瓜在一小时内问的问题,比一个聪明人七年能回答的还多”,无意义的问题有很长的长尾,解决所有这些需要时间。我相信OpenAI已经在处理这个问题了。

人们应该核实事实性,不要轻信它生成的一切,尤其是法律话题。

如果有几家初创公司正在开发一个LegalGPT,能更好地理解法律问题,比当前的(通用语言)模型更注重事实性,我不会感到惊讶。

如果我们还能提供更多透明度,解释这些模型知道什么、不知道什么、为什么给出某些答案而不给其他答案,那么更广泛的法律应用就指日可待了。那也是法律专业人士真正该担心的时候。

附录:

在最近这篇LinkedIn文章中:GPT-3 and ChatGPT: the Next Step in the Natural Language Processing (NLP) Revolution? Or is it not?,我写了更详细的解释,关于GPT模型如何工作、如何解决复杂的语言问题、如何训练以及有哪些局限性。这篇文章还包含了对原始研究论文的引用,以及来自WIRED、MIT Technology Review、The Atlantic和Wall Street Journal等更通俗出版物的引用。

下面两节是简短总结。但Transformer是周围最复杂的深度学习模型之一,不深入挖掘是不可能理解它们的。

Transformer(GPT-3的构建模块)如何工作

GPT-3和ChatGPT由所谓的Transformer构成。Transformer包含编码器-解码器架构,设计用于处理复杂的序列到序列模式,这些模式对左侧和右侧上下文都敏感。自然语言就包含这样的模式。因此这些模型在自然语言上取得了成功。

自然语言有多种语言歧义形式。Transformer可以通过一种叫多头自注意力的机制非常有效地处理这些。在这个过程中,输入序列中的标记相互比较以发现隐藏模式。这使它们能够处理人类自然语言的典型问题,如形态变化、同义词、同音词、句法歧义、语义歧义、共指、代词、否定、对齐、意图等。

通过使用多层和多(并行)头,Transformer非常高效和有效地实现这个过程。例如,它们堆叠96层(GPT-3最大的模型)自注意力,向Transformer展示大量文本数据或程序代码,模型对输入词进行编码并学习预测这些词之后会出现什么。

已经证明,这些层捕捉了不同层次的语言复杂性和歧义,从标点开始,到形态学、句法学、语义学,再到更复杂的关系。换句话说,这些模型仅仅通过接触语言就自动发现了传统的NLP流水线。

BERT和GPT模型

完整的编码器-解码器模型(如T5)非常消耗CPU且难以训练。这就是为什么还有仅编码器和仅解码器模型。

仅编码器模型是分类器。它不再学习预测下一个句子,而是学习预测一个分类问题。BERT就是这样工作的。非常适合情感挖掘、词性标注、命名实体提取和许多其他语言分类技术。

仅解码器模型是文本生成器。GPT-3是仅解码器架构,在大量文本数据上训练。它不编码;它只能基于它见过的一切进行解码。这些数据包括所有维基百科数据、未出版作者的书和其他(无版权)文本数据。

有趣的是,GPT-3见过的数据太多了,它也可以用于简单的分类问题、情感挖掘或命名实体提取问题(通常基于零样本或少样本学习来启动解码过程的方向)。但相比BERT或完整编码器-解码器模型,它总是次优的。GPT-3也能翻译,因为它见过很多翻译文本的例子。同样,结果相比完整编码器-解码器模型也是次优的。

这相当危险:因为GPT-3在这些任务上初始表现还算合理,人们倾向于继续微调提示来更好地完成这些任务,但最终很可能会失败,浪费时间和资源。

常见问题(FAQ)

ChatGPT能替代判例法搜索引擎吗?

不能。GPT-3虽能生成带案号、刑期的判例参考,但本质是统计语言序列,并非事实性工具,可能一本正经地编造错误信息,且训练数据截止2021年,之后的判例它完全不知道。

为什么大语言模型的幻觉问题难以解决?

幻觉与模型能力纠缠在一起,无法单独剥离。模型训练目标是最大化生成概率而非诚实度,事实核查本身也极难,且知识库更新永远赶不上世界变化,因此短期内无法根治。

法律工作中该如何负责任地使用ChatGPT?

把它当初稿生成器而非最终答案提供者,用它激发思路而非替代判断。任何依赖它生成的内容都必须人工核实每个事实,完全自动化的法律内容生产在可预见的未来仍是危险想法。

晓婷深圳
本文由 晓婷 审核,最后更新于 2026年9月21日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。