AI、机器学习、深度学习、生成式AI:一套套娃,层层包含
AIAI Summary (BLUF)
人工智能(AI)技术正在重塑各行各业。本文从基础概念出发,系统梳理了AI、机器学习、深度学习和生成式AI之间的层级关系,并介绍了基础模型、Transformer等核心技术,帮助读者快速建立对AI的整体认知。
核心洞察
先说结论:AI、机器学习、深度学习、生成式AI人工智能技术分支,能够自主生成文本、图像、代码等新内容。这四个词,日常基本被混着用,但它们的层级关系其实很清楚。这篇文章把这条链路讲得特别明白,看完你就能跟同事解释,为什么大模型和传统AI根本不是一回事。
核心结论
AI、机器学习、深度学习、生成式AI是层层包含的关系:AI > 机器学习 > 深度学习 > 生成式AI;生成式AI是深度学习的一个子集,不是传统AI的另一个名称。
深度学习与经典机器学习的核心区别在隐藏层数量:经典神经网络一种模仿生物神经网络结构和功能的计算模型,是AI模型的基础架构。它由大量互联的神经元(节点)组成,通过调整神经元之间的连接参数(权重)来学习数据中的模式。通常只有1-2层隐藏层,深度神经网络至少3层、多可到几百层。隐藏层多了,模型才能自动从无标签数据中提取特征,这是传统机器学习做不到的。
今天主流的生成式AI工具——ChatGPT、GPT-4、Copilot、BERT、Bard、Midjourney——核心都是Transformer模型标准的decoder-only Transformer架构,采用Pre-norm设计,使用Flash Attention优化,支持可变深度配置,是NanoChat的核心语言模型组件。。Transformer属于深度学习模型,用序列数据训练,能生成文本、图像、视频和代码等长序列内容。
训练基础模型的成本极高:需要TB甚至PB级别的未标注数据,使用数千个GPU组成的集群运行数周,花费可达数百万美元。开源基础模型项目(如Meta的Llama-2)让开发者可以跳过这一初始训练环节。
通用人工智能(AGI)目前只是理论概念,尚未实现。现有AI系统如Alexa、Siri、特斯拉自动驾驶都属于弱AI/窄AI;没有任何已知系统达到强AI水平,即能在广泛任务中达到或超过人类能力。
AI:让机器模拟人
AI这个概念,说白了就是让计算机去模拟人的学习、理解、推理、决策这些能力。今天很多应用和设备已经能做到不少事:摄像头能识别物体,音箱能听懂你说话,手机能从你的使用习惯里学东西,然后给你做推荐。有的AI甚至能独立行动,比如自动驾驶汽车,不需要人随时干预。
不过到了2024年,AI圈的头条几乎全被生成式AI霸占了。生成式AI能自己写文章、画图、做视频。想把生成式AI聊明白,得先把它的地基看清楚,地基是机器学习,再往下是深度学习。
AI、机器学习、深度学习、生成式AI是怎么套娃的
理解这四者的关系有个特别直观的方式:把它们想成一组套娃。AI是最大的那个,机器学习是AI下面的一块,深度学习又是机器学习的一块,生成式AI是深度学习的一块。一个套一个。
AI之下是机器学习。机器学习的核心做法,是拿数据训练算法,让模型学会做预测或做决策。它涵盖了一大堆具体技术,线性回归、逻辑回归、决策树、随机森林、支持向量机、K近邻、聚类等等,每种方法适合不同的问题和数据。
这些算法里,神经网络一直是最受关注的那种。神经网络的结构受人类大脑启发,由节点一层层连起来,共同处理和分析复杂数据。数据量大、模式复杂的时候,神经网络特别擅长从里面找规律。
机器学习的入门形态是监督学习。做法是使用带标签的数据集,每条训练数据都有一个正确答案,模型学习输入和输出之间的对应关系,然后拿这个映射去预测没见过的新数据。比如给模型看一万张标着"猫"的图片,它就能学会认出猫来。
深度学习:能自动提取特征的机器学习
深度学习是机器学习里的一个分支,用的是多层神经网络,叫深度神经网络。它跟经典机器学习里的神经网络相比,隐藏层多得多。经典的那种一般只有一两层隐藏层,深度神经网络至少三层,多的能到几百层。
隐藏层多带来的一个关键能力,是能跑无监督学习。深度神经网络可以从大量没有标签、也没有结构的数据里,自动提取出有用的特征,自己判断这些数据代表什么。
因为不需要人打标签,深度学习把机器学习推到了一个很大的规模。今天你身边大多数AI应用,背后都有人在跑深度学习。处理自然语言、识别图像、快速分析复杂数据,这些都是它的强项。
深度学习还带来了别的学习方式
半监督学习是监督和无监督的混合体,训练时同时用有标签和无标签的数据,常用来做分类和回归。
自监督学习不靠人工标签,直接从无结构数据里生成隐含标签,相当于让数据自己当老师。
强化学习走的是另一条路,不靠从数据里找规律,而是靠试错和奖励函数来学。AlphaGo用的就是这一套。
迁移学习也很好用,把一个任务上学到的知识搬到另一个相关任务上,能提升新模型的表现。
生成式AI:能自己"创作"的模型
生成式AI,有时候也叫"gen AI",指的是那类能根据用户的提示或请求,生成复杂原创内容的深度学习模型。比如长文、高清图、逼真的视频或音频,这些都能生成。
打个比方,生成式模型先对训练数据做一个简化表示,然后基于这个表示去创作新东西。新内容和原数据相似,但不完全一样。
其实生成式模型在统计领域已经用了很多年,主要是分析数值数据。但过去十年里,它进化到了能分析和生成更复杂的数据类型。这个进化恰好和三类深度学习模型的兴起同步:
变分自编码器(VAE),2013年出现,让模型能根据一个提示或指令,生成多种内容变体。
扩散模型,2014年首次出现。它先把图片加噪,加到你完全认不出来,然后再一步步去噪,最后根据提示生成一张全新的图。
Transformer模型,也叫变换器模型。它用序列数据训练,能生成连续的长序列内容,比如句子里的词、图像里的形状、视频里的帧、代码里的命令。今天那些刷屏的生成式AI工具,ChatGPT、GPT-4、Copilot、BERT、Bard、Midjourney,核心都是Transformer。
生成式AI怎么运作的
一般来说,分三个阶段:
训练,创建一个基础模型。
调优,让模型适配具体的应用场景。
生成、评估、再调优,不断提升准确性。
训练
一切从基础模型开始。基础模型是一个深度学习模型,很多不同的生成式AI应用都建立在它之上。
现在最常见的基础模型是大语言模型(LLM),用于文本生成。但也有针对图像、视频、声音、音乐生成的基础模型,还有支持多种内容类型的多模态基础模型。
训练基础模型这事儿挺费劲。你需要用海量的原始数据去训练一个深度学习算法,这些数据是未标注的、非结构化的,可能是互联网上TB甚至PB级别的文本、图像或视频。训练出来的是一张拥有数十亿参数的神经网络。这些参数编码了数据中的实体、模式和关系,模型拿到提示就能自主生成内容。
成本就别提了。训练过程需要数千个GPU组成的集群,跑上几个星期,花掉几百万美元。好在Meta的Llama-2这类开源基础模型项目,让很多开发者能跳过这一步,省下这笔钱。
调优
模型得针对特定的内容生成任务做调优。常用方法有几种:
一是微调。给模型喂应用相关的标注数据,包括应用可能会收到的用户提问、提示,以及对应格式的正确回答。
二是基于人类反馈的强化学习(RLHF)。人类用户评估模型输出的准确性或相关性,模型根据反馈自我改进。实际操作可以很简单,就是让用户直接跟聊天机器人或虚拟助手对话,告诉它哪里错了。
生成、评估和再调优
一个应用在跑起来之后,开发者和用户得定期评估输出质量。模型的调优频率可以很高,甚至每周一次。基础模型本身反而更新得很慢,可能一年或一年半才动一次。
想提升生成式AI应用的表现,还有一招叫检索增强生成(RAG)。简单说,就是让基础模型在训练数据之外,再去找相关的知识来源,用来调整参数、提高准确性和相关性。
智能体:AI的下一站
AI智能体是一个自主的AI程序。它能自己设计工作流程,调用各种工具(也就是其他应用或服务),不需要人干预就能替用户或另一个系统执行任务、达成目标。
智能体式AI则是多个AI智能体组成的系统。这些智能体被协调起来,完成单个智能体搞不定的更复杂任务。
聊天机器人是在预设约束里运行的,需要人的介入。AI智能体不一样,它自主、目标驱动、还能适应环境变化。这里的"智能体"和"智能体式",强调的就是模型的这种自主行动能力。
可以把智能体想成生成式AI的下一步。生成式AI专注于根据学到的模式创作内容,智能体则用这些内容去跟其他智能体和工具交互,做决策、解问题、完成任务。举个例子,一个生成式AI应用能告诉你,根据你的工作安排,什么时候爬珠峰最合适。但一个智能体能告诉你这个,还能顺手用在线旅行服务帮你订好最合适的航班,在尼泊尔订好最方便的酒店。
AI的好处,具体说说
AI在各行各业的好处不少,常被提到的有这么几类:
重复性任务的自动化。
从数据中获得更快、更多的洞察。
决策质量提升。
减少人为错误。
全天候可用。
降低物理风险。
自动化重复性任务
数据收集、录入、预处理这些数字活儿,还有仓库拣货、制造流程这些体力活儿,AI都能自动干。人就可以腾出手来做更高价值、更有创造性的工作。
决策质量提升
无论是辅助决策还是全自动决策,AI都能让预测更快更准,让决策更可靠。配合自动化,企业可以对机会和危机做出实时响应,不需要人盯着。
减少人为错误
AI减少人为错误的路子很多。它可以引导人按正确步骤操作,可以在错误发生之前就发出警报,还可以完全自动化,不让人插手。这在医疗行业尤其关键,比如AI引导的手术机器人能保持稳定的精准度。机器学习算法还会随着接触数据增多不断改进,错误率越降越低。
全天候可用
AI不睡觉。它全天在线,每次表现都稳定。AI聊天机器人或虚拟助手能减轻客户服务的人力压力。在材料处理或生产线上,AI还能在完成重复性任务时保持稳定的工作质量和产出。
降低物理风险
驯兽、拆弹、深海作业、高海拔施工、太空任务,这些危险工作交给AI,就不用拿人去赌了。自动驾驶汽车这类技术虽然还没完全成熟,但确实有可能降低乘客受伤的风险。
AI的实际用例
AI的应用场景很多,这里只挑几个行业的例子。
客户体验、服务与支持
AI 能帮企业做什么
企业可以部署 AI 驱动的聊天机器人和虚拟助手,处理客户咨询、工单这些事。这些工具靠自然语言处理和生成式 AI 的能力,看懂客户关于订单状态、商品详情、退换货政策的提问,然后给出回答。
聊天机器人和虚拟助手能全天候在线,回答常见问题的速度比人工快不少,人类员工也能腾出手来做更高级的事。客户体验更一致,等待时间更短。
欺诈检测
机器学习和深度学习算法能分析交易模式,把异常挑出来。比如突然在陌生地点大额消费,或者登录地点跟平时不一样,这些都可能指向欺诈。有了这套机制,机构能更快响应,把损失压到最小,客户也安心。
个性化营销
零售商、银行这些直接跟客户打交道的公司,都在用 AI 做个性化体验和营销活动。AI 根据客户的购买历史和行为数据,预测他们可能想要什么产品,甚至实时生成针对单个客户的文案和专属优惠。销售上去了,流失率下来了。
人力资源与招聘
AI 驱动的招聘平台能把筛选简历、匹配职位描述这些环节自动化,有的还能做视频初面。候选人一多,行政文书工作堆积如山。靠这些工具,文书工作能减掉一大半。响应快了,招聘周期短了,不管候选人最后能不能入职,体验都更好。
应用开发与现代化改造
生成式 AI 写代码的工具和各种自动化工具,能接手应用开发里那些重复的编码任务,还能加速遗留系统的迁移和现代化改造,包括格式调整和平台更换。任务完成更快,代码风格更统一,错误也少一些。
预测性维护
机器学习模型能分析传感器、物联网设备传回的数据,预测设备什么时候需要维护,赶在故障发生前发出预警。AI 驱动的预防性维护能避免生产中断,供应链出问题也不至于等到影响利润了才发现。
AI 的风险与挑战
大家都在抢着上 AI,想尽快尝到甜头。这个速度可以理解,但引入和维护 AI 工作流,挑战和风险也不少。
数据风险
AI 系统靠数据集活着。数据集可能被投毒、被篡改、自带偏见,也可能被网络攻击,造成数据泄露。要减少这些风险,得守住数据完整性,从开发、训练到部署、上线后,整个 AI 生命周期都要有安全和可用性保障。
模型风险
攻击者会盯上模型本身,偷走它、对模型做逆向工程,或者未经授权就篡改它。模型的架构、权重和参数决定了它的行为、准确度和性能,这些核心组件一旦被动过,模型就不可信了。
运营风险
所有技术都有运营风险,AI 也不例外:模型漂移、偏见、治理结构出漏洞。这些风险不处理,系统会故障,安全漏洞会被攻击者利用。
伦理与法律风险
开发和部署 AI 系统,如果不把安全和伦理放在前面,就可能侵犯隐私,产出偏见结果。比如有偏见的训练数据用在了招聘上,可能会强化性别或种族刻板印象,让 AI 模型偏向某些人群。
AI 伦理与治理
AI 伦理是个跨学科领域,研究怎么让 AI 的正面影响最大化,同时把风险和不想要的后果减到最少。AI 伦理的原则,靠 AI 治理机制来落地。治理机制就是一套护栏,确保 AI 工具和系统安全、合乎伦理。
AI 治理要覆盖各种监督机制,专门处理上面提到的那些风险。做 AI 治理,只靠开发者不够,得让开发者、用户、政策制定者、伦理学家一起参与,这样 AI 系统的开发和部署才能真正跟社会价值观合拍。
AI 伦理和负责任 AI 涉及的常见价值观包括这么几个:
可解释性与可理解性
AI 越做越复杂,人类越来越难理解算法为什么得出这个结果,也很难追溯过程。可解释 AI 是专门解决这个问题的一套流程和方法,它让用户能读懂、理解并信任算法产出的结果。
负责任的 AI 不是一句口号
聊天机器人部署得再顺,也只是把 AI 用起来的第一步。等它真正进到业务流程里,几个绕不开的问题马上会冒出来:它对所有用户一样公平吗?有人恶意攻击,它扛得住吗?它做了错误的判断,谁来负责?
这几件事合在一起,业内有个说法:负责任的 AI。听着像道德宣言,其实每一条都对应着具体的工程决策。
公平与包容
机器学习说白了就是一种统计意义上的分组。它天生就在把人分类,给不同的人不同的结果。分组本身,谈不上好坏。麻烦在于,当分类开始系统性地偏向某些群体,同时让另一部分群体持续吃亏,问题就来了。放到招聘、信贷、医疗这些场景里,影响会被放大。
怎么减少这种偏差?数据收集的时候就得检查样本有没有偏。历史数据里一直是某个群体的简历占多数,模型学出来的筛选标准自然会偏向那个群体。模型设计阶段也得单独评估,在性别、年龄、地域这些维度上,不同群体的表现差多少。还有一个容易忽略的点:团队本身要多元。一群背景相同的人,很难察觉自己做的系统在别的群体身上会出问题。
鲁棒性与安全
AI 系统不会一直活在干净的实验室里。真实世界的输入千奇百怪:有人随手打错字,有人故意改几个词把意图带偏,还有人在图片上加一点人眼看不见的噪点,识别结果就全变了。
鲁棒性差,说的就是这个。模型在测试集上跑得漂亮,一到真实环境就翻车。
恶意攻击也在不断升级。数据投毒,往训练数据里掺脏东西;提示词注入,绕开设计者的意图让模型乱说话。这些传统软件时代就有的安全课题,换了个形式在 AI 这里重演。
所以训练模型的时候,不能假设输入永远是干净正常的。把对抗样本加进训练集,模拟各种异常情况。部署之后也别当甩手掌柜,持续盯着线上表现,发现被攻击的苗头马上处理。好的 AI 系统和银行金库一个道理:建好只是第一步,之后得不停加固。
问责与透明
AI 出了错,谁来负责?这个问题最容易被跳过,也最绕不开。
很多模型做决策就是个黑箱:数据进去,结果出来,中间过程没人说得清。企业拿 AI 筛选简历、审批贷款,申请者被拒了,总得知道自己是怎么被拒的。监管来问,企业也得给出解释。所以在业务上,模型的可解释性很实在。哪怕没法把每个判断都完全拆开看,至少得知道哪些特征起了主要作用,决策过程能追溯。
问责更直白。AI 是工具,责任在人。企业把 AI 部署到业务流程里,就得对它的所作所为负责。出了事不能甩锅给算法,一句"模型自己学坏的"糊弄不过去。内部要有清晰的职责分工:模型谁训练的、谁部署的、谁盯着线上表现,都得有数。问题出了,能快速定位到具体环节。
透明度:让用户看得到
除了公平、安全和问责,透明也是负责任的 AI 的一部分。组织得把 AI 系统从开发、部署到产出结果的责任和治理结构划清楚。用户也得能看懂一个 AI 服务是怎么工作的,能评估它的功能,搞清楚它的强项和局限。透明度上去了,用 AI 的人才能理解这个模型是怎么造出来的,不用对着黑盒子猜。
隐私与合规
GDPR 这类监管框架摆在那里,处理个人信息就得遵守相应的隐私原则。这里有几层事要做:保护好可能含个人数据的 AI 模型,管住哪些数据能进模型,再就是让系统保持弹性,能跟随法规和 AI 伦理观念的变化做调整。
数据进模型这件事,入口把关比事后补救容易得多。模型训练完再想擦掉里面的某些个人信息,技术上非常麻烦。
弱 AI 与强 AI
研究者按能力层次,把 AI 大致分了两档。
弱 AI,也叫窄 AI,针对特定任务或一组任务设计。智能语音助手,比如亚马逊的 Alexa、苹果的 Siri,还有社交媒体聊天机器人、特斯拉的自动驾驶,都算这一类。
强 AI,又叫通用人工智能(AGI),要求机器在广泛的任务范围内理解、学习和运用知识,达到甚至超过人类水平。这个级别的 AI 目前只是理论上的存在,没有哪个已知系统摸到边。研究者认为,就算 AGI 真能实现,计算能力也得再来一次大飞跃。科幻电影里那种有自我意识的 AI,离现实还远。
AI 大事记
"机器能思考"这个念头,古希腊就有了。但真正跟电子计算挂钩,也跟这篇文章讨论的话题有关的里程碑,从 1950 年开始。
1950 年,艾伦·图灵发表论文《计算机器与智能》。图灵在二战中破译过德军的 ENIGMA 密码,常被称为"计算机科学之父"。他在论文里问了一个问题:机器能思考吗?
顺着这个问题,他设计了一个测试,就是后来著名的图灵测试。人类审讯者通过文字对话,尝试分辨对面是计算机还是真人。这个测试发表后受过不少质疑,但它在 AI 历史上的地位依然重要,而且因为它涉及语言学,哲学界至今还在讨论。
1956 年,约翰·麦卡锡在达特茅斯学院的第一届 AI 会议上正式提出"人工智能"这个词。他后来还发明了 Lisp 语言。同年,艾伦·纽厄尔、J.C. 肖和赫伯特·西蒙写出了 Logic Theorist。这是第一个真正跑起来的 AI 程序。
1967 年,弗兰克·罗森布拉特造出了 Mark 1 感知机。这是第一台基于神经网络、靠试错来"学习"的计算机。仅仅一年后,马文·明斯基和西摩·帕珀特出版了《感知机》。这本书是神经网络领域的里程碑,但也在相当长一段时间里,成了反对继续研究神经网络的理由。
1980 年,用反向传播算法训练的神经网络开始在 AI 应用里普及。
1995 年,斯图尔特·罗素和彼得·诺维格出版了《人工智能:一种现代方法》,后来成了 AI 研究领域的标杆教材。书里梳理了 AI 的四种目标或定义,按照理性与思考、行动与决策两个维度区分计算机系统。
1997 年,IBM 的深蓝在国际象棋比赛里击败了世界冠军加里·卡斯帕罗夫,重赛又赢了一次。
2004 年,约翰·麦卡锡写了《什么是人工智能?》,给出了一个后来被反复引用的 AI 定义。那时候大数据和云计算已经起步,企业能管理的数据越来越多,这些数据后来成了训练 AI 模型的材料。
2011 年,IBM Watson 在智力问答节目《Jeopardy!》上击败了冠军肯·詹宁斯和布拉德·拉特。差不多同一时期,数据科学开始成为热门学科。
2015 年,百度的 Minwa 超级计算机用卷积神经网络识别和分类图像,准确率超过普通人类。
2016 年,DeepMind 的 AlphaGo 靠深度神经网络,在五局比赛里击败了世界围棋冠军李世石。围棋变数极大,刚走四步就有超过 14.5 万亿种可能的局面,这场胜利因此格外有分量。谷歌后来花了约 4 亿美元收购 DeepMind。
2022 年,以 OpenAI 的 ChatGPT 为代表的大语言模型爆发,AI 的性能和它能给企业带来的价值都上了一个大台阶。生成式 AI 让深度学习模型可以提前在海量数据上做预训练。
2024 年,AI 的复兴还在继续。多模态模型能同时处理文字、图像、声音等多种类型的数据,带来更丰富、更扎实的体验。这类模型把计算机视觉的图像识别和 NLP 的语音识别整合到了一起。超大参数模型的收益开始递减,小模型反而在稳步往前走。
常见问题(FAQ)
AI、机器学习、深度学习、生成式AI是什么关系?
它们是套娃关系:AI最大,机器学习是AI的子集,深度学习是机器学习的子集,生成式AI是深度学习的子集。
生成式AI是怎么运作的?
生成式AI分三步:训练创建基础模型,调优适配场景,再通过生成、评估和再调优提升准确性。
AI能帮助企业做什么?
AI可自动化重复任务、提升决策质量、减少人为错误、全天候运行,并降低物理风险,广泛应用于客服、欺诈检测和招聘等领域。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。


