图灵奖得主杨立昆:生成式AI有点过时了

首页 > 科技

图灵奖得主杨立昆:生成式AI有点过时了

来源:一起来护肤 发布时间:2023-08-21 16:33

图灵奖得主杨立昆:生成式AI有点过期了

​“我不以为存在通用人工智能这样的概念,人工智能是非常专业的。”

收拾整顿|吴莹

图片来源视觉中国

近日,Meta首席人工智能科学家、2018年图灵奖获得者杨立昆(Yann LeCun)在麻省理工学院发表了他对AI大模型发展的最新看法。

杨立昆以为目前的机器学习能力比起人类还差得远,机器学习并没有人类学习的那种推理和计划能力,这一缺失导致我们无法做出和人类智力相称的人工智能。同时,他以为现在的LLMs(Large Language Models,大型语言模型)是两年前的研究成果,已经过期了,现在更新的AI学习方式应该是自监视学习(self-supervised learning)。

最后,他还指出应该要打造目标驱动型人工智能,抛却那些生成式练习方式,尽快研究出有推理能力,能进行复杂计划分层规划的人工智能。并提出不存在通用人工智能的概念,人工智能都是很专业的。

演讲的出色观点:

1.自监视学习可以被看作是机器学习的一种“理想状态”,模型直接从无标签数据中自行学习,无需标注数据。

2.开放的立异让我们在人工智能开发过程中获益颇丰,为这些技术带来可见性、审查和信任是我们努力的目标。

3.我以为未来人工智能和机器学习研究面临着三个挑战。第一是学习世界的表征和猜测模型。解决这个题目的方法就是自监视学习。第二是学习推理。基本上与人类的潜意识相对应,可以做到下意识的反应,不需要过多地思索。第三是学会分层制定行动计划。可以通过大量复杂的动作来实现目标。

4.大多数人类知识都长短语言的。我们在一岁之前学到的一切都与语言无关。除非拥有以视觉形式提供直接感官信息的系统,否则我们将无法创造出达到人类智力水平的人工智能。

5.终极,我们想要做的是使用自监视学习和JEPA架构来构建之前提到的那种可以猜测世界和进行计划推理的系统,这些系统是分层的,可以猜测世界上将要发生的事情。

6.我不以为存在通用人工智能这样的概念,人工智能是非常专业的。

以下为杨立昆在麻省理工学院的演讲(有删改):

比起人类,机器学习还差得远

我们应该意识到,与人类、动物的学习行为比拟,机器学习真的很糟糕。人类和动物能够了解世界是如何运作的,可以对任务进行推理和计划,他们的行为是由目标所驱动的,而机器学习却做不到这一点。不外跟着自监视学习的应用,生物世界和机器学习之间的差距正在缩小。自监视学习已经在文本、自然语言理解、图像、视频、3D模型、语音、蛋白质折叠等领域的机器学习中占据了主导地位。

自监视学习可以被看作是机器学习的一种“理想状态”,模型直接从无标签数据中自行学习,无需标注数据。它在自然语言理解中的使用方式是,获取一段文本,通过删除一些单词(例如用空缺标记替代它们)来掩盖它的一部分错误,然后练习一些神经网络来猜测丢失的单词,只需丈量缺失部门的重建误差。在这个过程中,系统答应你存储或表示语法、语义等内容,然后可以使用这些内容去进行下一步的任务,例如翻译或主题分类等。

这种做法在文本练习中效果非常好,由于文本的不确定性更高,无法正确猜测文本中哪个单词会泛起在特定位置,但可以做到的是猜测字典中所有单词的某种概率分布,可以轻松计算该单词分布的概率,并很好地处理猜测中的不确定性。

自回归语言模型是我们最近常常听到的学习方式,它的运作方式与自监视学习类似。实在这是刚才提到的自监视学习方法的一个特例。将一系列标记、单词转化成向量,然后练习一个系统来猜测序列中的最后一个标记。一旦有了一个经过训练就可以天生下一个标记的系统,基本上就可以用自回归、递归的方式来猜测下一个标记,这就是自回归猜测。这使得系统可以一个接一个地猜测标记并天生文本,它们从文本中捕捉的知识量相称惊人,这些系统通常拥有数十亿甚至千亿个参数,需要使用1万亿~2万亿个代币进行练习,有时甚至更多。

此类模型的泛起已有很长的历史,好比Blenderbot、Galacica、Llama 1和Llama 2、Google的Lambda和Bard、DeepMind的Chinchilla,当然还有OpenAI的ChatGPT。这些模型都非常适合作为写作的辅助工具,但它们对潜伏表达的了解确实有限,由于它们纯粹是从文本中接受练习。

我们刚推出了一个Llama 2的开源大模型,目前有70亿、130亿和700亿参数的三个版本,并且可以免费商用。目前这个模型已经用2万亿个代币进行了预练习,上下文长度为4096,某些版本已经针对对话内容进行了微调,在很多基准测试中,它与其他系统(无论是开源仍是闭源)比拟都具有上风。它的本质特征是开放性,我们与模型一起发布了一份多人签名的文本。该文本记载了我们人工智能研究中的立异方法。开放的立异让我们在人工智能开发过程中获益颇丰,为这些技术带来可见性、审查和信任是我们努力的目标。

人工智能很强盛,以至于人们在犹豫是否需要严格的控制和监管它,还有对于选择开源仍是闭源的探讨也十分激烈。的确风险肯定是存在的,但大量证据表明开源软件实际上比专有软件更安全。而且AI和LLMs的好处如斯之大,假如我们对此保密的话,无疑是搬起石头砸自己的脚,Meta绝对站在开放研究这一边。基于LLMs的培训非常昂贵,因此我们不需要拥有25个不同的专有LLMs,我们需要一些开源的模型,以便人们可以在它们之上构建微调的产品。

未来我们与数字世界的所有交互都将通过人工智能系统中的虚拟助手来调节。它将成为人类知识的宝库,我们不用再询问谷歌或者进行文献搜索,只需要与我们的人工智能助手去交谈,或许还会参考一下原始材料,但总体仍是会通过人工智能系统去获得我们所需要的信息。它将成为每一个人都可以使用的基础设施,所以基础设施必需是开源的。在互联网发展的历史中,微软和微软系统公司等供应商之间曾为提供互联网的软件基础设施而展开过一场竞争,所有供应商都失去了当今运行互联网的Linux、Apache、Chrome、Firefox、JavaScript,这都是开源的。

人类的知识如斯庞杂,这需要数百万人以众包的方式作出贡献。这些系统是所有人类知识的存储库,类似于维基百科,维基百科不能由专有公司创建,它必需集成全世界人民的聪明,因此,基于AI的系统也会泛起同样的情况,开源人工智能是不可避免的,我们只是迈出了第一步。

“今天看到的LLMs模型将在3~5年内消失”

对于人工智能领域的研究职员来说,LLMs革命发生在两年前,实在已经有点过期了。不外对于最近几个月才接触ChatGPT的公家来说,这仍是很新鲜的。实在也能发现这个模型并没有那么好用,它们没有真正给出与事实一致的谜底,还会产生幻觉甚至胡言乱语,并且无法考虑最近的信息,由于它们是根据近两年的信息进行练习的。所以需要通过RHF(一种量化方法)来调试它,但是RHF也没办法做到那么完美。人工智能不会讲道理,也不能做计划,而人类是可以做到这些的。

我们很轻易被它们的流畅性所蒙蔽,认为它们很智慧,实在智力非常有限,它们与物质现实没有任何联系,完全不知道这个世界是如何运转的。还有它们基本上是通过构建来获得谜底的,即一个系统在自回归后天生一个标记,假如天生的任何一个标记都有概率让你偏离准确谜底的范围,这些概率就会累积。长度为n的标记串,P(准确的概率)=(1-e错误的概率)n,因此准确的概率跟着天生的序列长度呈指数下降,假如不进行重新设计,这是无法修复的。这确实是自回归猜测的一个本质缺陷。

不久前,我们和雅各布·布朗尼(Jacob Browning)合著了一篇论文,发表在一本名为《Noema》的哲学杂志上,这篇文章从根本上指出了现有大模型技术的局限性。其中谈到了这样一个事实:大多数人类知识都长短语言的。我们在一岁之前学到的一切都与语言无关。除非拥有以视觉形式提供直接感官信息的系统,否则我们将无法创造出达到人类智力水平的人工智能。实在无论是来自认知科学,仍是经典人工智能子领域的研究论文,都指出了LLMs确实无法计划的事实,它们没有真正的思索能力,也没有和人类一样的推理和计划能力。

所以我以为未来人工智能和机器学习研究面临着三个挑战。第一是学习世界的表征和猜测模型。解决这个题目的方法就是自监视学习。第二是学习推理。基本上与人类的潜意识相对应,可以做到下意识的反应,不需要过多地思索。第三是学会分层制定行动计划。可以通过大量复杂的动作来实现目标。

我之前写了一篇愿景论文,“A path towards autonomous machine intelligence”(《通往自主机器智能的道路》)现在我将这篇论文称之为《目标驱动人工智能》。它是围绕着所谓的认知架构的设法构建的,是一个不同模块相互交互组成的体系结构,为系统提供了对世界状态的感知模块。根据对世界状态的感知猜测与已有的记忆相结合,可以对世界未来要发生的事情做出有效猜测。

世界的状态用来初始化你的世界模型,然后将初始配置与想象的动作序列结合起来,提供给世界模型,再将结果给予目标函数。这就是我为什么称之为目标驱动。你无法越过该系统,由于它是硬连线来优化这些目标的,除非你修改目标,否则无法让它产生有效内容。

世界模型有多个操作步骤,例如,你采取两个操纵,然后在你的世界模型中运行它们两次,以便你可以分两步猜测将要发生的情况。当然世界是不确定性的,当潜伏变量在一组中变化,或从分布中对它们进行采样时,会得到多个猜测,当然这使得规划过程变得复杂,终极我们真正想要的是某种分层操纵的方法。

例如,假设我坐在纽约大学的办公室里,想要前往巴黎,我的第一步是乘坐交通工具前往机场,第二步是赶飞机去巴黎。我的第一个目标是去机场,该目标可以分解为两个子目标,第一是到街上打出租去机场,我怎么去街上呢?需要从椅子上站起来走出大楼,而在这之前,我需要调动我身体的肌肉从椅子上站起来,这样我们一直在做分层规划,甚至这种规划是不假思索,下意识进行的。但是我们现在的AI系统是无法自发学做到这一点的。我们需要的是一个能够学习世界状态的系统,这将使它们能够将复杂的任务分解成更简朴层次的任务。我以为这对于人工智能研究来说是一个巨大的挑战。

我们今天看到的LLMs模型将在3~5年内消失,会泛起新的可以做分层计划,也能做推理的模型,使用命令让谜底转换为流畅的文本。这样我们就会得到既流畅又真实的东西。做这件事可能会失败,但我以为这应该是要去努力的方向。

假如我们有这样的系统,除了练习本钱模型之外,我们将不需要任何的RHF或人类反馈,也不需要在全球范围内对系统进行微调以确保安全,只需要设定一个目标,使其产生的所有输出都是安全的,我们不需要为此重新练习整个编码器和所有内容,这实际上会大大简化练习,降低练习的本钱。

当我们观察婴儿时,会发现婴儿出生后的几个月中主要是通过观察来获取对这个世界的背景熟悉,当他们可以实际对世界采取行动时,才会一点点通过互动获取知识。他们学习的大多是直观的物理知识,好比重力惯性、动量守恒等,婴儿需要大约9个月的时间才能真正明白,不受支撑的物体会掉落。显然他们不会像LLMs那样需要1万亿代币来练习他们,人类不会接触到那么多的文本信息。任何10岁的孩子都可以学会在几分钟内清理餐桌,但我们没有可以做到这一点的机器人。有些事情对人类来说好像很轻易,但对于AI来说却很难题,反之亦然,AI在很多专有任务上都比人类强得多。

我们还没有找到机器能够像人类那样理解世界的机制。而解决这个题目的方法,就是自监视学习,通过这种方式来填补空白。假如我们练习一个神经网络来进行视频猜测,可以看到系统生成的猜测非常恍惚,这是因为系统经过训练只能进行一次猜测,并且无法正确猜测视频中将要发生的情况。它猜测了一种恍惚的混乱,这是所有未来可能发生结果的平均值。假如你使用类似的系统来猜测天然视频,效果是一样的,都是一些恍惚的猜测。因此我们的解决方案是联合猜测嵌入架构(JEPA),JEPA背后的主要思惟是抛却猜测需要天生的设法。现在最流行的就是生成式AI,但我以为应该抛却它,这已经不是一个很流行的解决方案了。

生成式模型是一种输入x来假设视频或者文本的初始片断,通过编码器和预测器运行它,然后尝试猜测变量y。而衡量系统机能的误差基本上是猜测y和实际y之间的某种差异度量。联合猜测嵌入架构,不会尝试猜测y,而是猜测y的表示,因此x和y都会通过计算表示的编码器,然后你执行表示空间中的猜测。这样做的长处是y的编码器可能具有不变的属性,可以将多种方式映射到同一个结果中。因此假如有难以预测的事情,编码器可能会消除这种难猜测的点,从而使猜测题目变得更轻易。例如,假设你正在路上开着一辆自动驾驶汽车,这里的猜测模型想要猜测道路上其他汽车将要做什么。但路边可能有树,今天有风,所以树上的叶子正在以某种混乱的方式移动。树后面有一个池塘,池塘上也由于风的缘故出现了涟漪。这些涟漪和树叶的运动就很难猜测,由于它们很混乱,但这些信息也非常丰硕,可能就储藏着我们想要的谜底。因此假如你使用该天生模型猜测的话,就不得不投入大量资源来尝试所有与任务有关的细节猜测,本钱就比较高。而JEPA可以选择从场景中消除这些细节,只保存相对轻易猜测的y细节,例如其他汽车的运动,这样对结果的猜测就简朴多了。当然,假如你想使用生成式模型也是可以的,但假如你想要的是了解世界然后能够进行规划,就需要一个联合猜测嵌入架构了。

我们如何练习这样的系统

实验证实,想在图像而不是文本的上下文中使用自监视学习,独一有效的就是联合猜测嵌入架构。假如你练习一个系统,给它一对图像,比方说x和y或视频片断,然后告诉它计算x和y相同的表示,系统就会崩溃,它将产生恒定的sx和sy,然后完全忽略x和y。该如何纠正这个题目?必需将自己置于基于能量的模型背景下,基于能量的学习可以被看作是猜测、分类或决议计划任务的概率估计的替换方法。基于能量的模型不需要根据概率建模来解释它们的作用,而是根据捕捉变量之间依赖性的能量函数来解释。假设你的数据集有两个变量x和y,基于能量的模型捕捉x和y之间的依靠关系的方式是计算一个能量函数,这是一个具有标量输出的隐式函数,它将x和y作为输入,并为其提供一个数据密度更高的区域。假如你具有这个能量景观的函数,可以计算这个能量景观,那么该函数将捕捉x和y之间的依靠关系,你可以从y推断x,在不是函数的x和y之间进行映射,有多个与单个x兼容的y,所以它可捕捉多模态。

我们如何练习这样的系统?有两类方法:

一是对比方法。更改能量函数的参数,以便能量在数据点上取较低的值,与在那些对比点上取较高的值进行比对。早在20世纪90年代初,我就为这个方法的诞生作出了贡献,但我现在不喜欢它了,由于在高维空间中,为了使能量函数呈现准确的外形,必需保证天生对比点的数目呈指数增长。

这可不是什么好事,所以我更喜欢另一种方法,正则化方法,通过某种正则化器最小化可以吸收低能量的空间体积,以便系统可以通过改变能量函数的参数,使数据点的能量变低。这样数据点会被收缩包裹在低能量区域,更有效率一些。题目是我们如何做到这一点,这就需要抛却生成式AI模型、概率模型、对比方法、强化学习,由于它们的效率都太低了。有一种新的方法是VICReg(Variance-Invariance-Covariance Regularization,一种自监视学习方式)。这是一种通用的方法,可以应用于图像识别、分割等各种应用的联合猜测嵌入架构情况,效果非常好,不会让你厌烦细节,可以使用自监视学习方法来预练习卷积网络,然后砍掉扩展器,粘上一个线性分类器,对其进行练习、监视并丈量机能。通过这种方式,可以在ImageNet上获得非常好的机能,特别是对于分布外学习和迁移学习来说,机能尤其好。这种方法有一个修改版,名为VICRegL,去年在NeurIPS上发布。

几周前,我们在CVPR(IEEE国际计算机视觉与模式识别会议)上推出了一种名为Image JEPA(计算机视觉模型)的新方法,它使用掩蔽和转换器架构来学习图像中的特征。这种方法的长处除了屏蔽之外,不需要任何数据增强。因此,它不需要真正知道你正在操纵的数据类型,效果非常好。我们巴黎的同事提出了另一套方法,称之为DINO(自监视学习方法之一),它在ImageNet上为人们提供了超过80%的结果,它完全受监视,没有微调,也没有任何数据增强,这是相称惊人的。

终极,我们想要做的是使用自监视学习和JEPA架构来构建之前提到的那种可以猜测世界和进行计划推理的系统,这些系统是分层的,可以猜测世界上将要发生的事情。通过视频练习系统的一些早期结果,通过对视频中的连续帧和扭曲图像进行练习来学习图像和视频的良好表示。

目标驱动是指我们将制定能够驱动系统行为的目标,使其耐用且安全。为了让它发挥作用,我们正在努力做一些事情,从视频中进行自监视学习。我们正在使用这些JEPA架构,但我们还没有终极的配方。我们可以用它来构建由目标驱动的推理和计划的LLMs,但愿可以构建出能够分层规划的学习系统,就像动物和人类一样。我们还有许多题目需要解决,用正则化、潜变量来处理不确定性的JEPA、存在不确定性时的规划算法、用逆强化学习来模拟的学习本钱模块……

我们仍旧缺少达到人类水平人工智能的基本概念,我们缺少从视频等复杂模式中学习感知模型的基本技术。也许在未来,我们能够构建可以规划谜底以满意目标的系统。我不以为存在通用人工智能这样的概念,人工智能是非常专业的。所以让我们努力去尝试创造达到人类水平的智能,建造具有与人类相同技能和学习能力的人工智能。毫无疑问,在未来某个时刻,机器将在人类智能的所有领域超越人类。我们可能不想受到这种威胁,但每个人都将得到比我们更智能的系统的匡助。不用担心,人工智能不会脱离我们的控制,就像我们大脑的新皮质无法逃脱我们基底神经节的控制一样。

上一篇:Pi网络联合创... 下一篇:工行金卡年费...
猜你喜欢
热门阅读
同类推荐