语言模型的前世今生与GPT的人生哲学

首页 > 科技

语言模型的前世今生与GPT的人生哲学

来源:没蜡笔的小新 发布时间:2023-07-12 17:51

语言模型的前世今生与GPT的人生哲学

任何一个系统都有自己的第一性原理,是一个根基性命题或假设,不能缺省,也不能被违反。

——亚里士多德《第一哲学》

GPT的革命,当然不止是生产力。

“今天的GPT和过去的AI很不一样,今天我们与GPT聊天时,经常有一种强烈的以为它是人的感觉,而且是一个很智慧、正在进化的人。”李志飞笃定地表达直觉判定。

大模型的迅猛发展让AI走在历史性的奇点,未来毕竟走向何方?为什么AGI的路上,非大模型不可?

欲探究未来,先回溯过去。太阳底下从来没有新鲜事,今天大语言模型压缩即智能的思惟,早已写在1948年香农的信息论,而今天的大模型只是做工程化的实践。今天ChatGPT的胜利,是概率论的胜利,也是贝叶斯定理的胜利。只有回归原理的洞悉,才能预见未来的进化路径。

从AI的发展历程来看,模型和算法是其不断成长的核心驱动力。什么是语言模型,语言模型如何一步步走到今天,方法演进的过程中解决了什么题目,又带来哪些新的题目。纵观语言模型的演进,你会发现今天大语言模型GPT的胜利,是刻在偶尔中的必然。

近日,李志飞在混沌大会上发表演讲,以“一”思维的方式探求本质,将语言模型的过去、现在和未来渐渐铺展,透过历史的脉搏,抽丝剥茧地梳理了语言模型的前世今生——我们从哪里来,我们是谁,我们要到哪里去?我们在扪心叩问这一谜底时,也在思索本日人类所处的位置。

GPT这么努力,就是为了增加对next token猜测的确定性,为了熵减; 而人类这么努力,是为了对抗熵增,增加对未来的确定性,也是为了熵减;大模型本质上在追求的底层逻辑,也是人类遵循的“第一性原理”,并不断进行实践。

假如未来的智能体能够通过建模视频等多模态的无监视方式学习,将会非常高效。如果它们能够跟物理世界直接交互,从Agent到多Agent互动,它们将能够比人类学习更多,并且进化速度更快。“今天的GPT仍是山顶洞人,还非常的孤傲,但在未来的世界Agent一定是无处不在的,多Agent互动会改变一切。”李志飞表示。

而未来会如何博弈,还取决于GPT拥有怎样的世界观、价值观和人生观,它仅仅是世界的倒影,仍是有了自主意识?假如这些智能体变得比人类更智慧,将会发生什么?

Matt Ridley在其著作《理性乐观派:人类经济提高史》中提到:始于十多万年前的交换和专业分工习惯,创造出了以加速趋势改善现状的集体大脑,澎湃的创新能力更让人类战胜了许多在当时看来难以躲过的灾祸。

对于人类的未来,是理性乐观,仍是如辛顿般隐忧——假设田鸡创造了人类,那么你以为现在谁会占据主动权,是人,仍是田鸡?

以下为演讲内容梳理。

一、过去的语言模型

ChatGPT的泛起,让“语言模型”忽然走到台前,成为一个全民爆火的词汇,而10年前“语言模型”是只有自然语言处理某一细分研究方向的人才会学习的内容,它作为一个后台系统存在,并不为大众所熟知。但实在,早在大语言模型GPT泛起之前,人们天天都在大量接触和使用着语言模型。

好比输入法,当我们输入一个词,如何给出对下一个词的公道建议,就是语言模型的典型应用之一。好比搜索,当我们在搜索框输入文字的时候,会得到一些搜索建议,其应用的也是语言模型。甚至使用Google Translate、语音助手时,其背后的语音识别系统都会用到语言模型。语言模型可谓无处不在。

那么什么是语言模型?犹如物理模型是对物理世界的建模,用以理解和描述物理世界的本质;语言模型则是对语言世界的建模,通过构建词汇或短语之间的关联性,来理解和描述人类语言的本质。好比在物理世界中,经典的物理模型——牛顿第二定律,F=MA,是用一种非常量化和形式化的方法来描述力的作用效果。同样地,语言模型也具有量化和形式化表示的特性

语言模型主要用来做什么?简朴来说,语言模型主要做三件事。

一是判定一句话是否符合人类语言习惯。假如将一句话抛给语言模型,它会判定这句话是否符合中文或英文的使用习惯。如大家写邮件时,所碰到的语法纠错提示,其用到的就是语言模型。

二是猜测下一个词,赋能语言应用。好比只给出一句话的前几个字,语言模型就可以根据语言规律来猜测后面的字是什么,如输入法和今天的ChatGPT,就是基于语言模型猜测下一个词的应用。

三是作为打分函数对多个候选谜底进行打分排序。语言模型广泛用于语音识别、机器翻译、OCR等任务中,将几种候选的语句结果,交给语言模型来打分排序,语言模型则会系统性地给出一个最优的谜底。其中,语音识别、机器翻译是语言模型用得最高级、最复杂的地方,由于系统有指数级多的谜底,对谜底打分需要用到复杂的动态规划算法。

举两个例子。假如语音识别模型给出两个可能的结果,分别为“你的账单分六期来还”和“你的账单分六七来还”,这时候语言模型要做的事情,就是选择其中一个准确选项。显然它会选第一个,由于更加符合人类自然语言习惯。

假如机器翻译将一句英文翻译为中文,得到“我在晚上8点的时候完成了工作”和“我完成了工作在晚上8点”两种不同的翻译结果。其中第二种是按照英文语序进行翻译的,而第一种是重新打乱顺序翻译的,很显然它选择第一个作为更优的谜底,这就是语言模型的价值所在。

语言词汇的世界浩瀚如海,从量化的角度表达,语言模型是一种用于计算“一段文本”可能性的概率模型。把一段文本看作是一串时间轴上的单词序列,语言模型的任务即计算该文本泛起的概率。

假如学过基本的联合概率和前提概率,以下就非常容易理解了。

上一篇:消息称华为有... 下一篇:富士康之后,...
猜你喜欢
热门阅读
同类推荐