深入聊聊开源AI及其未来的挑战

首页 > 科技

深入聊聊开源AI及其未来的挑战

来源:娱乐当家 发布时间:2023-06-09 16:00

深入聊聊开源AI及其未来的挑战

作者 | Lum Ramabaja

译者 | 核子可乐

策划 | 刘燕

从 AI 的价值说起

固然我坚信开源 AI 将继承蓬勃发展,但也认定企业和政府会在未来几年内进一步加强对新型神经网络架构和技术的应用限制。在本文中,我们将一同猜测和展望未来十年间 AI 可能带来的潜伏颠覆,提出一些建议和方案匡助开源社区适应这个布满挑战的未来。

猜测未来绝非易事,这里提出的不少猜测也许永远不会实现,甚至朝着截然相反的方向前进。但我以为这样的思索仍有重要意义,将匡助我们主动适应不断变化的新世界。跟着整个时代的快速推进,这种设想并规画新阶段下新形势的能力将变得越来越重要。

在不久的将来,人与人之间的交互方式、交换价值和介入劳动的方式,甚至是整个社会的组织结构都将发生根本性变化。到那时,也许每个人都将拥有自己的个性化 AI 实体,我个人称之为“魂灵”(Ghost);这些实体彼此相连,就构成了 AI 系统的全球网络。它们将为人类提供诸多服务,而不同于以往的功能性助手,人类更多应该将其视为自身的认知延伸。企业和组织可能也会拥有自己的“魂灵”,借此在成员之间达成高效协作。

除了社交之外,具有轮回连接的联想记忆网络可能将为 AI 系统赋予记忆。这些独立的“魂灵”甚至可能发展出自己的身份。另外,利用共鸣算法的 AI 系统也有可能实现,进而产生去中心化的自主 AI。尽管这样的未来彻底来临,但我们已经能够预见到由此展开的一系列经济动向。

AI 天生服务的交换价值,将即是提供服务所需要的能量(即运行相关模型的本钱),再加上 AI 在市场中的信息不对称程度。使用 AI 执行相对简朴的服务必然对应较低的交换价值,从而导致 AI 所有者的剩余价值维持在低位。

这种趋势将极大影响以服务为基础的经济体系,预计大多数现有服务的剩余价值都将大幅衰减。因此预计在未来一段时间内,很多西方国家的民众和政府都将像 19 世纪的勒德分子那样对技术抱有强烈的抵触情绪、甚至是敌意。受到跨部门收益递减的影响,世界上很多地区将通过垄断许可策略和独裁划定等方式阻碍 AI 的普及。

不外世界上还有更多积极接纳 AI 提高的地区,开源 AI 很可能会在交换价值低但使用价值高的服务上(即可由 AI 执行的相对简朴服务)在这里蓬勃发展。与之对应,那些模型机能的微小改进即可对应价值明显晋升的服务,将迎来截然不同的经济激励形式。对于此类服务,预计赢家通吃将继承占据主流,意味着更进步前辈的 AI 系统将持续提供更多的剩余价值。

因此,分享技术和模型架构立异的动力将有所下降。但请留意,体系内对剩余价值的榨取只会在参与者间存在价值不对称时才会发生。在 AI 的背景下,这种不对称很可能会体现在信息层面,即控制和限制他人获取信息和知识的能力。

参与者之间的信息不对称可能是政府强制管控的结果(例如知识产权、许可、访问控制等);消解这种信息不对称需要采取政治步履,已非纯粹的技术手段所能解决。然而,技术本身同时也将削减因资源不对称所引发的信息不对称。

具体来讲,如今的人工神经网络通常以密集方式进行练习,意味着一旦提供输入,网络内的所有单元均会被激活。对于 transformer 这类架构(即 ChatGPT 等大语言模型的技术基础),传播信息的计算成本极为高昂,主要体现在其中的“自注意力”环节上。计算复杂度越高,对应的能量消耗也就越大。

因为练习大语言模型(LLM)需要大量资源,所以预计“赢家通吃”类 AI 系统的开发和治理将首先由少部分闭源实体所主导。出于经济念头,这些实体会将模型权重和架构作为专有资产,严格保密能为其带来更强的盈利能力。

遗憾的是,这种资源限制导致研究职员、非营利组织和初创公司等小规模实体因无法承担高昂的能源本钱,而几乎不可能从零开始练习自己的大语言模型。因此,目前大部分开源大语言模型均是对现有模型进行微调,这种方法本钱更低且耗能更少。基于这样的动态,我们最明智的决议计划应该是保持开源 AI 在质量上始终具有竞争力,借此降低深度学习模型规模化练习和运行带来的本钱。

稀疏激活张量

面对经济念头失衡、高强度大语言模型练习带来的夸张能耗、以及 AI 控制权的日益集中,我们 Open Cybernetics 意识到必需采取更加积极主动的态度。为数据集创建类似 GPL 的尺度,恰是开源 AI 社区向前迈出的重要一步。但必需承认,无版权运动还不足以抵御这个十年内即将泛起的颠覆性经济和政治气力。

相反,必需借助新的技术和协议来实现社会经济权力的动态性转变。面对这个题目,我力推“稀疏激活张量”概念及其对等空间的协同作用。我们将在未来的工作中不断探索如何构建具备模型中立性的稀疏激活张量数据结构。

在本文中,我将简朴先容其基本理念、技术开发的底层原理,以及对开源社区及其他领域的影响。简朴来讲,稀疏激活张量就是能够以稀疏方式检索并更新自身状态的数据结构。为了更好地理解其深层含义,让我们先从一个简朴示例入手。

图一:什么是嵌入层。

嵌入层可被看作基于一对一映射原理运行的稀疏激活张量。也就是说:嵌入层由 token 列表(例如单词)以及包含相应嵌入的权重矩阵组成。语料库中使用的每个词,都将被分配给权重矩阵中的一行,从而创建词到嵌入的映射(参见图一)。这些嵌入随后会作为神经网络的输入。嵌入层之所以能被视为稀疏激活张量,是因为它满意此类数据结构的两个相关尺度:

嵌入可以通过数据库进行有效检索,无需将整个张量加载至内存中即可进行稀疏检索。

嵌入能以稀疏方式更新。在通过嵌入层的反射传播期间,仅须调整与所用 token 相关的权重,其余嵌入将被排除在更新步骤之外。

固然一对一映射方法在单词等离散 token 情况下确有价值,但却无法在连续输入中正常起效。例如,一个 28 x 2828 x 28 的图像块中包含巨量潜伏像素组合,根本不可能建立一对一映射的嵌入层。但我们将在后文讨论,使用多对一映射的方法同样能获得类似结果。嵌入检索和稀疏激活张量之间的逻辑联系也将变得显而易见。

考虑这样一个情况,我们有一个归一化矩阵 WK,它由存储模式和一个归一化输入 I 组成(详见图二)。在 I 和 WK之间执行点积,本质上相当于检查 WK中的各列并确定哪个列向量与 I 更相似。所得到的 K 向量表示 I 和 WK 的每一列之间的余弦相似度。K 得分越高,则表示输入与相应列之间的相似度越高。

图二:K 中的值代表 Wk 的列与 I 的相似度。

结合 softmasx 激活函数,附加权重矩阵 WV和标量参数β来调节 softmax 分布的强度,我们就能将 I 与给定输出 O 联系关系起来(参见图三)。softmax 运算的结果分布决定了 Wv 矩阵中的各些行会被赋予更高权重。这样的神经网络层配置,通常被称为现代 Hopfield Lookup 层。它使用一组预定的可学习模式的加权乞降,在连续输入和输出嵌入之间建立联系关系。

图三:现代 Hopfield Lookup 层。

大家可能已经发现,从 I 到 O 的转换需要大量计算。这还只是一部分,tarnsformers 中的自注意力步骤需要消耗更多算力。如图四所示,tarnsformer 的自注意力步骤要用到 3 个矩阵:查询(Q)、键(K)和值(V)矩阵,再加上 softmax 函数。请留意,步骤中的 dk项与β在图三示例中的作用相似。

图四:transformer 中的自注意力机制。为了简朴起见,这里省略了多头组件以及编码器的层归一化和残差连接。

为了导出查询、键和值矩阵,首先要计算大量不必要的余弦相似度。具体来讲,这些点积运算中的很大一部分对自注意力步骤的输出嵌入并没有明显贡献。换言之,Q、K 和 V 中的大多数数值往往显著小于 1。尽管如此,之所以要在输入 I 与 WQ、WK、WV各列进行比较,就是由于我们事先并不知道会产生最高余弦相似度的权重矩阵有着怎样的特定内部模式。这种先验知识的缺乏会增加 transformer 的相关练习本钱,迫使我们不得不在整个 Q 和 K 矩阵之间进行点积运算。

为了凸起当前 AI 系统中信息检索过程的低效题目,让我们考虑以下场景:我们有一个大型数据库,但愿执行一项简朴查询。目前 AI 系统需要加载和遍历内存中的整个数据库,才能检索与我们查询相对齐的少数匹配项,而根本不会利用索引记实。可以看到,像 transformer 这种联系关系记忆网络的信息传播方式极为低效,而潜伏的解决方案有如下两种。第一,通过修改注意力机制来使用机器学习方法,借此减少计算需求。这方面尝试在 Linformer 和 Performer 等项目中均有体现。或者,我们也可以考虑在不改变底层模型架构的情况下,引入数据库系统的设计原则。

比如说,我们知道可以在 I 和权重矩阵之间执行效率更高的近似 K 最近邻(kNN)查找,这就避免了加载或遍历整个张量。这种方法可以明显降低大语言模型的计算需求,进而省下大量能源。有趣的是,部门大语言模型已经开始采用这种技术。例如,Memrizing Transformer 就在向量数据库上以更高效的近似 kNN 查找来使用外部寄存器。这些使用向量数据库的大语言模型,通常会在后台使用 HNSW 算法。

与数据库进行类比,“稀疏检索”的概念相当于具有预索引的权重,无需遍历整个数据库即可实现记实检索(即已存储的模式)。然而,目前能利用向量数据库的 transformer 还仅限于在推理阶段执行近似 kNN 查找。换言之,模型练习阶段仍只能以算力密集方式进行,因此对应大量能源消耗。为了促进大规模神经网络的集体练习,必需将模型权重的同时更新转化为稀疏更新。通过设计这种包含稀疏检索和稀疏更新的神经构建块,我们将为开源 AI 社区做出贡献,克服资源限制导致的信息不对称题目。

“魂灵”的密码学证实

作为缓解资源限制的有效策略,开源 AI 社区中的部门研究职员已经开始利用受信对等协作来推理和微调大语言模型。例如,Petals 等项目就在使用基于 Kadelia 的分布式哈希表,在去中心化的节点网络中传播神经流动。通过这种方法,Petals 用户能够在多个节点间分配练习和推理任务,而不再依靠单一机器加载整个大语言模型。通过共同介入练习过程,这些分布式节点扩展了其单打独斗所无法实现的能力。

固然这些系统实用性出众,但还缺少还原当前对等 AI 项目的一个枢纽组成部分:对抗环境中的无信任机制。要想在 Petals 这类系统中执行前向传播,就要求人们必需充分信任网络中的其他节点。换句话说,任何恶意节点都能返回实际上并非源自模型的输出。固然这种局限性没有彻底击溃协作研究的远景,但的确已经阻碍了对等 AI 系统在现实世界中的广泛应用。

这就是稀疏激活张量施展明显上风的第二个用例。除了能源效率更高之外,稀疏激活张量还具有必要属性,能够在对等 AI 网络中实现前向和后向传播的密码学安全。现在,让我们简朴观察 Merkle 树数据结构,了解这一切是怎样实现的。

Merkle 树是一种二叉树数据结构,用于安全验证列表中的值是否存在,且不必向另一方提供列表中的每个值。要创建 Merkle 树,列表中的每个值都须使用加密哈希函数进行哈希处理,进而产生叶节点。之后,通过哈希将这些叶节点组合起来形成非叶父节点。重复这个过程,直至抵达二叉树的根(详见图五)。

上一篇:b·体育(中国)... 下一篇:Siri 还有未...
猜你喜欢
热门阅读
同类推荐