矩阵模拟!Transformer大模型3D可视化,GPT-3、Nano-GPT每一层清晰可见

首页 > 科技

矩阵模拟!Transformer大模型3D可视化,GPT-3、Nano-GPT每一层清晰可见

来源:戏说健康 发布时间:2023-12-04 14:53

矩阵模拟!Transformer大模型3D可视化,GPT-3、Nano-GPT每一层清晰可见

  新智元报道  

编纂:桃子 好困

【新智元导读】Transformer大模型工作原理毕竟是什么样的?一位软件工程师打开了大模型的矩阵世界。

黑客帝国中,「矩阵模拟」的世界或许真的存在。

模拟人类神经元,不断进化的Transformer模型,一直以来都深不可测。

很多科学家都试着打开这个黑盒,看看毕竟是如何工作的。

而现在,大模型的矩阵世界,真的被打开了!

一位软件工程师Brendan Bycroft制作了一个「大模型工作原理3D可视化」网站霸榜HN,效果非常震撼,让你秒懂LLM工作原理。

1750亿参数的GPT-3,模型层足足有8列,密密麻麻没遍布了整个屏幕。

GPT-2模型不同参数版本的架构可视化,差异巨大。如下是有150亿参数GPT-2(XL),以及有1.24亿参数GPT-2(Small)。

这个3D模型可视化还展示了,大模型天生内容的每一步。

这里,Bycroft主要分解了OpenAI科学家Andrej Karpathy打造的轻量级的GPT模型——NanoGPT,参数目为85000。

地址:https://bbycroft.net/llm

看过这个可视化图,你就可以了解ChatGPT的大脑。

从GPT-2(Small)到GPT-3的参数规模的跨越,让人叹为观止。

Bycroft称,这个指南侧重于模型的推理,而非练习,只是机器学习中的一小部分。在详细例子中,模型的权重已经预练习完成,使用推理过程来天生输出。

当然了,这个可视化网站也是收到了Karpathy在PyTorch中创建的minGPT,以及YouTube视频系列「Neural Networks: Zero to Hero」的启发。

接下来,一起深入来了解,Transformer模型每一层。

先容

为了利便进行演示,Brendan Bycroft给NanoGPT布置了一个非常简单的任务:

获取一个由六个字母组成的序列:C B A B B C,并按字母顺序排序,即「ABBBCC」。

上一篇:封闭式基金价... 下一篇:数智技术赋能...
猜你喜欢
热门阅读
同类推荐