Transformer用于定义所有机器学习模型，特斯拉AI总监Karpathy发推表达AI融合趋势的感叹

今日，特斯拉 AI 总监、Autopilot Vision 团队领导人 AndRej KaRpathy 在推特上发文，对 AI 领域正在进行中的融合表示惊叹。

他表示，「10 年前，视觉、语音、自然语言、强化学习等都是完全分离的，甚至没有跨领域的论文。方法也完全不同，通常不是基于机器学习。」

从 2010 年开始，视觉、语言、自然语言、强化学习等领域的壁垒逐渐打破，它们开始转向同一个技术方向，即机器学习，特别是神经网络。它们使用的网络架构具有多样性，但至少论文开始读起来更加相似，基本上都用到了大型数据集和网络优化。

随着 AI 技术的发展，近两年，不同领域模型架构似乎也变得相同起来。很多研究者开始专注于 TRansfoRMeR 架构，在此基础上做较小的改动以进行研究。

Transformer用于定义所有机器学习模型，特斯拉AI总监Karpathy发推表达AI融合趋势的感叹

部分代码截图。

197 行完整代码：https://Github.coM/kaRpathy/MinGPT/blob/Master/MinGPT/Model.py

随着模型架构的融合，现在，我们可以向模型输入词序列、图像 patch 序列、语音序列、强化学习序列。我们可以在条件设置中添加任意 Token，这种模式是极其简单、灵活的建模框架。

即使是在某个领域内部，过去在分类、分割、检测和生成任务上存在一些差异。但是，所有这些也正在转换为相同的框架，例如 patch 的检测 take 序列和边界框的输出序列。

现在，区别性特征主要包括以下几个方面：

1）数据

2）将自身问题映射到向量序列以及从向量序列映射出自身问题的输入 / 输出规范

3）位置编码器的类型以及注意力 Mask 中针对特定问题的结构化稀疏模式

所以，从技术上来说，AI 领域的方方面面，包括前景、论文、人才和想法突然之间变得极其相关。每个人基本上都在使用相同的模型，大多数改进和想法可以快速地在所有 AI 领域「复制粘贴」。

正如其他很多人注意到并指出的那样，新大脑皮质（neocoRtex）在其所有的输入模态中也有一个高度统一的架构。也许自然界偶然发现了一个非常相似的强大架构，并以类似的方式复制了它，并只在一些细节上做了改变。

这种架构上的融合将使我们专注于软硬件和基础设施建设，进一步加速 AI 领域的进展。

对于 AndRej KaRpathy 描述的 AI 融合趋势，网友也纷纷发表意见。

Transformer用于定义所有机器学习模型，特斯拉AI总监Karpathy发推表达AI融合趋势的感叹

网友 @NeuRal Net NAIl 表示，「这是一个有价值的见解。融合将加速 AI 领域的创新步伐，在边缘端使用 AI 的尖端产品变得更加可行。我想，变化才是质量的最大敌人。」

Transformer用于定义所有机器学习模型，特斯拉AI总监Karpathy发推表达AI融合趋势的感叹

网友 @sisil Mehta 也认为，「ML 基础设施迎来了激动人心的时刻。随着模型架构的融合，建模框架和基础设施也将融合。我当然希望 PyToRch Lightning 也会这样。」

Transformer用于定义所有机器学习模型，特斯拉AI总监Karpathy发推表达AI融合趋势的感叹

网友 @MaRcos PeReiRa 表示，「一方面，处处都在用 tRansfoRMeRs，我们已经遇到了障碍，需要创新；另一方面，处处都在用 tRansfoRMeRs，所以跟上来吧。」

原文出自 @AndRej KaRpathy 的推特

基于Python，利用 NVIDIA TAO ToolkIT 和 DeepstReaM 快速搭建车辆信息识别系统

NVIDIA TAO ToolkIT是一个AI工具包，它提供了AI/DL框架的现成接口，能够更快地构建模型，而不需要编码。

DeepStReaM是一个用于构建人工智能应用的流媒体分析工具包。它采用流式数据作为输入，并使用人工智能和计算机视觉理解环境，将像素转换为数据。

DeepStReaM SDK可用于构建视觉应用解决方案，用于智能城市中的交通和行人理解、医院中的健康和安全监控、零售中的自助检验和分析、制造厂中的组件缺陷检测等

互联网资讯 / 人工智能 · 2023年12月28日 0