据 OpenAI 2022 年 6 月 23 日发布的研究介绍,其团队训练了一个能够玩 Minecraft 的神经网络,核心方法是 Video PreTraining(VPT,视频预训练)。该方法先利用大规模、未标注的人类 Minecraft 游玩视频进行学习,再结合少量由承包人员提供的带标签数据进行训练。经过微调后,模型可以学会制作钻石工具;来源显示,这一任务通常需要熟练人类玩家花费 20 分钟以上、约 24,000 个动作完成。更关键的是,该模型并非通过游戏内部 API 或简化环境操作,而是使用人类原生交互方式——键盘按键与鼠标移动——这让它被视为通向通用电脑使用智能体的一步。
VPT 的核心:用少量标注数据“连接”海量视频与动作
传统强化学习在复杂开放世界任务中往往需要大量试错,而 Minecraft 这类环境不仅目标长、步骤多,还存在大量视觉观察与操作决策。OpenAI 此次强调的 VPT 思路,是先从人类玩家视频中学习“看见画面后大概会发生什么”,再借助少量带有人类操作记录的数据,把画面与具体键鼠动作对齐。
这类训练方式的意义在于:互联网上存在大量人类完成任务的视频,但大多数视频没有精确的操作标签。若模型能够利用未标注视频进行预训练,就可以显著扩大训练素材来源。对于开发者而言,这提示了一个趋势:未来构建能操作软件、网页、游戏或桌面环境的智能体,不一定完全依赖昂贵的逐步标注数据,而可能更多使用视频、屏幕录制、操作轨迹等混合数据。
- 训练素材包括大规模未标注的人类 Minecraft 游玩视频。
- 仅使用少量带标签的承包人员数据作为动作监督。
- 模型输入输出贴近人类接口:观察屏幕,并输出键盘、鼠标动作。
- 微调后可完成制作钻石工具这类长序列任务。
为什么 Minecraft 任务重要:它考验长期规划与低层操作
制作钻石工具并不是简单的点击或一次性分类任务。玩家需要采集资源、制作工具、探索环境、处理危险、理解物品合成链条,并在较长时间内保持目标一致。来源提到,熟练人类通常也需要 20 分钟以上和约 24,000 个动作,说明这类任务对模型的连续决策能力要求很高。
从 AI 应用角度看,Minecraft 更像一个可控但复杂的“电脑使用训练场”。模型必须把视觉识别、短期动作控制和长期目标结合起来。相比只生成文本的语言模型,这类系统更接近能在图形界面中执行任务的智能体,例如打开软件、配置参数、操作网页后台或完成多步骤工作流。
对 API 使用者与模型生态的影响
虽然这项研究本身并不是一个面向普通开发者直接调用的商业 API,但它传递出的方向与今天的模型调用生态密切相关:AI 能力正在从文本生成,扩展到多模态理解与真实界面操作。对于依赖 OpenAI、Claude、Gemini 等模型能力构建产品的团队,未来的接口需求可能不再只是“输入文本、返回文本”,而会扩展到屏幕图像、视频片段、动作序列、工具调用与状态反馈。
这也会影响 API 中转、额度和并发设计。智能体型任务通常链路更长,单次任务可能包含多轮模型调用、图像理解、规划、执行与校验,调用成本和稳定性压力都会上升。开发者在设计系统时,需要提前考虑任务拆分、失败重试、日志追踪以及多模型路由,而不是只关注单次响应速度。
对 API 批量调用场景来说,VPT 代表的路线还说明:未来高价值模型可能不只是“更会聊天”,而是更会利用人类自然界面完成复杂任务。当模型具备键鼠级操作能力后,企业自动化、游戏智能体、教学演示、软件测试、RPA 升级等方向,都可能产生新的模型调用需求。
本站解读:通用智能体会带来更复杂的接入层需求
OpenAI 将 VPT 描述为迈向通用电脑使用智能体的一步,这一点值得 API 开发者关注。文本模型时代,接入层主要解决密钥、额度、价格、并发和失败切换;智能体时代,接入层还可能需要管理视觉输入、操作动作、工具权限和任务状态。换言之,稳定的模型调用中介能力会变得更重要。
对于正在做 AI 应用的团队,VPT 的启示可以概括为三点:第一,多模态与行动能力会成为模型生态的重要竞争方向;第二,长任务会放大 API 成本、延迟和可靠性问题;第三,应用侧需要从“调用一次模型”升级为“编排一组模型与工具”。这类变化将持续影响开发者如何选择模型、规划额度、控制成本并设计可维护的接入架构。
