2022 年 6 月 23 日,OpenAI 发布了关于 Video PreTraining(VPT,视频预训练)的研究进展:研究团队训练了一个神经网络,使其能够通过观看大量未标注的人类 Minecraft 游玩视频来学习操作,并只使用少量由承包人员提供的带标注数据进行对齐。来源显示,在进一步微调后,该模型可以学会制作钻石工具;这类任务通常需要熟练玩家花费 20 分钟以上,并涉及约 24,000 个连续动作。更值得关注的是,模型并非通过游戏内部 API 或特殊环境接口完成任务,而是使用人类原生交互方式,即键盘按键与鼠标移动。
从 AI/API 使用者视角看,这项工作的重要性不只在于“AI 会玩游戏”,而在于它展示了一条训练通用电脑操作智能体的路径:让模型从真实人类操作视频中学习,再通过少量标注和微调迁移到复杂任务。对于未来的模型调用、自动化办公、网页操作、软件测试和游戏智能体 API,这类方法都具有参考意义。
VPT 的核心思路:用大量无标注视频降低训练门槛
传统强化学习往往依赖环境奖励、模拟器接口或大量人工设计的任务反馈,而 Minecraft 这类开放世界游戏的动作空间复杂,单靠稀疏奖励很难高效学习。VPT 的关键在于先利用少量带标注数据学习“画面到动作”的映射,再把这种映射扩展到海量未标注视频上,让模型能够从普通玩家视频中学习行为模式。
这种方式的价值在于,互联网上存在大量人类操作软件、网页、游戏和工具的视频。如果模型能够从这些视频中提取“人是如何完成任务的”,就有机会把未标注数据转化为训练智能体的资源。OpenAI 在 Minecraft 上的实验,相当于验证了这一路径在长序列、多步骤、强交互场景中的可行性。
- 数据来源更接近真实人类行为:模型学习的是人类玩家的键鼠操作,而非专门为机器设计的接口。
- 标注需求被压缩:只需少量带动作标签的数据,便可利用更大规模的无标注视频。
- 任务链条更长:制作钻石工具需要持续规划、采集、合成和操作,远超简单点击任务。
- 泛化方向更明确:键盘与鼠标是通用电脑交互入口,意味着方法可能扩展到其他软件场景。
为什么 Minecraft 是观察通用智能体的好场景
Minecraft 并不是一个只有固定关卡和明确按钮的环境。玩家需要探索地形、收集材料、制作工具、规避风险,并根据当前状态不断调整策略。来源摘要提到,制作钻石工具通常需要熟练人类花费 20 分钟以上、执行约 24,000 个动作,这说明模型面对的是长时间依赖记忆、规划和精细控制的任务。
因此,VPT 的意义在于把视觉理解、动作预测和任务执行结合起来。模型需要根据屏幕画面判断自己处于什么位置、有哪些资源、下一步该按什么键或移动鼠标。这种能力与未来的电脑使用智能体高度相关:无论是打开网页、填写表单、运行开发工具,还是在复杂控制台中排查问题,本质上都可以被抽象为“观察界面并执行动作”。
对开发者与 API 生态的影响:从文本模型走向操作型模型
当前开发者使用大模型 API,主要围绕文本生成、代码补全、图片理解、多模态问答等能力。但 VPT 代表的方向提示,下一阶段的 API 可能不只是返回一段文字,而是输出可执行动作序列,甚至直接控制浏览器、桌面软件或虚拟环境。对 API 中转、模型调用和企业接入而言,这会带来新的需求。
首先,操作型智能体对稳定性和延迟更敏感。文本接口可以等待几秒生成结果,但鼠标移动、按键执行和环境反馈需要连续调用,任何中断都可能导致任务失败。其次,长任务会显著增加上下文、状态管理和调用成本,开发者需要关注额度、并发、失败重试与日志追踪。再次,安全边界也会变得更重要:一旦模型具备真实操作能力,权限隔离、沙箱环境和人工确认机制将成为 API 产品设计的基础。
对于使用 OpenAI、Claude、Gemini 等模型构建应用的团队来说,VPT 提供的启发是:未来智能体能力并不只来自更强的语言理解,也来自对人类操作轨迹的学习。开发者在设计 Agent 系统时,可以更早考虑浏览器自动化、界面状态回传、动作审计和多步任务恢复等模块,而不是只把模型当作聊天接口。
仍需关注的限制与落地路径
来源信息表明,该研究是迈向通用电脑使用智能体的一步,但并不意味着模型已经具备全面可靠的电脑操作能力。Minecraft 虽然复杂,却仍是相对封闭的游戏环境;真实办公软件、网页系统和开发工具具有更多权限、异常状态和安全风险。要把类似能力产品化,还需要在任务成功率、可解释性、成本控制和权限治理方面持续推进。
综合来看,OpenAI 的 VPT 工作把“视频数据训练智能体”推到了更受关注的位置。它对开发者的现实意义在于:未来 API 调用可能从一次性生成内容,扩展为持续观察、决策和执行的完整流程。谁能在模型能力、调用成本、并发稳定性和安全接入之间取得平衡,谁就更可能在智能体应用生态中获得优势。
