Sutton认为,当今的大型模型主要依赖于预训练和后训练阶段来获得其能力,模型一旦上线,通常参数不再进行更新,仅能依靠上下文、知识库或重新训练来适应环境的变化。因此,如何让人工智能在部署后具备持续学习的能力,已成为行业亟需攻克的核心问题。在8月18日,红杉资本旗下播客《Training Data》发布了一期关于人工智能持续学习的访谈,受访者为强化学习领域的重要人物、2024年图灵奖得主Rich Sutton。此次对话也有他的前学生、Oak Lab的联合创始人Khurram Javed参与,访谈由红杉资本合伙人Sonya Huang和Alfred Lin共同主持。
对话涵盖了Sutton在2019年发表的《苦涩的教训》,并深入探讨了合成数据、世界模型与持续学习等主题,以及智能体如何通过真实体验形成抽象概念。Sutton指出,若一个模型在部署后就停止更新,那么它就无法被视为一个完整的智能系统。尽管大型模型在某些方面取得了显著进展,但它们仍然仅解决了智能的部分问题,尤其是在语言能力上。
基于此,Sutton将持续学习的发展视为一条完整的技术路线。他与Khurram Javed于上个月共同创建了AI初创公司Oak Lab,推出了以经验学习、时间抽象和规划为核心的OaK架构,期望智能体能够从连续的经历中实时学习,持续更新其认知并优化决策能力。
在今天,尽管大型模型仿佛无所不知,有一个关键特性往往被忽视:这些模型的能力主要在上线之前就已形成,经过预训练和后训练后,参数几乎处于固定状态。因此,即使模型每天接触大量的用户和新信息,其处理方式仍无法像人类一样,将这些经历转化为新的长期能力。