Meta 首席 AI 科学家 Yann LeCun(杨立昆):自回归大模型将在 3-5 年内消失

CN
15小时前

撰文:Techub News 整理

导语

在近期举办的 ChatGPT Talks 2023 大会上,图灵奖得主、纽约大学教授、Meta 首席 AI 科学家 Yann LeCun(杨立昆)发表了一场引人深思的主题演讲。作为深度学习与卷积神经网络领域的先驱,LeCun 在 Meta 主导前沿 AI 研究,并刚刚推动发布了开源大模型 Llama 2。在这场演讲中,他并未过多赞誉当前火热的大语言模型(LLM),而是犀利地指出了其核心局限,并勾勒了他心目中下一代 AI 系统的蓝图——「目标驱动 AI」。这场演讲不仅是技术前瞻,更是对 AI 发展路径与开放生态的深刻思考。

摘要

  • 当前自回归大语言模型存在「根本缺陷」,无法真正理解世界、进行推理与规划,且幻觉问题无法通过现有架构根除。
  • LeCun 预测,现有大模型将在 3 到 5 年内消失,被能够进行内部规划与推理的「目标驱动 AI」系统所取代。
  • 通往人类水平 AI 需攻克三大挑战:学习世界模型、学习推理、学习规划复杂动作序列。
  • 开源是 AI 基础设施的必然未来,正如互联网的基础软件,封闭的专有系统将无法被全球接受。
  • 需要抛弃当前流行的生成模型、概率模型、对比方法和强化学习,转向基于「联合嵌入预测架构」的自监督学习来构建世界模型。

自回归大模型的辉煌与根本缺陷

Yann LeCun(杨立昆)开宗明义地指出,尽管以 ChatGPT 为代表的自回归大语言模型取得了令人惊叹的成就,但它们在 AI 研究社区看来「真的不怎么样」。这些模型仅通过海量文本进行训练,缺乏对物理世界的直接体验,因此不具备常识,对现实世界的理解极其有限。它们本质上是一个「发散过程」:模型以自回归方式逐个预测下一个词元(token),任何一步微小的预测误差都会在后续步骤中被指数级放大,导致最终输出的答案可能在长文本中完全偏离事实。这是其架构固有的、无法通过简单修补解决的缺陷。

LeCun 将大语言模型的能力类比于心理学家丹尼尔·卡尼曼所说的「系统一」思维,即快速、直觉式、无需深思的反应。然而,人类智能的核心——「系统二」思维,即通过深思熟虑、推理和规划来解决问题的能力,是目前大模型所完全缺失的。它们无法进行复杂的多步骤规划,例如策划一次从纽约到巴黎的旅行,并将其分解为订票、前往机场、登机等一系列子任务和具体动作。

更关键的是,LeCun 强调,人类和动物的大部分知识是非语言的。婴儿在学会说话前,通过观察和互动已经掌握了大量关于物理世界的直观知识(如物体恒存、重力)。这些构成常识基础的知识,是大语言模型仅从文本中永远无法真正获得的。因此,他认为,仅凭文本训练,永远无法达到人类水平的 AI。

开源 AI:不可避免的未来基础设施

在深入技术批判之前,LeCun 首先谈到了 Meta 近期发布开源大模型 Llama 2 背后的理念。他认为,AI,尤其是未来将作为人类与数字世界交互中介的 AI 助手,将成为全人类知识的存储库和基础设。回顾互联网历史,其底层基础设施(如 Linux、Apache、HTTP)无一不是开源的。专有商业解决方案最终都输给了开放生态。

LeCun 断言,AI 领域将重演这一历史。未来的 AI 基础设施必须是开源的,原因有三:其一,从安全角度看,开源软件经过更广泛的审查,往往比闭源软件更安全;其二,构建涵盖全人类知识的系统需要全球数百万人的贡献,这类似于维基百科的模式,不可能由少数几家专有公司完成;其三,世界许多国家和地区不会接受其公民的所有信息都来自美国西海岸少数科技公司控制的闭源系统。

因此,Meta 坚定地站在开源研究的一边。LeCun 展望,未来只需要少数几个开源的基础大模型,整个生态系统就可以在其之上进行微调和开发各种应用产品,这将极大地促进创新和普及。

目标驱动 AI:下一代系统的蓝图

那么,应该构建什么样的 AI 系统来克服现有大模型的缺陷呢?LeCun 提出了「目标驱动 AI」的认知架构。其核心是一个可预测结果的「世界模型」。该系统包含几个关键模块:感知模块(估计世界状态)、世界模型(预测行动后果)、演员模块(想象行动序列)和成本模块(评估结果好坏)。

系统的运作原理是:给定一个目标(例如「去巴黎」),演员模块想象一系列行动,世界模型预测这些行动将导致的结果,成本模块则评估这些结果是否符合目标以及是否满足一系列「护栏」目标(如安全性、无害性)。整个系统通过优化(推理)过程,寻找能够最小化总成本的动作序列。这个过程本身就是规划和推理。

LeCun 特别指出,这种架构是本质安全的。只要护栏目标(如毒性检测)被硬编码在成本模块中,系统在推理时就会自动优化以避免产生有害输出,无需像现在这样通过复杂的「基于人类反馈的强化学习」来微调整个模型,且难以防范「越狱」攻击。

真正的挑战在于实现分层规划。人类可以轻松地将「去巴黎」分解为「去机场」、「登机」等高层目标,再进一步分解为「站起来」、「开门」、「打车」等具体动作,直至控制肌肉的毫秒级指令。当前 AI 完全无法自发学习这种分层表示和规划能力,这是实现人类水平 AI 必须攻克的核心难题之一。

抛弃生成模型:用联合嵌入架构学习世界模型

如何构建能够准确预测的世界模型?LeCun 给出了一个可能让当前 AI 界感到意外的答案:放弃生成模型。当前火爆的生成式 AI(包括自回归大模型)都属于生成模型,它们试图直接预测未来的具体数据(如下一个词元或下一帧视频图像)。但在面对高度不确定的现实世界(如预测视频下一帧)时,生成模型往往只能输出模糊的平均结果,因为它被迫为所有可能性分配概率。

LeCun 力推的方法是「联合嵌入预测架构」。其核心思想是:不再直接预测原始数据 Y,而是预测数据 Y 的抽象表示。系统通过编码器将输入 X(如当前视频片段)和待预测目标 Y(如下一视频片段)分别映射到表示空间,然后在这个抽象空间中进行预测。编码器的关键在于,它可以选择性地丢弃那些难以预测但对当前任务无关紧要的细节信息(如风中树叶的随机晃动),只保留易于预测且相关的特征(如道路上汽车的移动)。这使得预测任务变得可行且高效。

然而,训练此类架构面临「坍塌」风险:系统可能学会输出恒定表示来轻松最小化预测误差。为此,LeCun 团队开发了如 VICReg 等方法,通过正则化手段确保表示空间具有足够的方差和信息量。实验证明,这类方法在图像、视频等复杂模态的自监督学习上,效果远超基于重建的生成模型。

结论:通往人类水平 AI 的挑战与必然

Yann LeCun(杨立昆)总结道,要实现人类乃至动物水平的 AI,必须解决三大挑战:1. 学习世界的表征和预测模型;2. 学习推理;3. 学习规划复杂动作序列以满足多个目标。他构想的「目标驱动 AI」架构结合了分层规划、基于世界模型的推理和能量最小化优化,是应对这些挑战的一个可能方向。

他大胆预测,当前形式的自回归大语言模型将在 3 到 5 年内消失,取而代之的是能够内部规划答案、基于世界模型推理、并由目标驱动的系统。这样的系统将能同时保证事实准确性、流畅性和安全性。

最后,LeCun 谈到了对超级智能的看法。他认为不存在所谓的「通用人工智能」,因为即使人类智能也是高度特化的。他确信,未来机器将在所有人类智能领域超越人类,但这并不可怕。人类将始终掌控这些更聪明的机器,正如我们的大脑皮层并未脱离我们控制一样。未来的图景是,每个人都将被比自己更聪明的 AI 系统所辅助,共同推动知识与文明的进步。而实现这一未来的基石,将是开放、合作与持续的基础研究。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接