对话概述:第三人称分析
本次详尽的转述以第三人称、客观且结构化的视角,全面呈现了人工智能领域领军人物莱克斯·弗里德曼(Lex Fridman)与杨·勒昆(Yann LeCun)之间的一场高阶对话。原始对话文本超过26,000词,涵盖广泛议题,包括当前大型语言模型(LLM)的局限性、具身化与世界模型驱动的人工智能的必要性、专有AI系统带来的风险,以及一个由开源、以人为本的智能所塑造的未来愿景。
本转述在保持原意、语气与深度的基础上,对内容进行了重新表述,采用正式、客观的第三人称叙述方式,并通过章节、子标题与项目符号提升可读性与清晰度。文末附有简明总结,系统梳理整场讨论的核心要义。
一、核心困境:权力、控制与智能的未来
这场对话的核心,是一场深刻的技术与哲学辩论:谁应当掌控人工智能的未来?我们应如何构建它?
杨·勒昆(Yann LeCun),Meta公司首席人工智能科学家、图灵奖得主、纽约大学教授,展现出清晰而一贯的世界观。他明确指出:人类未来面临的最大威胁,并非超级人工智能脱离控制,而是少数私营科技巨头垄断AI权力。
他强调,这一风险源于专有AI系统——由大型科技公司封闭开发、无法访问的模型。这类系统若被广泛采用,将使极少数企业垄断人类知识的获取途径,操控公共舆论,主宰数十亿人的数字信息摄入。
勒昆将此与开源AI相对比:后者允许像Meta的LLaMA系列这样的基础模型被自由查看、修改与适配。他坚信,开放性不仅是技术选择,更是一种道德与民主的必然要求。
“通过专有AI系统集中权力所带来的危险,远大于其他一切。”
他将AI的未来与新闻媒体的未来直接类比:正如一个自由多元的媒体生态对民主至关重要,AI系统也必须保持多样性与去中心化,以守护思想多元、自由思考与人类自主权。
二、自回归语言模型的根本局限
对话中最为关键的论点之一,聚焦于当前大型语言模型(LLM)的根本缺陷——如GPT-4、LLaMA 2与LLaMA 3。
勒昆断言:自回归LLM并非通向人类水平或超人类智能的可行路径。尽管它们在文本生成方面表现强大,但缺乏真正智能所必需的基础要素。
LLM所缺失的关键特征:
-
对物理世界的理解
LLM无法感知或与真实世界互动。它们无法理解重力、物体恒存性或因果关系。其知识仅基于统计与语言模式,而非真实体验。 -
持续记忆能力
LLM不具备长期记忆。它们无法在会话间保留信息,也无法利用过往经验指导未来决策。其依赖有限的上下文窗口,无法累积知识。 -
推理与规划能力
LLM无法进行真正意义上的推理或规划。它们不会建模未来状态,无法评估行动序列或优化目标。其输出仅基于模式匹配,而非目标导向的思维。 -
具身认知
勒昆强调,智能源于与环境的互动。人类与动物在掌握语言之前,已通过视觉、触觉、听觉等感官输入学习。人类大脑在短短四年间处理的视觉数据量高达10¹⁵字节,远超LLM训练所用的2×10¹³字节文本。
“通过感官输入,我们获取的信息远多于语言所能传递的。”
由此引出一个关键洞见:语言只是现实的压缩、近似表达。它无法承载物理体验的丰富性、直觉或常识。
三、世界模型与自监督学习的主张
为突破LLM的局限,勒昆主张一种全新范式:通过感官数据(尤其是视频)进行自监督学习,构建世界模型。
为何选择视频?
- 视频包含连续、高维、实时的数据,远比文本丰富。
- 它捕捉运动、深度、纹理、物体交互与因果动态。
- 为学习直觉物理、物体恒存性与物体功能提供天然环境。
生成模型的失败
十余年来,研究人员尝试训练AI系统预测视频中的像素——即生成下一帧画面。这一方法称为生成建模,但最终失败,原因如下:
- 可能的视频帧空间浩如烟海。
- 精确预测每个像素在计算上不可行。
- 模型仅学会模仿模式,而非真正理解。
“我们尝试过,但失败了……我们无法让它们学会图像或视频的良好表征。”
突破:联合嵌入预测架构(JEPA)
勒昆提出JEPA(Joint Embedding Predictive Architecture) 作为革命性替代方案。与生成模型不同,JEPA不预测像素,而是:
- 输入一段视频或图像;
- 对其部分区域进行“破坏”或遮蔽(如移除一块像素);
- 使用编码器提取原始数据的潜在表征(压缩、抽象的版本);
- 训练一个预测器,从被破坏的数据中重建未受损输入的表征。
该方法为非对比性,不依赖负样本(如“这不是猫”)来防止模型坍塌。相反,它通过正则化机制,确保模型学习有意义的结构。
“系统学会消除噪声,只保留可预测且有意义的内容。”
为何JEPA有效?
- 在抽象表征空间中运行,而非像素空间;
- 关注“可预测内容”,而非全部细节;
- 自然构建分层抽象,类似人类思维;
- 已在以下任务中展现成功:
- 视频中动作识别;
- 检测物理上不可能事件(如物体突然消失);
- 学习直觉物理。
“这是首次见到系统能学会视频的良好表征。”
四、迈向高级机器智能(AMI)的路径
勒昆构想一个未来:AI系统通过结合以下要素,实现人类水平智能:
- 基于视频与感官数据训练的世界模型;
- 利用内部世界模型进行分层规划;
- 基于目标驱动的推理,答案通过优化生成,而非自回归预测。
模型预测控制(MPC)
关键创新是模型预测控制(Model Predictive Control),该方法在航空航天与机器人领域已有数十年应用。其运作机制为:
- 基于当前动作模拟未来状态;
- 依据目标评估结果;
- 选择能最大化成功概率的动作。
这与LLM截然不同:LLM无法规划——它们没有内部世界模型。
勒昆以一个简单例子说明:
-
LLM方式:“我需要从纽约去巴黎。”
→ 可能列出“坐飞机”“订票”等步骤,但无法说明如何从椅子上起身或步行至机场。 -
基于JEPA的系统:
→ 构建环境的世界模型;
→ 规划动作序列(如“起身”“走向电梯”“按按钮”)以达成目标;
→ 可根据实时反馈动态调整计划。
这才是真正的智能:不仅回答问题,更具备推理、规划与适应能力。
五、语言的作用与纯文本AI的局限
尽管文本数据量巨大(10¹³个token),勒昆仍认为:仅靠语言无法实现真正理解。
为何语言不足以支撑理解?
- 信息带宽低:语言是稀疏、离散的现实表征;
- 缺乏感官基础:无法通过阅读“理解重力”;
- 常识表达不完整:笑话、讽刺与社交线索依赖共享的物理体验。
“我们所称的常识推理……你必须自己去理解。”
他承认,部分常识可从文本中推断,但效率低下且不完整。
“不把东西打翻,显然更容易。”
因此,语言必须根植于感知与行动,才能实现真正理解。
六、幻觉问题与系统性缺陷
勒昆指出,幻觉(即生成虚假或荒谬内容)是自回归LLM的根本缺陷。
幻觉为何发生?
- 每个token基于概率生成;
- 错误随序列指数累积;
- 系统无内部模型验证真伪。
“随着token数量增加,答案变得荒谬的概率呈指数增长。”
这使LLM在医疗诊断、法律建议或科学研究等关键任务中不可靠。
解决方案:能量模型
勒昆提出一种新架构:能量模型(Energy-Based Models),其机制如下:
- 系统通过最小化标量“能量”得分,评估答案质量;
- 使用梯度下降在抽象表征空间中优化答案;
- 可在生成文本前进行规划与推理。
“系统在说出答案前,会先思考。”
这与自回归生成形成根本性突破,更贴近人类认知:我们先思考,再开口。
七、开源与民主化AI的主张
勒昆坚定支持开源AI,不仅作为技术选择,更是民主的必要条件。
为何必须开源?
- 防止少数企业垄断;
- 促进多元视角、语言、文化与价值体系;
- 赋能本地创新:政府、非政府组织与中小企业可针对本地需求微调模型。
“若要拥有多样化的AI助手,必须依赖开源。”
他列举真实案例:
- 印度:将LLaMA 2微调为22种官方语言;
- 塞内加尔:用本地语言开发LLM,用于传播医疗信息;
- 法国:拒绝由美国控制的AI系统,以保护国家主权。
“所有公民的数字信息摄入,不应由美国西海岸的三家公司掌控。”
八、开源的商业逻辑
尽管存在质疑,勒昆认为:开源并非利润威胁,而是可持续商业模式的路径。
企业如何从开源中获利?
- Meta 公开发布基础模型(如LLaMA);
- 第三方 在其上构建应用(如客服机器人、企业知识系统);
- Meta 通过以下方式获得收入:
- 企业授权;
- 广告(若服务为广告支持);
- 销售专用工具。
“将基础模型公开发布,并不会损害我们。”
开源模式加速创新,吸引人才,建立信任。
九、回应批评:AI末日论与审查问题
勒昆直接回应AI末日论者——那些担忧超级智能AI将毁灭人类的人。
为何他持不同意见?
- AGI不会突然出现。它将是一个渐进、迭代的过程,如同印刷术的诞生;
- AI不会拥有内在欲望(如统治欲)。欲望是社会物种的生物本能,非机器特性;
- 不会出现单一“叛变AI”。相反,良性AI将监督并制衡恶意AI,如同现实中的执法机构。
“将会有智能AI警察,对抗你的叛变AI。”
他还批评AI中的审查问题,以谷歌Gemini为例。他认为:审查不是技术问题,而是政治问题。
“你无法让一个系统被所有人认为‘无偏见’。”
真正的解决之道是多样性,而非控制。
十、机器人的未来与物理智能
勒昆认为,真正的机器人技术,只有在AI具备世界模型后才能实现。
为何当前机器人受限?
- 现有机器人(如波士顿动力、特斯拉Optimus)依赖手工构建模型与预设行为;
- 无法适应新任务或环境;
- 缺乏常识、规划能力与经验学习。
“我们离L5级自动驾驶仍相距甚远。”
他预测:未来十年将实现突破,但前提是:
- AI从视频中学习;
- 系统发展出直觉物理与动作规划能力;
- 机器人能从经验中学习,而非仅靠编程。
十一、人类价值观与安全护栏的作用
勒昆承认,AI必须与人类价值观对齐,但他反对“必须存在单一普世道德框架”的观点。
如何构建安全AI?
- 护栏可内置于开源系统中;
- 微调允许社区设定自身价值观;
- 目标驱动AI可内置规则,如“服从人类”“不伤害他人”。
“系统可被设计为安全,因其本就以有用为目标。”
他以飞机安全为例:安全并非来自独立“安全团队”,而是通过设计更可靠、更优的系统实现。
十二、人类未来的愿景
勒昆以一个有力的愿景作结:AI将使人类变得更聪明。
“AI将使人类变得更聪明。”
他将AI的潜力与印刷术的发明相提并论——这一变革性事件:
- 使知识普及;
- 推动启蒙运动;
- 带来民主、科学与革命。
“印刷术带来了200年的宗教冲突,但整体上是积极的。”
他相信,AI也将产生类似净正向影响,尽管短期存在挑战。
十三、最终总结:未来蓝图
这场对话最终凝聚为一个清晰、可操作的未来愿景:
- 放弃自回归、生成式模型,转向基于JEPA的世界模型学习;
- 从感官数据而非仅文本构建AI;
- 利用开源平台保障多样性、民主与创新;
- 发展具备规划、推理与经验学习能力的系统;
- 将安全设计为系统默认属性,而非附加层;
- 信任人类智慧地使用AI,而非恐惧它。
“若AI,尤其是开源AI,能使人变得更聪明,它将强化人类本性的善良。”
最终纲要(英文版)
1. 核心主题:权力与开放
- 最大威胁是专有系统导致AI权力集中;
- 开源AI是民主、多样与创新的基石。
2. LLM的局限
- 缺乏世界理解、记忆、推理与规划能力;
- 仅为统计模式匹配器,非智能主体。
3. 解决方案:基于JEPA的世界模型
- JEPA 通过联合嵌入与预测在抽象空间中学习;
- 从视频而非像素学习;
- 实现直觉物理、常识与规划能力。
4. AI的未来
- 模型预测控制实现目标导向规划;
- 能量模型实现“先思考,再说话”;
- 分层规划是复杂任务的关键。
5. 开源作为民主必然
- 保障本地、文化、语言多样性;
- 赋能政府、NGO、中小企业;
- 防止企业或国家垄断。
6. 回应末日论者
- AGI不会突然出现;
- AI不会拥有内在欲望;
- 良性AI将制衡恶意AI。
7. 前路展望
- 未来十年将实现机器人与具身AI的突破;
- 开源模型将成为基础;
- 人类将变得更聪明,而非更弱。
Continue the conversation
Discussion