
Rich Sutton:能够持续学习的智能体才是未来
Om avsnittet
在Bayt播客上收听任何播客的中文翻译音频,并查看双语字幕:
iOS:https://apps.apple.com/app/apple-store/id6748532039?pt=121796720&ct=xiaoyuzhou&mt=8mt=8
📝 本期播客简介
本期节目我们翻译了知名AI播客《Training Data》。由红杉资本合伙人Sonya Huang与Alfred Lin主持,本期对话了强化学习先驱、《苦涩的教训》作者里奇·萨顿(Rich Sutton)及其共同创始人Khurram Javed。两人联合创立了Oak Lab,致力于打破当前大模型“训练后冻结”的范式,打造能真正从自身经验中持续学习的智能体。萨顿直言:“我不奇怪,奇怪的是整个领域。”他们犀利指出合成数据是“重大错误”,提出“大世界假说”,并分享了解决灾难性遗忘的“持续反向传播”算法。这场对话将带你深入探讨:为何前沿实验室被困于局部最优?AI如何跨越语言模仿,迈向五到十年内功耗仅20瓦的万亿参数持续学习大脑?
⚙️ 本期嘉宾
里奇·萨顿(Rich Sutton):强化学习奠基人之一,阿尔伯塔大学AI研究计划核心推动者,著有AI领域圣经级文章《苦涩的教训》。他长期致力于探索心智与学习的本质,坚信所有学习本质上都是持续的,智能的核心在于不断从行动中更新认知。
Khurram Javed:萨顿的前学生,Oak Lab联合创始人,长期深耕持续学习与智能体架构设计。他深入剖析了当前AI范式的局限性,并阐述了Oak Lab如何通过新算法实现智能体的自我进化与能效突破。
🌟 精彩内容
🧠 “我不奇怪,是领域疯了”:持续学习才是智能的本能
萨顿指出,在AI热潮之前,人们从未区分“持续学习”与“非持续学习”,因为所有真正的学习都发生在行动中。他认为当前AI圈将模型发布后权重冻结的做法才是“奇怪”的,而人类与动物天生就在不断从经验中更新认知。真正的智能不应是一次性预训练,而是贯穿始终的动态过程。
“在所有这些AI热潮之前,你不需要提持续学习,因为谈论非持续的学习是没有意义的。所有学习都是持续的。我们总是在行动中学习。这才是正常的思维方式。我不奇怪。这个领域才奇怪。”
🌍 “大世界假说”与合成数据的陷阱:世界远比模拟器复杂
针对当前大模型依赖合成数据的趋势,嘉宾提出了“大世界假说”:世界的复杂程度远超任何智能体或模拟器。依赖人类专家策划的合成数据终究受限于人类认知,且无法覆盖真实物理世界的无穷变量。智能体必须直接与现实世界交互,从真实经验中不断修正粗糙的近似模型,而非依赖静态的模拟数据。
“合成数据是个大错误。世界极其复杂,任何模拟都显得微不足道。正因为世界极其复杂,你根本不可能做到‘最优’,你必须依赖各种近似处理。所以,我们必须不断学习。”
🛑 告别“训练后冻结”:LLM只占智力的四分之一?
萨顿高度肯定LLM是“未预料的科学突破”,但强调它仅代表了智力的大约四分之一。当前范式过度依赖人类知识灌输,导致模型在部署后停止学习。真正的智能系统应能像人类一样,在交互中不断吸收新知识、更新权重,并保持认知的连贯性,而不是被当作静态的知识库。
“大型语言模型是一项了不起的科学突破……但我要说清楚,所有的智能不仅仅是流利地使用语言。还有更多的东西。这大概占智力的20%或四分之一。我们还没完成。”
🔧 灾难性遗忘“完全可治愈”:持续反向传播算法揭秘
针对持续学习最大的痛点“灾难性遗忘”,嘉宾指出这并非不可逾越的技术鸿沟,而是算法设计问题。Oak Lab提出的“持续反向传播”算法通过为每个权重设置独立的学习步长,并不断注入随机性以生成新特征单元,实现了在吸收新经验的同时保护旧知识。这为构建真正可进化的AI大脑提供了算法基础。
“灾难性遗忘是‘完全可治愈’的。你需要为每个权重元学习步长,并在特征空间中不断提出新单元。持续反向传播就是不断注入随机性生成新种子,再用反向传播进行测试。结合这些,你将迎来新一代的持续深度学习。”
🚀 20瓦的万亿参数大脑:Oak Lab的十年愿景与前沿实验室的“局部最小值”困境
Oak Lab的目标是在5到10年内,打造一个能持续学习、保持连贯且功耗仅20瓦的万亿参数智能体。嘉宾坦言,前沿大厂因受制于当前范式的“局部最小值”,难以承受新范式初期性能下降的阵痛,从而错失范式跃迁。而Oak Lab选择从小团队起步,专注底层算法突破,追求极致的能效比与真正的自主进化能力。
“前沿实验室被困在一个局部最小值里,新范式在变好之前几乎不可能不变糟。他们太执着于现有产品,不可能去走一条事情会越来越糟的路。我们的目标,五到十年后,是一个万亿参数的思维,它能持续学习,保持连贯,并运行在20瓦的功耗上。”
🌐 播客信息补充
翻译克隆自:Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again
本播客AI进行播客音频制作,如果你对翻译和音频质量有任何意见,随时联系我。
如果有后续想要听中文版的其他外文播客,也欢迎联系微信:caiwenshuo
你可以在Bayt播客上收听任何播客的中文翻译,并查看双语字幕,
安卓 下载地址:https://baytfm.com
iOS 下载地址:https://apps.apple.com/app/apple-store/id6748532039?pt=121796720&ct=xiaoyuzhou&mt=8mt=8
=== keywords (plain) ===
强化学习, 持续学习, 大语言模型, 灾难性遗忘, 合成数据, 大世界假说, 持续反向传播, Oak Lab, 里奇·萨顿, 人工智能范式, 智能体架构, 算力能效, 认知科学, 红杉资本, AI前沿
前往小宇宙评论区与主播互动
Fler avsnitt
Visa alla avsnitt av 播客翻译计划播客翻译计划 med Mason finns tillgänglig på flera plattformar. Informationen på denna sida kommer från offentliga podd-flöden.