开场介绍
这是一场关于人工智能前沿进展的对话,内容包括过去一年出现的重要技术突破,以及我们对未来一年的一些判断。讨论有时会非常技术化,但我们会尽量让领域外的听众也能理解,同时不牺牲深度。能与 AI 社区中我非常欣赏的两位朋友 Sebastian Raschka 和 Nathan Lambert 做这期节目,是我的荣幸。他们既是广受尊敬的机器学习研究者和工程师,也是优秀的传播者、教育者、作者和 X 发帖者。
Sebastian 写了两本我强烈推荐给初学者和专家的书:《从零构建大语言模型》和《从零构建推理模型》。我始终相信,在机器学习和计算机科学领域,理解一件事最好的方式之一就是亲手从零构建它。Nathan 是艾伦人工智能研究所(AI2)的后训练负责人,也是《The RLHF Book》的作者。他们都经营着很棒的 X 账号和 Substack;Sebastian 在 YouTube 上有课程,Nathan 也有自己的播客,大家都值得关注。这里是 Lex Fridman Podcast。
为了支持它,请在描述中查看我们的赞助商,您还可以在其中找到联系我、提出问题、获取反馈等的链接。现在,亲爱的朋友们,这是Sebastian Raschka和Nathan Lambert。
中美 AI 竞赛:谁会胜出
因此,我认为观察这一切的一个有用的镜头就是所谓的 DeepSeek 时刻。这发生在大约一年前的 2025 年 1 月,当时开放权重的中国公司 DeepSeek 发布了 DeepSeek R1,我认为可以公平地说,它以接近或达到最先进的性能让所有人感到惊讶,据称计算量要少得多,而且价格要便宜得多。从那时到今天,人工智能的竞争无论是在研究层面还是在产品层面都变得疯狂。它只是一直在加速。
今天我们来讨论这些变化,先从一个尖锐的问题开始:在国际 AI 竞争中,究竟是中国公司阵营还是美国公司阵营更领先?Sebastian、Nathan,很高兴见到你们。Sebastian,你认为谁在领先?
“领先”是一个很宽泛的词。你提到了 DeepSeek 时刻,我认为 DeepSeek 确实赢得了开放权重模型从业者的心,因为它愿意开放分享模型。领先也有不同时间尺度:今天、明年和十年后。至少有一点我很确定:到 2026 年,很难有哪家公司长期独占其他公司无法获得的技术,因为研究人员会频繁更换工作和实验室,知识会随人才流动。因此,技术获取本身不太可能产生一个明确赢家。
然而,我确实认为差异化因素将是预算和硬件限制。我不认为这些想法是专有的,而是实现它们所需的资源。因此,我目前没有看到赢家通吃的情况。我现在看不到。
Nathan,你觉得怎么样?
你会看到实验室在他们想做的事情上投入了不同的精力。为了界定我们记录这一点的时间点,对 Anthropic 的 Claude Opus 4.5 模型的炒作绝对是疯狂的。在过去的几周里,我已经使用了它并构建了一些东西,就炒作而言,它几乎已经达到了一种梗的程度。这很有趣,因为这是非常有机的,然后如果我们回到几个月前,Google 发布了 Gemini 3,而且该版本的营销和令人惊叹的因素似乎非常高。但随后在 11 月底,Claude Opus 4.5 发布,炒作不断升温,而 Gemini 3 则更早。
感觉人们现在没有那么常谈论 Gemini 3,尽管它发布时,很多人都说这是 Google 重新发挥其 AI 结构性优势的时刻。Gemini 3 是一个很强的模型,我仍然会用,只是模型之间的差异正在缩小。我同意 Sebastian 的判断:想法流动得很快,但组织文化仍然重要。Anthropic 长期重押代码,Claude Code 如今正为它带来回报。即使思想可以自由流动,真正的瓶颈仍是人的投入和组织文化;至少从外部看,Anthropic 显得是这些实验室中最不混乱的一家。
如果 Anthropic 能继续保持这种状态一段时间,组织稳定性会成为优势。但另一边,中国正在出现一批来势很猛的技术团队,远不止 DeepSeek 一家。DeepSeek 在中国引发的浪潮,有点像 ChatGPT 在美国让每家公司都开始做聊天机器人。如今中国有很多公司在发布强劲的前沿开放权重模型,以至于 DeepSeek 作为中国头号开放模型开发者的光环正在减弱;近几个月,Z.ai 的 GLM、MiniMax,以及 Moonshot 的 Kimi K2 Thinking 都更加亮眼。
新的 DeepSeek 模型依然很强,但回头看,2025 年更重要的叙事可能是:DeepSeek 为更多中国公司提供了一个参照和平台,让它们能够以开放权重方式发布优秀模型。沿着这条轨迹发展,美国公司的现有商业模式可能会受到挑战。不过目前美国用户仍愿意为 AI 软件付费,而在中国和世界其他一些地区,用户历史上并不习惯为软件支付很高费用。
中美 AI 竞赛:谁会胜出(续)
因此,像 DeepSeek 这样的一些模型因其开放权重而受到人们的喜爱。您认为中国公司持续发布开放权重模型多久了?
我认为这种开放发布还会持续几年。和美国一样,它暂时没有明确商业模式。我长期写开放模型,也收到过一些中国公司的主动联系;它们很清楚现实约束:出于安全顾虑,很多美国头部科技公司和 IT 企业不会向中国公司购买 API 订阅。因此,这些公司把开放权重模型视为扩大影响力、参与美国快速增长的 AI 支出市场的一种方式。它们对此非常务实,而且目前确实有效。
我认为政府会看到这在技术的采用方面正在国际上产生很大的影响力,因此将会有很多激励措施来保持它的发展。但构建这些模型并进行研究非常昂贵,因此在某些时候,我预计会进行整合。但我不认为这会成为 2026 年的故事。到 2026 年,将会有比 2025 年更多的开放模型构建者。其中许多著名的将在中国。
你本来想说点什么吗?
是的。您提到 DeepSeek 失去了王冠。我确实认为在某种程度上是的,但我们也必须考虑到他们仍然稍微领先。并不是 DeepSeek 变得更糟,只是其他人都在使用 DeepSeek 的想法。例如,你提到 Kimi,同样的架构,他们正在训练它。再说一次,我们有这种跨越式的发展,他们可能在某个时间点做得更好一些,因为他们有更新的模型。我认为这又回到了一个事实:不会有明显的赢家。一个人发布了一些东西,另一个人进来了,最新的模型可能总是最好的模型。
是的。我们还将看到中国公司有不同的激励措施。 DeepSeek 非常神秘,而其中一些初创公司就像世界上的 MiniMaxes 和 Z.ais 一样。这两家公司实际上已经提交了 IPO 文件,他们正试图获得西方的关注并在那里进行大量的宣传。所以我不知道这些激励措施是否会改变模型的开发,因为众所周知,DeepSeek 是由对冲基金 Highflyer Capital 建立的,我们不知道他们到底用这些模型做什么,也不知道他们是否关心这个。
他们在沟通方面是保密的,但在描述其模型如何工作的技术报告方面却并不保密。他们在这方面仍然开放。我们还应该说,关于 Claude Opus 4.5 的炒作,有一层是 X 回声室、X 回声室的宠儿,以及使用该模型的实际人数。我认为可以公平地说,ChatGPT 和 Gemini 专注于只想解决日常生活问题的广大用户群,而且用户群是巨大的。因此,有关编码的炒作可能并不代表实际使用情况。
我想说,很多使用模式都是名称识别和品牌,但也几乎是肌肉记忆,ChatGPT 已经存在很长时间了。人们刚刚习惯了使用它,它几乎就像一个飞轮,他们将其推荐给其他用户。一个有趣的一点是大语言模型的定制。例如,ChatGPT 具有记忆功能。所以你可能有订阅,并且将其用于个人物品,但我不知道你是否想在工作中使用同样的东西,因为私人和工作之间存在界限。如果您在公司工作,他们可能不允许这样做,或者您可能不希望这样做。
这也意味着,一个人可能会同时订阅多个服务。比如一个账号只用于工作代码,不包含私人照片或业余项目;另一个账号则用于个人事务。未来很可能是不同模型对应不同用例,而不是每个人只能选择一个模型。
ChatGPT、Claude、Gemini 与 Grok:谁领先
您认为哪种模型会赢得 2025 年的胜利,哪种模型会赢得 26 年的胜利?
我认为在消费者聊天机器人的背景下,问题是:你愿意把赌注押在 Gemini 上而不是 ChatGPT 上吗?我想说,我的直觉感觉这是一个有点冒险的赌注,因为 OpenAI 一直是老牌企业,而且在技术领域有很多好处。我认为2025年的势头是在Gemini这边,但他们是从如此低的起点开始的。安息吧巴德和那些早期的尝试。我认为他们在组织混乱中克服困难、实现这一目标的巨大功劳。但也很难对 OpenAI 下赌注,因为它们总是显得如此混乱,但它们非常擅长落地。
我个人对 GPT-5 的评价很复杂,但它的路由机制一定为 OpenAI 节省了大量成本:多数用户不必始终调用最昂贵的模型。问题在于,我个人喜欢的模型特征,与真正能影响大众选择的差异化因素,并不总是一回事。
你对2026年有何看法?谁会赢?
我会说一些话,尽管这有风险。我认为Gemini会在ChatGPT上继续取得进展。当这两者都以如此极端的规模运营时,Google就有了规模,并且Google有能力更好地将研究和产品分开,而你听到很多关于 OpenAI 运营混乱并追求高影响力的事情,这是一种非常初创的文化。然后在软件和企业方面,我认为 Anthropic 将继续取得成功,因为他们一次又一次地为此做好了准备。显然,Google云有很多产品,但我认为这个 Gemini 品牌对他们来说很重要。
Google云将继续表现出色,但这在生态系统中解释起来是一件更复杂的事情,因为它是与 Azure 和 AWS 等公司竞争,而不是在模型提供商方面竞争。
那么在基础设施方面,您认为 TPU 给他们带来了优势吗?
很大程度上是因为 NVIDIA 芯片的利润非常高,而Google可以从上到下开发所有东西来适应他们的堆栈,而不必支付这个利润,而且他们在建设数据中心方面已经处于领先地位。因此,所有这些产品的交付时间都很高,而且成本很高,利润率也很高,Google在这方面拥有一种历史优势。如果要出现一种新范式,它最有可能来自 OpenAI。他们的研究部门一次又一次地展示了这种提出新研究想法或产品的能力。像 Deep Research、Sora、o1 思维模型一样,所有这些定义性的东西都来自 OpenAI,这一定是他们作为一个组织的首要特征之一。
很难押注 OpenAI 会输,但我认为今年很大一部分进展,仍会来自扩大规模和摘取模型优化中尚未被利用的低垂果实。
显然,智能和速度之间需要权衡。这就是 GPT-5 试图在幕后解决的问题。就像,人们真的想要情报、广大公众,还是想要速度?
我认为实际上这是一个很好的品种,或者可以在那里进行切换的选项。就我个人的使用而言,大多数时候当我查找内容时,我会使用 ChatGPT 来快速提问并快速获取我想要的信息。对于大多数日常任务,我使用快速模型。现在我觉得自动模式挺好的,不用特意说“想”或者“不想”。话又说回来,我有时也想要专业模式。很多时候,当我写完一些东西后,我会把它放入 ChatGPT 中并说:“嘿,进行一次彻底的检查。我所有的参考文献都正确吗?我所有的想法都正确吗?我是否犯了任何格式错误?数字是否错误?”或类似的东西。我不需要立即这样做。
我可以完成我的事情,也许吃晚饭,让它运行,然后回来完成它。这就是我认为有这个选择很重要的地方。如果每个查询都需要等待 30 分钟,甚至 10 分钟,我会发疯的。
ChatGPT、Claude、Gemini 与 Grok:谁领先(续)
这就是我。我坐在这里失去了理智,你使用了路由器和非思考模型。我想,“你怎么忍受这个?”
这就像我的反应。我已经大量使用 ChatGPT 一段时间了。我从来没有接触过GPT-5非思考。我发现它只是......它的语气,然后是它的错误倾向。它只是出错的可能性更高。其中一些来自 OpenAI 发布 o3 时,它是第一个进行深度研究并找到许多来源并为您集成它们的模型。所以我就习惯了。当我寻找任何类型的工作信息查询时,无论是论文还是代码参考,我只会使用 GPT-5.2 Thinking 或 Pro。我会定期同时进行五个专业查询,每个查询都寻找一篇特定的论文或有关方程式的反馈。
我有个有趣的例子。出发录这期播客前,我家里的本地 GPU 正准备跑一个很长的强化学习实验,但我习惯离家前拔掉电器,结果不小心把 GPU 也拔了。妻子已经坐进车里,我只能赶紧处理。我需要在十秒内拿到一条 Bash 命令,把多个实验和评估串起来并记录日志。虽然我会用终端,但那个时刻我只想最快得到正确命令。
这是一个搞笑的情况,但是,是的,那么你用了什么?
所以我做了非思考最快的模型。它给了我 Bash 命令。我想将不同的脚本相互链接,并使用“tee”命令将其路由到日志文件。我突然意识到,我只是很着急而已。我自己也可以考虑一下。
对了,不知道有没有一个代表性的案例:老婆在车里等,你要跑,拔掉GPU,你要生成Bash脚本。这听起来像一部电影……《碟中谍》。
我为此使用Gemini。我用思维来思考所有的信息,然后用Gemini来思考快速的事物或我有时可以Google搜索的事物。它善于解释事物,我相信它有这个知识背景,而且很简单。 Gemini 应用程序已经变得更好了。
这对这类事情很有好处。然后,对于代码和任何形式的哲学讨论,我使用 Claude Opus 4.5,也始终具有扩展思维。扩展思维和推理时缩放只是使模型稍微智能的一种方法。当进度非常高时,我总是会站在这一边,因为你不知道什么时候会解锁新的用例。然后,我有时会使用 Grok 获取实时信息,或者在 AI X 上查找我知道我看到并且需要挖掘的内容。尽管当 Grok 4 推出时,Grok 4 Heavy(他们的专业版本)实际上非常好,并且给我留下了深刻的印象,然后我只是因为打开 ChatGPT 应用程序而失去了肌肉记忆。所以我使用很多不同的东西。
是的。实际上我确实使用 Grok 4 Heavy 进行调试。对于其他解决不了的硬核调试,我发现它是最擅长的。这很有趣,因为你说 ChatGPT 是最好的界面。对我来说,出于同样的原因(但这可能只是动力),Gemini 对我来说是更好的界面。我想是因为我爱上了他们大海捞针的能力。如果我放入了一些有很多上下文的东西,但我正在寻找非常具体的信息以确保它跟踪所有内容,我发现 Gemini 是最好的。所以,如果其中一些模型赢得了你的心,那就很有趣了——
...对于特定日期的一项特定功能,对于特定查询或提示,您会说,“这个模型更好。”所以你会坚持一段时间,直到它做出一些非常愚蠢的事情。这就像阈值效应。一些聪明的事情发生了,然后你爱上了它,然后它做了一些愚蠢的事情,你会想,“你知道吗?我要切换并尝试 Claude 或 ChatGPT。”诸如此类的事情。
ChatGPT、Claude、Gemini 与 Grok:谁领先(续)
就是这样。你使用它直到它坏掉,直到你遇到问题,然后你改变LLM。我认为这就像我们使用任何东西的方式一样,比如我们最喜欢的文本编辑器、操作系统或浏览器。我的意思是,有很多浏览器选项:Safari、Firefox、Chrome。它们相对相似,但也有一些边缘情况,也许你想使用扩展,然后你就切换了。但我认为没有人会在不同的浏览器中输入相同的内容并进行比较。仅当网站无法呈现或出现问题时才执行此操作。所以这是一个很好的观点。你使用它直到它坏掉,然后你探索其他选择。
就长上下文而言,我也是 Gemini 用户,但 GPT-5.2 发布博客有疯狂的长上下文分数,很多人都在想,“他们只是想出了一些算法更改吗?”在这个小模型更新中,它从 30% 左右上升到 70% 左右。因此,跟踪所有这些事情也非常困难,但现在我更看好 GPT-5.2 的长上下文。因此,实际测试这一点就像一场永无休止的战斗。
嗯,有趣的是,我们没有人从用户的角度谈论中国模式。那说什么?这是否意味着中国模式没有那么好,或者这是否意味着我们只是非常有偏见并且以美国为中心?
我确实认为这就是目前模型和平台之间的差异。我认为开放模型因开放权重而闻名,而不是其平台。
还有很多公司愿意以非常低的成本向你出售开放模型推理。我认为,就像 OpenRouter 一样,查看多模型事物很容易。您可以在 Perplexity 上运行 DeepSeek。我认为坐在这里的所有人都会说,“我们始终如一地使用 OpenAI GPT-5 Pro。”我们都愿意为边际付出代价——
……情报增益。美国的这些模型在输出方面更好。我认为问题是,他们今年和未来几年会保持更好的状态吗?但只要他们更好,我就会付钱给他们。我认为还有分析表明,中国模型的服务方式(你可能会说是否是由于出口管制)是它们每个副本使用的 GPU 较少,这使得它们速度较慢并导致不同的错误。这是关于速度和智力的。
如果这些东西对你作为用户有利,我认为在美国很多用户都会这么做。我认为这将刺激这些中国公司以其他方式竞争,无论是免费还是大幅降低成本,或者它将在产品方面培育创造力,这对生态系统有利。但我认为简单的事情是美国的模式目前更好,我们使用它们。我尝试了其他开放模型,我想,“有趣,但我不会……我不会再回到过去了。”
最适合编程的 AI
我们并没有真正提到编程。这是很多人非常关心的另一个用例。我基本上使用游标和Claude Code各占一半,因为我发现它们是完全不同的体验并且都很有用。您经常编程——……那么您使用什么?目前的氛围如何?
因此,我使用 VS Code 的 Codeium 插件。你知道,这非常方便。它只是一个插件,然后它是一个可以访问您的存储库的聊天界面。我知道Claude Code有点不同。它更具有智能体化。它触及的东西更多;它会为您完成整个项目。我还没有完全适应这一点,因为也许我是一个控制狂,但我仍然想看看发生了什么。 Codeium 现在对我来说是最有利的地方,它对我有帮助,但它并没有完全取代我。
我应该提到,我使用 Claude Code 的原因之一是培养英语编程技能。我的意思是,体验是根本不同的。与对生成的细节进行微观管理并查看差异(如果您使用的 IDE 是这样的话,可以在 Cursor 中进行查看)相反,您是在不断进步的过程中深入理解代码,而不是仅仅在这个设计空间中思考并在宏观层面上进行指导。我认为这是思考编程过程的另一种方式。此外,Claude Code 似乎是对 Claude Opus 4.5 的更好利用。
这对人们来说是一件好事。你可以打开 Claude Code,你可以打开 Cursor,你可以打开 VS Code,你可以在所有这些上选择相同的模型 - ......并提出问题,这非常有趣。Claude Code在这个领域做得更好。这很了不起。
应该说明,你们两位在多个领域都是真正的行家:既是研究者、程序员和教育者,也都在写书。Nathan 也希望很快出版一本关于 RLHF 的书。
它可以预订,并且有完整的数字预印本。我只是为了让物理事物变得更漂亮、更好地组织起来,这也是我这样做的很多原因——当我们的生活大部分都是数字化的时候,创造出你认为在物理形式上非常出色的东西是很有趣的。
我应该说,说到 Perplexity,Sebastian Raschka 是一位机器学习研究员和作家,以多本有影响力的书籍而闻名。我想提的两本书(也是我强烈推荐的一本书)是《从头开始构建大语言模型》,以及新书《从头开始构建推理模型》。我对此感到非常兴奋。从头开始构建东西是最有效的学习方式之一。
老实说,从头开始使用大语言模型非常有趣,而且需要学习很多东西。就像你说的,这可能是了解某些东西如何真正运作的最好方法,因为你可以看数字,但数字可能有错误。你可以看看概念性的解释,但你可能会误解它们。但如果有代码并且代码有效,你就知道它是正确的。没有误会;这是精确的。否则,就行不通。我认为这就是编码背后的美妙之处。它没有说谎。基本上,这是数学。即使是数学,你也可能在一本你永远不会注意到的书中出现错误,因为你在阅读时没有运行数学,所以你无法验证它。有了代码,好处是你可以验证它。
是的,我同意你关于《从头开始构建大语言模型》一书的看法。抛开其他一切、互联网等,只专注于书本是件好事。但是,你知道,与历史书相比,它只是不那么孤独。真的更好玩。例如,在编程方面,我认为与大语言模型一起编程确实更有趣。我认为与大语言模型一起阅读确实更有趣。但你是对的。应尽量减少这种干扰。因此,您使用大语言模型基本上可以丰富经验,也许可以添加更多背景。也许我只是……大语言模型对我来说,在小范围内“顿悟”时刻的发生率确实很高。
最适合编程的 AI(续)
100%。我还想纠正自己:我并不是建议不要使用大语言模型。我建议分多次进行。就像,一次离线,专注模式,然后……我的意思是,我也做笔记,但我试图抵制立即查资料的冲动。我进行第二遍。对我来说,这样的结构更加结构化,我得到的东西也更少……我的意思是,有时事情会在本章中得到解答,但它也有助于让它深入思考并思考它。其他人有不同的偏好。我强烈建议在读书时使用大语言模型。对我来说,这不是第一件事;而是我要做的第一件事。这是第二关。
作为推荐,我做了相反的事情。我喜欢在一开始就使用大语言模型——……来展示我现在正在步入的这个世界的完整背景。但我尽量避免离开大语言模型进入X和博客的世界,因为那样你就会陷入这个兔子洞。你正在阅读某人的观点,关于某个特定主题存在激烈的争论,突然间你就进入了互联网和 Reddit 等领域。但如果你纯粹是让大语言模型告诉你为什么这很重要,大局想法是什么……有时书籍本身就擅长做到这一点,但并非总是如此。
这就是我喜欢 ChatGPT 应用程序的原因,因为它为人工智能在您的计算机中提供了一个家,您可以在那里专注于它,而不仅仅是我混乱的互联网选项中的另一个选项卡。我认为Claude·科德(Claude Code)在让这成为一种乐趣方面做得尤其出色,作为一种产品设计,它似乎非常吸引人,成为你的人工智能将走向世界的界面。它和 Codex 之间有一些非常无形的东西;它给人的感觉很温暖、很吸引人,而 OpenAI 的 Codex 通常也很好,但感觉边缘有点粗糙。
而 Claude Code 让构建事物变得有趣,尤其是从头开始,你相信它会创造出一些东西。显然,这对于网站和刷新工具(我用它来进行数据分析)很有好处。在我的博客上,我们抓取了 Hugging Face,因此我们现在可以保留每个数据集和模型的下载数量。Claude说:“是的,我已经使用了这些数据,没问题。”我当时想,“那会花我好几天的时间。”然后我有足够的态势感知能力,“好吧,这些趋势显然是有道理的”,你可以检查一下。但这只是一个很棒的界面,您可以在其中拥有一个中介,而不必做维护不同 Web 项目所需的可怕的低级工作。
开放权重与闭源大模型
好的。所以我们刚刚讨论了一些闭源权重模型。我们来谈谈开放的。请告诉我开放式大语言模型模式的概况。哪些是有趣的?哪一个对您来说很突出,为什么?我们已经提到过 DeepSeek。
你想看看我们能一下子说出多少个名字吗?
是啊是啊。不看笔记。
DeepSeek、Kimi、MiniMax、Z.ai、Antlang。我们只是去中国化。
让我们引入 Mistral AI、Gemma——……gpt-oss,OpenAI 的开源模型。事实上,NVIDIA 有一款非常酷的产品,Nemotron 3。有很多东西,尤其是在年底。 Qwen 可能就是那个——
哦,是的。 Qwen 是我要说的显而易见的名字。我试图通过……你可以找到至少 10 个中国人和至少 10 个西方人。我的意思是,OpenAI 发布了他们的第一个开放模型——
很久以前了。
…自 GPT-2 以来。当我撰写有关 OpenAI 开放模型发布的文章时,人们会说,“不要忘记 GPT-2”,我认为这真的很有趣,因为现在是一个非常不同的时代。但 gpt-oss 实际上是一个非常强大的模型,并且做了一些其他模型做得不太好的事情。自私地说,我会推广一批西方公司;美国和欧洲都有这些完全开放的模式。我在艾伦人工智能研究所工作,我们在那里构建了 OLMo,它发布数据和代码以及所有这些。现在,我们对那些试图发布所有内容以便其他人可以训练这些模型的人进行了实际的竞争。
基础模型研究所/LM360 拥有各种类型的 K2 模型。 Apertus 是一家瑞士研究联盟。 Hugging Face 有 SmolLM,非常受欢迎。 NVIDIA 的 Nemotron 也开始发布数据。然后是斯坦福大学的海洋社区项目,该项目有点让人们可以打开 GitHub 问题并实现新想法,然后让它在稳定的语言建模堆栈中运行。所以到 2024 年,这个空间、这个列表会小得多——
……所以我认为这只是 AI2。因此,对于更多人参与并理解语言模型来说,这是一件好事,而中国还没有一家公司可以与之类似。在我说话的同时,我想说的是,中国的开放语言模型往往更大,这使它们作为 MoE 具有更高的峰值性能,而我们非常喜欢的许多东西,无论是 Gemma 还是 Nemotron,往往是来自美国的较小模型,这种情况正在开始改变。 Mistral Large 3问世,这是一个巨型MoE模型,与12月的DeepSeek架构非常相似。然后是一家初创公司 Reka AI,Nemotron 和 NVIDIA 都已经调侃了超过 1000 亿个参数的 MoE 模型 -
......在 2026 年第一季度时间表中出现的 4000 亿个参数范围内。因此,我认为这种平衡今年将在人们使用中国与美国开放模式的用途方面发生变化,我个人会非常兴奋地看到这一点。
首先,能够说出这么多的名字是一个巨大的支持。你真的命名为 LLaMA 吗?
不。
我觉得……
安息吧。
这不是故意的。
安息吧Llama。好的。您能提到哪些有趣且脱颖而出的模型吗?你提到Qwen 3显然是一个佼佼者。
所以我想说,DeepSeek-V3 和 DeepSeek R1 几乎已经结束了这一年。另一方面,12 月,DeepSeek-V3.2。因为我喜欢这些的原因是它们总是有有趣的架构调整——……这是其他人没有的。但除此之外,如果您想使用熟悉但真正出色的性能,Qwen 3 以及像 Nathan 所说的 gpt-oss。我认为 gpt-oss 的有趣之处在于,它是第一个真正考虑到工具使用而进行训练的开放权重模型,我确实认为这是一种范式转变,生态系统还没有完全准备好。因此,对于工具的使用,我的意思是大语言模型能够进行网络搜索或调用Python解释器。
我确实认为它很出色,因为它是一个巨大的解锁。例如,对大语言模型最常见的抱怨之一是幻觉,对吗?因此,在我看来,解决幻觉的最佳方法之一就是不要试图总是记住信息或编造事情。对于数学,为什么不使用计算器应用程序或 Python?
开放权重与闭源大模型(续)
如果我问大语言模型,“谁赢得了 1998 年足球世界杯?”它不仅可以尝试记忆,还可以进行搜索。我认为大多数情况下仍然是Google搜索。所以 ChatGPT 和 gpt-oss,他们会对 Google 进行工具调用,也许找到 FIFA 网站,然后发现是法国。它会给你可靠的信息,而不仅仅是试图记住它。所以我认为这是一个巨大的解锁,目前开放权重生态系统尚未充分利用。很多人不使用工具调用模式,因为我认为这是一个信任的事情。您不想在计算机上运行它,因为它可以访问工具并可能擦除您的硬盘驱动器,因此您希望将其容器化。但我确实认为,对于未来几年拥有这种能力来说,这是非常重要的一步。
所以一些快速的事情。首先,感谢您定义工具使用的含义。我认为对于我们正在讨论的概念来说,这是一件很棒的事情,即使是像 MOE 这样成熟的事情。你必须说这意味着混合专家(MoE),你必须让人们对这意味着什么、它的实际使用方式以及不同的口味有什么建立直觉。那么,开放模型的爆炸式增长意味着什么呢?你的直觉是什么?
如果你要发布一个开放模型,你希望人们使用它,这是首要的事情。然后是透明度和信任之类的事情。我认为当你看看中国时,最大的原因是他们希望世界各地的人们使用这些模型,但我认为很多人不会。如果你看看美国以外的地区,很多人不会为软件付费,但他们可能拥有计算资源,你可以在其中放置模型并运行它。我认为也可能存在您不想发送到云端的数据。因此,第一件事是让人们使用模型、使用人工智能,或者使用你的人工智能,而如果没有模型的访问权限,他们可能无法做到这一点。
我想我们应该明确说明,所以我们一直在谈论这些中国模型和开放权重模型。通常,它们的运行方式是本地的。因此,这并不是说您要将数据发送到中国或硅谷开发该模型的任何人。
许多美国初创公司通过托管和销售来自中国的这些模型来赚钱。这称为销售token,这意味着有人会调用该模型来完成某些工作。我认为另一个原因是像 OpenAI 这样的美国公司。 OpenAI 的 GPU 匮乏;它们已达到 GPU 的极限。每当他们发布版本时,他们总是谈论他们的 GPU 如何受到伤害。我认为在其中一次 gpt-oss-120b 发布会议上,Sam Altman 说,“哦,我们发布这个是因为我们可以使用你们的 GPU。我们不必使用我们的 GPU,OpenAI 仍然可以从中获得分发,”这是另一件非常真实的事情,因为它不会花费他们任何费用。
对于用户来说,我也认为,有些用户只是在本地使用该模型,就像他们使用 ChatGPT 一样。但对于公司来说,我认为拥有这些模型是一个巨大的解锁,因为你可以定制它们,你可以训练它们,你可以在后训练添加更多数据,比如将它们专门用于法律、医疗模型等任何你拥有的模型。你提到了Llama;来自中国的开放权重模型的吸引力在于许可证更加友好。我认为它们只是不受限制的开源许可证,而如果我们使用 Llama 或 Gemma 之类的东西,就会附加一些条件。我认为这就像你拥有的用户数量的上限。
然后,如果你的用户超过了数百万,你就必须向 Meta 或类似的机构报告你的财务状况。我认为虽然它是一个免费模型,但有附加条件,人们喜欢不附加条件的东西。所以我认为除了性能之外,这也是来自中国的开放权重模型如此受欢迎的原因之一,因为你可以直接使用它们。从这个意义上来说,没有什么问题。
开放权重与闭源大模型(续)
生态在这方面已经改善,主要原因是新的模型提供方给出了更开放的许可证。刚才你在 Perplexity 里看到“Kimi K2 Thinking hosted in the US”,正说明用户会在意模型由谁、在哪里托管。Kimi K2 Thinking 很受欢迎,很多人认为它的创意写作和部分软件任务表现很好。用户会逐渐发现并偏爱不同模型各自的小特点。
这些模型中的一些模型探索了哪些有趣的想法,您可以谈论这些想法,比如您特别感兴趣的想法?
也许我们可以按时间顺序来。我的意思是,当然有 2025 年 1 月推出的 DeepSeek R1。然而,这是基于前一年 2024 年 12 月推出的 DeepSeek-V3。架构方面有很多东西。令人着迷的是,您仍然可以——我的意思是,这就是我从头开始的编码项目所做的——您仍然可以从 GPT-2 开始,并且可以向该模型添加内容以使其成为另一个模型。所以这一切仍然有点像同一个血统。它们之间有着非常密切的关系。但在我看来,DeepSeek 的独特之处在于混合专家(MoE)。我的意思是,他们并没有发明混合专家。
我们也许可以更多地讨论混合专家(MoE)的含义。但在我们深入细节之前先列出这些东西:混合专家(MoE),但他们也有多头潜在注意力,这是对注意力机制的调整。我想说,到 2025 年,这是这些开放权重模型之间的主要区别因素:进行不同的调整,使推理或 KV 缓存大小更加经济。稍后我们还可以定义 KV 缓存。但它使得拥有长上下文、缩小 KV 缓存大小变得更经济。那么我们可以做哪些调整呢?其中大部分都集中在注意力机制上。 DeepSeek中存在多头潜在注意力;还有群组查询注意力,目前还是很流行的。
它不是由这些模型中的任何一个发明的;这要追溯到几年前。但这将是另一种选择。滑动窗口注意,如果我没记错的话,我认为OLMo 3使用了它。因此,这些不同的调整使模型有所不同。除此之外,我曾经将它们全部放在一篇文章中,只是对它们进行了比较;它们惊人地相似。只是中心Transformer块的重复次数和人们调节的小旋钮方面的数字不同。但它的好处是无论如何它都能工作。您可以进行调整,可以移动标准化层以获得一些性能提升。
OLMo 在消融研究方面总是非常出色,可以显示如果您移动某些物体,它实际上会对模型产生什么影响。消融研究:它会使情况变得更好还是更糟?但是有很多方法可以实现Transformer并使其仍然工作。仍然流行的重要思想是混合专家(MoE)、多头潜在注意力、滑动窗口注意力和组查询注意力。然后在年底,我们看到重点是使注意力机制与推理token预测线性扩展。例如,Qwen3-neXt 添加了门控 Delta 网络。它的灵感来自于状态空间模型,其中你有一个不断更新的固定状态。但它本质上使这种注意力变得更便宜,或者用更便宜的操作取代了注意力。
Transformer:2019 年以来的大模型演进
退一步讨论Transformer的总体架构可能会很有用。
是的,所以也许我们应该从 GPT-2 架构开始,这个转换器源自“Attention Is All You Need”论文。
因此,“Attention Is All You Need”论文有一个 Transformer 架构,该架构由两部分组成:编码器和解码器。 GPT 只专注于解码器部分。它本质上仍然是一个神经网络,内部有这种注意力机制。你一次预测一个token。您将其传递给嵌入层。这是Transformer块。Transformer块具有注意力模块和全连接层。中间有一些标准化层。但它本质上是具有这种注意力机制的神经网络层。因此,当我们从 GPT-2 转向 gpt-oss-120b 时,就会出现混合专家(MoE)层等。它不是 GPT-OSS 发明的;它已经有几年了。
但这本质上是一种调整,目的是使模型更大,而不会在每次前向传递中消耗更多计算。所以就有了这个全连接层,如果听众熟悉多层感知器,你可以想到一个迷你多层感知器,Transformer内部的全连接神经网络层。而且它非常昂贵,因为它是完全连接的。如果你有一千个输入和一千个输出,那就相当于一百万个连接。这是这个Transformer中非常昂贵的部件。这个想法是将其扩展到多个前馈网络。因此,假设您有 256 个,而不是一个,但您不会同时使用所有这些。
现在你有了一个路由器,它会说:“好吧,根据这个输入token,使用这个完全连接的网络将会很有用。”在这种情况下,它被称为专家。因此,混合专家(MoE)意味着您拥有多名专家。根据您的输入内容(假设它的数学含量更高),与将输入文本从英语翻译成西班牙语相比,它会使用不同的专家。它可能会咨询不同的专家。并不是那么明确地说,“好吧,这只是数学专家,这是西班牙语专家。”有点模糊。但其本质是把更多的知识打包到网络中,但并不是所有的知识都会一直被使用。
那会非常浪费。所以是的,有点像在token生成过程中,你更有选择性。有一个路由器可以选择哪些token应该发送给哪个专家。它增加了更多的复杂性。训练起来比较困难。有很多事情可能会出错,比如崩溃之类的。所以我认为这就是 OLMo 3 仍然使用密集的原因......我的意思是,我认为,OLMo 模型具有混合专家(MoE),但是密集模型,其中密集意味着......所以这也是行话。密集和稀疏之间有区别。因此,混合专家(MoE)被认为是稀疏的,因为我们有很多专家,但其中只有少数是活跃的。而密集则相反,你只有一个完全连接的模块,并且它总是被利用。
所以也许这是一个讨论 KV 缓存的好地方。但实际上,在此之前,即使缩小,从根本上来说,从 GPT-2 到今天,有多少新的想法得以实现?比如,这些架构到底有多大不同?
想象一下混合专家(MoE)体。 gpt-oss-120b 中的注意力机制,即 Group Query Attention 机制。所以这是从多头注意力到组查询注意力的轻微调整,所以我们有两个。我认为他们用 RMSNorm 取代了 LayerNorm,但这只是一个不同的标准化,而不是一个大的变化。这就像一个调整。非线性激活函数——对于熟悉深度神经网络的人来说,我的意思是,它与用 ReLU 改变 sigmoid 是一样的。它并没有从根本上改变网络。这就像一个调整。我想说,就是这样。本质上并没有那么不同。它仍然是相同的架构。所以你可以将一个从一个转换...基本上,你只需添加这些更改就可以从一个转换为另一个。
Transformer:2019 年以来的大模型演进(续)
它基本上仍然是相同的架构。
嗯嗯。是的。例如,您之前提到过我的书。这是书中的一个 GPT-2 模型,因为它很简单,而且非常小,大约有 1.24 亿个参数。但在奖励材料中,我确实有从头开始的 OLMo、从头开始的 Gemini 3 以及其他类型的从头开始的模型。我总是从我的 GPT-2 模型开始,然后添加不同的组件,然后就可以从一个模型过渡到另一个模型。从某种意义上说,这有点像血统。是的。
你能为人们建立直觉吗?因为当你缩小并观察它时,人工智能世界有如此快速的进步,而与此同时,从根本上说,架构并没有改变。那么,所有的动荡、进步的混乱都在哪里呢?收益在哪里?
因此,开发或训练网络有不同的阶段。你有预训练。现在回到过去,这只是 GPT-2 的预训练。现在你有预训练、中期训练和后训练。所以我认为现在我们正处于后训练的重点阶段。我的意思是,如果你将其扩展到更好、更高质量的数据,预训练仍然会给你带来优势。但是,例如,我们可以解锁 GPT-2 所没有的功能。 ChatGPT 基本上是一个 GPT-3 模型。并且GPT-3在架构上与GPT-2相同。新功能是添加监督微调和带有人类反馈的强化学习。因此,更多的是算法方面而不是架构方面。
我想说系统也发生了很大变化。我想如果你听过 NVIDIA 的公告,他们会说“你现在可以做 FP8,你现在可以做 FP4”。正在发生的事情是,这些实验室正在研究如何利用更多的计算来放入一个模型中,这可以让他们更快地训练并让他们放入更多的数据。然后你可以通过这样做更快地找到更好的配置。因此,您可以将每个 GPU 每秒的token数作为进行大规模训练时查看的指标。通过打开 FP8 训练,您可以从 10K 增加到 13K,这意味着模型中每个参数使用的内存更少。通过保存更少的信息,您可以减少沟通,并且可以更快地训练。
因此,所有这些系统事物都支持更快的数据和算法实验。当你查看架构时,这种循环会一直持续下去,很难描述,而且它们是完全相同的。但用于训练这些模型的代码库将会有很大不同——……你可能……GPU 是不同的,但你训练 gpt-oss-20b 的挂钟时间可能比 GPT-2 快得多——……当时训练的。
是的。就像您所说的,例如,他们在 Mixture of Experts 中进行了 NVIDIA FP4 优化,可以让您获得更多吞吐量。但我确实认为就速度而言,这是事实,但它并没有在某种意义上赋予模型新的功能。只是:在不降低模型性能的情况下,我们可以将计算粗化到什么程度?但我确实认为Transformer有替代方案。有文本传播模型,这是一种完全不同的范式。尽管文本扩散模型可能使用Transformer架构,但它不是自回归Transformer。还有曼巴模型;这是一个状态空间模型。
但它们确实需要权衡,而且事实是,没有任何东西可以取代自回归Transformer作为最先进的模型。因此,对于最先进的技术,您仍然会选择这种东西,但现在有更便宜的替代方案,即某种程度的妥协的替代方案,但它不再只是一种架构。有小孩子来了。但如果我们谈论最先进的技术,它基本上仍然是 Transformer 架构,自回归,本质上源自 GPT-2。
AI 缩放定律是否仍然成立
我想这里的一个大问题是——我们在这里讨论了预训练背后的架构——缩放定律在预训练、后训练、推理、上下文大小、数据和合成数据中是否仍然有效?
我想从缩放定律的技术定义开始——
……这说明了这一切。缩放定律是…之间的幂律关系。您可以将 x 轴(您正在缩放的内容)视为计算和数据的组合,这有点相似,然后 y 轴就像我们下一个token的保留预测精度。我们讨论了自回归模型。就像如果你保留一组模型没有见过的文本,那么当你训练时它的准确度有多高?当人们发现这是一种非常可预测的关系时,缩放定律的想法就出现了。我认为这个技术术语还在继续,那么问题是,用户从中得到什么?还有更多类型的扩展,其中 OpenAI 的 o1 以引入推理时缩放而闻名。
我认为不太出名的是还表明您可以扩展强化学习训练并获得这种对数 x 轴,然后在 y 轴上线性提高性能。因此,现在在这三个轴上讨论了预训练的传统缩放定律(即模型有多大和数据集有多大),然后缩放强化学习,这就像我们将要讨论的试错学习可以进行多长时间。我们将定义更多的内容,然后是推理时间计算,这只是让模型在特定问题上生成更多token。
所以我有点看好;它们确实仍在发挥作用,但大部分唾手可得的成果已经被实现,特别是去年在具有可验证奖励的强化学习方面,即 RLVR,然后是推理时缩放。这就是为什么这些模型使用起来感觉如此不同,以前你会立即获得第一个token。现在,他们会花几秒钟、几分钟甚至几个小时产生这些隐藏的想法,然后才给你答案的第一个词。这就是推理时缩放的全部内容,就模型如何改变能力而言,这是一种非常棒的阶跃函数。他们启用了这个工具,并启用了我们正在讨论的更好的软件工程。
当我们说启用时,这几乎完全是事实的下游,这种带有可验证奖励的强化学习训练只是让模型非常容易地掌握这些技能。因此,如果你观察模型生成大量token时的推理过程,它通常会做的是:它尝试一个工具,查看它返回的内容,它尝试另一个 API,它查看它返回的内容以及是否解决了问题。当你训练模型时,它们很快就会学会这样做。
最后,这提供了这种通用基础,模型可以在您的存储库中很好地使用 CLI 命令、为您处理 Git、移动事物、组织事物或搜索以查找更多信息——如果我们一年前坐在这些椅子上,我们并没有真正想到模型会做这些事情。所以这只是今年发生的事情,彻底改变了我们对使用人工智能的看法,我认为这非常神奇。这是一个非常有趣的演变,并释放了如此多的价值。但目前尚不清楚解锁此类内容的下一个途径是什么。
我认为,我们稍后会持续学习,但围绕人工智能的某些领域有很多讨论,但没有人知道下一步功能何时真正到来。
所以你实际上讲了很多东西,而且讲得很快。如果能稍微拆开它们的包装就好了。你说你基本上看好每个版本的扩展。那么我们可以从头开始吗?预训练:我们是否意味着预训练缩放上容易实现的目标已经被摘取了?预训练是否已达到稳定水平,或者您仍然看好预训练?
预训练变得极其昂贵。我认为扩大预训练规模也意味着你将为用户提供一个非常大的模型。因此,我认为 GPT-4 之类的类似模型已经松散地确定了最大尺寸约为一万亿个参数。有很多传言称,随着训练变得更加高效,它们实际上变得更小了。您希望缩小模型,因为这样您的服务成本就会相应下降。相对于为数亿用户提供服务的成本而言,训练这些模型的成本确实很低。我认为 DeepSeek 拥有大约 500 万美元的著名数字,用于按云市场价格进行预训练。
AI 缩放定律是否仍然成立(续)
在 OLMo 3 论文第 2.4 节中,我们刚刚详细说明了 GPU 集群用于训练的时间(包括工程问题、多个种子),租用集群来处理训练模型的所有问题和难题大约需要 200 万美元。所以这些模型……很多人可以花一到一千万美元来训练一个模型,但为数百万用户提供服务的经常性成本实际上是数十亿美元的计算成本。一千个 GPU 的租金你每天可以支付 100 英镑。这些公司可能拥有数百万个 GPU。你可以看看这些东西坐在那里要花多少钱。
所以这是一件大事,然后就好像,如果扩展实际上给了你一个更好的模型,那么它在经济上值得吗?我认为,随着人工智能解决更引人注目的任务,我们会慢慢推出它——比如 Claude Opus 4.5 等,使 Claude Code 能够为事情工作。我在 7 月份启动了这个名为 ATOM 项目的项目,即 American Truly Open Models,这就像一个真正的氛围编码网站。我的工作是制作情节之类的。然后我在过去几周回来刷新它,Claude Opus 4.5 与当时可用的任何模型相比,刚刚解决了 6 月和 7 月构建时遇到的所有问题。它可能是一个更大的模型。这涉及很多事情,但仍有进展。
所以你所说的是缩放定律 y 轴的细微差别——它的体验方式与基准相比,实际的智能可能会有所不同。但是,您对预训练的直觉仍然是:如果扩大计算规模,模型会变得更好吗?不是在经济上是否可行,而是从法律方面来看,你认为这些模型会变得更聪明吗?
是的。我认为……有时人工智能公司的领导层说这句话时几乎是幻灭了,但他们会说,“它可以维持 13 个数量级的计算;为什么它会结束?”所以我认为从根本上来说它不太可能停止。就像最终我们甚至无法测试更大的规模一样,因为更多计算带来的所有问题。我认为,关于 2026 年非常大的 NVIDIA Blackwell 计算集群(如千兆瓦级设施)上线的一年有很多讨论。这些都是在 ChatGPT 之前或之后于 22 年和 2023 年签署和寻求的电力和数据中心合同。
因此,我们花了两到三年的时间来构建这些更大的集群来训练模型,而显然人们对构建更多的数据中心有着巨大的兴趣。这就是人们所说的症结所在:这些新的集群即将到来。实验室将拥有更多的计算资源用于培训。他们会利用这一点,但这并不是理所当然的。我已经看到了如此多的进步,我期待它,我期待更大的模型。我想说今年我们会看到 2,000 美元的订阅费;我们已经看到了 200 美元的订阅。就像可以再增长 10 倍一样,这些都是可能发生的事情——它们都是更大模型的下游,该模型提供了更多的尖端技术。
因此,据报道,xAI 将在 26 年初达到 1 吉瓦的规模,到年底将达到整整 2 吉瓦。您认为他们会如何在缩放定律的背景下利用它?是不是有很多这样的推论?这样的训练很多吗?
最终变成了以上所有内容。我认为训练模型时的所有决定都会回到预训练。因此,如果您要在模型上扩展强化学习,您仍然需要决定支持此目的的架构。我们正在讨论其他架构并使用不同类型的注意力。我们还在讨论混合专家(MoE)模型。 MoE 模型的稀疏性质使其生成更加高效,这成为后训练的重要组成部分,并且您需要准备好架构,以便能够实际扩展此计算。我仍然认为大部分计算都是在预训练时进行的。因为你仍然可以让模型变得更好,所以你仍然想重新审视这个。
您仍然想要尽可能最好的基础模型。几年后,这个数字就会饱和,强化学习的计算时间将会变得更长。
AI 缩放定律是否仍然成立(续)
是否有人不同意你的观点,认为预训练基本上已经死了?这一切都是关于扩展推理、扩展后训练、扩展上下文、持续学习和扩展合成数据?
人们有那样的感觉并以那样的方式描述它,但我认为这并不是正在发生的做法。
人们普遍认为这东西已经死了——
兴奋在别处。因此,强化学习中唾手可得的成果——……在其他地方。例如,我们在 11 月份发布了我们的模型。每个公司都有最后期限。我们的截止日期是 11 月 20 日,为此,我们的运行时间为 5 天,与 2024 年相比,对于大约 300 亿个参数的模型进行后期训练来说,这是一个非常长的时间。这不是一个大模型。然后在 12 月,我们发布了另一个版本,只是让 RL 再运行三周半,模型明显变得更好,所以我们发布了它。这需要大量的时间来分配给那些将成为你今年巅峰的事情。所以就像——
理由是——
当他们训练一个模型时,会做出这些类型的决定,但他们不能永远离开它。你必须不断吸收研究人员的改进成果。所以你重新进行预训练,你将进行一个月的后训练,但随后你需要将其提供给你的用户。您需要进行安全测试。我认为有很多地方可以强化这个不断更新模型的循环。有一些事情需要改进。您将获得一个新的计算集群,可以让您更稳定或更快速地执行某些操作。您经常听说 Blackwell 存在推出问题,在 AI2,我们预训练的大多数模型都在 1,000 到 2,000 个 GPU 上。
不过,当预训练规模达到 1 万或 10 万张 GPU 时,会遇到完全不同的故障。GPU 会以各种奇怪方式坏掉;在 10 万张 GPU 的训练中,几乎可以肯定任何时刻至少有一张不可用,因此训练代码必须处理冗余。相比之下,我们在一个集群上做后训练,或普通学习者训练小模型,面对的不是同一种问题。训练最大模型真正困难的是超大规模分布式系统,这是另一类系统工程问题——
——而它又是实现缩放定律、尤其是预训练缩放的前提,因为所有 GPU 必须同时协同工作。转向强化学习后,异构算力反而更容易利用,因为系统中有许多模型副本。简单介绍语言模型强化学习:通常有两组 GPU,一组叫 actor,负责采样;另一组叫 learner,负责真正的强化学习更新。常用的是策略梯度算法,其中 PPO 和 GRPO 是两类流行方法。
另一侧的 actor 会生成 completion,这些结果随后被评分;强化学习的核心就是优化奖励。实践中,可以让分布在世界不同地点的多个 actor 处理不同问题,再把结果送回高速互联的计算集群,由 learner 计算梯度并更新模型。这里需要紧密互联的网络、不同形式的并行,以及高效切分模型的能力。不同训练和推理服务方式,都有各自必须解决的规模化问题。
我们讨论了预训练,我们讨论了 RL,然后推理时缩放是:如何为 1 亿用户思考一小时的模型提供服务?我真的不知道,但我知道这是一个难题。为了给人们这种智能,存在所有这些系统问题,我们需要更多的计算,并且需要更稳定的计算来完成它。
所以我听到的是:你对这些缩放路径都持乐观态度,包括推理时缩放、推理能力的提升,甚至预训练缩放?
是的,这是一个很复杂的话题,但大体有两个旋钮:训练缩放和推理时缩放。假如算力无限,两者当然都应该做。训练本身又分成预训练、中期训练和后训练。扩大模型、增加数据、训练更大的模型,会让它获得更多知识,成为更好的基础模型,并为后续能力解锁提供基础;但这并不意味着它立刻就能解决最复杂的任务——
——无论是在预训练期间还是刚完成预训练时。你仍然需要中期训练,以及采用强化学习的后训练,去解锁模型已从预训练中获得的知识和能力。更多预训练当然会带来更好的基础模型,但正如 Nathan 所说,成本会迅速上升。算力不是无限的,所以必须决定,是把更多算力用于扩大模型,还是投入其他阶段。这是一种权衡;理想情况下所有路径都要做,因此缩放远没有失效。
你仍然会得到一个更好的模型,但就像我们在 Claude 4.5 中看到的那样,这是不值得的。我的意思是,因为此时您可以使用其他技术释放更多性能,特别是如果您考虑推理时缩放。这是 o1 今年最大的收获之一,它比预训练 Claude 4.5 这样的较大模型更进一步地使用了较小的模型。所以,我不会说预训练缩放已经死了。只是现在还有其他更有吸引力的扩展方式。但在某些时候,您仍然希望在预训练上取得一些进展。需要考虑的是你想把钱花在哪里。
如果你在预训练上花费更多,那就是固定成本。你训练模型,然后它就永远拥有这种能力。您可以随时使用它。通过推理时缩放,您在训练期间无需花钱;你稍后每次查询都要花钱,然后就是数学问题了。如果我半年更换的话,我的模型还能上市多久?也许花 500 万、1000 万或 1 亿美元来训练它更长时间是不值得的。也许我会做更多的推理时缩放并从中获得性能。就用户查询而言,我可能花费了 200 万。这变成了你有多少用户并进行数学计算的问题。我认为这也是有趣的地方,ChatGPT 所处的位置。
我认为他们有很多用户需要更便宜的价格,他们有更小的 GPT-5 模型。对于其他公司来说,他们的客户还有其他权衡。例如,在数学问题或数学奥林匹克竞赛中,他们有一个专有模型,我很确定这只是一个经过微调的模型,但其中大部分是推理时缩放,以在某些任务中实现峰值性能,而您并不总是需要它。但是,长话短说,我确实认为预训练、中期训练、后训练和推理时缩放仍然是你想做的事情。目前,今年,基本上,它正在寻找合适的比率,为您带来最大的收益。
AI 如何训练:预训练、中期训练与后训练
我认为这可能是定义预训练、中期训练和后训练的好地方。
因此,预训练是一次训练下一个token预测的经典方法。您拥有大量数据。由于 OLMo 3,Nathan 可能也有非常有趣的见解。本文的很大一部分重点关注正确的数据组合。因此,预训练本质上只是熵损失的训练,在大量互联网数据、书籍、论文等的语料库上训练下一个token预测。这些年来,情况发生了一些变化,人们过去常常竭尽全力地投入一切。现在,这不仅仅是原始数据。它也是人们重新表述某些事物的合成数据。因此,合成数据并不一定意味着纯粹是人工智能编造的数据。
它还从维基百科文章中获取一些内容,然后将其改写为问答问题或对其进行总结、奖励,并以这种方式生成更好的数据。我认为这就像人类一样。如果有人把一本书比作一个混乱的——无意冒犯,但就像——Reddit 帖子或类似的东西。我确实认为你学到了——无意冒犯,但我认为——
将会有一篇关于此的文章,Sebastian。
一些 Reddit 数据非常令人垂涎,非常适合训练。你只需要过滤它。
我认为这就是这个想法。我认为这就像如果有人接受了这一点,并以一种更简洁和结构化的方式重新表述——我认为获得大语言模型的质量更高的数据可能是相同的——你最终会得到相同的大语言模型,但它到达的速度更快。它训练得更快,因为如果语法和标点符号正确,它就已经学会了正确的方式,而不是从混乱的方式获取信息,然后再学习如何纠正。所以,我认为这就是预训练的演变方式以及扩展仍然有效的原因;这不仅仅是数据量的问题,还包括让数据更好地为您服务的技巧。然后中期训练是……我的意思是,它曾经被称为预训练。
我认为之所以称为中期训练,是因为有预训练和后训练但中间没有任何内容很尴尬,对吗?听起来有点奇怪。你有预训练和后训练,但实际的训练是什么?所以,中期训练通常与预训练类似,但更专业一些。这是相同的算法,但您所做的是专注于例如长上下文文档。您在预训练期间不这样做的原因是因为您没有那么多长上下文文档。我们有一个特定的阶段。大语言模型的一个问题仍然是它是一个神经网络;它存在灾难性遗忘的问题。
所以,你教它一些东西,它会忘记其他东西。虽然不是百分百忘记,但天下没有免费的午餐。人类也同样如此。如果你问我十年前学过的数学,我不会知道;我得再看一遍。
Nathan实际上是说他消耗了太多的内容,以至于出现了灾难性的遗忘问题。
是的,我正在努力学习很多关于人工智能的知识,就像当我学习预训练并行性时,我会想,“我失去了一些东西,但我不知道它是什么。”
我不想将大语言模型拟人化,但我认为就人类的学习方式而言,这是一样的。数量并不总是更好,因为它是有选择性的。中期训练是在最后对高质量内容进行选择性,因此大语言模型最后看到的就是高质量的内容。然后后训练就是所有的微调:监督微调、DPO、带有人类反馈的 RLVR 等等。所以,细化阶段。这也很有趣,成本问题,对吧?预训练,你现在在这上面花了很多钱。 RL少了一点。 RL,你并没有真正教它知识;这更像是解锁知识。
它更像是技能学习,比如如何利用预训练中获得的知识解决问题。今年,或者去年,2025 年,实际上已经有三篇关于 RL 预训练的论文。但我认为没有人在生产中这样做。
AI 如何训练:预训练、中期训练与后训练(续)
玩具,现在的玩具示例。
玩具示例,对。概括地说,强化学习后训练更像是技能解锁,而预训练本质上就像吸收知识。
一些可能对人们有帮助的事情。许多人认为合成数据不利于训练模型。您提到 DeepSeek 获得了一篇 OCR(光学字符识别)论文。很多实验室都这么做了; AI2 有一个,其他有多个。这些实验室之所以拥有这些,是因为网络上存在大量难以用文本编码的格式的 PDF 和其他数字文档。因此,您可以使用 DeepSeek OCR 或我们所说的 OLMo OCR 之类的工具来提取可能数万亿个token的候选数据。预训练数据集规模为万亿量级;它以数万亿token来衡量。
研究人员的较小模型可能约为 5 到 10 万亿。据记录,Qwen 的token数量高达 50 万亿美元,有传言称这些封闭实验室的token数量可达 100 万亿美元。获取这些潜在数据是一个非常大的漏斗,而您实际训练模型的数据只占其中的一小部分。该字符识别数据将被描述为用于实验室预训练的合成数据。还有一个事实是,ChatGPT 现在可以提供精彩的答案,您可以根据这些最佳答案进行训练;那是合成数据。这与早期的 ChatGPT 幻觉数据有很大不同。
一个有趣的问题是,如果我没记错的话,OLMo 3 的训练数据比其他一些开放权重模型(甚至可能是 OLMo 2)要少。但你仍然获得了更好的性能,这可能是数据如何提供帮助的示例之一。
这主要取决于数据质量。我认为如果我们有更多的计算能力,我们就能训练更长时间。我认为我们最终会认为这是我们想做的事情。特别是对于大型模型,您需要更多的计算,因为大型模型可以从数据中吸收更多,并且您可以从中获得更多好处。它就像那些对数图之一——如果你测量大量的token,小模型会更快趋于平稳,而更大的模型需要更多。但大多数情况下,我们现在在 AI2 上并没有训练那么大的模型,获得尽可能高质量的数据是自然的起点。
关于数据质量这个话题有什么要说的吗?是否还有一些容易实现的目标可以提高质量?
这有点像不断转动曲柄。历史上,开放社区总会有一个公认最好的预训练数据集,领先者随着最新项目而变化:早期 AI2 有 Dolma,Hugging Face 有 FineWeb,还有 DCLM,也就是 DataComp for Language Models。互联网越来越封闭,因此大家通常从 Common Crawl 这类规模达数百万亿 token 的语料出发,再进行过滤。
它看起来像很多科学工作,你在训练分类器并根据如何将数据集修剪成最高质量的东西和适合你的任务的东西来做出决策。以前,语言模型在知识和对话事物上进行了更多测试,但现在人们期望它们能够进行数学和编码。要训练推理模型,您需要重新混合整个数据集。实际上,这里有一些很棒的科学方法,您可以使用庞大的数据集并从不同来源(例如 GitHub、Stack Exchange、Reddit 或 Wikipedia)采样许多非常微小的东西。
您可以从中采样一些小东西,在每种混合上训练小模型,并根据您的评估来衡量它们的性能。你可以只进行基本的线性回归,就像“这是你的最佳数据集”。但如果你的评估发生变化,你的数据集就会发生很大变化。因此,许多 OLMo 3 都添加了新的推理源,以便更好地擅长数学和代码,然后您执行此混合过程,它会给您答案。我认为今年实验室里发生了很多这样的事情;有新的热门事物,无论是编码环境还是网络导航,你只需要引入新数据并改变你的整个预训练,以便你的后训练能够更好地发挥作用。这就像不断的重新进化和重新确定他们关心的模型的内容。
AI 如何训练:预训练、中期训练与后训练(续)
是否有一些有趣的轶事表明哪些数据源的质量特别高,超出了我们的预期?你提到 Reddit 有时可以成为一个来源。
Reddit 非常有用。我认为 PDF 绝对是其中之一。
哦,尤其是 arXiv。
是的,AI2 已经运行 Semantic Scholar 很长时间了,它是 Google Scholar 的竞争对手,具有更多功能。为此,AI2 发现并抓取了大量可公开访问的论文 PDF,这些论文可能不在某个出版商的封闭付费花园后面——真正开放的科学 PDF。如果你坐在所有这些上并处理它们,你就可以从中获得价值。我认为前沿实验室很早就已经完成了很多这种风格的工作。你需要有一个非常熟练的研究人员,了解事物如何改变模型,并将其引入并清理;这是很多劳动。
我认为在很多前沿实验室,当他们扩大研究人员规模时,会更多地投入到数据中。如果您加入前沿实验室并且希望产生影响,最好的方法就是找到更好的新数据。奇特、迷人的算法事物,比如弄清楚如何制造 o1,就像是科学家最性感的想法。就像,“哦,我想出了如何扩展强化学习。”有一个小组做到了这一点,但我认为大部分贡献是-
在数据集上。
……“我要让数据变得更好”,或者“我要让基础设施变得更好,这样我团队中的每个人都可以将实验速度提高 5%。”
同时,我认为出于法律原因,这也是最保守的秘密之一——你的训练数据是什么。因此,还有很多工作需要隐藏训练数据,本质上是为了让模型不会因为这些法律原因而泄露数据源。
另一件事,完整地说,是有些人试图仅使用许可数据进行训练,而 Common Crawl 是整个互联网的一部分。如果我托管多个网站,我很高兴让它们训练语言模型,但我没有明确许可管理它的内容。因此,Common Crawl 基本上是未经许可的,这意味着实际上尚未就如何使用数据提供您的同意。还有另一个想法,您可以仅根据已明确许可的数据训练语言模型,以便提供管理合同。我不确定 Apertus 是版权问题还是许可问题。我知道他们这样做的原因是为了遵守欧盟规定,他们想确保他们的模型符合其中一项检查。
嗯嗯。在这一点上,许可之间也存在区别。有些人,就像你说的,只是购买许可证。假设他们购买了一本 Amazon Kindle 书或一本 Manning 书,然后在训练数据中使用它;这是一个灰色地带,因为您为内容付费,并且您可能想对其进行培训。但也存在一些限制,甚至不允许这样做。这就是它变得有点模糊的地方。
我认为这仍然是现在的热门话题。像 OpenAI 这样的大公司会向私营公司寻求其专有数据,而私营公司也越来越保护自己的数据,因为他们知道,“好吧,几年后这将成为我的护城河。”我确实认为这是一个有趣的问题。如果大语言模型变得更加商品化,并且很多人了解大语言模型,就会有更多的人能够训练这些模型。当然,还有基础设施方面的挑战。
但如果你想到像制药、法律或金融这样的大行业,我确实认为他们在某个时候会雇佣其他前沿实验室的人员在他们的专有数据上构建他们的内部模型,这将是目前尚不存在的预训练的另一个解锁。因为即使你想,你也无法获得这些数据——大多数时候你无法获得临床试验和此类信息。因此,我确实认为,如果您关注特定领域的应用程序,那么这种意义上的扩展可能仍然存在,因为现在我们只关注通用的 LLM,如 ChatGPT、Anthropic 等。它们只是通用目的。如果大语言模型确实是针对特定任务经过专门训练和设计的,那么他们甚至没有触及大语言模型可以做什么的表面。
AI 如何训练:预训练、中期训练与后训练(续)
谈到数据,有件发生在 2025 年、但大家似乎很快忘掉的事:Anthropic 在诉讼中败诉,需要向作者支付 15 亿美元。据我理解,Anthropic 购买并扫描了数千本书;因为书是合法购买的,这部分处理获得了法院认可。但另一方面,它也通过种子下载了一些书,法院据此认定它需要向作者承担巨额赔偿。这是一场金额惊人的诉讼,却很快就从公众视野里过去了,也再次说明风险投资生态中有多么庞大的资金。
这些法庭案件将定义人类文明的未来,因为很明显,数据在很大程度上推动了这一切,而且人类之间存在着非常复杂的紧张关系。我的意思是,你可以感同身受。你们都是作者。我的意思是,在某种程度上,你把你的心和灵魂、你的汗水和泪水投入到你所做的写作中。有人在不给你信用的情况下训练你的数据,感觉有点像盗窃。
正如Nathan所说,它也有两层。有人可能会购买这本书,然后对其进行培训,这可能会被认为公平或不公平,但也有一些直接的公司使用盗版书籍,甚至不向作者提供补偿。我认为,这就是人们对此感到有点愤怒的地方。
是的,但必须有某种补偿计划。这就像 Spotify 流媒体最初为音乐所做的那样。你知道补偿是什么样的吗?您必须定义这些类型的模型。你必须把这一切都想清楚。我认为人们普遍好奇的另一件事是,我很想听听你们的想法:随着大语言模型的使用越来越多,如果你看看 arXiv 或 GitHub,就会发现越来越多的数据是由大语言模型生成的。在那样的世界里你会做什么?这是一个多大的问题?
最大的问题是基础设施和系统,但从人工智能的角度来看,这是不可避免的。
所以它基本上是大语言模型生成的数据,本质上是由人类管理的,对吗?
是的,我认为许多开源贡献者正在合理地精疲力尽。如果你有一个流行的开源存储库,有人会说,“哦,我想做开源人工智能。这对我的职业生涯有好处”,他们只是编写一些代码并将其投入其中。你可能会比我得到更多。
是的,所以我实际上在这里有一个案例研究。我有一个名为 mlxtend 的存储库,是我在大约 10 或 15 年前作为学生开发的,对于某些算法(尤其是频繁的数据挖掘内容)来说,它仍然是一个相当流行的库。最近有两三个人在很短的时间内提交了大量的 PR。我确实认为大语言模型参与了这些 PR 的提交。作为维护者,我有两件事。首先,我有点不知所措;我没有时间通读它,因为,特别是因为它是一个较旧的图书馆,这对我来说不是优先考虑的事情。同时,我也有点欣赏它,因为我认为人们忘记了这不仅仅是使用大语言模型。
仍然有一个人类层来验证某些东西,从某种意义上说,这也是数据的标记方式,对吗?最昂贵的事情之一是获取 RLHF(人类反馈强化学习)阶段的标记数据。这有点像那样,它会经历几个阶段,然后你实际上会从中获得更高质量的数据。所以从某种意义上说,我不介意。它可能会让人感到不知所措,但我确实认为它也有其价值。
感觉原始的 LLM 生成的数据和由人类在循环中进行某种验证的 LLM 生成的数据之间存在根本区别,即使该验证只占代码行的一小部分……。
我认为这与人们认为的任何事情都是一致的,“哦,是的。我可以通过大语言模型来了解 XYZ,”这是事实。你可以,但可能有人是专家,他可能使用大语言模型来编写特定的代码。人类的工作是让它变得更好,并扔掉不太好的部分来为你预先消化它,这可以节省你的时间。我认为这就是有人过滤事物甚至正确使用大语言模型的增值之处。我认为这仍然是你免费获得的劳动力。例如,当您阅读 Substack 文章时。
我也许可以请大语言模型就此发表意见,但我什至不知道该问什么。我认为与我去使用大语言模型相比,阅读那篇文章仍然有价值,因为你是专家。您选择实际正确且应包含的知识,然后给我这份执行摘要。这是一个巨大的附加值,因为现在我不必浪费三到五个小时自己完成这个过程,并且可能会得到一些不正确的信息。所以我认为这也是作家的未来,尽管有大语言模型可以节省你的时间。
AI 如何训练:预训练、中期训练与后训练(续)
实际观看起来很有趣——我相信你们会这样做,但对我来说,要看看摘要和原始内容之间的区别。即使它是一页长内容的摘要,看看基于大语言模型的摘要如何发挥优势也是很有趣的。它从物体上移除的信号是什么?
声音是我经常谈论的话题。
嗓音?嗯,声音……我很想听听你所说的声音是什么意思,这真的很强大,但有时就像字面上的见解。就像删除洞察力一样,您实际上从根本上改变了事物的含义。因此,我一直对大语言模型在真正获得核心见解方面的糟糕程度感到失望,而这正是优秀总结的作用。然而,即使你使用广泛、极其复杂的提示,我真的想挖掘洞察力,但它仍然不完全在那里……我的意思是,这是一个关于什么是人类知识和智慧以及有洞察力意味着什么的整个深刻的哲学问题。但是当你谈论声音时,你的意思是什么?
所以当我写作时,我认为我想做的很多事情都是按照你作为一名研究人员的想法,这是非常原始的。研究人员试图将一个想法概括在他们理解的前沿,他们试图将一种感觉转化为语言。我认为在我的写作中,我尝试这样做,这使得它看起来既原始又富含信息,有些人会得到,有些人则不会。这就是研究的本质。我认为这是语言模型做得不好的地方。特别是,他们都接受了来自人类反馈的强化学习的训练,该学习旨在获取很多人的反馈,并在某种程度上平均模型的行为方式。
我认为,当模型中有这种过滤器时,它很难变得非常深入。对于 RLHF 的研究人员来说,这是一个很棒的基本问题:这为使模型变得更好提供了很多实用性,但问题的表述也有一个无法克服的结。这些语言模型在其想要表达的深层表达中并没有先验知识。我不认为这是不可能做到的。我认为有些模特的故事确实让人震惊。比如,我很想尝试一下 Bing Sydney——它有更多的声音吗?因为它经常会让人们出轨并影响……
显然,从历史上看,一种可怕的方式——比如告诉记者离开他的妻子——是一种可能被普遍采用的疯狂模式。但这是一种权衡:这个 RLHF 过程是否在某些方面增加了限制?
作为这些前沿实验室和公司之一,这是一个可怕的地方,因为数百万人正在使用它们。
去年 GPT-4o 被删除引起了很多强烈反对。我个人从未使用过该模型,但我与 OpenAI 的人员交谈过,他们收到用户发来的电子邮件,这些电子邮件可能会在半夜检测到部署中的细微差异。他们给他们发电子邮件说:“我的朋友与众不同。”他们找到这些员工的电子邮件并向他们发送内容,因为他们非常重视一组模型权重和部署给用户的配置。我们在 TikTok 上看到了这一点。我不使用 TikTok,但据说,五分钟内,算法就能识别你。它被锁定了。这些是进行推荐的语言模型。
就像,我认为你可以通过语言模型来做到这一点,在与它聊天的五分钟内,模型就能让你明白。人们还没有真正做好准备。我认为——不要把它给孩子们。不要把这种东西给孩子们——至少在我们知道发生了什么之前。
但也会有这种机制……随着这些大语言模型被越来越多地使用,会发生什么……不幸的是,人类状况的本质就是人们自杀。记者要做的就是广泛报道自杀者,他们很可能会将其与大语言模型联系起来,因为他们拥有有关对话的数据。如果你真的很挣扎,如果你很沮丧,如果你正在考虑自杀,你可能会和大语言模型谈论这件事。所以记者会说,“自杀是因为大语言模型。”由于法律问题等原因,这将导致公司越来越多地削弱大语言模型的优势。
AI 如何训练:预训练、中期训练与后训练(续)
所以它将尽可能通用。在这个领域开展工作非常困难,因为当然,你不希望大语言模型对那个级别的人类造成伤害,而且,这也是人类经历的本质——进行丰富的对话、令人满意的对话、挑战你并从中成长的对话。你需要那种优势。对于 RLHF 前沿的人工智能研究人员来说,这是极其困难的事情,因为你实际上是在处理人类的状况。
这些公司的许多研究人员都非常积极主动。 Anthropic 和 OpenAI 在文化上都希望通过这一点为世界做好事。这就是……我想,“哦,我不想从事这个工作”,因为,一方面,很多人将人工智能视为健康盟友,作为他们可以秘密谈论自己健康的人,但随后它就一路渗透到谈论心理健康。令人心碎的是,这可能是某人超出极限的事情,但其他人可能会得救。作为训练模型的研究人员,我不想训练图像生成模型并公开发布它们,因为我不想让某人在笔记本电脑上拥有可能伤害其他人的工具。
我的公司没有足够的基础设施来安全地做到这一点。有很多这样的领域,需要人们以复杂的态度来处理它,并坚信这是一个难题。
而且,作为一个社会和这些技术的用户,我们需要确保我们对此进行复杂的对话,而不是仅仅散布大型技术正在对人类造成伤害或窃取您的数据的恐慌。事情比那更复杂。你是对的,这些公司里有很多人,其中很多你认识,我也认识,他们非常关心帮助别人。他们正在考虑来自世界各地的人们的完整人类体验,而不仅仅是硅谷——他们的需求是什么以及这意味着什么。设计一个能够帮助不同年龄层、文化和精神状况的不同类型的人的系统确实很困难。
我希望就大型科技与普通人的关系而言,人工智能出现的时机有所不同。大型科技公司的声誉如此之低,而且由于人工智能如此昂贵,它不可避免地会成为一个大型科技公司。它需要如此多的资源,人们说美国通过这种扩建“将经济押在人工智能上”。这些因素同时交织在一起,造成了如此艰难的沟通环境。对我来说,与世界上更多讨厌大型科技并将人工智能视为其延续的人交谈是件好事。
你实际上推荐的一件事,你谈论的解药之一,就是在整个系统中获得主体性,而不是无能为力地袖手旁观,在人工智能迅速占领互联网时消耗它。通过使用人工智能来构建东西来寻找代理——构建应用程序、构建……第一,这实际上可以帮助你建立直觉,但第二,它具有赋权,因为你可以理解它是如何工作的以及它的弱点是什么。它让你有权利说:“这是对技术的错误使用,这是对技术的良好使用。”然后,您会更加融入系统,因此您可以作为消费者更好地理解它并更好地引导它。
我认为你提出的关于主体性的观点很好。我认为,与其忽视它并说“好吧,我不会使用它”,不如说“好吧,它就在那里。我无法把它放回去”。就像互联网和计算机刚出现时一样。我如何充分利用它,它如何帮助我提升自己?不过,我在这里担心的一件事是,如果你只是将它完全用于你喜欢做的事情,那么你喜欢做的事情就不再存在了。这可能会导致倦怠。例如,如果我使用大语言模型为我完成所有编程工作,那么现在就不需要编码了;我只是在管理一些为我编码的东西。
AI 如何训练:预训练、中期训练与后训练(续)
两年后,假设我每天只工作八小时——为自己编写一些代码——我还会感到满足吗?这是否会伤害我对我的工作和正在做的事情的兴奋感?我仍然为建造一些东西而感到自豪吗?
说到享受这个话题,还蛮有趣的。我们应该把这个放在里面,最近有一项针对大约 791 名专业开发人员的调查——专业意味着 10 多年的经验。
那是很长一段时间了。作为初级开发人员?
是的,在这个时代。结果在很多方面都令人惊讶。他们将其按初级和高级开发人员进行了细分,结果表明这两个小组在他们发布的代码中都使用了人工智能生成的代码。这不仅仅是为了娱乐或学习;这是他们发布的代码。他们中的大多数人使用它的比例约为 50% 或更多。有趣的是,对于超过 50% 的交付代码是 AI 生成的类别,高级开发人员更有可能这样做。但你不希望人工智能夺走你所爱的东西。我想这符合我的经历。这些具体结果表明,大约 80% 的人认为使用人工智能作为工作的一部分更加令人愉快或明显更加愉快。
我认为这取决于任务。例如,从我个人的使用情况来看,我有一个网站,有时我会在其中进行一些调整。我个人不喜欢这个,所以如果人工智能可以帮助我在我的网站上实现一些东西,我会全力以赴。这很棒。但与此同时,当我解决一个复杂的问题时——如果有一个错误,我寻找这个错误并找到它——这是世界上最好的感觉。你会得到很多快乐。但现在,如果你连bug都不去想,直接去读LLM,你就永远不会有那种感觉了,对吧?
但是,可能会有一个中间立场,你自己尝试一下,找不到它,你使用大语言模型,然后你就不会感到沮丧,因为它可以帮助你继续从事你喜欢的事情。查看这些统计数据,没有考虑到它是所有不同场景的平均值。我们不知道这是为了核心任务还是为了人们不会喜欢的平凡事物。从某种意义上说,人工智能确实非常适合做需要大量工作的平凡事情。
例如,我的妻子有一个用于读书俱乐部讨论的播客,她将节目笔记从 Spotify 传输到 YouTube,但链接不知何故中断了。她有一些剧集有 100 个链接之类的,进入那里手动修复每个链接真的很痛苦。所以我建议,“嘿,我们试试 ChatGPT。”我们将文本复制到 ChatGPT 中,它修复了这些问题。从一个链接到另一个链接不再需要花费两个小时,而是使工作变得无缝。我认为每个人都有一个用例,人工智能可以用于类似的事情——一些非常无聊和平凡的事情。
就我个人而言,由于我们正在谈论编码,所以很多乐趣都来自于光标一侧 - Claude Code一侧 - 我有一个结对程序员。这样就不那么孤独了。你让调试听起来很有趣。不,我想说调试就像你在沙漠里呆了几天之后喝了一杯水。你跳过了你正在受苦的整个沙漠部分。有时,有一个朋友虽然不能真正找到错误,但可以给你一些关于代码的直觉,然后和你一起穿越沙漠,找到那杯水,这真是太好了。对我来说,也许这说明了编程经历的孤独感。这是快乐的源泉。
AI 如何训练:预训练、中期训练与后训练(续)
这可能也与延迟满足有关。我是一个从小就喜欢圣诞礼物而不是真正收到圣诞礼物的人。我本来很期待这一天的到来,但当一切结束后,我感到很失望。也许这就像食物一样——当你真的饿了的时候味道会更好。调试并不总是那么好;这常常令人沮丧,但如果你能解决它,那就太好了。但也有一个“金发姑娘区”,如果它太难,那么你就是在浪费时间。不过,我认为另一个挑战是:人们如何学习?
我们查看的图表显示,与初级开发人员相比,更多的高级开发人员正在交付人工智能生成的代码。我认为这很有趣,因为直觉上你会认为是初级开发人员,因为他们还不知道如何做这件事。这可能意味着人工智能还不够好,无法解决这些任务,但这也可能意味着专家在使用它方面更加有效——他们知道如何审查代码并且更加信任它。未来社会的一个问题是:如果你不尝试自己做一件事,如何成为专家?
我通过自己尝试来学习。对于数学教科书,如果你查看解决方案,你会学到一些东西,但如果你先尝试然后欣赏解决方案,你会学得更好,因为你知道如何将其放入你的心理框架中。如果LLM一直在这里,你真的会经历漫长的挣扎吗?你愿意奋斗吗?挣扎并不好,但如果你用大语言模型做所有的事情,在某些时候你将永远不会真正迈出下一步,你也无法获得使用大语言模型作为专家所获得的解锁。
所以,我认为有一个金发姑娘的最佳点,也许诀窍是你专门安排离线时间,每天学习两个小时,剩下的时间你使用大语言模型。我认为,在我看来,人们仍然要对自己进行投资,而不仅仅是大语言模型的一切,这一点很重要。
是的,有一种感觉,我们作为一个文明,每个人都必须找到那个金发姑娘区。作为开发人员在编程环境中。现在,我们从预训练和中期训练开始进行了这场有趣的对话。让我们开始后期培训。后训练有很多有趣的事情。那么,后期培训中有哪些有趣的想法呢?
后训练:大模型的新研究方向
2025 年最大的挑战是学习这种具有可验证奖励的强化学习,RLVR。您可以在那里扩大训练规模,这意味着进行大量这种迭代生成级循环,这可以让模型学习工具使用和软件方面的有趣行为。这可以是搜索、自行运行命令并查看输出,然后训练也可以很好地实现这种推理时缩放。事实证明,这种范式之间的联系非常紧密,这种 RL 训练可以实现推理时缩放。但推理时间的缩放可以通过不同的方式找到。所以,这是一场完美的风暴,模型发生了很大的变化,而它们的训练方式是其中的一个主要因素。
这极大地改变了人们接受后训练的方式。
您能描述一下由 DeepSeek R1 推广的 RLVR 吗?你能描述一下它是如何工作的吗?
是的。有趣的是,我所在的团队提出了 RLVR 这个术语,它来自 DeepSeek 之前我们的 Tulu 3 工作。我们并没有因为自己是推广强化学习的人而获得太多赞誉,但顺便说一句,与学术界一样有趣的是命名和影响的能力——
——话语,因为封闭的实验室只能说这么多。作为一名学者,你可以做的一件事是,虽然你可能没有计算能力来训练模型,但你可以以一种最终的方式构建事物……我将其描述为社区可以围绕 RLVR 术语聚集在一起,这非常有趣。 DeepSeek 是在训练方面取得突破的人,也就是说,他们扩展了强化学习。他们让模型生成答案,然后对完成情况进行评分(如果答案正确),然后这种准确性就是对强化学习的奖励。因此,强化学习通常是一个在环境中行动的智能体,环境给它一个状态和一个奖励,而你试图最大化这个奖励。
就语言模型而言,奖励通常是一组可验证任务的准确性,无论是数学问题还是编码任务。诸如事实领域之类的事情开始变得模糊。在某些方面,这也是对你的指示的可验证或限制,例如“仅用以 A 开头的单词进行响应”。所有这些事情都可以以某种方式验证。核心思想是,你会发现更多可验证的问题,并让模型在进行 RL 梯度更新时多次尝试。基础设施是从人类反馈的强化学习(RLHF)演变而来的,在那个时代,他们试图优化的分数是人类总体偏好的学习奖励模型。
所以你改变了问题领域,让优化进行到更大的范围,这引发了模型功能和人们如何使用它们的重大变化。
RLVR 适用于哪些领域?
数学和代码是著名的,然后还有很多关于所谓的“准则”的工作,这与人们可能听说过的一个词有关,“大语言模型作为法官”。对于每个问题,我的训练数据集中都会有一组问题。然后我将有另一种语言模型并询问它:“这个问题的一个好的答案是什么样的?”然后你可以一遍又一遍地尝试这个问题,并根据这个评分标准分配一个分数。因此,这不一定像数学和代码领域那样可验证,但这种标题概念和其他可能有点模糊的科学问题却引起了很多关注。他们试图将这组方法推入这些更加开放的领域,以便模型可以学到更多东西。
我认为这就是所谓的带有人工智能反馈的强化学习,对吗?
这是 Anthropic 的宪法人工智能论文中创造的旧术语。所以很多事情都是循环出现的。
后训练:大模型的新研究方向(续)
另外,对于 RLVR 来说,只需退一步。我认为这里有趣、美妙的事情是,你问大语言模型一个数学问题,你知道正确的答案,然后你让大语言模型弄清楚,但它是如何做到的……我的意思是,你并没有真正限制它。您可以添加一些限制,例如“使用相同的语言”或“不要在西班牙语和英语之间切换”。但假设您几乎不干涉。
你只给出问题和正确答案,让大语言模型自己找到推导路径。实践中,它往往会像学生或数学家一样,一步步写出解法,而这些中间步骤能提高最终准确率。所谓推理时缩放,粗略说就是在模型回答时投入更多计算;在这里,模型会生成更多 token。DeepSeek R1 论文显示,强化学习训练越久,模型的回答往往也越长。
回答会逐渐变长、消耗更多 token,因此简单任务也会更贵,但这些解释步骤常常能提高准确率。也有许多论文指出,模型给出的解释未必完全正确,甚至可能与答案无关,却仍会帮助它得到更好的结果。我不想把大语言模型拟人化,但这有点像人做复杂数学题:会在草稿纸上分步骤推导、划掉错误,再继续计算。
而且该模型还会自我修正,我认为这就是 DeepSeek R1 论文中的顿悟时刻。他们称之为“顿悟时刻”,因为模型本身意识到它犯了一个错误,然后说:“啊,我做错了,让我再试一次。”我认为这太酷了,只要给它正确的答案并让它弄清楚如何去做,从某种意义上说,它就可以做人类会做的事情。虽然大语言模型不像人类那样思考,但这确实是一种有趣的巧合。好的副作用是,看到这些步骤对我们人类来说是件好事。它建立了信任,我们可以学习或仔细检查事情。
这里有很多值得讨论的地方。我觉得所谓“顿悟时刻”多少有些被夸大,因为模型在预训练中几乎见过整个互联网,当然也见过人们展示推导过程、口头纠错,甚至数学课上“试一下——不对,我弄错了”的记录。RLVR 真正擅长的是放大这些行为,让模型更愿意延长思考并检查自己的工作。它确实很漂亮:训练让模型强化了这些有助于改进最终答案的行为。
我还可以给你一个实际的例子。我正在 MATH-500 上使用 RLVR 训练 Qwen 3 基础模型。基本模型的准确度约为 15%。只需 50 个步骤,就像 RLVR 只需要几分钟,模型的准确率就从 15% 提高到 50%。你不能告诉我它正在学习任何关于数学的基本知识——
Qwen 的例子有些特殊。今年已有两篇论文讨论 Qwen 的数据污染,其中一篇我也参与了。问题尤其涉及它特殊的中期训练阶段:它训练过许多与 MATH 基准测试题极其相似的问题,所以这个案例需要谨慎解释。
确切地。所以你可以看到,基本上强化学习并没有向模型传授任何关于数学的新知识。你不可能只用 50 个步骤就能做到这一点。所以知识在预训练中就已经有了;你只是解锁它。
我仍然不同意这个前提,因为其中有很多无法严格证明的复杂因素。拿 Qwen 3 所谓的基础模型来说,你可以从 Hugging Face 随便找一道数学应用题,比如“爱丽丝有五个苹果,又给出三个”。人们怀疑这些 Qwen 系模型,是因为即便只改数字、保留题目文字,它们在不用工具的情况下仍能给出精度异常高的小数答案——
——这意味着模型很可能见过与测试集近乎相同的问题,而且生成训练数据时曾使用工具得到高精度答案;纯语言模型本身通常不会自然产生这种表现。因此研究界一直在争论:那些用 Qwen 训练、又专门在这个已被多篇论文指出可能受污染的数学基准上评测的强化学习论文,究竟有多少可信度?这也让一些人认为 RLVR 的快速收益主要来自格式或既有能力的解锁。但实验并不完全受控,因素很多,我们还不能确定。
后训练:大模型的新研究方向(续)
但如果不是真的,我会说蒸馏不起作用,对吗?蒸馏在某种程度上可以发挥作用,但最大的问题——我正在研究这种污染——是我们不知道数据中有什么。除非你有新的数据集,否则这真的是不可能的。即使是像 MMLU 这样简单的东西,它是一个多项选择基准,如果你只是稍微改变格式,比如使用点而不是括号,模型的准确性将会有很大的不同。
我认为这可能是一个模型问题,而不是一个普遍问题。
大语言模型的开发者甚至没有恶意,比如,“嘿,我们想在那个基准上作弊。”只是它在某个时刻看到了一些东西。我认为评估大语言模型的唯一公平方法是在模型部署的截止日期之后制定一个新的基准。
我们能否列出后训练所有事情的秘诀是什么?您提到 RLVR 是一件非常令人兴奋且有效的事情。也许我们应该详细说明。 RLHF 仍然有一个非常重要的组成部分需要发挥。对于后期培训还有哪些其他的想法?
我想你可以按顺序处理这个问题。您可以将其视为使 o1(第一个推理模型)成为可能的原因。从中期训练开始,您将进行类似的干预。据传,支持 o1 和类似模型的实际上是仔细的数据管理,其中提供了广泛的所谓推理轨迹。这只是在正向过程中生成单词的模型,反映了将问题分解为中间步骤并尝试解决它们。因此,在中期训练,您需要拥有与此类似的数据,以便当您进入后训练(主要是通过这些可验证的奖励)时,它可以学习。
然后今天发生的事情是你要弄清楚要给模型提供哪些问题,你可以训练它多长时间,以及在解决这些可验证的问题时你可以让模型使用多少推理。随着模型变得更好,某些问题不再有用;该模型将 100% 解决这些问题,因此信号非常少。如果我们看一下 GRPO 方程,就会发现这个方程因此而闻名,因为本质上给予智能体的奖励是基于给定动作(完成)相对于同一问题的其他答案的好坏程度。因此,如果所有问题都得到相同的答案,那么这些类型的算法就没有信号。
所以他们正在做的是寻找更难的问题,这就是为什么你会听到科学领域之类的东西,这些东西很难得到正确的结果。如果你有一个实验室或其他什么东西,它只会产生这么多的token,或者更难的软件问题。前沿模型都在进军这些更难的领域,在那里它们可以训练更多的问题,并且模型将立即学习更多的技能。 RLHF 与此的联系是,RLHF 过去是、现在仍然是模型的点睛之笔,它通过改进组织、风格或语气使模型变得更加有用。
有不同的东西能引起不同的观众的共鸣。有些人喜欢非常古怪的模型,而 RLHF 可能擅长实现这种个性,而有些人讨厌模型所做的 Markdown 项目符号列表,但它实际上非常适合快速解析信息。这个人类反馈阶段非常适合在一天结束时将其放入模型中。这就是 ChatGPT 对人们如此神奇的原因。而且这种使用实际上保持相当稳定。例如,这种格式还可以帮助模型更好地解决数学问题。
当您训练这些模型时,样式和格式之间的界限以及您用来回答问题的方法实际上是紧密相连的。 RLHF 仍然可以使模型在数学方面变得更好,但这些可验证的领域是执行此操作的更直接的过程,因为它对问题表述更有意义。总结一下:中期训练为模型提供了需要学习的技能;具有可验证奖励的强化学习可以让模型进行多次尝试,将大量计算投入到针对难题的试错学习中;然后RLHF完成模型,使其易于使用并完善。
后训练:大模型的新研究方向(续)
您能否评论一下 RL VR 所需的计算量?
它只是不断上升。我认为 Grok 4 因在预训练和后训练使用相似的计算量而闻名。回到扩展讨论,它们涉及非常不同的扩展硬件。预训练非常受计算限制,这就像 FLOPS 讨论:一次可以完成多少次矩阵乘法。因为在强化学习中,你要生成这些答案并在现实环境中尝试该模型,所以它最终会更加受内存限制。你正在生成长序列,注意力机制有一种行为,当你生成更长的序列时,你的记忆会呈二次方增加。所以计算变得非常不同。
在预训练中,我们会谈论一个模型——如果我们回到拜登政府的行政命令——训练一个模型就像 10 到 25 次 FLOPS。如果你在后期训练中使用 FLOPS,那就更奇怪了,因为现实就是你分配了多少个 GPU 几个小时。就时间而言,强化学习计算越来越接近,因为你无法将所有内容都放入一个系统中。预训练的计算量非常大,所有 GPU 都在相互通信,而且效率极高,而 RL 拥有所有这些移动部件,可能需要很长时间才能生成包含 10 万个token的序列。
如果您认为 Gemini 3 Pro 需要一个小时,那么如果您的训练运行必须采样一个小时怎么办?您必须确保有效处理。因此,在 GPU 时间或挂钟时间中,强化学习运行的天数可能接近与预训练相同的天数,但它们可能不会同时使用那么多 GPU。实验室有一些经验法则,您不希望预训练持续超过一个月,因为它们会发生灾难性的失败。如果您计划将一个大型集群保留两个月,然后在第 50 天失败,那么机会成本就非常大了。
人们不想把所有鸡蛋放在一个篮子里。 GPT-4 就像终极的 YOLO 跑步,以前没有人愿意这样做,需要三个月的时间来训练,每个人都对它的效果感到震惊。我认为人们现在更加谨慎和渐进。
因此,RLVR 在您可以训练多少或仍然获得收益方面更加不受限制,而 RLHF,因为它是偏好调整,达到了一定程度,在其上花费更多预算实际上没有意义。退后一步进行偏好调整:有多个人可以对同一件事给出多种解释,而且它们都可能是正确的,但在某些时候,你学习了某种风格,迭代它是没有意义的。我最喜欢的例子是,如果亲戚问我他们应该买什么笔记本电脑。我给他们解释或询问他们的用例,他们可能会优先考虑电池寿命和存储。
其他人,比如我们,会优先考虑 RAM 和计算。两个答案都是正确的,但不同的人需要不同的答案。通过偏好调整,您试图以某种方式进行平均;你要求数据标记者给你首选的答案,然后你以此为基础进行训练。但在某些时候,你会学到平均首选答案,并且没有理由继续训练更长时间,因为它只是一种风格。通过 RLVR,您可以让模型解决越来越复杂、困难的问题。因此,我认为长期向 RLVR 分配更多预算更有意义。
现在,我们处于 RLVR 1.0 阶段,仍然是一个简单的事情,我们有一个问题和答案,但我们不会对中间的东西做任何事情。例如,Google发表了多篇关于过程奖励模型的研究论文,这些论文也为解释给出了分数——解释的正确性如何?我认为这将是下一件事,比如说今年的 RLVR 2.0,重点关注问答之间的步骤以及如何利用这些信息来提高解释和准确性。这是一个角度。还有一篇 DeepSeek-V3.2 论文,其中也有有趣的推理缩放。
嗯,首先他们开发了模型,将自己作为一个单独的模型进行评分。我认为这将是一方面。另一个,就像 Nathan 提到的,RLVR 将分支到其他领域。
后训练:大模型的新研究方向(续)
人们兴奋的地方是价值函数——这非常相似。过程奖励模型将事物的好坏分配给推理过程中的每个中间步骤,而价值函数将价值应用于语言模型生成的每个token。这两者在语言建模和推理模型时代基本上都未经证实。无论出于何种原因,现在人们对价值函数更加乐观。我认为过程奖励模型在 o1 时代之前被尝试过很多次,很多人对此感到头疼。价值模型在强化学习领域有着悠久的历史。
它们是现有深度强化学习的核心核心之一——训练价值模型。因此,目前的文献表明人们对尝试价值模型感到兴奋,但缺乏证据。在尝试扩大流程奖励模型方面也存在一些负面例子。
这些事情并不总是在未来成立。总结一下缩放:由于信号缩放的方式,您不想做太多 RLHF。人们已经在 RLHF 上工作了很多年,尤其是在 ChatGPT 之后,但是使用 RLVR 训练的推理模型的第一个版本(OpenAI 的 o1)有一个缩放图,如果您以对数方式增加训练计算,您会得到评估的线性增加。此内容已被转载多次;我认为 DeepSeek 有这样的情节。但 RLHF 没有缩放定律,如果对数增加计算量,就会获得线性性能。
事实上,RLHF 的开创性缩放论文是关于奖励模型过度优化的缩放损失。这是 RLVR 和我们现在拥有的方法所划定的一条大线;他们将遵循这种扩展范例,您可以将最佳运行额外提升 10 倍,从而获得性能,但 RLHF 无法做到这一点。这将是领域定义。要实现最佳 RLHF,您可能不需要额外的 10 倍或 100 倍计算,但要实现最佳 RLVR,则需要。 Meta 实习有一篇开创性的论文,名为“使用语言模型扩展强化学习的艺术”。
他们的框架称为 ScaleRL。他们的增量实验大约是 10,000 V100 小时,每个实验要花费数千或数万美元,而且他们做了很多次实验。这种成本是普通学者无法承受的,这在试图弄清楚如何向每个社区学习时产生了一种硬平衡。
给 AI 开发与研究初学者的建议
我想知道我们是否可以岔开话题,谈谈教育和学习。如果你是一个对编程感兴趣并且对人工智能感兴趣的聪明人,我认为从头开始构建一些东西是一个好的开始。您能告诉我您建议人们做什么吗?
正如您所说,我个人会从头开始实现一个可以在计算机上运行的简单模型。从头开始构建模型的目的不是为了拥有每天用于个人项目的东西。它不会成为您的私人助理来取代现有的开放权重模型或 ChatGPT。这是为了了解大语言模型的具体内容、大语言模型的具体结果以及预训练如何在您自己的计算机上进行。然后你了解预训练、监督微调和注意力机制。
您对事物的工作原理有了深入的了解,但在某些时候您会达到极限,因为较小的模型只能做这么多。大规模学习大语言模型的问题在于,制作更大的模型会变得更加复杂,因为不仅仅是模型变得更大。您必须考虑将参数分片到多个 GPU 上。即使对于 KV 缓存,也有多种实现方式。一是只是了解它是如何工作的,就像通过连接列表逐步增长的缓存一样,但这在 GPU 上并不是最佳的。您可以预先分配一个张量,然后填充它。但这又会增加 20 或 30 行代码。
对于每件事,你都添加了很多代码。我认为这本书的诀窍基本上是理解大语言模型是如何运作的。它不会是你的生产级大语言模型,但一旦你拥有了它,你就可以理解生产级大语言模型。
所以你总是试图建立一个适合一个 GPU 的大语言模型?
是的。我的大多数示例都适合在一个 GPU 上。我有一些 MoE 模型的奖励材料;其中一两个可能需要多个 GPU,但目标是在一个 GPU 上实现。最美妙的是你还可以自我验证。这几乎就像 RLVR 一样。当您从头开始编写这些代码时,您可以从 Hugging Face Transformers 库中获取现有模型。 Hugging Face Transformers 库很棒,但如果您想了解 LLM,我认为这不是最好的起点,因为代码非常复杂。它必须适应如此多的用例,并且有些人在生产中使用它。它必须非常复杂,所以它是相互交织且困难的;阅读起来不是线性的。
它最初是一个微调库,然后发展成为每个模型架构及其加载方式的标准表示。 Hugging Face 是获取模型的默认位置,而 Transformers 是支持该模型的软件——因此人们可以轻松加载模型——并用它做一些基本的事情。
所有拥有开放权重模型的前沿实验室都有 Hugging Face Transformers 版本,从 DeepSeek 到 gpt-oss。这是加载它们的规范方式。但同样,即使 Transformers 库也没有在生产中用于推理。人们使用 SGLang 或 vLLM,这又增加了一层复杂性。
应该说 Transformers 库大约有 400 个模型。
因此,它是一个尝试实现大量 LLM 的库,因此您拥有庞大的代码库。这是巨大的。这是——我不知道,也许有数百万——数十万行代码。理解你想理解的部分就像大海捞针一样。但它的美妙之处在于你有一个有效的实现,所以你可以从它开始向后工作。我建议做的是,如果我想了解 OLMo 3 是如何实现的,我会查看模型中心和配置文件中的权重。你可以看到,“哦,他们使用了很多层。他们使用组查询注意力。”然后您会看到人类可读的 100 行配置文件中的所有组件。然后从 GPT-2 模型开始并添加这些内容。
这里最酷的事情是您可以加载预先训练的权重并查看它们是否适用于您的模型。您希望匹配使用 Transformers 模型获得的相同输出,然后您可以将其基本上用作可验证的奖励,以使您的架构正确。有时我需要一天的时间。对于 OLMo 3,挑战在于位置嵌入的 RoPE;他们有一个 YaRN 扩展,并且有一些自定义缩放。一开始我还不太适应,但在这场斗争中你会明白一些事情。最后,您知道它是正确的,因为您可以针对参考实现对其进行单元测试。我认为这是最好的学习方式之一。基本上,你对某些东西进行逆向工程。
给 AI 开发与研究初学者的建议(续)
我认为这是今天每个有兴趣进入人工智能领域的人都应该做的事情,这就是我喜欢你的书的原因。我是从强化学习和机器人领域接触到语言模型的,所以我从来没有花时间去学习所有的基础知识。今天的 Transformer 架构就像过去的深度学习一样基础,人们需要学习它。我认为很多人不知所措的地方是如何应用它来产生影响或找到职业道路。
人工智能语言模型使这些基础知识变得如此容易理解,有动力的人会学习它。然后就像,“我如何让周期达到目标,为研究做出贡献?”我实际上相当乐观,因为这个领域发展得如此之快,以至于很多时候最优秀的人都无法完全解决问题,因为有一个更大、更容易实现的目标需要解决,所以他们会继续前进。在我的 RLHF 书中,我尝试采用后训练技术并描述它们如何影响模型。值得注意的是,有很多东西人们就停止了研究。
我认为人们在完成基础知识后尝试缩小范围是好的。阅读相关论文并参与生态系统——你实际上……随机的人在网上与领先研究人员的接近程度令人难以置信。 ML 中 X 上的匿名帐户非常流行,没有人知道这些人是谁。深入研究这些东西的人可能只是随机的。尤其是用AI工具来帮助你不断挖掘你不理解的东西,这是非常有用的。有些研究领域可能只需要阅读三篇论文,然后其中一位作者可能会给您回复电子邮件。
但你必须在这些电子邮件中投入大量精力才能表明你了解该领域。新手需要花费几周的时间才能真正掌握一个非常狭窄的领域,但是在基础知识之后缩小范围是非常有用的。我对角色训练非常感兴趣——如何让模型变得有趣、讽刺或严肃,以及如何处理数据来实现这一目标。牛津大学的一名学生联系我说:“嘿,我对此很感兴趣,”我向他提出了建议。现在那篇论文已经存在了。世界上可能只有两三个人对这个特定主题非常感兴趣。
他是一名博士生,这给了你一个优势,但对我来说,这是一个我在等待有人说的话题,“嘿,我有时间花很多时间在这个上面。”我确信还有很多更狭隘的事情,你会说,“这个问题没有答案是没有意义的。”信息太多,人们感觉自己无法抓住任何东西,但如果你真正专注于一个领域,我认为有很多有趣的东西需要学习。
是的,我认为你不能尝试全部完成,因为这会让人不知所措,而且你会精疲力尽。比如,我已经很久没有跟上计算机视觉的步伐了;我只专注于大语言模型。但回到你的书,我认为如果你想了解 RLHF,这是一个非常好的资源,而且物有所值。我不会只是去那里阅读原始的 RLHF 论文,因为你会花两年的时间——
——其中一些是相互矛盾的。我刚刚编辑了这本书,没有一章需要我说:“X 篇论文说的是一件事,Y 篇论文说的是另一件事,我们拭目以待。”
给 AI 开发与研究初学者的建议(续)
在后训练的大局中,我们可能错过了哪些想法?浏览目录:首先,您进行了问题设置、训练概述、偏好是什么、偏好数据和优化工具、奖励建模、正则化、指令调整、拒绝采样、强化学习。然后是人工智能和人工智能反馈、推理和推理时缩放、工具使用和函数调用、合成数据和蒸馏、评估,然后是开放问题部分:过度优化、风格和信息、产品用户体验、角色和后期培训。有哪些值得一提的连接教育部分和研究部分的想法?你提到了性格训练,这很有趣。
角色训练很有趣,因为那里的东西太少了,但我们讨论了人们如何与这些模型互动。我们使用它们感觉很好,因为它们是积极的,但这可能太过分了;它可能过于积极。从本质上讲,这就是您如何更改数据或决策以使其完全符合您的要求。 OpenAI 有一个叫做“模型规范”的东西,这本质上是他们希望模型做什么的内部指南,并将其发布给开发人员。因此,您可以知道 OpenAI 培训的失败是什么(他们有意图但尚未实现),以及什么是他们实际上想做而您只是不喜欢的事情。
这种透明度非常好,但整理这些文档的所有方法以及遵循它们的难易程度还不是很为人所知。我认为这本书的设计方式是,强化学习章节显然是人们想要的,因为每个人都通过 RLVR 听说过它,它是相同的算法和相同的数学,但你可以在非常不同的文档中使用它。我认为RLHF的核心是偏好有多混乱。这本质上是我几年前写的一篇论文的翻版,但这一章告诉你为什么 RLHF 永远无法完全解决,因为 RL 的设置方式假设偏好可以量化并简化为单个值。
我认为它在经济学文献中与冯·诺依曼-摩根斯特恩效用定理有关。在这一章中,所有哲学、经济和心理学背景都会告诉您在进行 RLHF 时哪些内容会被压缩。在本书的后面部分,您将使用这个 RL 映射来使数字上升。我认为这就是为什么人们进行研究会非常有价值,因为量化偏好是人类设计问题以使它们变得可研究的东西。但存在一些根本性的争论;例如,在语言模型响应中,您关心的事物有不同,无论是准确性还是风格。
当你收集数据时,它们都会被压缩成“我比另一个更喜欢这个”。世界其他地区有很多研究探讨如何实际做到这一点。我认为社会选择理论是经济学的一个子领域,围绕如何汇总偏好。我参加了一个研讨会,该研讨会发表了一份白皮书,介绍如何考虑将社会选择理论用于 RLHF。我希望那些对数学感兴趣的人能够偶然进入这个更广泛的背景。我还保留了我喜欢的推理模型的所有技术报告的列表。第 14 章对 RLVR 进行了简短总结,并在一张巨大的表格中列出了我喜欢的每一个推理模型。我认为在教育领域,目前很多内容都需要是我喜欢的——
——因为语言模型非常擅长数学。例如,关于直接偏好优化的著名论文,它是一种比强化学习简单得多的解决问题的方法——附录中的推导跳过了数学步骤。我试图在这本书中重做推导,我想,“他们使用的这个日志技巧到底是什么?”但当使用语言模型时,他们只是说,“这是日志技巧。”我不知道我是否喜欢数学如此商品化。我认为阅读本附录的一些困难以及遵循数学对于学习是有好处的。
给 AI 开发与研究初学者的建议(续)
是的,我们经常回到教育这个话题。你们都多次提到“斗争”这个词。这是有价值的。我想,如果你在这个过程中没有遇到困难,那么你就没有完全遵循正确的学习过程。
一些提供者开始研究教育模型,旨在不提供……实际上,我没有使用过它们,但我猜他们的设计目的是不立即提供所有信息,并让人们为之工作。我认为你可以训练模型来做到这一点,这将是一个很棒的贡献。在书中,你必须重新评估每一个决定——这是一个很好的例子。我认为我们有机会在 AI2 进行这方面的工作,我认为这会很有趣。
这是有道理的。前几天我为电子游戏做了类似的事情。在业余时间,我喜欢带有谜题的电子游戏,例如《塞尔达》和《银河战士》。有一款新游戏让我陷入了困境。我不想挣扎两天,所以我用了LLM。但我告诉它:“请不要剧透。我已经到了这一步,接下来我该怎么办?”你可以对数学做同样的事情,你会说:“我现在遇到了困难。不要给我完整的解决方案,但我可以尝试什么?”你仔细地探究一下。
但问题是它需要纪律。很多人喜欢数学,但也有很多人需要做作业,而这只是一条捷径。我们可以开发教育大语言模型,但其他大语言模型仍然存在,并且仍然存在使用它们的诱惑。
我认为很多人,尤其是在大学里的人,都了解他们所热衷的东西——他们对此有自我意识,并且他们明白这不应该是一件容易的事。就像,我认为我们只需要培养一种良好的品味——谈论研究品味,就像学校对你应该为之奋斗的东西的品味——以及你不应该为之奋斗的东西。这很难知道,因为有时你对什么对你的职业生涯真正有用没有良好的长期愿景。但你必须培养这种品味,是的。
我可能正在和我的未婚夫或朋友谈论这件事,就像有一个短暂的 10 年窗口,所有作业和所有考试都可以数字化。但在此之前,每个人都必须完成蓝皮书上的所有考试,因为没有其他办法。现在,在人工智能之后,每个人都需要参加蓝皮书和口语考试,因为每个人都可以很容易地作弊。这就像这一代人拥有不同的教育体系,一切都可以数字化,但你仍然不能作弊。现在它又要回去了。这真是太有趣了。
你提到性格训练。只是缩小一个更普遍的主题:对于该主题,需要多少计算?一般来说,作为一名研究人员做出贡献,是否有一些地方不需要太多计算,而您实际上可以作为个人研究人员做出贡献?
对于角色训练,我认为这项研究是建立在使用 LoRA 微调大约 70 亿个参数模型的基础上的,这就像......本质上,你只是微调模型权重的一小部分。我不知道具体需要多少 GPU 小时。
但这是可行的。
并非每个学者都可行。因此,对于某些学者来说,情况是如此严峻,以至于你唯一能做的工作就是在封闭模型或开放模型中进行推理,你可以从它们那里得到完成结果,你可以查看它们并理解模型。这非常适合评估,你希望最擅长创建模型失败的代表性问题或表现出某些能力,我认为你可以突破这一点。我认为,如果你想拥有职业发展动力,从事评估工作的研究人员的最高目标是让前沿实验室接受你的评估。所以你不需要让每个项目都这样做。
但是,如果您来自一所没有计算能力的小型大学,并且您发现了Claude正在努力解决的问题,然后下一个Claude模型将其出现在博客文章中,那就是您的职业火箭飞船。我认为这很难,但如果你想用最少的计算来确定最大可能的影响范围,那就是这样的——范围变得非常狭窄,并且需要了解模型的发展方向。因此,您需要构建一个工具来测试 Claude 4.5 会失败的地方。如果我要开始一个研究项目,我需要考虑八个月后模型将在哪些方面陷入困境。
给 AI 开发与研究初学者的建议(续)
但是开发全新的想法又如何呢?
这是一个权衡。我认为,如果你正在攻读博士学位,你也可能会说,“在语言模型领域工作太冒险了。我要走更长远的道路,”这就像——10年后定义语言模型开发的是什么?我认为我最终会成为一个非常实际的人。我的意思是,我攻读博士学位的感觉就像是,“我进入了伯克利。最糟糕的情况是,我获得了硕士学位,然后我就去科技行业工作。”所以我对此非常务实。这些人工智能公司为员工提供的生活条件、……OpenAI 的平均薪酬是每位员工每年超过 100 万美元的股票。对于美国的任何一个普通人来说,进入这个人工智能实验室都会改变你的生活。所以我对此很实际——
——如果你专注的话,语言模型中仍然有很多向上流动的机会。看看结果,看看这些工作。但从研究的角度来看,就变革性影响和这些学术奖项而言,成为下一个 Yann LeCun 源于不太关心语言模型开发。
在这种情况下,这是一个巨大的经济牺牲。
所以我开始和一些很棒的学生一起工作,他们会问,“我应该去人工智能实验室工作吗?”我想,“你在一所顶尖学校获得博士学位。你要离开去实验室吗?”如果你去顶级实验室工作,我不会责怪你。不要随意去某个可能为零的初创公司工作。但如果你要去 OpenAI,我认为放弃博士学位可能值得。
让我们更仔细地思考一下这个问题。您会在哪里推荐人们做出研究贡献?学术界的选择是——获得博士学位,花五年时间发表论文,尽管计算资源有限。有些研究实验室更专注于开放权重模型,因此在那里工作。或者关闭前沿实验室。 OpenAI、Anthropic、xAI 等。
这两个梯度是:越封闭,你往往获得的钱就越多,但你获得的信用也就越少。在建立你所做过的事情的组合方面,你作为一名学者所做的事情是非常清楚的。相反,如果你打算用这个相当合理的进展来换取成为机器中的一个齿轮,这也可能非常有趣。我认为他们的职业道路非常不同。但成为一名研究人员的机会成本非常高,因为博士生基本上没有任何报酬。我认为这最终会奖励那些拥有相当稳定的安全网的人,他们意识到自己可以长期经营,做非常有趣的工作并找到一份非常有趣的工作。
因此,“我将完成我的博士学位并在之后解决这个问题,因为我想这样做,”这是一个特权地位。与此同时,学术生态系统正受到资金削减等问题的轰炸。有很多不同的权衡,我知道很多人会说,“我不喜欢它。我无法应对这种资金搜索。我的拨款被政府无缘无故地削减了,”或者,“我不知道会发生什么。”因此,我认为存在很多不确定性和权衡,在我看来,有利于只接受具有有意义影响的高薪工作。这并不是说你在 OpenAI 工作就能获得报酬。您正在打造前沿事物,改变数百万人与科技的关系。
但在出版方面,他们变得更加保密,而且越来越保密。所以你发表的文章越来越少。你正在产生大规模的积极影响,但你只是机器中的一个齿轮。
我认为,老实说,它并没有改变那么多。我曾在学术界工作过;我已经不在学术界了。同时,我也不想错过在学术界的时光。但在讲到这一部分之前我想说的是,我认为它并没有太大改变。我与合作者一起使用人工智能或机器学习方法在计算生物学中应用,很多人直接从学术界转到Google。我认为这是同一件事。当时,教授们对他们的学生进入工业界感到悲伤,因为他们无法在这个意义上继承他们的遗产。我认为这是同一件事。它并没有改变那么多。唯一改变的是规模。
但是,你知道,很酷的东西总是在封闭的行业中开发出来的。你不能谈论它。我认为现在的区别在于你的偏好。你喜欢谈论你的工作并发表文章,还是更喜欢在封闭的实验室里?这是一个区别——当然是补偿。但一直都是这样。所以这实际上取决于你在哪里感觉舒服。而且,没有什么是永远的。现在唯一的办法就是第三种选择,那就是创业。有很多人在创业。这是一个非常危险的举动,但这是一种高风险、高回报的情况,而加入行业实验室是相当安全的,并且可以提供向上的流动性。
给 AI 开发与研究初学者的建议(续)
老实说,我认为一旦你进入了行业实验室,未来找到工作就会更容易。但话又说回来,你对团队和专有事物的工作有多喜欢,而你对出版工作的喜欢程度如何?我的意思是,出版是有压力的。会议的接受率可能是任意的并且非常令人沮丧,但这也是很高的回报。如果你发表了一篇论文,你会感觉很好,因为上面有你的名字。你有很高的成就。
老实说,我觉得我的教授朋友平均比在前沿实验室工作的朋友更快乐。因为只有一个基础——前沿实验室肯定会做这个 9/9/6——这本质上是一直工作的简写。
AI 行业的工作文化
您能将 9/9/6 描述为一种文化吗?我相信你可以说它是在中国发明并在硅谷采用的。 9/9/6 是什么?现在是上午 9:00 到晚上 9:00 —
每周六天。
每周六天。那是什么,72小时?这基本上是硅谷AI公司的标准吗?这种磨练的心态越来越多。
是的,我的意思是,也许不完全是这样,但我认为有这样的趋势。这很有趣——我认为它几乎翻转了,因为当我在学术界时,我有这样的感觉,因为作为一名教授,你必须写资助,你必须教学,你必须做你的研究。这就像三份工作合二为一,如果你想成功,这不仅仅是一份全职工作。我觉得现在,就像Nathan刚才说的那样,与实验室相比,教授们的压力或工作量甚至比前沿实验室还要少,因为——
我认为他们工作很多。他们真是太满足了。通过与学生合作——……并拥有持续的指导和以人为本的使命。我认为在一个事物发展非常快而且非常混乱的时代,这对人们来说是非常有价值的。
是的,我认为在初创公司,存在这种压力。你必须做到。人们投入时间确实很重要,但这真的很困难,因为你必须不断地交付。我曾在一家初创公司工作过。我过得很开心,但我不知道我是否能永远这样。这是一个有趣的节奏,就像我们一开始谈到的那样。这些模型正在相互超越,并且与竞争对手相比,它们只是不断尝试迈出下一步。现在简直就是无情。
我认为这种跨越式的性质和拥有多个参与者实际上是语言建模进步的一个被低估的驱动力,因为竞争是如此根深蒂固。这些公司有意创造了非常强大的文化。例如,Anthropic 以其在文化上的坚定承诺和组织而闻名。我们很少听到他们的消息,但 Anthropic 的每个人似乎都非常一致。生活在一个非常紧张的文化中,并且拥有这种竞争动力,会让你努力工作并创造出更好的东西。
但这是以人力资本为代价的。你只能这样做这么长时间,人们肯定会精疲力尽。我写了一篇关于职业倦怠的文章,因为我自己也曾经历过这种情况,尤其是在进行全模式培训时试图成为一名经理。这是一项疯狂的工作。在《苹果在中国》一书中,帕特里克·麦吉谈到了苹果工程师在中国建立供应链的努力。他提到他们有“拯救婚姻”计划,他在播客中说,人们会因为这种程度的努力工作而死亡。这是一个以人力成本为基础创造进步的完美环境。人力成本是我们开始时的 996,人们确实很辛苦。
我也读过这本书。我认为他们有一个暗号,表示如果有人必须回家与家人共度时光以挽救婚姻。然后同事们说:“好吧,这是针对这种情况的红色警报。我们必须让那个人这个周末回家。”但与此同时,我不认为他们是被迫工作的。他们对产品充满热情,以至于你会陷入这种心态。作为一名学者和一个独立的人,我有时会遇到这种情况。我工作过度,这不健康。我有背部和颈部问题,因为我没有得到应有的休息。但这并不是因为有人强迫我;而是因为有人强迫我。这是因为我想工作,因为它是令人兴奋的事情。
OpenAI 和 Anthropic 就是这样的。他们想做这项工作。
硅谷泡沫
是的,但也有一种与规模法则理念相一致的热情正在兴起,尤其是在硅谷。有这样一种炒作,世界将在几周内发生转变,而你想成为其中的中心。我很幸运能够与各种各样的人进行对话,并且我可以看到世界各地的所有这些气泡和回声室。看看我们人类如何形成它们是很有趣的。我认为可以公平地说,硅谷是一种回音室、一种筒仓和泡沫。我认为气泡实际上非常有用且有效。这不一定是一件坏事,因为你可以非常高效。
这可能是史蒂夫·乔布斯的现实扭曲场,因为你只要让对方相信突破即将到来,通过让对方相信这一点,你就能让突破迫在眉睫。
布莱恩·霍巴特写了一本对气泡进行分类的书。其中之一是金融泡沫,它涉及投机,是不好的;另一个是有效的扩建,因为它推动人们建造。我确实认为人工智能参与其中,但我担心它会转变为金融泡沫。
是的,但在思想空间中,泡沫创造了现实扭曲场。这意味着你偏离了现实,如果你在工作996的同时走得太远,你可能会错过人类经验的一些基本方面。这是硅谷的一个普遍问题。这是一个非常特殊的地理区域。您可能不了解中西部的观点或美国和世界各地所有其他不同人类的经历。你们以某种方式向对方说话,并让对方相信某件事,这可能会让你们陷入真正的麻烦。
无论人工智能是否取得巨大成功并成为一项强大的技术,无论在哪一条轨迹上,你都可能会给自己带来麻烦。所以你必须考虑所有这些。你是一个年轻人,正在努力决定自己的人生目标。
有件事我其实也不完全理解:旧金山 AI 圈的梗已经发展到“永久下层阶级”这种说法。它暗示 2025 年最后六个月是 AI 初创公司或模型建立持久价值的唯一窗口,否则价值都会被既有公司拿走,而你会永远落后。这就是旧金山 AI 叙事的一个例子。尽管如此,对于真正想在 AI 领域产生影响的年轻人,旧金山仍然可能是机会密度最高的地方,只是它也有明显的副作用。
我认为旧金山是一个令人难以置信的地方,但有一点泡沫。如果你进入了那个非常有价值的泡沫,那就也退出吧。阅读历史书、阅读文学作品、参观世界其他地方。 X 和 Substack 并不是整个世界。
我想我会说,与我一起工作的一个人要搬到旧金山,我需要给他一份《女巫季节》的副本。这是一部从 1960 年到 1985 年的科幻史,经历了嬉皮士革命、城市文化的兴起、艾滋病毒/艾滋病危机等等。那是最近的事情,有那么多的动荡和伤害,但也有旧金山的爱。没有人知道这件事。这是一本很棒的书,《女巫的季节》;我推荐它。我的一群出去玩的旧金山朋友向我推荐了它。我住在那里,我并不欣赏这种环境,而且它只是最近的事。
文本扩散模型与其他研究方向
是的。好吧,让我们……我们谈论了很多事情,当然还有去年令人兴奋的事情。但今年,你们提到的令人兴奋的事情之一是文本传播模型的扩展以及对文本传播的不同探索。您能谈谈这是什么以及它有哪些可能性吗?那么,与当前的 LM 相比,有哪些不同的方法呢?
是的,所以我们具体讨论了 Transformer 架构和自回归 Transformer 架构,例如 GPT。这并不意味着没有其他人在做其他事情。人们总是在寻找下一件大事,因为我认为不这样做几乎是愚蠢的。当然,现在Transformer架构是最流行的,而且效果最好,但不要把所有鸡蛋都放在一个篮子里总是一个好主意。人们正在开发自回归Transformer的替代品。例如,其中之一是文本传播模型。
听众可能会从图像生成中了解扩散模型,例如稳定扩散(Stable Diffusion)使其普及。当时,人们使用 GAN(生成对抗网络)。然后是一个扩散过程,您可以迭代地对图像进行去噪,随着时间的推移,这会产生质量非常好的图像。其他公司建立了自己的扩散模型。现在人们会说,“好吧,我们可以在文本上也尝试一下吗?”它还没有直观意义,因为感觉它不是像像素那样连续的东西,我们可以区分。它是离散文本,那么我们如何实现去噪过程呢?
但它有点类似于Google的 BERT 模型。当你回到原来的Transformer时,有编码器和解码器。解码器就是我们现在在 GPT 等中使用的解码器。编码器更像是一种并行技术,其中您有多个并行填充的token。 GPT 模型一次执行一个token的自回归完成。在 BERT 模型中,你有一个有间隙的句子——你将它们屏蔽掉——然后一次迭代会填补这些间隙。
文本扩散有点像这样,您从一些随机文本开始,然后填充缺失的部分或通过多次迭代迭代地完善它们。这里很酷的一点是,它可以同时处理多个token,因此有望提高效率。当然,现在的权衡是质量有多好?它可能会更快,但是您执行的降噪步骤越多,文本就会变得越好。人们试图看看这是否是自回归模型的有效替代方案,能够以更少的计算量提供相同的质量。
目前,有论文表明,如果你想获得相同的质量,你必须加快去噪步骤,然后你最终会花费与自回归模型相同的计算量。另一个缺点是,虽然它是并行的,但有些任务不是并行的。对于推理任务或工具使用,你必须要求代码解释器给你一个中间结果,扩散模型有点棘手。所以有一些混合体。但主要思想是我们如何并行化它。这是一条有趣的途径。我认为现在主要有研究模型,比如 LaMDA 和其他一些模型。
我看到了一些初创公司的模型,一些已部署的模型,但目前还没有像 Gemini 或 ChatGPT 那样的大规模扩散模型。但Google宣布,他们正在推出 Gemini Diffusion,并将其置于 Nano 2 模型的背景下。他们表示,对于大多数基准测试的相同质量,我们可以更快地生成东西。我不认为文本扩散模型会取代自回归大语言模型,但它将适合快速、廉价、大规模的任务。也许未来的免费套餐也会是这样的。
我认为有几个实际开始使用它的例子。举一个例子来说明为什么这样做要好得多:当像 GPT-5 这样的模型需要时间响应时,它一次生成一个token。这种扩散的想法本质上是在一批完成中生成所有这些token,这就是为什么它可以更快。
文本扩散模型与其他研究方向(续)
我听到的初创公司都是代码初创公司,你有一个代码库,有人在有效地进行氛围编码。他们说,“进行此更改”,代码差异本质上是模型的巨大回复。它不必有那么多的外部背景,并且您可以通过使用这些扩散模型快速获得它。他们使用文本扩散来生成非常长的差异,因为使用自回归模型执行此操作需要几分钟,而这段时间会导致面向用户的产品产生大量流失。每一秒,你都会失去用户。所以我认为这将会是——
-增长并拥有一些应用程序,但我实际上认为不同类型的模型将比以前更快地用于不同的事情。我认为工具使用点是阻止它们成为最通用用途的地方,因为使用 Claude Code 或 ChatGPT 等带有搜索功能的工具,自回归链会被外部工具打断,而我不知道如何通过扩散设置来做到这一点。
工具使用
那么今年和未来几年工具使用的未来是什么?您认为那里会有很多发展吗?如何将其集成到整个堆栈中?
我确实认为现在主要是在专有的大语言模型方面,但我们会在开源工具中看到更多这样的情况。这是一个巨大的解锁,因为这样你就可以真正将某些任务从仅仅记忆外包到实际计算——你知道,大语言模型不必记住23加5,只需使用计算器即可。
那么你认为这可以帮助解决幻觉吗?
不是解决它,而是减少它。尽管如此,大语言模型仍需要知道何时请求工具调用。其次,这并不意味着互联网总是正确的。您可以在网络上搜索 1998 年世界杯冠军是谁,但仍然需要找到正确的网站并获取正确的信息。您仍然可以访问不正确的网站并获取不正确的信息。我不认为它会完全解决这个问题,但它正在改善。今年早些时候还有另一篇很酷的论文——我认为那是 12 月 31 日,所以技术上不是 2026 年,但也很接近——关于递归语言模型。
这是一个很酷的想法,可以更进一步。 Nathan,您之前提到过,由于计算预算的原因,在学术界进行出色的研究变得更加困难。如果我没记错的话,他们所做的一切都是 GPT-5,所以他们甚至没有使用本地模型。但我们的想法是,对于一个长上下文任务,不是让大语言模型一次性或一连串地解决所有问题,而是将其分解为子任务。你让 LLM 决定什么是好的子任务,然后递归调用 LLM 来解决这个问题。
然后添加工具——你知道,每个子任务可能会访问网络并收集信息,然后最后将它们整合在一起。我认为使用类似的东西会有很多解锁,你不一定要改进LLM本身,你可以改进LLM的使用方式和它可以使用的内容。目前使用工具的一个缺点是您必须授予大语言模型使用工具的权限。这需要一些信任,特别是如果你想解锁一些东西,比如让大语言模型为你回复电子邮件,或者只是对它们进行排序。我不知道今天是否允许大语言模型访问我的电子邮件,对吧?我的意思是,这是一个巨大的风险。
我认为关于工具使用的问题还有最后一点。您暗示了这一点,我们都以自己的方式解决了这一问题:开放模型与封闭模型以非常不同的方式使用工具。有了开放模型,人们就会去 Hugging Face 并下载模型,然后人们会问:“我想要什么工具?”也许 X.ai 是我首选的搜索提供商,但其他人可能会关心不同的搜索初创公司。当你发布一个模型时,它需要对多种工具有用,这真的很困难,因为你正在制作一个通用推理引擎,而这实际上正是 gpt-oss-120b 的优点。
但在封闭模型上,您正在将特定工具深入集成到您的体验中。我认为开放模型将很难复制我喜欢用封闭模型做的一些事情,在封闭模型中你可以参考公共和私人信息的混合。我每三到六个月就会尝试一次 Web 上的 Codex,它只是提示模型对我拥有的某些 GitHub 存储库进行更新。
这套安全的云环境非常适合将其发送出去做这件事,然后再回到我身边。这可能有助于定义一些本地开放和封闭的利基市场。由于急于让工具使用发挥作用,开放模型处于不利地位,这是不可避免的。这些前沿实验室中有很多资源,但是当开放模型解决这个问题时会很有趣,因为这将需要一个更灵活的模型,可以与这种递归思想一起工作,成为一个协调器。希望必要性能够推动那里的创新。
持续学习
所以,持续学习——这是一个长期存在的话题,也是一个重要的问题。我认为随着训练模型成本的上升,这一点变得越来越重要。那么您能解释一下什么是持续学习以及今年和未来几年取得进步的重要性吗?
这与这种科幻时代精神有很大关系:什么是 AGI(通用人工智能),什么是 ASI(人工超级智能)?我们今天拥有的语言模型能够做什么?我认为语言模型可以解决很多任务,但人工智能社区的一个关键里程碑是人工智能何时可以取代任何远程工作者,接收信息并解决数字任务。局限性在于语言模型不会像员工那样从反馈中学习。如果你雇用一名编辑,他们可能会搞砸,但你会告诉他们,他们就不会再这样做了。
但语言模型不具备自我修改和快速学习的能力。我们的想法是,如果我们想要获得真正的、通用的、可适应任何远程工作场景的智能,它需要能够从反馈和在职学习中快速学习。我个人更看好语言模型能够提供非常好的上下文。你可以写大量的文档,说:“我有所有这些信息。这是我写过的所有博客文章。我喜欢这种类型的写作;我的声音就是基于此。”但很多人不向模特提供这一点。
智能体模型才刚刚开始。所以这是一种权衡:我们是否需要通过持续学习来更新该模型的权重,以使它们学习得更快?或者,反驳是我们只需要为他们提供更多的背景和信息,他们就会因为拥有大量的背景并且非常聪明而显得学习速度很快。
所以我们应该在这里提到术语。持续学习是指不断改变权重,使模型根据新输入的信息进行适应和调整,并且持续、快速、频繁地进行。然后你在另一面提到的东西通常被称为情境学习。当你学习东西时,有一个巨大的上下文窗口。每次提示系统时,您都可以继续加载额外的信息,我认为这两者都可以合理地视为学习。这只是您学习的不同地方。
我认为,老实说,持续学习——权重更新——我们已经有了不同的风格。我认为这里的区别是:你是在每个人的个性化定制模型上这样做,还是在全球模型规模上这样做?我认为我们已经从 GPT-5 升级到 5.1 和 5.2。这可能不是立竿见影的,但它就像一个快速策划的更新,社区针对他们无法做的事情提供了反馈。他们更新了权重,发布了下一个模型,等等。所以这是一种味道。另一个更细粒度的例子是 RLVR;你运行它,它就会更新。
问题是你不能只对每个人这样做,因为更新每个人的权重成本太高。即使在 OpenAI 规模上,建设数据中心也太昂贵了。我认为只有当你的设备上有一些东西并且成本由消费者承担时,这才是可行的。就像苹果试图对苹果智能模型所做的那样,将它们放在手机上,以便他们从体验中学习。
有点相关的话题,但是这种——也许是拟人化的术语——记忆。您越来越多地看到,对于如何向这些系统添加内存的机制有哪些不同的想法?特别是个性化记忆?
持续学习(续)
现在,它就像上下文一样——将事物填充到上下文中,然后回忆起来。但同样,它很昂贵,因为即使你缓存它,你也要花费token。第二个是你只能做这么多。我认为这更像是一种偏好或风格。很多人在解决数学问题时都会这样做。你可以添加以前的知识,但你也可以给它一些偏好提示,比如“做我上次喜欢做的事”。但它并没有解锁新的功能。为此,人们仍在使用的一件事是 LoRA 适配器。
这些基本上不是更新整个权重矩阵,而是并行或叠加的两个较小的权重矩阵,例如增量。但你可以在某种程度上做到这一点,话又说回来,这是经济学。例如,也有论文表明 LoRA 学到的东西更少,但忘记的东西也更少。天下没有免费的午餐。如果你想了解更多,你需要使用更多的重量,但它会变得更昂贵。如果你学得越多,你就会忘记更多;你必须找到那个金发姑娘区。
我们并没有真正提到太多,但本次讨论中也暗示了上下文长度。那里有很多可能的创新吗?
长上下文
普遍看法是,长上下文主要受算力和数据约束,也会受到注意力变体等架构细节影响。我们提到的混合注意力模型,相当于在 Transformer 中加入类似状态空间模型的结构,它们在处理很远的 token 时更省计算。但这种能力并非免费,仍需要大量算力和合适数据。现实中有多少 10 万 token 的序列、又从哪里获得?把它们规模化训练最终会非常昂贵。
输入上下文长度很快已经达到一百万 token。我预计今年会继续增长到两百万或五百万,但不会直接跃升到一亿;那需要真正的突破。持续学习可能出现新的研究突破,让 Transformer 更便宜、更擅长处理超长上下文。若没有这种突破,按现有路径持续工程优化,能力仍会稳步增长。
我认为从极端情况来看,天下没有免费的午餐。为了降低成本,一种极端的做法是使用一个 RNN,它只有一个状态,可以保存之前的所有内容。它是一个特定的固定大小的东西,所以你永远不会真正增加内存。你把所有东西都塞进一种状态,但是上下文越长,你忘记的信息就越多,因为你无法将所有东西压缩到一种状态。另一方面,你有Transformer,它会尝试记住每个token。如果您想查找特定信息,这很好,但非常昂贵,因为您有 KV 缓存和不断增长的点积。
不过,Mamba 层也有类似问题:像 RNN 一样,它会把信息压缩进有限状态,只是选择性更强。NVIDIA Nemotron 3 展示了一个“Goldilocks 区间”:在能访问全局信息的注意力层,与便宜的压缩状态层之间找到合适比例。未来的规模化,很可能来自在运行成本与有效能力之间找到更好的平衡。
再推荐一篇论文:Recursive Language Models,它试图解决长上下文问题。核心发现是,与其把所有内容塞进一个巨大上下文,不如拆成多个较小任务;这样既节省内存,准确率还可能高于让大语言模型一次处理全部内容。这是一种新范式,未来可能出现更多变体。长上下文仍会进步,但正如 Nathan 所说,预训练阶段可用的长文档远少于普通文档,因此研究模型在这一尺度上的行为更困难。
有一些经验法则,本质上是预训练语言模型,例如 OLMo,我们以 8K 上下文长度进行预训练,然后通过训练扩展到 32K。根据经验,将训练上下文长度加倍大约需要 2 倍的计算量,然后通常可以再次将上下文长度增加 2 到 4 倍。我认为其中很多最终都会在预训练时受到计算限制。每个人都在谈论今年顶级实验室的计算量的大幅增长,这应该反映在一些更长的上下文窗口中。
但我认为在后训练方面,还有一些更有趣的事情。由于我们有智能体,智能体将自行管理此上下文。现在,使用 Claude Code 的人非常害怕压缩,即 Claude 获取全部 100,000 个工作token并将其压缩到项目符号列表中。但下一个模型将要做的是——我确信人们已经在研究这个——模型可以控制何时以及如何压缩。所以你基本上可以训练你的强化学习算法,其中压缩是一个动作,
它缩短了历史。那么问题的表述将是:“我想在模型将其历史压缩到最小长度的同时保持最大评估分数。”因为这样你就拥有了进行这种复合自回归预测所需的最少量的token。实际上,这里有非常好的问题设置,这些智能体模型学习以不同的方式使用它们的上下文,而不仅仅是向前推进。
长上下文(续)
最近一个有趣的例子是 DeepSeek-V3.2,其中他们有一个稀疏注意力机制和一个非常高效、小型、轻量级的索引器。它不会关注所有token,而是选择我实际需要的token。这几乎回到了最初的注意力概念,你是有选择性的,但注意力总是存在的;你可能对其中一些的权重为零,但你会使用它们。但他们更像是,“好吧,让我们掩盖这一点,或者干脆不这样做。”即使 OLMo 中有滑动窗口注意力,这也有点像那个想法。你有一个固定的滚动窗口,因为你并不总是需要一切。
有时,在某些层中你可能会这样做,但这很浪费。但现在,我认为如果你使用一切,你就安全了;它为您带来最大的性价比,因为您永远不会错过任何信息。现在,我认为今年也将是弄清楚如何在这方面变得更聪明的一年,就像你说的那样。现在人们想要拥有下一个最先进的技术,而最先进的技术恰好是蛮力、昂贵的东西。一旦你有了这个,就像你说的,你想保持这种准确性,但看看我们现在如何使用技巧更便宜地做到这一点。
是的,所有这些缩放的事情。就像我们首先获得 Claude 4.5 Sonnet 模型的原因一样,因为您可以更快地训练它,并且不会很快遇到这些计算墙。他们可以尝试更多的事情并更快地得到模型,即使更大的模型实际上更好。
机器人
我认为我们应该说人工智能领域正在发生很多令人兴奋的事情。我最近的注意力非常集中在机器人技术上,所以今天我们几乎完全不谈论机器人技术。关于图像生成和视频生成有很多内容。我认为可以公平地说,就强度和热情而言,最令人兴奋的研究工作是在大语言模型领域,这就是为什么我认为我们有理由专注于我们正在讨论的大语言模型。但最好引入某些可能有用的东西。例如,世界模型——人们对此越来越兴奋。您认为明年 LLM 领域的世界模型会有什么用处吗?
另外,对于大语言模型来说,有趣的是,我认为如果我们解锁更多大语言模型功能,它也会自动解锁所有其他领域,因为它会使进展更快。因为,你知道,很多研究人员和工程师都使用大语言模型编程。因此,即使他们研究机器人技术,如果你优化这些有助于编码的大语言模型,也会得到回报。但是,是的,世界模型很有趣。基本上,你可以让模型运行对世界的模拟——就像真实事物的小玩具版本——它可以解锁大语言模型不知道的数据等功能。它可以模拟事物。我认为大语言模型恰好可以通过预训练和下一个token预测来很好地发挥作用,但我们可以用更复杂的方式来做到这一点。
我认为 Meta 曾发表过一篇论文,名为“Coder World Models”。他们基本上将世界模型的概念应用于大语言模型,他们不仅通过下一个token预测和可验证的奖励来检查答案的正确性,还确保中间变量是正确的。该模型基本上是学习代码环境。我认为这很有道理;只是做起来很昂贵。但它通过对整个过程(而不仅仅是结果)进行建模,使事情变得更加复杂,并且可以增加更多价值。
我记得当我还是一名研究生时,有一个名为 CASP 的竞赛,他们进行蛋白质结构预测。他们预测了尚未解决的蛋白质结构。从某种意义上说,这实际上很棒,我认为大语言模型也需要类似的东西,你可以进行基准测试,但没有人知道解决方案,直到有人在事后揭示它。当 AlphaFold 出现时,它打破了这一基准。我的意思是有多次迭代,但我记得第一次明确地模拟了物理相互作用和分子的物理学。
还有一些不可能的角度之类的事情。然后在下一个版本中,我认为他们摆脱了这个,只是使用蛮力,扩大规模。我认为对于大语言模型来说,我们目前正处于这种强力扩展的状态,因为它恰好起作用,但我确实认为在某些时候恢复这种方法可能是有意义的。我认为对于世界模型来说,这实际上可能非常酷。当然,对于机器人技术来说,这与大语言模型完全相关。
是的,机器人技术非常明确。存在运动或操纵的问题。运动问题得到了更多解决,尤其是在学习领域。但它有很多价值,就像最初的蛋白质折叠系统一样……引入传统的基于模型的方法。因此,你不太可能端到端地学习操纵或全身局部操纵问题。这就是梦想。但当你看到人手的魔力……以及现实世界的复杂性时,你就会意识到,从头到尾学习这一点真的很难——……我猜 AlphaFold 2 没有这样做。
机器人(续)
我对机器人学习很兴奋。围绕语言模型形成的关注和投资,也共同推动了这个领域。训练 Transformer 的基础设施正在成为一种通用、世界级的工业建模工具;机器人领域过去受到的许多限制,如今都缓解了,算力也更多。研究者可以把语言模型作为中心模块,再围绕已经有效的能力进行探索。我看到的趋势有点像 Hugging Face Transformers 与 Hugging Face 生态在语言模型领域扮演的角色。
我想当我在 Hugging Face 的时候,我就试图让这一切发生,但还为时过早。 Hugging Face 上的这些开放机器人模型使人们能够贡献数据并对其进行微调。我认为现在我们已经更接近了,因为对机器人和自动驾驶汽车的投资是相关的并且能够实现这一点。一旦你达到了拥有这种生态系统的地步,有人就可以下载机器人模型并将其微调到他们的机器人或在世界各地共享数据集。这个领域有一些工作,比如几年前的 RTX,人们就开始这样做了。但一旦他们拥有了这个生态系统,它看起来就会非常不同。然后整个 ChatGPT 后的繁荣正在投入更多的资源,我认为这是一个非常好的研究领域。
这也导致了更好、更准确、更真实的模拟器的诞生,缩小了机器人领域中模拟与真实的差距。但你知道,你提到了很多兴奋和投资。其缺点是,在炒作周期中发生的——我个人认为,大多数机器人技术人员也相信——是机器人技术不会在隐含或明确承诺的时间范围内得到解决。那么,当所有这些机器人公司如雨后春笋般涌现,但他们却没有有效的产品时,会发生什么呢?然后就会出现令人兴奋的崩溃,这令人伤脑筋。希望其他东西会突然出现,以便其中一些想法能够继续发展。
我认为这也与持续学习的问题有关。现实世界是如此复杂,而对于大语言模型来说,你真的不需要为用户学习一些东西,因为每个人都必须做很多事情——每个人可能都想在他们的电子邮件或代码中修复他们的语法。它受到更多限制,因此您可以为此准备模型。但为现实世界准备一个机器人却更困难。你有机器人基础模型,你可以学习诸如抓取之类的东西,但每个房子都是不同的。它是如此不同,以至于机器人本质上必须在工作中学习。我认为这就是现在的瓶颈:即时定制。
我认为我不能低估机器人技术人员或任何人几乎根本没有谈论过的事情的重要性,那就是安全。我们谈论的有关学习的所有有趣的复杂性、所有的失败模式和失败案例——我们与大语言模型谈论的所有事情,有时会以有趣的方式失败——所有这些都是大语言模型领域的乐趣和游戏。在机器人领域,在人们的家中,经过数百万分钟和数十亿次的互动,你几乎可以永远不会失败。当你在现实世界中部署具体系统时,你只需要解决许多你在考虑一般机器人学习问题时从未想过必须解决的问题。
机器人(续)
我非常不看好面向普通消费者购买的家用学习型机器人,但很看好自动驾驶和工业机器人自动化,例如 Amazon 新建的配送中心从一开始就优先为机器人而不是人类设计。AI 圈对人工智能推动自动化抱有很高期待——
......以及大规模制造,我确实认为机器人这样做的路径更合理。它的设计和优化是为了完成人类可以做但不想做的重复性任务。但这也将比人们预计的时间要长得多。我认为,由于我们拥有巨大的人工智能优势,从人工智能奇点到扩大美国大规模制造的飞跃受到许多政治和其他挑战性问题的困扰。
AGI 时间线
让我们具体谈谈时间表:AGI 或 ASI 的时间表。作为一个起点,说没有人真正同意 AGI 和 ASI 的定义是否公平?
我认为存在很多分歧,但我一直受到反对,人们说这是可以复制大多数数字经济工作的东西。远程工作者是一个相当合理的例子。我认为 OpenAI 的定义在某种程度上与此相关——一种可以完成一定数量的具有经济价值的任务的人工智能——我不太喜欢这个定义,但它可能是一个基础点。如今的语言模型虽然非常强大,但并不是远程工作者的替代品。人工智能可以做的一些事情比远程工作要困难得多,比如解决......
......发现一个你甚至无法假设的意想不到的科学发现,这将是人们所谓的人工超级智能问题的一个例子。或者查看所有医疗记录并找到人们不知道的某些疾病之间的联系,或者找出某种常见药物可以治疗某种特定的癌症。他们会说这是超级智能。所以这些都是自然的层次。我的问题是,它与对人工智能和这些宗教方面意义的追求深深地交织在一起。您可以采取不同的路径。
我什至不知道远程工作是否是一个好的定义。我喜欢最初标题为 AI2027 的报告。他们更注重代码和研究品味,因此目标是超人编码员。他们有几个里程碑式的系统:超人编码员、超人人工智能研究员、超级智能人工智能研究员,然后是完整的 ASI。当你开发出超人编码员后,其他一切都会很快发生。任务是拥有完全自主、自动化的编码,因此您为了进行研究而需要执行的任何类型的编码都是完全自动化的。
从那时起,人类将与该系统一起进行人工智能研究,他们将很快能够开发出一个真正可以为您进行研究的系统。这就是这个想法。最初,他们的预测是 2027 年或 28 年,现在他们将预测推迟了三到四年,即 2031 年。我的预测甚至可能会超过 2031 年,但至少你可以具体思考完全自动化编程有多困难。
是的,我不同意他们关于事情如何发展的一些假设和动态,但我认为他们在定义具体的里程碑来讲述一个有用的故事方面做得很好。这就是为什么这份《AI 2027》文件的影响力远远超出了硅谷——因为他们讲述了一个好故事并做了很多严谨的工作。
我认为我属于的阵营是人工智能是所谓的锯齿状,它在某些事情上表现出色,但在某些事情上却很糟糕。我认为,当他们接近这位自动化软件工程师时,他们所擅长的是传统的机器学习系统和前端——该模型在这些方面非常出色——但分布式机器学习,这些模型实际上非常糟糕,因为进行大规模分布式学习之类的训练数据太少了。这是我们已经看到的,而且我认为这种情况只会被放大。然后这些权衡就有点混乱了,还有你认为人工智能研究是如何运作的等等。
所以你认为基本上一个超人编码员几乎是无法实现的意思,因为事情的锯齿状本质,你总是会在能力上存在差距?
AGI 时间线(续)
我觉得有些说法把“完整性”过早地赋予了模型。模型在某些代码任务上已经超越人类,而且这种趋势会继续;人类也很有创造力,会利用这些强项弥补模型弱点,从而快速推进。很长一段时间里,人与模型之间都会保持这种配合:人类补上模型还做不到的部分,而最优秀的 AI 研究者,正是最会把这种超能力释放出来的人。
从我们已经看到的能力看,这条边界还会继续移动。用 Claude Code,几小时内就能搭起一个漂亮网站或完成数据分析,而且这些能力会不断提升,我们也会在过程中学到新的编程技能。联系大型科技公司的投入来看,《AI 2027》更偏向奇点叙事;但我认为研究本身混乱、社会化,而且大量关键信息存在于模型难以处理的数据和互动中。尽管如此,今天的系统已经非常强大,科技公司也集体投入了数百亿美元,所以我们肯定会得到更强的 ChatGPT 和 Claude Code。
很难预测这条路最终通向哪里,但未来图景足够清晰,才会让世界上最有影响力的人投入如此多资金。我们甚至还不知道“更好的 ChatGPT”具体意味着什么,更不知道它能否自动化 AI 研究。至少在这个时间尺度上,我认为还不能。大型科技公司花掉 1000 亿美元的速度,很可能会快于我们得到一个能触发 AI 研究奇点的自动化 AI 研究员。
所以,如果“自动化 AI 研究员”算一个有意义的里程碑,你的预测是它还要十年以上?
在软件开发上,我认为会少于十年;但在真正的科研活动上,可能会更久。
好吧,我们只是为了好玩,尝试想象一个所有软件编写都是完全自动化的世界。你能想象那个世界吗?
到今年年底,自动化的软件数量将会非常多。但如果你尝试使用 RL 训练模型,你需要让多个 GPU 相互通信。这仍然会很困难,但我认为会容易得多。
理解编程完全自动化的一种方式,是比较“产出的有效代码量”和“参与其中的人类数量”。很长一段时间里,软件开发仍会有人在环,只是相对于代码总量,人会越来越少。所谓超人程序员,隐含的极端假设是人类参与者趋近于零。那么,当参与者只剩几百人,而不是几十万人时,世界会是什么样?
我认为软件工程会更多转向系统设计和结果目标。过去几周里,舆论从“智能体有点糟糕”迅速转向软件工业化:任何人都可以创建软件。真正重要的是,人们需要理解系统如何工作,并学会引导模型,才能从语言模型中获得最好的结果。我们很难真正接受软件开发会发生多大变化,以及未来会有多少人无需查看代码就能完成工作。
AI 会取代程序员吗
我认为有趣的是思考这些系统是否是独立的,从某种意义上说,虽然我毫不怀疑大语言模型将在某种程度上以计算器解决计算的方式解决编码问题,对吗?在某种程度上,人类开发了一种工具,你永远不需要人类来计算这个数字;你只要输入它,它就是一个算法。我认为编码可能也是如此。但问题不是......我认为会发生的事情是你只会说,“建立那个网站”,它将成为一个非常好的网站,然后你可能会完善它。但它会独立做事吗……
还会有人要求人工智能做某事吗?就像有人会说,“建立那个网站吗?”或者是否会有人工智能只构建网站或其他什么东西?
我认为谈论建立网站是——
太简单了。
是的。当然。
只是网站的问题和网络的问题,你知道,HTML 和所有类似的东西,它非常有弹性。它会告诉你坡度。它擅长显示坡度。我更愿意考虑安全关键系统,比如要求人工智能端到端地生成一些东西来管理物流——或者管理汽车——车队,诸如此类的东西。所以它会端到端地为你生成它。
我认为一个更中间的例子是 Slack 或 Microsoft Word 之类的东西。我认为如果组织允许的话,人工智能可以很容易地实现端到端的功能,并为你想要尝试的事情做得相当好。你想在 Slack 中添加一个你想要使用的新选项卡,我认为人工智能能够很好地做到这一点。
事实上,这是一个很好的例子。我们距离这个目标还有多远?
就像今年一样。
瞧,我不知道。我不知道。
我想我不知道 - 生产代码库有多糟糕,但我认为在......大约几年内,很多人将被推向设计师和产品经理,你有多个这样的智能体可以为你尝试一些东西,他们可能需要一到两天的时间来实现一个功能或尝试修复一个错误。你有这些仪表板——我认为 Slack 实际上是一个很好的仪表板——你的智能体会在其中与你交谈,然后你会提供反馈。但是,就像我制作了一个网站,然后“你想制作一个还过得去的徽标吗?”我认为这些有凝聚力的设计和风格对于模特来说会非常困难,很难决定下一步要添加什么。
我只是……好吧。所以我和很多程序员一起出去玩,他们中的一些人总体上有点怀疑——这就是氛围。我只是认为向复杂系统添加功能涉及很多复杂性。就像,如果你看看浏览器,Chrome。如果我想添加一个功能,如果我想要有选项卡而不是顶部,我希望它们位于左侧。接口,对吗?我认为我们不是……这不是明年的事情。
今年的 Claude 版本之一,他们的测试之一是我们给它一个软件,然后让 Claude 运行来完全重新创建它,它几乎已经可以从头开始重建 Slack,只需给定软件的参数并留在沙箱环境中即可做到这一点。
所以从头开始的部分,我几乎更喜欢。
因此,规模较小、较新的公司可能具有优势,他们会说,“我们不需要臃肿和复杂,因此这个功能就存在。”
AI 会取代程序员吗(续)
我认为这已经到了你提到的一些与你交谈的人持怀疑态度的地步,我认为这并不是因为大语言模型不能做 X、Y、Z。而是因为人们不希望它这样做。
其中一些可能是人类方面的技能问题。不幸的是,我们必须对自己诚实。其中一些可能是规格不足的问题。所以,编程……这就像人际关系和友谊中的沟通问题。你假设大语言模型应该以某种方式读懂你的想法。我认为这是规范驱动设计真正重要的地方。就像您一样,使用自然语言,指定您想要的内容。
我认为如果你与实验室的人交谈,他们会在他们的培训和生产代码中使用这些。 Claude Code 是用 Claude Code 构建的,他们都广泛使用了这些东西。而达里奥谈到了Claude的代码有多少……就好像这些人在能力上稍微领先一样——
大型企业在推理上的花费可能是我们的 10 到 100 倍,而我们只是每月 100 或 200 美元的普通订阅;它们会把资源充分用起来。一年前还没有 Claude Code,也没有真正成熟的推理模型。以目前的进步速度看,模型还有许多明显可修复的低垂果实。比如 Claude 连续 14 次尝试调用一条我根本没安装的 CLI 命令,哪怕我已经把正确命令发给它。从建模角度看,这类故障是可以解决的。
我同意你的看法。总的来说,我变得越来越乐观。就你所阐述的内容而言,我认为这是一个人的技能问题。因此,Anthropic 和其他公司在了解如何最好地使用模型进行编程方面处于领先地位。因此,他们正在有效地使用它们。我认为郊区有很多程序员不知道……我的意思是,没有关于如何使用它们的真正好的指南。人们试图准确地弄清楚这一点,但是——
它可能非常昂贵。其切入点可能是每月 2,000 美元,这只适合科技公司和富人。可能就是这样。
但这可能是值得的。如果最终结果是一个可以工作的软件系统,那么这可能是值得的。顺便说一句,有趣的是我们如何从对 AGI 时间线的讨论转向更务实和有用的东西。关于 AGI 和 ASI 的时间表,有什么具体和深刻的内容可以说吗?或者这些讨论是否有点脱离日常?
有一些有趣的赌注。有很多人尝试在真正的科学领域进行可验证奖励的强化学习(RLVR)。有些初创公司花费了数亿美元的资金,他们拥有湿实验室,在那里他们的语言模型提出了在现实世界中进行测试的假设。我想说他们还早,但随着进步的步伐——
——也许他们早了六个月并且成功了,因为他们先到了,或者也许他们早了八年。你真的不知道。因此,我认为,如果一家解决这个问题的初创公司在所有其他科学领域都发生了 AlphaFold 时刻,那么将这种势头扩展到其他科学领域的登月计划将具有很大的变革性。我认为有些初创公司——也许 Harmonic 就是其中之一——他们全力投入语言模型和精益数学。我想你最近有另一位播客嘉宾谈到了这个问题,就好像我们不知道在该模型上花费 1 亿美元会产生什么结果。
其中大多数都会失败,但其中一些可能是重大突破,与 ChatGPT 或 Claude Code 类型的软件体验截然不同。就像一个只对数学博士有用的工具,但却使他们的效率提高了 100 倍。
AI 会取代程序员吗(续)
我同意。我认为这会发生在很多领域,特别是那些拥有大量资源的领域,如金融、法律和制药公司。但话又说回来,这真的是AGI吗?因为我们再次专业化了。它真的与我们过去拥有专门算法的方式有很大不同吗?我认为这只是同一件事,但更复杂。我们称之为AGI有门槛吗?我认为真正酷的是我们拥有可以专门化的基础模型。这就是突破。
现在,我认为我们还没有做到这一点,因为首先,它太贵了,而且 ChatGPT 不只是放弃他们的模型来定制它。我可以想象一种商业模式,OpenAI 在某个时候会说:“嘿,美国银行,我们将花费 1 亿美元来打造您的定制模型。”我认为这将是巨大的经济附加值。但另一件事是,差异化因素是什么?如果每个人都使用 ChatGPT,他们都会做同样的事情。每个人都步调一致,但通常公司都希望拥有竞争优势。我认为没有办法使用他们的一些私人数据并尝试专业化。这会很有趣。
考虑到进展的速度,确实感觉事情即将到来。我不认为 AGI 和 ASI 阈值特别有用。
我认为真正的问题,这与远程工作者的事情有关,是我们什么时候才能看到经济影响的巨大而明显的飞跃?例如,因为目前 LLM 模式对经济的影响并没有出现明显的飞跃。除了 AGI 或 ASI 之外,还有一个真正的问题:我们何时会看到 GDP 跃升。跳。
是的,就像,GDP 由什么组成?很多是金融服务,所以我不知道这是什么。我很难想象 GDP 的增长,但我想说,当你不再需要查看代码时,软件开发就会以不同的方式变得有价值。所以,当Claude会让你成为一家小企业时——本质上Claude可以建立你的网站、你的银行账户、你的电子邮件和你的其他任何东西——而你只需要表达你想要向世界展示什么。这不仅仅是一个企业市场,而且很难。我不知道你如何让人们尝试这样做。我想如果 ChatGPT 能做到的话——人们正在尝试 ChatGPT。
我认为这可以归结为一个科学问题:“使用工具来解决问题有多难?”因为你所暗示的很多东西,远程工作的东西,都是工具的使用。就像电脑的使用一样;你如何拥有一个大语言模型,在这个智能体系统中,在世界上做一些事情,并且只有 1% 的时间搞砸。
计算机的使用是实验室关心的一个很好的例子,但我们还没有看到很多进展。
或者更少。
我们在 2025 年看到了多个演示,比如 Claude 可以使用你的计算机,或者 OpenAI 有操作员,但它们都很糟糕。所以他们在这方面投入了资金,我认为这将是一个很好的例子。然而实际上,接管整个屏幕似乎比拥有可以在后端调用的 API 困难得多。其中一些是你必须为他们所有人设置一个不同的工作环境。他们不是在你的 MacBook 上工作;而是在你的 MacBook 上工作。他们单独与Google、亚马逊和 Slack 进行交互,并且他们处理所有这些事情的方式与人类截然不同。所以其中一些可能是结构性阻碍。
另外,就规范而言,我认为任意任务的问题在于您仍然必须指定您希望大语言模型做什么。环境如何?你如何指定?你可以说出最终目标是什么,但如果它不能解决最终目标——对于大语言模型,如果你要求它提供文本,它总是可以澄清或执行子步骤。您如何将这些信息输入到为您预订旅行的系统中?你可以说,“好吧,你搞砸了我的信用卡信息”,但即使要达到这一点,作为用户,你如何在模型尝试之前指导模型呢?我觉得这个界面真的很难。
AI 会取代程序员吗(续)
是的,它必须特别了解你的很多信息。这需要不断学习——了解整个过程中所犯的一般错误,以及你自己所犯的错误。
所有人工智能界面都被设置为要求人类输入。我想我们谈论了很多Claude·科德。它询问反馈和问题。如果它对你的计划或愿望没有足够的说明,它就会开始问问题,“你愿意吗?”我们讨论了内存,它可以跨聊天保存。它的第一个实现有点奇怪,它会在聊天中提到我的狗的名字或其他东西。我说,“你不需要对此表现得含糊其辞。我不在乎。”但事情正在出现,比如 ChatGPT 具有 Pulse 功能。
这就像几个精心策划的段落,其中包含一些可供查看或讨论的链接,人们会谈论语言模型将如何向您提出问题。它可能会起作用。语言模型知道你预约了医生或其他什么,就像,“嘿,那之后你感觉怎么样?”这又进入了人类非常容易受到这种影响的领域,并且即将发生很多社会变革。而且,他们正在尝试让模型参与进来。有些人真的很喜欢这个 Pulse 功能,它可以处理您的聊天并自动搜索信息并将其放入 ChatGPT 应用程序中。所以会有很多事情发生。
我以前用过这个功能,但总感觉不好,因为它每天都这样,我很少去查看。你知道在我根本不看的东西上消耗了多少计算量吗?
世界上还有很多闲置计算,所以不要感觉太糟糕。
好的。您认为可能需要新的想法吗?通向 AGI 的道路(无论是什么,无论我们如何定义)是否有可能解决更普遍的计算机使用问题,解决生物学、化学和物理问题,有点像达里奥对 AGI 或强大人工智能的定义?您认为可能需要全新的想法吗?非大语言模型、非强化学习的想法。它们可能是什么样子?我们现在要稍微进入哲学领域。
对于像奇点这样的事情发生,我会说是的。新的想法可以是架构或训练算法,它们是深度学习的基础。但从本质上来说,它们很难预测。但我认为即使没有这些进步,我们也不会走得太远。比如,我们可能会得到这个软件解决方案,但如果没有更多的创新,它可能会停留在软件上,而不是使用计算机。所以我认为将会取得很多进展,但如果你把目光放远一点,在接下来的 30 年里仍然会有一些想法看起来像是一项重大的科学创新,它们开启了下一个篇章。我不知道它是一年后还是15年后到来。
是的。我想知道这个惨痛的教训在未来 100 年是否依然有效,以及它会是什么样子。
如果缩放定律是深度学习的基础,我认为痛苦的教训将永远适用,即计算将变得更加丰富。但即使在丰富的计算范围内,那些具有更陡峭的缩放定律斜率或更好的偏移量的人(例如,这是性能和计算的二维图) - 即使有更多的可用计算,那些获得 100 倍的人也会获胜。
它可能就像字面上带有太阳能电池板的围绕地球运行的计算机集群。
这样做的问题是散热。你受到太阳的所有辐射,但没有任何空气来散热。但是有很多空间可以放置集群。那里有大量的太阳能,你可以计算出散热量,但也有大量的能源,并且可能有工程意愿来解决热量问题——……所以可能会有。
有没有可能——我们应该说这绝对有可能——今年我们基本上会陷入停滞状态?不是指……系统能力,而是系统能力对人类文明实际上意味着什么。因此,在编码方面,将会建立非常好的网站。非常好的自动完成功能。
AI 会取代程序员吗(续)
这是理解代码库的非常好的方法,也许有助于调试,但实际上只是编码方面的一个非常好的助手。它可以帮助研究数学家做一些数学工作。它可以帮助您购物。这是一个好帮手。这是 Clippy 的类固醇。还有什么?它可能是一个很好的教育工具和诸如此类的东西,但事实证明计算机的使用极其难以解决。因此,我试图在所有这些领域中构建一个愤世嫉俗的案例,这些领域不会产生真正巨大的经济影响,但要意识到在各个级别上训练这些系统的成本有多大——包括预训练和推理,推理、推理等等的成本有多大。这可能吗?您认为这种可能性有多大?
当你查看这些模型时,你会发现有很多明显的事情需要改进,并且需要很长时间来训练这些模型并完成这门艺术,这需要我们花很多年的时间才能在我们正在寻找的任何基准或性能方面真正达到饱和。它可能服务于非常狭窄的利基市场。 ChatGPT 的普通用户可能不会从中获得很多好处,但它将通过在不同的事情上做得更好来服务不同的人群。
AGI 梦想正在消退吗
但我认为现在每个人都在追求的是一个对每个人都有用的通用系统。所以,好吧,如果不是……那就会趋于稳定,对吧?
我认为这个梦想实际上已经快要消亡了。正如您谈到的专业模型,它就像......而多模式通常......就像,视频生成是完全不同的事情。
“那个梦想快要消亡了”是一个很大的说法,因为我不知道它是否正在消亡。如果你问前沿实验室的实际人员,他们仍然在追逐它,对吗?
我确实认为他们仍在急于推出下一个模型,这将比上一个模型好得多。 “很多”是一个相对词,但会比前一个更好。我看不到他们放慢脚步。我只是认为不仅通过扩展模型来获得或感受到更多的收益,但现在……我觉得有很多技术债务。就像,“好吧,让我们把更好的模型放在那里,更好的模型,更好的模型。”现在人们会说,“好吧,让我们同时改进它周围的一切。”
就像上下文和推理缩放的工程一样。大型实验室仍将继续这样做。现在,较小的实验室也将迎头赶上,因为他们现在正在招聘更多人。会有更多的人。大语言模型,它有点像一个圆圈。它们还可以提高他们的工作效率,就像放大器一样。我认为我们可以期待的是放大,但不是范式改变。我不认为这是真的,但一切都会被放大、放大、放大,而且我可以看到这种情况会持续很长一段时间。
是的。我想我对梦想即将消亡的陈述取决于你认为它会做什么。像 Claude Code 一样,它是一个通用模型,可以做很多事情,但它很大程度上取决于集成和其他事情。我敢打赌 Claude Code 可以很好地处理你的电子邮件,而最困难的部分是弄清楚如何向它提供信息以及如何让它能够发送你的电子邮件和类似的东西。但我认为这可以追溯到“一个模型统治一切”的精神,这就像云中的一个东西,可以处理你的整个数字生活,并且比每个人都聪明得多。
因此,从 Claude Code 转变为这样的信念是一个有趣的飞跃——在某些方面,有一些途径可以实现这一点——但我确实认为行业的说法有点不同。
我认为,作为一个使用大语言模型的普通人,我们接下来感受到的直接事情可能与一些琐碎的事情有关,比如制作数字。现在大语言模型在计算数字方面很糟糕。是因为我们得到的廉价模型比幕后的推理计算更少吗?也许有了一些奇才,我们已经可以得到更好的数字,但如果你今天要求画一个 X、Y、Z 的流程图,大多数时候都是很糟糕的。对于人类来说,这是一项非常简单的任务。我认为有时画一些东西比写一些东西更容易。
是的,多模态理解确实感觉很奇怪,它没有得到更好的解决。
我认为我们并不是在说一件我们没有意识到的明显的事情,这是一件难以衡量的巨大事情,它使所有人类知识都可以被……整个世界所获取。我认为其中一件事很难说清楚,但Google搜索和大语言模型之间存在巨大差异。我觉得我基本上可以向大语言模型询问任何事情并得到答案,而且它的幻觉越来越少。
这意味着了解我自己的生活,弄清楚职业轨迹,弄清楚如何解决我周围的问题,通过人类历史了解任何事情。我觉得没有人真正谈论这一点,因为他们立即认为这是理所当然的,这太棒了。这就是为什么每个人都在使用它——因为你可以获得一些问题的答案,并考虑随着时间的推移它的影响。这不仅发生在美国,也发生在美国。世界各地都是如此。世界各地的孩子们都能够学习这些想法——随着时间的推移所产生的影响可能就是真正的 GDP 增长。这不会像一个飞跃。
AGI 梦想正在消退吗(续)
这就是我们到达火星的方式,这就是我们构建这些东西的方式,这就是我们拥有一百万个新的 OpenAI 的方式,所有的创新都是从那里发生的。这就是渗透到一切事物中的安静力量,对吗?人类知识。
我确实同意你的观点,从某种意义上说,它使知识更容易获得,但这也取决于主题是什么。对于数学之类的东西,你可以问它问题,它会回答,但如果你想从头开始学习一个主题——我们之前讨论过这一点——我认为最好的地方仍然是数学教科书,有人线性地布置它。这是一个经过验证的学习主题的策略,如果你从零开始获取信息密集的文本来吸收它,那么这是有意义的,但随后你使用大语言模型进行无限的练习。
如果你在某个领域遇到问题,或者对你不确定的事情有疑问,你可以要求它生成示例问题,你解决它们,然后也许你需要更多的背景知识,你可以要求它生成这些问题。但它不会给你任何教科书上没有的东西。如果有意义的话,它只是以不同的方式包装它。
但有些事情也可以更及时地增加价值,除了人类即时执行之外,没有其他好的选择。例如,如果您打算去迪士尼乐园,并且试图弄清楚要为哪个公园购买哪些门票,但没有相关教科书。没有这方面的信息密集资源。只有稀疏的互联网,然后大语言模型有很多价值。你只要问它。你在这些特定的日子里旅行受到限制,你想去某些地方,你要求它弄清楚你需要什么,何时何地......它的费用是多少等等。这是一个非常定制的即时包。个性化本质上就像——
...从稀疏的互联网中获取信息,这是一种非信息密集型的东西,没有更好的版本存在。你几乎是从头开始做的。
AI 如何赚钱
即使它确实存在,也充满了——说到迪士尼世界——广告。就像世界上任何一个城市一样,如果你问“最值得做的十件事是什么?”大语言模型比互联网上的任何东西都要好得多。
好吧,就目前而言,这是因为它们得到了大量补贴,最终它们将通过广告来支付费用。
哦,我的天啊。
它来了。
不。我希望在这种情况下能够非常清楚地表明什么是广告、什么不是广告,但是——
这是我几年前提到过的事情。就像,我不知道,如果你正在寻找一款新的跑鞋,耐克可能会先出现,这是否是巧合?也许,也许不是。我认为这方面有明确的法律。你必须清楚这一点,但我认为这是每个人都担心的。就像那里微妙的信息或类似的东西。而且,这也让我们谈到了广告的话题,我认为这是一件事,希望他们尝试在 2025 年推出,因为我认为他们现在仍然没有以其他方式赚钱,所以……就像在那里有实际的广告位一样。但问题是他们不能,因为有没有广告的替代品,人们就会蜂拥而至——
...其他产品。他们互相比拼,花这么多钱只是为了获得用户,这也太疯狂了。
我想是的。就像一些 Instagram 广告一样——我不使用 Instagram——……但我理解付费平台来寻找真正喜欢你的产品的用户的吸引力。这是 Instagram 广告等最好的例子。
但在很多情况下,广告对于激励来说是非常糟糕的。我认为人工智能的力量可以与积极的观点相结合——就像,我是一个人,我有一家小企业,我想制造世界上最好的该死的牛排刀,我想把它们卖给需要它们的人。如果人工智能能让这种广告效果更好,那对世界来说非常有好处,特别是在数字基础设施方面,因为现代网络就是这样构建的。但这并不是说,让用户上瘾的信息流可以向人们展示更多内容是一件好事。所以,我认为 OpenAI 甚至会说,他们希望找到一种方法,既能提高广告的盈利能力,又能为用户赋予用户自主权。
我个人认为Google可能会更好地弄清楚如何做到这一点,因为他们已经拥有广告供应。如果他们弄清楚如何将 Gemini 应用程序中的这一需求转化为有用的广告,那么他们就可以将其打开。我不知道我是否认为是今年,但会有相关实验。
我确实认为,目前阻碍公司前进的真正原因是竞争对手没有这样做。这更像是一个声誉的事情。我认为人们现在只是害怕毁掉自己的声誉或失去用户——……因为如果有人推出这些广告,就会成为头条新闻。但-
除非它们很棒,但第一个广告不会很棒,因为这是一个我们不知道如何解决的难题。
是的,我认为第一个版本也可能类似于 X 上的内容,就像有时在两者之间有晋升职位的时间线。它会是类似的东西,上面会写着“促销”或一些小东西,然后会有一个图像或其他东西。我认为现在的问题是谁先采取行动。
如果我们展望 10 年后,广告的主张是,通过拥有如此多的用户,您将在广告上赚到很多钱 - ……您可以用它来资助更好的研发,并且 - ……制作更好的模型,这就是为什么 - ……就像 YouTube 主导市场一样。 Netflix 害怕 YouTube。他们赚的钱,我不知道——我每个月支付 28 美元的保费。他们每个月从我和其他许多人那里至少赚 28 美元,而他们只是在视频领域创造了如此主导地位。所以我认为这就是命题,即广告可以给你带来持续的优势——……在每个用户的支出方面。但现在里面有这么多钱,就像有人启动飞轮一样——很可怕,因为这是一个长期的赌注。
2026 年的大型收购
您认为今年商业方面会出现一些疯狂的大动作吗?就像Google或苹果收购 Anthropic 之类的?
Dario 永远不会出售,但我们开始看到一些类型的整合,Groq 的估值为 200 亿美元,Scale AI 的估值接近 300 亿美元。还有无数其他交易的结构实际上对硅谷生态系统有害——这些许可交易并不是所有人都参与其中,而不是通过授予普通员工股票来使普通员工受益的全面收购。这是硅谷文化需要解决的一个大问题,因为创业生态系统是生命线。如果你加入一家初创公司,即使它没有那么成功,你的初创公司很可能会以低廉的溢价被收购,并且你会得到你的股权报酬。
这些许可交易本质上占用了顶尖人才很多时间。我认为据传 Groq 与 NVIDIA 的交易对员工来说更好,但这仍然是一个避免反垄断的事情。我认为这种整合趋势将会持续下去。我和我尊敬的许多聪明人一直期待整合会更早发生,但情况似乎开始出现转变。但与此同时,有些公司出于我不明白的原因筹集了巨额资金。我说:“我不知道你为什么要拿这笔钱。”因此,今年的情况可能好坏参半,但一些整合压力正在开始。
您认为我们会看到什么样的令人惊讶的整合?你说Anthropic是“从来没有”。我的意思是,Groq 是一个大产品——顺便说一句,Groq 带有 Q。
是的。这里有很多初创公司,而且人工智能初创公司的溢价非常高。因此,可能会有大量 100 亿美元的收购,这对于一家可能成立一年前的初创公司来说是一笔非常大的收购。我想到的是 Manus.ai,这家总部位于新加坡的公司成立于 8 个月前,然后退出了 20 亿美元。我认为还会有其他一些价值数十亿美元的大型收购,比如 Perplexity。
就像困惑一样,对吧?
是的,人们向苹果公司传言。我认为人工智能有很大的压力和流动性。大公司面临着取得成果的压力,我猜想,一次大型收购会给人们留下讲述故事下一章的余地。
我的意思是,是的,我们一直在谈论代码。也许有人获得了 Cursor。
他们处于如此有利的地位,因为他们拥有如此多的用户数据。我们讨论了持续学习之类的事情;他们有最有趣的博客文章之一。他们提到,他们的新 Composer 模型是对来自中国的大型混合专家(MoE)模型之一的微调。你可以从八卦中知道这一点,或者因为模特有时会用中文回应,而美国模特却没有这样做。他们在一篇博客文章中表示,“我们根据使用模型的人的真实反馈每 90 分钟更新一次模型权重。”这是模型上发生的最接近现实世界强化学习的事情,而且就在他们的一篇博客文章中。
那真是难以置信。
——这太酷了。
顺便说一句,我应该说我经常使用 Composer,因为它的好处之一就是速度快。
我需要尝试一下,因为每个人都这么说。
并且可能会有一些首次公开募股。你认为 Anthropic、OpenAI、xAI 吗?
他们都可以轻松筹集这么多资金,以至于他们觉得没有必要……只要融资很容易,他们就不会进行首次公开募股,因为公开市场会施加压力。
我认为我们在中国看到的生态系统有点不同,MiniMax 和 Z.ai 都在申请提交 IPO 文件,看看中国市场的反应将会很有趣。事实上,我猜想,只要这一切继续下去,美国就会受到同样的炒作,而不是基于两国都损失大量资金的现实。我希望更多的美国大型人工智能初创公司上市,因为了解他们如何花钱并获得更多洞察力会非常有趣。而且只是为了让人们有机会投资这些,因为我认为它们是这个时代的公司。现在,美国许多大型初创企业都遵循不上市的传统。
就好像我们仍在等待 Stripe 及其 IPO,但 Databricks 绝对没有;他们像 G 轮融资之类的筹集资金。我只是觉得这对市场来说是一种奇怪的平衡,我希望看到这些公司上市并以公司可以的方式发展。
OpenAI、Anthropic、Google DeepMind、xAI 与 Meta 的未来
你们认为十年后,一些前沿模型公司还会存在吗?比如 Anthropic、OpenAI?
我绝对不认为这是赢者通吃,除非他们中的一个人确实发现了一些算法秘密,可以让这个飞轮发挥作用。因为他们的发展道路都非常相似。 Google 和 OpenAI 拥有相同的产品,而 Anthropic 更专注,但当你与人们交谈时,听起来他们正在解决很多相同的问题。所以我认为……有些产品会传播开来。这是一块非常大的蛋糕,人们将从中捞钱。
我不想轻视它,但 OpenAI 和 Anthropic 主要是 LLM 服务提供商。其他一些公司,如Google和 xAI,与 X 相关,也做其他事情。因此,如果人工智能变得更加商品化,那些只提供大语言模型的公司很可能会消亡。
我认为他们的优势是拥有很多用户,而且我认为他们只会转向。我认为,就像“Anthropic”一样,它也发生了转变。我不认为他们最初计划从事代码工作,但碰巧他们发现,“好吧,这是一个很好的利基市场,现在我们在这个利基市场中感到很舒服,并且我们正在推动这个利基市场。”我也能看到同样的事情一次……假设来说,我不确定这是否属实,但假设Google占据了通用聊天机器人的所有市场份额。也许 OpenAI 之后会专注于其他一些子主题——比如……我认为,他们有太多的用户,在可预见的未来不会消失。
我认为Google总是准备好用人工智能模式说“别喝啤酒了”。
我认为问题是这些公司是否能够支持估值。我会看到人工智能公司在某些方面受到关注,比如 AWS、Azure 和 GCP,它们都在同一领域竞争,而且都是非常成功的企业。 API 市场有可能非常无利可图,以至于他们在产品和硬件堆栈上上下波动。他们拥有大量现金,可以建造发电厂和数据中心,这现在是一个持久的优势。但也有一个合理的结果,即这些 API 对于开发人员来说非常有价值且非常灵活,以至于它们变得像 AWS 这样的东西。但AWS和Azure也会有这些API,所以五六个人在API市场竞争是很困难的。所以也许这就是他们被排挤的原因。
你提到了“RIP LLaMA”。 Meta 有获胜之路吗?
我想没人知道。他们搬家很多,所以他们与黑森林实验室签署了许可协议,这是图像生成,或中途。因此,我认为在某些方面,在产品和面向消费者的人工智能方面,现在下结论还为时过早。我认为他们有一些非常优秀并且非常有动力与扎克伯格关系密切的人。所以我认为那里还有一个故事要展开。 Llama 有点不同,Llama 是该组织最集中的表达方式。我认为 Llama 不再受到这种程度的支持。我认为这对他们来说是一个非常成功的品牌,所以他们仍然可能会参与开放生态系统的一部分,或者将 Llama 品牌延续到不同的服务中,因为人们知道 Llama 是什么。
你认为有 Llama 5 吗?
不是一个开放权重的。
这很有趣。简单回顾一下,我的意思是,Llama 是开创性的开放权重模型——Llama 1、2、3,备受喜爱。但我认为随后发生的事情(只是假设或推测)是,Meta 的领导者和高层管理人员一样,对 Llama 感到非常兴奋,因为他们看到它在社区中有多受欢迎。然后我认为问题在于试图利用开源来引起更大的轰动。这感觉像是被迫的,就像开发这些非常大的 Llama 4 模型只是为了在基准测试中名列前茅。
但我不认为 Llama 模型的目标是在基准测试中击败 ChatGPT 或其他模型。我认为我们的目标是建立一个人们可以使用、信任、修改和理解的模型。这包括拥有更小的模型;他们不一定是最好的模特。所发生的事情只是这些模型 - 当然,基准测试表明它们比实际情况更好,因为我认为它们有根据偏好进行训练的特定模型,因此它们在基准测试中表现良好。这就是一种过度拟合的现象,迫使它成为最好的。但与此同时,他们没有做人们可以使用的小模型,也没有人可以运行这些大模型。
OpenAI、Anthropic、Google DeepMind、xAI 与 Meta 的未来(续)
然后发生了一件奇怪的事情。我认为这只是因为人们对推动前沿的头条新闻太兴奋了。我想就是这样。
基准同步方面的内容太多了。
工作量太大了。
我认为它是在内部政治斗争和不协调的激励措施下崩溃的。研究人员希望建立最好的模型,但有一层组织和管理层试图证明他们做了这些事情。有很多文章和谣言都做出了一些可怕的技术决定,而且看起来事情太糟糕了,一切都崩溃了。
是的,但我们也应该大力支持马克·扎克伯格。我认为这实际上来自马克,来自领导层的高层,他说开源很重要。这一事实的存在意味着可能会有 Llama 5,他们从基准同步中吸取教训,并说,“我们将成为 GPT-OSS——”“……并提供一个非常出色的开源库。”
人们说的是 Mark 和 Alexander Wang 之间存在争论,Alexander Wang 非常聪明,但更反对开源。就他对人工智能组织有很大影响力而言,这种可能性似乎要小得多,因为马克任命他为指导人工智能的新领导。如果开放或封闭不再是模型的决定性本质,我不认为这会成为马克和亚历克斯之间的决定性争论。他们都很聪明,但我很难理解所有这些,因为 Mark 在 2024 年 7 月写了这篇文章,这可能是当时最好的博客文章,为开源 AI 提供了案例。然后 2025 年 7 月到来了,“我们正在重新评估我们与开源的关系。”所以这只是一种……
但我也认为问题是——嗯,我们可能有点太严厉了,这导致了一些问题。我的意思是,我们作为开源开发人员或开源社区。因为尽管这个模型可能不是每个人都希望的,但它还是遭到了很多反对。我认为这有点不幸,因为作为一家公司,他们希望获得积极的头条新闻。他们不仅没有得到头条新闻或积极的头条新闻,反而得到了负面的头条新闻。然后这对公司产生了不好的影响。这可能是一种恶意反应,几乎就像是,“好吧,我们试图做一些好事,我们试图给你一些很酷的东西,比如开源模型,但现在你对我们持负面态度。”因此,从这个意义上说,“好吧,也许我们会改变主意。”我不知道。
是的,这就是关于……X的动态讨论可能会让我们作为一个社区误入歧途。因为有时感觉是随机的;人们会选择自己喜欢和不喜欢的东西。我的意思是,您可以在 Grok 4.1 和 Grok Code Fast 1.0 中看到同样的情况。我不认为,就氛围而言,人们不会公开喜欢它。但很多人都在使用它。因此,如果你看看 Reddit 和 X,他们并没有真正给予它来自编程社区的赞扬——……但是,就像他们使用它一样。Llama可能也是同样的情况。我不明白积极炒作或消极炒作的动态。我不明白。
OpenAI、Anthropic、Google DeepMind、xAI 与 Meta 的未来(续)
我的意思是,2025 年的故事之一是美国填补了Llama的空白,这就是这些中国开放权重模型的崛起——……以至于我想,“这是我在过去五个月里花费大量精力的唯一问题”,它正在试图做政策工作——……让美国投资于此。
告诉我亚当的故事吧。
亚当项目是……一开始我把它称为美国 DeepSeek 项目,它对 DC 观众来说并不真正有效,但它讲述了我在职业生涯中能做的最有影响力的事情的故事。这些中国的开放权重模型正在培育很大的力量,并且对开放模型的需求也很大,尤其是对中国模型非常谨慎的美国企业。
看看 Perplexity,Adam 项目——美国真正的开放模型——是一项总部位于美国的倡议,旨在构建和托管高质量、真正开放的人工智能模型和支持基础设施,明确旨在与中国快速发展的开源人工智能生态系统竞争和追赶。
我认为一句话总结就是这样——或者两句话。其中一个主张是,开放模型将成为人工智能研究的引擎,因为这是人们的起点;因此,拥有它们很重要。因此,第二个问题是,美国应该建立最好的模型,以便最好的研究发生在美国,而这些美国公司可以从人工智能研究发源地中获得价值。如果没有对开放模型进行更多投资,我们网站上的所有情节都是“Qwen,Qwen,Qwen,Qwen”,而所有这些模型都是这些中国公司在美国和国际上培养影响力的优秀模型。
美国在人工智能上的投入要多得多。创建比封闭实验室尖端技术高出半代或一代的开放模型的能力大约需要 1 亿美元,这是一大笔钱,但与这些公司所拥有的相比还无法相比。因此,我们需要一支集中力量来做到这一点。我认为我们得到了几乎整个堆栈的人们的签名参与,包括政策。
那么政府有支持吗?
我认为政府中技术上没有任何人公开签署过该协议,但我知道拜登和特朗普政府中从事人工智能政策工作的人都非常支持在美国推广开源模式。我认为,例如,AI2 在四年内从 NSF 获得了 1 亿美元的资助,这是 NSF 有史以来授予的最大的 CS 资助,对于 AI2 来说,这是一个尝试,我认为这是一个起点。但当有多个组织构建模型时,就会出现最好的结果,因为它们可以交叉传播想法并构建这个生态系统。如果只是 Llama 向世界发布模型,这是行不通的,因为 Llama 可能会消失。同样的情况也适用于 AI2;我不可能是唯一一个建造模型的人。
我们需要花费大量时间与人们交谈,无论他们是否参与政策……我知道 NVIDIA 对此感到非常兴奋。我认为黄仁勋已经专门谈到了这一点的紧迫性,他们在 2025 年做了更多的工作,其中 Nemotron 3 模型更受关注。他们已经开始随 NVIDIA 的开放模型一起发布一些数据,但很少有公司这样做,尤其是像 NVIDIA 这样的规模。所以有进步的迹象。我们听说 Reflection AI,他们说他们的 20 亿美元筹款致力于建立美国开放模型,他们的公告推文读起来就像文化潮流开始转向。
我认为 7 月份我们有四到五个 DeepSeek 口径的中国开放权重模型,而来自美国的模型为零。那是我发布这个的那一刻,我想,“我想我必须在这上面花费精力,因为没有其他人会这么做。”所以需要很多人一起贡献。我并不是说亚当项目是唯一推动生态系统发展的事情,但正是像我这样的人在做这种事情来传播信息。
AI 的“曼哈顿计划”
你喜欢2025年美国人工智能行动计划吗?这包括开源的东西。白宫人工智能行动计划包括一个名为“鼓励开源和开放权重人工智能”的专门部分,定义了此类模型,并认为它们对创新和初创公司具有独特的价值。
是的。我的意思是,《人工智能行动计划》只是一个计划,但我认为这可能是本届政府出台的最连贯的政策文件,我希望它能在很大程度上取得成功。我认识从事这方面工作的人。挑战在于制定政策并使其成为现实,作为一名人工智能研究人员,我不知道如何做到这一点,但很大程度上其中的很多事情都是非常真实的。这个国家大力发展人工智能,虽然人们听说了一些问题,从用水到其他什么问题,但我们应该能够在这个国家建造东西,而不会在这个过程中破坏地方。花费精力是值得的。
我认为这是联邦政府的职责。他们制定了议程。制定议程,让开放权重应该成为首要考虑因素,这是他们可以做的很大一部分事情,让人们思考这个问题。
此外,对于教育和人才来说,这非常重要。否则,如果只有封闭模型,如何让下一代人做出贡献?进入公司之后你才能学习,但到了这个时候,你如何识别和聘用人才呢?我认为开源对于教育民众和培训下一代研究人员至关重要。这是唯一的方法。
我想让这件事传播得更广的方法是讲述一个中国人工智能与独裁国家融合、成为 ASI 并接管世界的故事,因此我们需要我们自己的美国模式。但我在美国谈论创新和科学是非常有意的,因为我认为这既是更现实的结果,也是我想展现的世界。
不过,我想说,任何开放权重模型都是有价值的模型。
是的。我的观点是我们应该处于领先地位。但我认为值得这么简单地说,因为人工智能生态系统中仍然有声音说,由于安全风险,我们应该考虑禁止发布开放模型。我认为值得补充的是,实际上,如果美国没有自己的防火墙,这是不可能的,众所周知,防火墙的效果不太好。训练这些模型的成本,无论是一亿美元还是一亿美元,对于世界上很多想要产生影响力的人来说都是可以承受的,所以这些模型将在世界各地接受训练。我们希望这些信息和这些工具能够在世界各地自由流动并进入美国,以便人们可以使用它们并向它们学习。
阻止这种情况将是对我们互联网的一次重组,这似乎是不可能的。
您认为来自中国的大型开放式重量模型对美国公司来说实际上是一件好事吗?您之前提到过,他们在发布开源内容方面通常落后一代人。例如,gpt-oss-120b可能不是尖端模型,或者Gemini 3可能不是,因为他们想确保它是安全的。但是,当这些公司看到 DeepSeek-V3.2 确实很棒并且在使用时没有出现强烈反对或安全风险时,可能会鼓励他们发布更好的模型。也许这是一件非常积极的事情。
百分之一百。这些中国公司已经启动了一些事情,我认为如果他们不全部发布模型,这些事情可能不会发生。我几乎可以肯定,这些讨论是由领导层进行的。
AI 的“曼哈顿计划”(续)
未来是否有可能世界上的主导模型、人工智能模型都是开源的?
取决于您预测的进展轨迹。如果你认为几年内就会出现饱和,基本上是在财政支持仍然非常好的时间内,那么开放模型将得到如此优化,运行成本如此之低,以至于它们将获胜。从本质上讲,这可以追溯到开源理念,更多的人将投入资金来优化这些开放权重通用架构的服务,从而使它们成为标准。然后你可以拥有专用于它们的芯片,它会比这些定制的封闭公司的产品便宜得多。
我们应该说,AI2027 报告预测——从叙述的角度来看,它所做的一件事就是将会出现大量的中心化。随着人工智能系统变得越来越聪明,国家安全问题将会出现,你将集中实验室,你将变得超级秘密,并且将会有整个竞赛。
......从军事角度看你......中美之间的关系。因此,我们就大语言模型进行的所有这些有趣的对话——所有将军和士兵都会走进房间,说:“好吧,我们现在正处于整个事情的曼哈顿计划阶段。”
我认为 2025 年、26 年、27 年——我认为这样的事情根本不可能发生。我的意思是,你可以对计算机做出同样的论点,对吧?你可以说:“好吧,计算机是有能力的,但我们不希望普通公众拥有它们。”或者芯片——甚至是人工智能芯片——但你会看到华为现在是如何制造芯片的。这花了几年时间,但是……我认为没有办法可以容纳这样的知识。我认为在当今时代,这是不可能的,就像互联网一样。我认为这是不可能的。
关于曼哈顿计划,我看到的一件有趣的事情是,我认为类似曼哈顿计划的开放模型实际上是相当合理的,因为它不会花费那么多。但我认为那将会到来。从文化上看,公司似乎正在发生变化。但我同意Sebastian刚才所说的所有内容。就像,我不认为它会发生,也没有帮助。
是的。我的意思是,曼哈顿计划背后的推动力是存在文明风险。对于开源模型来说,激励这一点更加困难。
不存在文明风险。
英伟达、GPU 与 AI 计算集群的未来
在硬件方面,我们多次提到 NVIDIA。您认为 Jensen 和 NVIDIA 会继续获胜吗?
我认为他们的缺点是必须进行大量迭代和大量制造。他们正在做的事情——他们确实在创新,但我认为总有可能有人做了一些根本不同的事情,他们非常幸运,然后做了一些事情。但我认为问题在于采用。要知道,NVIDIA的护城河恐怕不仅仅是GPU;还有GPU。它更像是 CUDA 生态系统,并且已经发展了二十多年。我的意思是,甚至当我还是一名研究生时,我就在实验室里进行生物物理模拟、分子动力学,当时我们有一个 Tesla GPU 只是用于计算。现在已经是十五年前的事了。
他们花了很长时间建立了这个,我认为这就是护城河。这不是芯片本身。尽管他们现在有钱来迭代、构建和扩展,但这实际上取决于兼容性。如果你的公司有这么大的规模,你为什么要选择一些有风险的东西,因为它们每年只能生产一些芯片?你就和大的一起去吧。但我确实认为现在有了大语言模型,设计像 CUDA 这样的东西会更容易。花了 15 年时间,因为这很困难,但现在我们有了大语言模型,我们也许可以复制 CUDA。
我想知道训练和推理是否会分开……计算,因为我们稳定了推理所需的计算越来越多。
这应该就是收购 Groq 的目的。这就是为什么 Vera Rubin 的一部分是——
......他们有一个新芯片,没有高带宽内存,或者很少,这是最昂贵的部件之一。它是为预填充而设计的,预填充是推理的一部分,本质上是进行大量矩阵乘法,然后只有在进行自回归生成并且具有 KV 缓存交换时才需要内存。因此,他们拥有专为特定用例设计的新 GPU,然后每次翻牌的拥有成本实际上要低得多。但我认为NVIDIA的命运仍然在于AI的传播。他们最大的客户仍然是这些超大规模公司,无论是Google(显然可以制造 TPU)、亚马逊制造 Trainium,还是试图做自己的事情的微软。
只要人工智能的进展速度很快,NVIDIA 的平台就是最灵活的,人们就会希望如此。但如果出现停滞,那么通过创建定制芯片,就有更多的时间来做到这一点。
有趣的是,NVIDIA 非常积极地尝试开发各种不同的产品。
他们试图创造需要大量 GPU 的商业价值领域。
但他们不断创新,并且正在进行大量令人难以置信的研究,所以……
每个人都说公司非常以詹森为中心,以及他在运营上的投入程度。这听起来与我听说过的许多其他大公司很不一样。只要这是一种文化,我认为你就可以期待这种文化能够不断取得进展。就好像他还处于苹果的史蒂夫·乔布斯时代。只要这就是它的运作方式,我对他们的情况非常乐观,因为这是他们的首要问题,而且我不知道为整个生态系统制造这些芯片是否是所有其他公司的首要目标。他们会做得很好,但可能不会那么好。
自从你提到詹森以来,我读了很多有关历史和历史上奇异人物的书。对于伟人的历史观,你们怎么看?个人对于引领科技行业的历史方向有多重要?那么,您知道,如果没有 Jensen,NVIDIA 会是什么样子呢?你提到了史蒂夫·乔布斯。没有史蒂夫·乔布斯,苹果会是什么样子?没有 Elon 的 xAI 或没有 Demis 的 DeepMind 是什么?
英伟达、GPU 与 AI 计算集群的未来(续)
人们更早、更快地制造事物,而从科学角度来看,许多伟大的科学家都相信在正确的时间出现在正确的地点。最终其他人仍然会有这个想法。所以我认为,通过这种方式,Jensen 正在帮助实现这场 GPU 革命,这比没有像他这样的人的情况下更快、更集中。这使得整个人工智能的构建速度更快。但我仍然认为最终会发生像 ChatGPT 这样的事情,并且会发生像这样的扩展,但它可能不会那么快。我认为这就是所应用的那种味道。
这些个人正在对某件事下注。有些人很幸运,有些人则不然。但如果没有这些人来掌舵,事情就会更加分散。这几乎就像投资 ETF 与投资个股一样。个股的上涨或下跌幅度可能比 ETF 更大,因为 ETF 更加平衡。我们最终会到达那里,但我认为重点是重点。激情和专注。
难道没有真实的案例表明,没有詹森,深度学习革命就不会重振旗鼓吗?
我想说的是,这可能是20年后的事了。
是的,20是……
或者另一个深度学习冬天可能会到来……如果 GPU 不存在的话。
这可能会彻底改变历史,因为你可以想到同时出现的所有其他技术,人类文明的焦点将变得……硅谷将被不同的炒作所吸引。
但我确实认为 GPU 轨迹肯定有一个方面是经过规划的。但另一方面,这也有很多幸运的巧合或良好的直觉。就像对生物物理模拟的投资一样。我的意思是,我认为它是从视频游戏开始的,然后它恰好擅长线性代数,因为视频游戏需要大量的线性代数。然后进行生物物理模拟。但我仍然不认为总体规划是人工智能。我认为这恰好是亚历克斯·克里热夫斯基(Alex Krizhevsky)。于是有人拿着这些 GPU 说:“嘿,让我们尝试用它来训练神经网络。”它碰巧工作得很好而且……我认为这只是因为你可以购买这些 GPU。
如果……NVIDIA 在早期就倒闭了,那么游戏就会产生对更快处理器的需求。我就是这么想的。我认为 GPU 仍然存在……在 AlexNet 和 Transformer 时代。只是很难知道是一家公司如此成功,还是多家芯片较差的小公司。但我不认为这会延迟 100 年。可能会延迟十年。
嗯,这可能会延迟一、二、三、四、五年。我的意思是,我不认为英特尔或 AMD 会做 NVIDIA 所做的事情。
我认为这不会是一家存在的公司。
一家新公司。
我认为崛起的将是一家不同的公司。
比如硅谷图形公司什么的。
所以是的,一些已经倒闭的公司会这么做。
但看看这些独特的人物、这些领导人,似乎对世界的轨迹产生了巨大的影响。显然,他们的背后有令人难以置信的团队。但是,你知道,拥有那种非常单一、近乎教条的焦点……是取得进步的必要条件。
是的,我的意思是,即使有了 GPT,如果没有一个人 Ilya 推动这种扩展,它也不会存在,对吗?
是的,达里奥也深度参与其中。如果你读过 OpenAI 的一些历史,你会发现这些人是多么早期的想法,“我们需要连接 10,000 个 GPU,利用 OpenAI 的所有计算并训练一个模型”,这似乎是一种疯狂的想法。那里有很多人不想这样做。
这是一件疯狂的事情——在扩展之前就相信扩展有任何迹象表明它将会实现。再次,单一数字。说到这里,100 年后,无论奇点是什么,这大概都是后奇点。当历史学家现在回顾我们的时代时,他们真正会强调哪些技术突破是导致奇点的突破?到目前为止我们有图灵到今天,已经80年了。
人类文明的未来
我认为它仍然是计算,就像总括术语“计算”一样。我并不认为 100 年或 200 年后一定会是人工智能。它仍然很可能是计算机,你知道吗?我们现在正在更好地利用计算机,但这就是计算的事实。
这基本上是一种摩尔定律的讨论。甚至 CUDA 和 GPU 的细节都不会被记住,也不会有所有这些软件混乱。显然,这只是计算。
我基本上同意,但是互联网和计算的连接能够合并吗?或者两者都是?
我认为互联网可能与通信有关——它可以是电话、互联网或卫星。计算更像是它的缩放方面。
互联网有可能被完全遗忘。互联网被包裹在电话网络中,就像通信网络一样。这只是另一种表现,真正的突破来自于计算量的增加——广义上的摩尔定律。
嗯,我认为人与人之间的联系是非常重要的。你想找到世界上最适合某件事的人,他们就在世界的某个地方。能够拥有这种信息流——人工智能也将依赖于此。我一直在关注我所说的关于单一中心模型的梦想已经破灭的说法;正在发展的事情是,人们有许多智能体来执行不同的任务。人们已经开始使用不同的云来执行不同的任务。它被描述为数据中心中有许多 AGI,每个 AGI 都进行管理并相互通信。这非常依赖网络和计算之上的信息自由流动。但网络,尤其是 GPU,是计算扩展的一部分。 GPU 和数据中心需要相互通信。
您认为神经网络被视为一项突破,这一事实有什么非常具体和独特的地方吗?就像一个天才的举动,你基本上以一种非常粗糙的方式复制人脑的结构,人类的思想?
我认为如果没有人类思维,我们可能就不会有神经网络,因为它是它们的灵感来源。但另一方面,我认为这是非常不同的。我的意思是,它是数字与生物的,所以我认为它可能会更多地被归类为一种算法。
在这种特殊类型的计算上,这是大规模并行化的吗?
它很可能是遗传计算,就像遗传算法一样,只是并行化。碰巧这样效率更高,效果更好。
很可能神经网络,我们现在构建它们的方式,只是导致奇点的系统的一个小组成部分。
我认为如果你考虑 100 年后,由于自治,社会可以通过更多的计算和智能而发生更大的改变。但看看这个,我们还记得哪些工业革命的事情呢?我们记得引擎——它可能相当于计算机。但人们也意识到了许多其他的物理变化,比如轧棉机和所有这些仍然已知的机器——空调、冰箱——其中一些来自人工智能的东西仍然是已知的; “变形金刚”这个词仍然广为人知。我猜想深度学习肯定仍然是众所周知的,但随着人工智能研究人员遍布各地,Transformer可能会在 100 年后逐渐消失。但我认为深度学习很可能是一个被人们记住的术语。
人类文明的未来(续)
我想知道人工智能会带来什么未来的空调和制冷。如果我们时光倒流100年,你认为会有什么不同?世界看起来如何?首先,你认为世界上有人类吗?你认为到处都是机器人吗?
我确实认为会有专门的机器人来执行某些任务。
人形形态?
也许是半人形。我们会看到的。我认为对于某些事情,是的,将会出现人形机器人,因为它适合环境。但对于某些任务来说,这可能没有意义。更难以想象的是我们如何与设备交互以及人类如何使用它们。我很确定它不会是手机或笔记本电脑。会是植入物吗?
我的意思是,它必须是脑机接口,对吗?我的意思是,从现在起 100 年后,鉴于我们现在所看到的进步,它必须如此,除非我们与现实互动的方式发生合法的彻底改变。
另一方面,如果你想到汽车,汽车的历史已经超过 100 年了,对吧?而且还是同一个界面。我们没有用其他东西取代汽车;我们只是让他们变得更好。但它仍然是方向盘,仍然是轮子。
我认为我们仍然会随身携带物理计算模块——因为人们想要拥有私有接口的能力。你可能不会像手机那样频繁地使用它,但我认为拥有一些可以让你拥有私人信息的东西作为你和互联网其他部分之间的接口仍然存在。它可能看起来不像iPhone,而且它的使用率可能会少很多,但我仍然希望人们随身携带东西。
为什么您认为智能手机是隐私的体现?上面有一个摄像头。有一个-
对您来说是私密的,例如加密消息、加密照片;你知道你的生活是什么。我想这是一个你对脑机接口有多乐观的问题。所有这些都会像您的整个日历一样存储在云端吗?很难想象如何处理我们可以通过脑机界面直观地处理的所有信息,向您呈现日历之类的东西。光想不看就知道你的电子邮件收件箱是很难的。就像您向计算机发出信号一样,然后您就知道您的电子邮件收件箱。人类大脑可以处理以非视觉方式输入的东西吗?我不知道这些转变是如何发生的。因为人类在 100 年内都不会改变。
我认为主体性和社区是人们真正想要的东西。
当地社区,是的。
所以,就像你亲近的人一样,能够与他们一起做事,并能够赋予你的生活意义。我不认为人类生物学正在改变我们可以讨论的时间尺度。 UBI 并不能解决主体性问题。我确实期望大量的财富,并且我希望财富能够扩散到一百年后,人们的平均生活确实会发生很大的变化。但 100 年后仍然会发生很多事情。如果你想想那些处于发展进程早期的国家,建设所有基础设施并制定与另一个国家分享财富的政策……我认为看到这一切在 100 年内发生是一种乐观的观点——……尽管它们仍然是独立的实体,而不仅仅是通过武力吸纳到某些国际秩序中。
但可能存在更好、更复杂、更有效的……社会支持系统,有助于减轻世界上某些程度的基本痛苦。随着社会的转型,大量工作在短期内消失,我认为我们必须真正记住,每一个失去的工作都是一个正在受苦的人。当大规模失业时,这才是真正的悲剧。你可以对经济学提出各种各样的论点,或者说这一切都会好起来,对 GDP 有利,因为会创造新的就业机会,但从根本上来说,对于人类的个人层面来说,这才是真正的痛苦。这是一个真正的个人悲剧。
随着技术发展,我们不能忘记那些具体的人。面对越来越多的 AI 垃圾内容,我反而希望线下面对面的人类体验会变得越来越稀缺、越来越有价值,比如相聚和当面交谈。
人类文明的未来(续)
未来几年,实体商品与线下活动的价值肯定会上升,同时 AI 垃圾内容带来的压力也会更大。垃圾内容才刚刚开始,接下来几年会出现越来越多不同版本的——
你觉得我们都会被淹没——
——不同版本的 AI 垃圾内容。
都会淹没在 AI 垃圾内容里。你是这个意思吗——
所以我希望,社会在被 AI 垃圾内容淹没到一定程度后会突然醒过来,意识到:“我们受不了了,这些东西根本不重要。”到那时,实体世界会获得高得多的溢价。
拿艺术这个经典例子来说,我认为我们最终会厌倦大量合成内容,其实现在已经有点厌倦了。艺术不会消失:实体画作相较复印件,不只更值钱,也更容易让人产生真实的欣赏。数字复制品即使完美,走进博物馆看到原作时,你仍会意识到那是一个人亲手完成的工艺,并因此珍视它。
写作、谈话和其他体验也会如此。遗憾的是,未来可能出现分叉:一部分被自动化,另一部分继续由人创作。就像今天相较两百年前,照片和复制品占比更高,但绘画并没有消失,真实创作仍有价值,变化的是比例。就我个人而言,一旦看出一段文字明显由 AI 生成,即使里面可能有好信息,我也很难继续读下去。
最终这些内容可能会逼真到足以骗过你,因此平台需要提供验证和建立信任的方式。比如你会相信 Lex 不是 AI 生成的,因为他长期持续地出现在这里,于是这个频道积累了信任;但对尚未建立这种信誉的新人来说,情况会更难。
这会很有意思。从根本上说,问题或许可以通过信任某些媒体机构来解决,但整个体系会越来越依赖信任。可能会出现认证系统,判断“这是真的、那不是真的”。有些 AI 内容仍有明显痕迹,但有些会逼真到难以分辨,那时你只能依赖来源信誉。这既有意思,也会带来问题。
一种极端方案,是给所有人类创作的内容加水印:我们亲自拍摄的照片在被编辑前都带有来源证明,软件与设备制造商通信,以维持“由人创作或编辑”的可信链条。这与给 AI 图片加水印的思路正好相反。当然,你也可能用一个 Google 工具生成带水印的图片,再用另一个工具去掉水印。
是的。基本上,这将是一场军备竞赛。
我们前面主要谈 AI 的积极面,但这些能力即使由相对不聪明的系统大规模使用,也可能破坏人类文明稳定,更不用说未来的超级智能系统。开发技术时,也必须认真考虑悲观者提出的风险。什么让你对人类文明的未来仍抱有希望?经历我们讨论的一切之后,人类会没事吗?
我认为会。我对 AI 和其他事情都容易担忧,但人类往往能找到出路;我们天生会建立社区、共同解决问题,这也是文明走到今天的原因。AI 与相关技术带来的机会确实巨大,但要让所有人理解并分享这些机会,还有重大的社会与政治问题。眼下世界本就令人不安,AI 又充满不确定性。解决这些问题需要大量工作,而且不只是造出新东西,还包括沟通、理解他人——这些恰恰不是历史上许多 AI 开发者最有动力去做的事。
这些问题大概可以解决,只是会比人们希望的更久。如果想得到持久收益,我们必须经历一段漫长、艰难、甚至令人痛苦的 AI 公共讨论。
人类文明的未来(续)
是的。在这个过程中,我尤其期待我们能在个人和文明层面更深入地理解自己,并回答一些重大谜题:意识究竟是什么?它似乎真的非常特殊,我们的心智中存在一种奇迹。AI 像一面镜子照向人类,让我们有机会重新追问这一切到底是怎么回事。
嗯,我确实认为这一点让我们与人工智能有很大不同,而我不担心人工智能接管的原因是,就像你说的,意识。我们人类,我们决定我们想要做什么。就目前的人工智能实施而言,我看不出它会发生变化。你必须告诉它做什么。所以你仍然拥有自主权。它不会夺走你的自主权,因为它变成了一种工具。你告诉它做什么。它将比以前的其他工具更加自动化。它肯定比锤子更强大,它可以解决问题,但仍然是你负责,对吧?所以人工智能不负责,你负责。你告诉人工智能做什么,它就会为你做这件事。
那么,在后奇点、后世界末日的人类与机器之间的战争中,你是说人类值得为之而战?
百分之百。想想 20 世纪 80 年代的《终结者》;我能看到真正危险的情况,主要还是有人明确把系统编程成去做有害的事。
在《终结者》那种设定里,我其实觉得人类会赢,因为我们足够机灵。很难提前解释具体怎么赢,但总能找到办法;我们甚至可能用本地大语言模型和开放权重大语言模型来对抗机器。抱歉把话题说得这么荒诞。Nathan、Sebastian,我一直很欣赏你们,很荣幸终于见面。感谢你们向世界分享的一切、写下的优秀书籍、所做的教学,也感谢今天这场有趣的对话。
感谢你邀请我们,也感谢这种人与人之间的连接,它其实——
——极其珍贵。感谢收听我与 Sebastian Raschka、Nathan Lambert 的对话。请查看节目简介中的赞助商,也可以在那里找到联系我、提问和反馈的链接。最后用 Albert Einstein 的一句话作结:“并不是因为我有多聪明,而是因为我与问题相处得更久。”感谢收听,希望下次再见。