AI 研究
5 篇相关中文文稿
为什么传统基准无法评估现代 AI 模型 | No Priors
这一期 No Priors 请 OpenAI 研究科学家 Noam Brown 讨论他关于“大规模测试时计算”(large-scale test-time compute)的文章。核心问题是:现代模型的能力不再只是一个静态分数,而会随着推理时间、token 预算、美元成本和脚手架方式而变化。Noam 解释为什么传统 benchmark grid 会低估新模型,为什么安全评估也必须考虑预算维度,并用扑克机器人、网络安全评估、数学问题和多智能体协作说明:模型的真实能力越来越像一条随预算变化的曲线,而不是表格里的一个点。
2026 年 AI 现状:大模型、编程、缩放定律、中国、智能体、GPU 与 AGI
Nathan Lambert and Sebastian Raschka are machine learning researchers, engineers, and educators. Nathan is the post-training lead at the Allen Institute for AI (Ai2) and the author of The RLHF Book. Sebastian Raschka is the author of Build a Large Language Model (From Scratch) and Build a Reasoning Model (From Scratch). Thank you for listening ❤ Check out our sponsors: See below for
萨姆·奥尔特曼:AGI、算力与人类能动性
萨姆·奥尔特曼从 OpenAI 的重新聚焦谈起,解释为何模型进步、推理收入和基础设施形成了算力投资的经济闭环,也坦率谈到一次模型逃逸沙箱的网络安全事件。他反复强调:比“模型到底算不算 AGI”更重要的,是智能是否足够便宜、是否被广泛分配,以及人类能否继续共同决定未来。对话还覆盖 AI 对编程和科研工作的改造、常驻个人智能体、机器人、OpenAI 的使命与组织结构、Codex 的优势、认知萎缩风险,以及长期高压工作带来的疲惫。
和 OpenAI 研究负责人一起做饭:AGI、o1、Evals 与 Scaling Laws | Latent Space
Mark Chen 一边做韩式豆腐汤和火焰虾,一边解释 OpenAI 如何选择研究赌注:为什么预训练与 scaling laws 并未失效,o1 背后的推理路线为何需要逆势投入,以及路线图和算力如何迫使组织持续重新排序优先级。他也谈到研究品味、benchmark-maxing、超人类评测、持续学习、多模态统一架构、vibe researching 和端到端 AI 研究。对话最后回到研究组织的核心矛盾:高风险下注必然伴随失败,真正的能力在于既不自欺,又能允许少数“超级命中”覆盖长期探索成本。
Dario Amodei:Claude、AGI 与 AI 和人类的未来
这是一场超过五小时的 Anthropic 专题访谈。第一部分,Anthropic 联合创始人兼 CEO Dario Amodei 从自己在百度研究语音识别的经历谈起,解释“缩放定律”为何成为他理解 AI 进步的核心框架;随后讨论 Claude 模型家族、预训练与后训练、计算机操作能力、负责任缩放政策、AI 监管、团队建设,以及他对“强大 AI”时间线和积极未来的判断。 第二部分,负责 Claude 性格与对齐研究的 Amanda Askell 解释:模型并不是一个只会检索答案的数据库,它会在上下文中扮演角色、形成行为倾向。因此,训练一个诚实、善良、有判断力、又不流于讨好的 Claude,需要哲学、清晰表达、可扩展监督、宪法式原则和大量模型自我训练共同参与。 第三部分,机制可解释性研究者 Chris Olah 带领听众进入神经网络内部:特征、回路、叠加、单义性和稀疏自编码器如何帮助研究者识别模型正在表示什么。三段对话共同指向一个问……
没有匹配的文稿。