⌘ K
主题
模型评测
2 篇相关中文文稿
001
No Priors: AI, Machine Learning, Tech, & Startups
36:19
002
Latent Space
41:17
为什么传统基准无法评估现代 AI 模型 | No Priors
这一期 No Priors 请 OpenAI 研究科学家 Noam Brown 讨论他关于“大规模测试时计算”(large-scale test-time compute)的文章。核心问题是:现代模型的能力不再只是一个静态分数,而会随着推理时间、token 预算、美元成本和脚手架方式而变化。Noam 解释为什么传统 benchmark grid 会低估新模型,为什么安全评估也必须考虑预算维度,并用扑克机器人、网络安全评估、数学问题和多智能体协作说明:模型的真实能力越来越像一条随预算变化的曲线,而不是表格里的一个点。
和 OpenAI 研究负责人一起做饭:AGI、o1、Evals 与 Scaling Laws | Latent Space
Mark Chen 一边做韩式豆腐汤和火焰虾,一边解释 OpenAI 如何选择研究赌注:为什么预训练与 scaling laws 并未失效,o1 背后的推理路线为何需要逆势投入,以及路线图和算力如何迫使组织持续重新排序优先级。他也谈到研究品味、benchmark-maxing、超人类评测、持续学习、多模态统一架构、vibe researching 和端到端 AI 研究。对话最后回到研究组织的核心矛盾:高风险下注必然伴随失败,真正的能力在于既不自欺,又能允许少数“超级命中”覆盖长期探索成本。
没有匹配的文稿。