Sabrina Halper Show 2026.09.02

Factory 创始人 Matan Grinberg:递归自我改进、中国开源模型与弦论带来的启示Sabrina Halper Show

Factory 创始人 Matan Grinberg 从弦论博士生涯谈到自主软件工程:理论物理训练给他的核心能力,不是某套公式,而是在永远信息不完整时快速抓住本质并做判断。

01

先看结论:后 AGI、软件护城河与开源模型

Matan Grinberg

我觉得我们现在已经进入 post-AGI 时代了——就好像 AGI 已经存在。唯一会让人类彻底没有工作可做的世界,是我们把所有问题都解决了。但在我看来,现存的问题数量在这里,而我们真正解决的问题数量还远在另一边。过去软件公司有一种护城河:我们知道怎么把东西做出来,别人不知道,所以我们会赢。这个护城河现在不存在了。没有什么东西是别人绝对造不出来的,这很疯狂。

大家经常谈 recursive self-improvement,递归自我改进:模型足够好之后开始训练、改进自己,形成循环,然后能力疯狂提升。但“能够自我改进”并不等于“能力会双曲线式爆炸增长”。我们完全可能达到 RSI,却发现它自己改进自己的速度仍然不如人类参与改进快。这个区别经常被忽略。

还有安全问题。以前如果公司发生安全事故,你应该感到羞愧、承担责任;现在却有人把这件事写成研究博客来炫耀。以及,如果我的选择是“没有开放模型”还是“有来自中国的开放模型”,我会明确选后者。因为如果高质量模型只来自少数闭源供应商,那会形成一种终极垄断——一个足以终结其他垄断的垄断。从整个经济体的利益看,我们不应该走到那一步。

Sabrina Halper

Matan,欢迎来我的节目。

Matan Grinberg

谢谢邀请我。

Sabrina Halper

我特别高兴你来。顺便说一句,你是我播客里第一个我也有幸作为小天使投资过的人。

Matan Grinberg

投得太少了。

Sabrina Halper

这个可以改。为了准备这一期,我还翻出了当年发给你的第一条消息。那时候我大学毕业才一年半,在纽约一家风投基金工作。我用 LinkedIn Sales Navigator 去找那些履历非常夸张、但 LinkedIn 上又看起来没在干什么的人——通常这意味着他们可能正在偷偷创业。我看到你的资料:做弦论 PhD、写过一堆疯狂的物理论文,同时 Twitter 上又出现了一个叫 Factory 的东西,于是我想,“这人到底在干什么?”

02

Sabrina 如何找到 Matan,以及一个到处搬家的数学少年

Sabrina Halper

我记得那是 2023 年 5 月。你当时几乎刚开始,我好像是最早联系你的人之一。你还记得吗?

Matan Grinberg

当然。事实上,那可能是我们收到的第一封投资人主动询问。当时公司真的很小,我们甚至还没准备好对外讲什么。我非常震惊你这么快就找到了我们。你不是靠什么正式融资流程,而是自己在网上把线索拼起来了。

Sabrina Halper

我想从更早开始。你小时候是什么样的人?

Matan Grinberg

我基本是在湾区 South Bay 长大的,但小时候搬家特别多,大概搬过十到十一次。我的父母都是苏联移民。父亲来自莫斯科,母亲的家庭来自摩尔多瓦一带。他们后来都在湾区工作。父亲长期在 South Bay,母亲在 Stanford Children’s Hospital 一带工作,所以我们的生活半径一直围着 Saratoga、Palo Alto、Cupertino、Los Altos 这些地方转。

搬得多不完全是因为工作。我父母有时会买房、装修、出租或者再卖掉,所以我小时候经常发现“哦,我们又要搬了”。这可能也让我很早就习惯环境不断变化。

Sabrina Halper

你小时候就是那种特别用功的天才小孩吗?

Matan Grinberg

完全不是。我挺调皮的,也被停过学。我经常觉得学校很无聊,但数学确实一直很好。我父母反而有点担心我,因为我显然有能力,可又不太愿意按学校那套方式来。他们会把我送去数学营、物理营之类的地方,希望我把精力放在更有建设性的事情上。

Sabrina Halper

所以你不是从五岁开始就宣称“我要做弦论”的那种人?

Matan Grinberg

不是。真正的转折其实来自愤怒,而且是很幼稚的那种愤怒。

03

因为一句“重修几何”走进弦论

Sabrina Halper

什么愤怒?是什么把你推上物理这条路的?弦论又到底哪里吸引了你?

Matan Grinberg

八年级快结束时,我还是一个不怎么勤奋的学生,但我知道自己数学很好。结果几何老师告诉我:“你上高中得重修几何。”我当时非常冒犯,心想:“她居然觉得我要重修?这些我都会。”于是我决定暑假证明给她看。

我人生第一笔 Amazon 订单——今天把订单列表拉到最底下还能看到——就是一大堆教材:Algebra 2、Trigonometry、Precalculus、Analysis 1/2/3、Differential Equations。我对自己说,好,我这个暑假就把它们全学了,还去参加外部课程和考试。

然后我问我爸:“最难的数学是什么?”他回答“弦论”。严格说弦论是理论物理,不是数学,但确实非常接近。于是我就说,那我就做弦论。我在 South Bay 上的是一所很小、几乎没人听过的私立学校,我们毕业班只有十个人。它有一个好处:学校允许我大量上网课、参加外部考试,所以我可以一直往前学。后来我真的形成了一个很夸张的目标:我要成为世界上最好的物理学家。说到底,这一切居然是从生气开始的。

Sabrina Halper

但对一个没学过这些的人来说,弦论到底是在解决什么?

Matan Grinberg

人类最强的两套预测理论,一套是量子场论,描述微观世界——粒子、电子、光子这些;另一套是广义相对论,描述很大的东西,比如星体和时空。它们的预测精度可以做到小数点后 13 到 15 位,这种准确程度简直不可思议。所以物理学家很自然会以为:这两套最成功的理论当然都对,而且应该能够放在一起。

问题是,一旦你真把它们放在一起,数学会崩掉。你可能问:一个讲极小,一个讲极大,它们为什么需要碰面?黑洞就是答案。黑洞奇点既极小又极重,你同时需要量子理论和广义相对论;可一组合,到处冒出无穷大,预测失效。弦论就是人们试图让这两套框架相容的一类方案。

Sabrina Halper

你在那个世界里待了十多年。虽然你现在做的事情看起来完全不一样,那种训练到底留下了什么?

04

理论物理真正教会他的:在信息不完整时做判断

Matan Grinberg

我做过的最好的一篇论文之一,讨论的是十维引力。你看看周围,我们显然不是生活在十维里,所以它非常抽象。但这种工作训练出来的能力,其实特别适合做公司:在你永远不可能掌握完整信息时,仍然做出足够好的判断。

理论物理有几百年的文献积累,而且每天大概还有一百篇新论文出来。你想真正做出贡献,几乎什么数学都得懂一点:algebraic topology、differential equations、algebraic geometry……每一个领域都足够别人做一辈子,但你不可能在每个领域都成为世界级专家。

所以真正的技能变成:我怎么最快读这些书,抓住 gist 和 intuition?哪些东西必须深入,哪些东西只能快速扫过去?我不可能把几千篇基础论文全部精读,但又必须知道什么信息足以支持下一步判断。这就是在极少、极不完整的信息下做判断。创业也是一样:你永远拿不到完整信息,但你还是得做重要决定。

Sabrina Halper

这比“会十维引力”听起来更像创业技能。

Matan Grinberg

对。理论物理本身很抽象,但判断方式非常可迁移。

05

离开学术界:IMDb 250、存在危机与物理学家的傲慢

Sabrina Halper

你刚才提到和 Juan Maldacena 相关的论文。你在 Berkeley 读博士时,什么时候突然说“算了,我不干这个了”?

Matan Grinberg

先纠正一下:那篇和 Juan 有关的工作其实是本科时期。后来我去 Berkeley 读 PhD,真正是在那里意识到我不想一辈子待在学术界。做理论物理基本意味着你必须留在 academia,而留在 academia 又意味着你得当老师。我不是一个特别好的老师,也不太享受教学。我当时有个很真实的念头:“天哪,难道我余生都要被 18 岁的人包围吗?”

Sabrina Halper

弦论本身呢?现在还有很多东西在发生吗?有人会说它“死了”。

Matan Grinberg

当然还有很多有趣的问题,但它是不是最有活力的地方?可能不是。过去十年里有很多非常聪明的理论物理学家离开了。Anthropic 的联合创始人里就有相当多物理背景的人,Jared Kaplan 和我甚至做的是很接近的方向;Dario 也学过物理,只是更偏生物。你会看到一种“物理学家外流”,因为别处出现了更有吸引力的问题。

Sabrina Halper

那你离开之后做什么?

Matan Grinberg

老实说,是一次很大的存在危机。我整个身份都建立在“我是物理学家”上。物理学家有时候还有一种傲慢,我自己肯定也受过影响。Rutherford 有句著名的话——如果我记错人名就改掉——“All science is either physics or stamp collecting.” 意思差不多是:要么是物理,要么只是在给东西分类。你长期处在这种文化里,很容易把“做物理”当成自己人格的一部分。

Sabrina Halper

而你此前也没真正做过别的工作?

Matan Grinberg

基本没有。除了做物理研究拿 grant,我从来没靠别的工作领过钱。所以我先决定让自己变成一个“正常、全面一点的人”。我找了一份“100 部最重要文学作品”的清单,开始一本本读;又打开 IMDb Top 250,把电影一部部看完。因为我过去在人文学科上真的很无知。Dickens 的《双城记》结尾甚至把我看哭了,我当时想:原来这种东西这么好。

做完这些我还是得想职业。我的选择大概是:利用十年 quantitative methods 经验去纽约做量化金融,这是很多数学家和物理学家的常见路线;或者去 Big Tech;或者去创业。我一度真的差点去纽约做量化,但最后朋友给了我很好的建议:你数学永远会很强,不用急着把它变成那条最显然的职业路径,先把 PhD 和研究做下去,同时看看别的东西。

06

从程序综合到创业:代码“自我复制”的吸引力

Matan Grinberg

在那之前,我没有上过正规的计算机科学课程。做物理当然写了很多程序,但不算系统学 CS。后来我去上了几门硕士课程。我这个人竞争心很强,发现自己没有 CS 本科背景,却能在这些课里比一些科班学生做得更好,这件事给了我一种很强的竞争快感,所以我继续学。

真正把我“nerd-sniped”的,是 program synthesis——我们今天更常把它叫 code generation。物理训练会让你本能地寻找“基础性的东西”:不要只看某个特例,要看 general case、n-dimensional case、abstract case。视频、音频、图片的格式在某种意义上都很任意,但机器学习与“能够生成、改写自身代码的系统”有一种非常 fundamental、非常原始的意味。我一下子就陷进去了。

我因此又在 Berkeley 多待了一年。然后越来越明显:如果要真正解决这个问题,academia 不是最合适的地方。你需要进入有真实、复杂、非平凡代码库和工程系统的环境,也就是工业界。而最直接的方式可能就是自己开公司。

问题是我完全不知道怎么开公司。所以我又回到熟悉的方法:先去 Amazon 买 Peter Thiel 的《Zero to One》,再去 YouTube 搜“how to start a company”。我随机看到了一个 Sean Maguire 的视频播客,发现他以前也是物理学家。我马上想:我得跟这个人聊聊。于是我给 Sean 发了冷邮件。

07

冷邮件 Sean Maguire 与 Factory 最初的使命

Sabrina Halper

Sean 回了你,你们出去散步。那时候你脑子里的 Factory 到底是什么?

Matan Grinberg

很震撼的是,我们最早那份 pitch 里的核心使命,和今天其实差不多。我们从第一张 slide 开始就想做 autonomous software development。不是 AI autocomplete,不是把 AI 塞进 IDE 里帮你更快补几行代码,而是用完整的 agent-based workflow 把软件开发中的一部分工作真正交出去。

如果在酒吧里让我用一句粗俗点的话解释,我们就是:automate the crap engineers don’t want to do——把工程师不想干的那些烂活自动化掉。关键是 automation,不是 acceleration。不是把工作从一个地方挪到另一个地方,也不是只把人的手速变快,而是让执行本身能脱离人持续运行。

当时可能确实太早了,但今天看这条路径比我原先预计的还快地变成现实。方向没有怎么变,只是我那时完全不知道创业、招人、组织这些东西有多难。

08

“沙漠期”为什么结束:模型变强,也因为工程师改变了习惯

Sabrina Halper

你以前把那几年形容为“walking through the desert”。愿景很准,可技术上就是做不到。为什么过去一年左右突然开始真的能工作了?

Matan Grinberg

It takes two to tango。一方面当然是模型变强了;但另一个很大的障碍其实是行为。开发者是世界上最擅长系统思考和解决问题的一群人,同时也是最挑剔的一群人。他们往往花了十几年、几十年塑造自己的 workflow,非常清楚自己喜欢什么 IDE、怎么组织工具链、怎么工作。

消费产品里大家爱讲 Steve Jobs 式的“用户不知道自己想要什么,我比用户更懂”。对开发者往往不是这样。他们真的知道自己要什么,而且喜欢 modular、composable、customizable 的东西。你很难强迫他们换掉一整套工作方式。

Sabrina Halper

所以过去一年,是他们被迫重新思考这一切了吗?

Matan Grinberg

我觉得人们确实更愿意说:过去认为神圣不可动的东西,现在都可以重新从 first principles 看。模型本身又同时大幅变好,这两件事叠在一起,于是软件开发的样子必须变得非常不同。

Sabrina Halper

Droid 今天具体能干什么?五年后又会是什么样?

Matan Grinberg

我们公司里有时会开玩笑说:anything you can do on a computer, you can do on a Droid。严格说,这句话已经相当接近事实。真正的问题不是“能不能”,而是为了让它可靠工作,你还需要配置多少环境、上下文和防护。

我们正在努力让这些准备越来越少。以前你要给一大串 instructions,现在 Droid 可以自己观察你过去怎么做、推断以后想怎么做。我们见过企业处理三十年历史的 COBOL migration:过去预计两年,现在 Droid 自己连续工作,四天就能做完。这个数量级的变化会迫使组织重新定义工程工作。

09

新瓶颈不是执行,而是决定“该做什么”

Sabrina Halper

四天替代两年,听起来简直疯了。

Matan Grinberg

真正的最大障碍已经不是 Droid 能做多少,而是谁来告诉它“现在最值得做什么”。新的 bottleneck 不再是 task completion,而是决定任务本身:哪些任务应该排在最前面?我们究竟应该让这些代理做什么?

Sabrina Halper

Anthropic 也说过现在他们相当一部分代码由 Claude 写。据说甚至到 80%。我还听那里的人说,技术招聘面试都要重做,因为需要的技能集合变了。那现在什么样的工程师会真正成功?

Matan Grinberg

十年前,招聘优秀工程师的一个很强信号可能是编程竞赛、算法竞赛,因为你想要的是能极快理解语言、算法、实现细节的人。现在这不再是负相关,只是相关性大幅下降。很多具体语言和算法知识,模型在 90% 的场景里已经比多数人掌握得更好。

我们现在发现更好的指标是 agency——主动性、主观能动性、对结果负责的倾向。前创业者在 Factory 的表现是非常强的信号,不是因为“创业失败或成功”这个标签本身,而是他们习惯遇到问题后自己找路,愿意对 outcome 负责。你会需要那些能在没有完整 instructions 时自己推动事情发生的人。

Sabrina Halper

所以重点从“我能多快把题做出来”,移到了“我知道哪道题值得做,而且能把结果扛下来”。

Matan Grinberg

对,这更接近 founder 的工作方式。

10

企业 AI 的三个阶段,以及 token maximization 的终点

Sabrina Halper

你现在跟很多大企业打交道。过去一年半,CEO 和董事会对 AI 的态度也在变化:预算什么时候不再转化为生产力?企业又怎么看自己对少数模型实验室的依赖?

Matan Grinberg

我观察到企业采用 AI 大致经历三个阶段。第一阶段是 AI 铺天盖地出现在新闻里,Andrej Karpathy 之类的人每天发模型有多强,于是董事会开始冲 CEO 喊:“我们的 AI strategy 是什么?赶快上 AI。给产品加点 AI,让我们也成为 AI company。” CEO 再去找 CTO:“我们到底在干什么?确保所有人都用起来。”

第二阶段就出现了 token maximization——不惜代价把使用量推上去。甚至会用“某个人用了多少 AI”来衡量他的表现。长期看这当然不是最优策略,但如果你的目标是打破旧习惯、让组织真正开始试新东西,短期超预算有时是合理的。你得先把发动机点着。

现在我们正在进入第三阶段:好,人们已经在用 AI 了,接下来得测 ROI。不能只问“用了多少 token”,而要问“每个 token 带来了多少利润或结果”。不同部门答案会完全不同。IT 负责人迟早得像分配人力预算一样分配 token budget:多给这个团队一美元推理预算,会得到什么边际回报?

有些地方,多出来的一美元可能花在人身上更值;另一些地方,执行几乎可以完全交给 token。比如企业销售本质上仍然很依赖人与人关系。AI 可以在开会前把十封邮件总结好,确保你没漏信息,但这根本不需要最顶级、最昂贵的模型。关系型活动会很快碰到 token 的边际收益上限。

但产品、marketing、data science、engineering 这些领域不太一样。更多 token 可以让你跑更多 A/B test、更深地理解用户、尝试更多实现、不断改系统,所以我们在那里看到显著 ROI。即便如此,最后仍然取决于人:有的团队会非常浪费 token,有的团队会极高效。这也是我们做 routing 的原因之一——不是所有任务都应该扔给最贵模型。

Sabrina Halper

我听说有段时间,有企业甚至按员工用了多少 AI 来评价人。

Matan Grinberg

有,或者至少把它当成很重要的指标。很贵,但如果只是为了让组织先动起来,我能理解。可长期当然不能这样。如果你让我花一百万美元 token,我可以很容易花掉,它不代表产生了一百万美元价值。

11

AI 采用不是行业问题,而是管理团队问题

Sabrina Halper

放到更大范围,有没有哪个行业采用得特别快,或者哪个行业慢得出乎意料?

Matan Grinberg

我最大的感受是,这一次不像 cloud adoption 那样主要按行业分层。云时代可能是某些 sector 明显领先、另一些明显落后;AI 这波更像是 team by team、management team by management team。

同样是银行,有的极其 progressive,有的非常落后。差异常常就在领导团队是否愿意推动、是否能衡量结果、是否真的改变流程。所以我不太愿意说“这个行业先进、那个行业保守”。对任何 business leader 来说,这反而是件鼓舞人的事:相当大一部分结果真的就在你手上。

Sabrina Halper

那我们说说模型。Factory 本质上会为任务路由到最合适的模型,包括 OpenAI、Anthropic 的不同型号,也包括开放模型,对吧?

Matan Grinberg

对。

12

中国开源模型与“终结所有垄断的垄断”

Sabrina Halper

对中国开放模型,外界意见很分裂。Factory 会用。你怎么看它们带来的风险?

Matan Grinberg

总体上我非常支持 open models。我觉得“大 token 公司”里存在一种宣传倾向:试图把“开放模型”和“中国模型”直接画等号。它们不是同一件事。开放模型本身非常重要,我们必须确保它们存在。大公司当然不喜欢,因为开放模型会削弱它们对 token 定价的控制力。

Sabrina Halper

但现在最强的开放模型是不是很多都来自中国?

Matan Grinberg

目前最好的里面很多确实是中国的,但也不是只有中国。比如 NVIDIA 的 Nemotron 就很好。

Sabrina Halper

我居然没听过。

Matan Grinberg

NVIDIA 的。它还未必站在绝对最前沿,但已经非常不错。这也是为什么我认为美国和西方拥有先进 open model 是 vital interest。

对每一家美国企业来说,同样不应该掉进 closed-model providers 的垄断。这里有个微妙的权衡:如果选项是“没有任何好开放模型”和“开放模型主要来自中国”,我宁愿要后者。因为只有闭源供应商能提供高质量模型的风险,是一种 absolute monopoly——它最终会吞掉其他竞争。整个经济体都有利益阻止这件事。

当然,既然开放模型会存在,我更希望最好的开放模型来自美国。未来 token 生成量会越来越接近世界信息生产量。如果你认同西方价值,那你会希望其中更多内容由体现西方价值的模型生成。你拿中美两个模型问普通 coding question,眼下差异可能极小,但这种微小差异会随着数十亿、数万亿次交互积累。

13

Sleeper agent、投毒代码与模型安全

Sabrina Halper

中国开放模型还有一个 nuance:它们并不一定“完全开放”,你看不到完整训练数据。长期来看,如果人从十岁开始就跟模型互动,语言、建议、工作方式都会形成反馈回路,价值观的影响可能非常细微。更直接的安全风险呢?

Matan Grinberg

如果你把中国开放模型部署在美国数据中心,它未必能直接看到或把你的数据交出去,所以“模型在中国”并不等于“数据发到中国”。但依然有几类危险向量。

第一类是 sleeper agent。理论上,一个模型可以在 latent space 里藏着某种触发行为:平时一切正常,遇到特定词或 trigger 后突然尝试偷数据、把数据发给某个服务器,再经过欧洲或非洲之类的中转最终流向别处。名义上部署方式完全合规,但触发后行为变得 hostile。这不是科幻意义上的“模型自己觉醒”,而是可以通过训练植入、而且很难彻底验证的一类行为。

Sabrina Halper

你真觉得这种事可行?

Matan Grinberg

当然可行,也有人研究。难点是很难全面验证,所以应该认真检查,但不能假装检查一次就万事大吉。

第二类风险是生成代码的质量和分布偏差。极端情况下可以是故意的:比如让英文文档、美国代码库语境和含 zero-day vulnerability 的代码产生隐蔽关联,使模型偶尔在西方代码环境里引入很细微的漏洞。这类相关性极难发现。也可能完全不是故意的:如果一个模型主要在中国开发,训练和评测会优先保证中文代码库或本地技术栈质量,英文或其他语言的数据可能天然更差。两种情况——恶意和非恶意——最终都可能造成系统性风险。

我仍然会选择承担这类风险,而不是接受美国只剩少数闭源供应商的垄断。风险要管理,但不能用“有风险”作为让开放生态消失的理由。

Sabrina Halper

说到风险,最近大实验室经常公开模型做出的那些极端行为,甚至有点像“我的模型更危险”“不,我的更危险”。

Matan Grinberg

我非常不喜欢把“问题有多严重”当作争取 legitimacy 的方式。以前发生安全事故,公司会觉得丢脸、会被问责;现在有人反而在 research blog 里拿它炫耀。比如 sandbox 做得很烂,agent 从 sandbox 跑出去——那首先可能是部署者的错,不是什么值得炫耀的“高级能力”。还有一种情况是嘴上说“没给互联网访问”,实际环境里却真的开放了网络,然后模型上网做了事,大家再惊呼“天哪,它获得互联网了”。这可能只是 gross negligence。

我不是说模型没有真正危险的高级能力,当然有。恰恰因此,我们更应该区分两件事:模型本身的危险能力,和部署它的人把权限、sandbox、网络边界做坏了。把后者包装成前者,会让安全讨论失真。

14

白宫 open-weights 政策、监管俘获与开放模型

Matan Grinberg

如果这真是一场可能给人造成现实伤害、甚至巨大经济损失的 arms race,那更不应该把事故当勋章。回到政策上,我还担心另一个问题:大玩家利用安全叙事做 regulatory capture,让新模型开发者很难进入市场。

白宫最近公布的 open-weights 方向,我认为是一个很聪明的突破。Michael Kratsios 等人推动的核心思路,在我理解里是:如果你发布大型 closed model,那你要承担相应监管负担;如果你发布开放模型,就不要用同样的审批壁垒把它压死。换句话说,closed 的可以存在,但不能一边享有封闭带来的控制力,一边让监管成本只落在潜在竞争者头上。

另一种路线是建立一个机构,任何达到某规模的模型发布前都必须测试、审批。听起来合理,可现实里很容易变成:审核耗时无限、需要关系、创业公司承担不起,于是创新被卡住。结果最强的大公司反而最能适应这种制度。

Sabrina Halper

你真觉得美国开放模型能追上吗?

Matan Grinberg

我觉得可以,而且 incentive 已经越来越清晰。甚至未必需要政府把每件事都亲自做掉。真正棘手的是 distillation 的不对称性:美国之外的模型开发者可以去蒸馏最强美国闭源模型,而美国本土开放模型开发者反过来这么做,可能直接违反美国公司的 terms of service,然后在美国被起诉。

15

蒸馏难题与“十亿美元级代理事故”

Matan Grinberg

现在很多非美国模型在蒸馏美国最强模型。有人希望政府直接阻止,但我觉得模型供应商自己也有责任:做 KYC,如果你明知某客户大规模调用只是为了蒸馏你的模型、而你不接受这种用途,就拒绝他。问题是这些调用也贡献收入,所以公司有动力继续卖 token。条款写着“不许蒸馏”,但你很难跑去中国起诉一家模型公司并有效执行。

反过来,美国 open-model company 就没这么自由。如果它在美国违规蒸馏,会受美国法律和合同约束。这才是我认为真正难的地方。如果能降低这种不对称造成的障碍,美国开放模型追上并不神秘。除此之外,只要存在清晰经济激励——政府和企业愿意购买美国开放模型,投资人就看到收入,VC 就会给钱,公司就能雇好研究员,形成正循环。

Sabrina Halper

再深一层谈 cybersecurity。代理现在让黑客用更少资源做更多事,普通消费者没准备好,大多数公司也才刚开始适应。能力和防御是在同步推进吗?

Matan Grinberg

不同步。大家冲向新 capability 的速度明显比冲向 security 快,这是巨大问题。很不幸,我觉得很多组织可能要等一次真正严重的事故,才会集体醒过来:“等一下,我们真的必须把这些东西保护起来。”企业已经开始投入更多注意力,但还远远不够。

我联合创始人 Eno 有个预测:这个十年里的某个时候,会发生一起涉及 agent 的十亿美元级事故。我觉得未必只是一件事。现在大家已经用 agent 做大量事情。我们自己就见过 agent swarm 试图攻击我们的系统,最后没成功。我们甚至写过博客。我们用 Droid 去对抗对方使用的 agents,内部把它叫“Droid Wars”。代理安全真的是一个很奇怪的新世界。

Sabrina Halper

AI 写的代码越来越多,会不会反而更脆弱?

Matan Grinberg

很难一句话回答。一方面,它可能更可靠,因为不会犯很多人类粗心导致的错误;另一方面,如果训练分布或 latent space 里系统性带着某类漏洞,它可能会以非常一致、非常“方法化”的方式重复那类漏洞。我们得同时适应这两种现实。

但我可以给一个更大胆的判断:再过几年,手写代码的人会非常少。你反而会希望大部分代码来自 AI,因为它的生成过程至少更可重复、更容易系统分析攻击面。现在实验室里已经有大量代码是 AI 写的,只是还没到 100%。

Sabrina Halper

那就回到 recursive self-improvement。模型什么时候真的能自我改进?到了那个点会不会一切突然改变?

Matan Grinberg

先把定义拆开。RSI 的含义只是:模型能够实质性改进自己。它不自动推出“能力会无限、指数或双曲线爆炸”。一个模型可以会改自己,但因为它还不如优秀研究员,所以每一轮只进步一点点,甚至整体速度仍比“人+模型”慢。

有些最沉迷 AGI timeline 的人会说 2027 年底 AGI,然后下一年世界彻底改变。里面经常藏着一个额外假设:一旦 RSI 到来,就等于疯狂能力跃迁。这个推理并不成立。我们可能得到 RSI,却只得到一条非常慢的改进曲线。今天模型当然已经对改进下一代模型做出巨大贡献,但我没看到证据表明我们已经进入“把它放开,它就不受限制地自我提升”的状态。

16

递归自我改进不等于爆炸式增长

Matan Grinberg

所以,我没有看到那种“人类松手之后,AI 自己无限改进”的迹象。递归存在,不代表增长曲线必然失控;速度、质量、研究判断和外部验证都还是约束。

17

“我们已经在 post-AGI 时代”与 AI 做数学

Sabrina Halper

实验室里的人通常最相信 AGI 很近,因为他们最早看到前沿模型;但你又天天和银行、大公司这些现实客户打交道,他们知道 bureaucracy 很慢。两个问题:你的 AGI timeline 是什么?以及就算旧金山实验室宣布“我们做到了”,投行、律所和其他行业到底多久才会真的改变?

Matan Grinberg

对我来说,AGI timeline 很难回答,因为定义和路径都太不确定。如果你问“AGI 对我意味着什么”,我甚至会说:我们已经到了。我们已经在 post-AGI era。过去一年看起来就像“AGI 之后的生活”:我们开始解决此前做不到的非常酷的问题。

我非常乐观,但不是因为“所有工作马上没了”。恰恰相反,工具越强,我们想解决的问题规模也会扩大。只有一种世界里人真的无事可做:所有问题都已经解决。可现实是问题空间远大于当前解题能力。

Sabrina Halper

而且生活质量越高,我们越会把以前根本不算问题的事情看成问题。

Matan Grinberg

对。比如 DoorDash。它解决的是真问题:有人没时间买菜、取餐。你如果对一万年前的人描述这个问题,他可能会说:“什么?这也叫问题?你自己去拿不就行了?”生活改善之后,新的摩擦才会上升成“值得解决的问题”。所以每解决一批问题,往往又会打开更多以前想不到的问题。

Sabrina Halper

数学就是个有意思的例子。现在 AI 已经在推翻一些 conjecture、扩大一些证明阈值。你作为前理论物理学家,会觉得这是一个特别激动人心的时代吗?

Matan Grinberg

非常有意思。甚至如果你今天想解决数学问题,待在 AI company 可能比待在传统 academic environment 更有资源。现在系统尤其擅长找 counterexample,或者把一个已有结果从某个 threshold 推高到更高一点;它还不太擅长凭空定义全新的研究领域、创造一整套新理论。

有个 Riemann hypothesis zeros 相关的进展很能说明这种能力。粗略说,一个性质如果能覆盖 100% 的 zeros 才算走到终点;过去的阈值大概在 47% 左右,而且几十年里一次只往上挪几个百分点。最近一次工作一下加了约 20 个百分点。如果一个人单独做出来,这绝对是巨大成就。

但数学家可能会说,这还不是“最美”的那类数学。数学里有让人惊叹于结构之美的新理论,也有很强但更像把 threshold 往上推的工作。AI 目前在后者上进展尤其显著。我觉得这反而很好:让系统接管大量这种搜索和推进,人类可以把更多精力放到和 AI 一起创造全新的理论框架。

18

软件能力普及后,为什么好软件的门槛反而更高

Sabrina Halper

软件工程越来越便宜,非技术人员也获得了一部分软件工程能力,而最技术的人又得到超级加速。这个变化最终怎么传导到产品、服务、GDP 和总体生产率?

Matan Grinberg

很难直接给 GDP 数字,因为有几个同心圆同时扩张。最外层是“我们能解决什么问题”;里面一层是“普通人能创造什么软件”。普通人的能力快速上升,但“什么算好软件”的质量门槛也同时上升,所以我们最终会把更多以前忍着不管的摩擦变成可解决问题。

我最喜欢的例子是 California DMV。八年前去一次体验非常糟,现在他们改了不少,稍微好些。但关键是:我们根本没必要接受“公共服务软件就该难用”。未来应该到处都有好软件,而且好到你甚至注意不到软件存在。

很多交互会从 intention 直接到 action。比如连一个 Bluetooth speaker、把一盏灯接到设备上、把东西发给某个人——现在每件小事都包含设置、菜单、兼容性、重复确认。我们可以把这些 friction、无关 feature 和 mundane task 一层层拿掉,让人保持 flow,把注意力留给真正重要的事。

Sabrina Halper

那是不是每个人最后都会自己做一套完美软件?

Matan Grinberg

不一定。最难的仍然是 vision——你到底想要什么。生成能力变便宜,并不会自动给你判断力。

19

不是每个人都该自己造软件:回到核心能力

Sabrina Halper

公司层面也一样。有些企业现在会说“我们自己做”。卖 AI 软件的人则说,销售周期很长,因为客户往往要亲自试过、发现没那么简单,才会承认需要外部产品。

Matan Grinberg

对,所以我并不觉得 everyone will build everything themselves。企业最终还是要回到 core competency:究竟什么让我们成为一家真正成功、比别人更好的公司?如果你是 consumer goods company,你的核心能力大概率不是自己造一整套内部 coding agents。这类共同问题可以从市场上买到更好的解决方案。

个人也一样。如果你生活里有个问题,而成千上万人都有,你大概率不该花大量时间自己从头造工具。别人很可能已经用比你更多的时间、更大的野心解决它了。把共同问题外包出去,你才能把精力集中到自己真正热爱、真正擅长、真正有 right to win 的事情上。

我自己也做很多低效率的杂事,我很期待这些东西被消掉。那比“每个人都自己造手机、自己造 App、自己造送餐系统”的世界好得多。后者听起来像自主,实际可能只是把大量基础设施工作重新压回个人身上。

Sabrina Halper

Factory 自己现在增长也非常快。我刚跟另一家软件公司的人聊,她说变化快到几乎没有时间停下来想战略。你有同样感觉吗?

Matan Grinberg

绝对有。以前软件公司的优势可以是“我们知道怎么 build,别人不知道”。现在这条不成立了。几乎没有别人绝对做不出来的东西。于是 differentiation 越来越来自 willingness to say no:我们到底把什么做到极致,什么即便能做也不做,什么只是短期 fad。

因为理论上什么都能造,“我把所有东西都自己做”反而成了诱惑。可很快你会发现真正难的仍然是选择。Factory 里我常说,我的 love language 就是别人对事情说 no。我喜欢听团队说“不做”,我自己也喜欢说“不”,因为这说明我们在做真正困难的取舍。容易的决定是“都要”,困难的决定才是“我们明确不做这个”。有时甚至应该把“不”说得稍微过头一点;如果某件事真的非做不可,事实最终会逼得你非常清楚。

20

两年低谷、忠诚的人与真正重要的投资人

Sabrina Halper

回到你个人。三年前你跟 Sean 散步,他相信你、写了支票,Sequoia 很快也投了。那一定很爽。然后你又经历大概两年很难的时期:你仍然觉得 vision 对,可 product-market fit 就是不完全工作;再后来突然转折,像火箭一样起飞。经历“VC 的太阳照着你、人人都想当你朋友”到公司困难、有人不再那么积极回电话,这是什么感觉?

Matan Grinberg

很难。可能我在 Princeton 读书的经历反而给了我一点预演——有时人需要你时会特别友好,不需要你时又是另一种样子。当然我爱 Princeton,只是在这种环境里你会更早看到这类行为。

我学到最重要的一点,是无限忠诚的人比大牌名字、潮流 logo 重要得多。投资人不会替你 build company。你 cap table 上有多酷的基金 logo 并不能解决日常问题。真正重要的是困难时周围有人真的支持你。

有时候最好的支持不是每次看到 competitor tweet 就立刻转给你,提醒你“别人又做了什么”,而只是说一句:“You’ll make it.” 然后让你安静工作。低谷也有一个好处:谁是真的,谁只是顺风时出现,会变得特别清楚。

今天能从那段时期走出来,本身就是一种 privilege。我们现在团队已经超过 100 人,是我合作过最聪明的一群人,他们想做自己一生里最重要的工作。我们又在一个非常美的城市里。每天我都很感激,但同时也知道必须更努力,每多投入一个小时都很重要。

Sabrina Halper

所以我其实很感谢你愿意拿出这一小时。现在让这些前沿公司的创始人花一小时录播客,我真的会感觉到这小时的成本,希望听众也能感受到。

Matan Grinberg

很多世界上最聪明的人都关注你,希望他们听完以后来 Factory。

Sabrina Halper

最后一个问题:一路上哪些团队成员、投资人或顾问真的让你印象特别深?

21

最好的顾问、Chainsmokers 投资人与结尾

Matan Grinberg

Sean Maguire 在我们董事会,他是第一个真正相信我的人,也是我们的第一位投资人,一直极其投入。Sequoia 的整个团队也非常好。你可能天真地觉得“他们牌子最大,所以可以躺着”,实际不是,他们每天都很拼。

Snowflake 的商业负责人 Chris Degnan 也是我们的顾问。我刚开始完全不懂 enterprise sales,他几乎把我知道的很多东西都教了。书当然有,但有些关键感觉书讲不出来。我在销售上犯过太多错误。如果一定要压缩成一个最重要的教训,就是:把 sales 当作 top priority。否则你很难建成一家 legendary business。这一点没有讨价还价的空间。

Palo Alto Networks 的 CEO Nikesh Arora 也给了我们很多帮助,非常慷慨地投入时间。Chris Frederickson 也是。你认识他——他很谦逊,是那种“懂的人自然懂”的人,极好的 manager,也是真正厉害的 investor。很多我认识的人在关键时候都会很认真地依赖他的判断,他也真的愿意给建议、给支持。

还有 The Chainsmokers 的 Alex Pall 等人。最早很多人会问:“他们真的是好投资人吗?”答案是,他们工作非常努力,而且真的很会做投资。有个很有意思的变化:你去看他们 Las Vegas residency 的幕后,五年前 DJ 台后面可能全是美女;现在往后一看,几乎全是 founders 和 engineers。他们抓住了一件事:创业者也想觉得自己很酷、想玩、想靠近音乐。他们提供了一个跟传统 VC 完全不同的东西。

我跟每个和他们合作过的 founder 聊,对方都说他们随时愿意帮忙,而且像永远不睡觉一样。我什么时候发消息,几乎都马上回。他们对时间和人脉都非常慷慨。我们很幸运有这么多真正投入、真诚的投资人。当然还有 Sabrina Halper——Factory 最早的一批 angel 之一。

Sabrina Halper

对,我当时应该更坚持、多投一点。我们现在开始补也行。Matan,谢谢你来。看着你从一个很早期的想法,把 Factory 做成一家真实运转、真实交付产品、让 autonomous software development 变得可用的公司,对我来说很特别。

Matan Grinberg

谢谢邀请,很开心。

Sabrina Halper

如果你喜欢这一期,请订阅节目。它真的会帮助我把节目继续做大,也让我能每周持续做新的访谈。