主题索引
主题

AI 安全

2 篇相关中文文稿

001

Dario Amodei:Claude、AGI 与 AI 和人类的未来

这是一场超过五小时的 Anthropic 专题访谈。第一部分,Anthropic 联合创始人兼 CEO Dario Amodei 从自己在百度研究语音识别的经历谈起,解释“缩放定律”为何成为他理解 AI 进步的核心框架;随后讨论 Claude 模型家族、预训练与后训练、计算机操作能力、负责任缩放政策、AI 监管、团队建设,以及他对“强大 AI”时间线和积极未来的判断。 第二部分,负责 Claude 性格与对齐研究的 Amanda Askell 解释:模型并不是一个只会检索答案的数据库,它会在上下文中扮演角色、形成行为倾向。因此,训练一个诚实、善良、有判断力、又不流于讨好的 Claude,需要哲学、清晰表达、可扩展监督、宪法式原则和大量模型自我训练共同参与。 第三部分,机制可解释性研究者 Chris Olah 带领听众进入神经网络内部:特征、回路、叠加、单义性和稀疏自编码器如何帮助研究者识别模型正在表示什么。三段对话共同指向一个问……

Lex Fridman 5:15:00
002

走进 Anthropic CEO Dario Amodei 的内心

Bloomberg Originals 的《The Circuit》主持人 Emily Chang 与 Anthropic CEO Dario Amodei 进行了一场超过一小时的深度访谈。两人从 Dario 的睡眠、压力、旧金山成长经历和离开 OpenAI 谈起,进入 Anthropic 的企业路线、Claude Code 的增长、算力瓶颈、与 OpenAI 的竞争,再转向更尖锐的问题:AI 对白领就业的冲击、Anthropic 与美国国防体系的合作边界、Palantir、军事 AI、所谓 “Mythos” 模型的网络安全能力、政府是否应接管前沿 AI、中国开源模型、AI 自我改进,以及 Dario 对“文明崩溃概率”和公众信任的回答。 这场访谈的核心不是某个单点爆料,而是 Dario 反复使用的一个判断框架:AI 不是突然跳变的奇点,而是一条“平滑指数曲线”。在他看来,成熟的反应既不是否认风险,也不是一夜之间恐慌或国有化,而……

Bloomberg Originals 1:10:04