Ryan Greenblatt – What happens once AI can automate AI research?
Ryan Greenblatt 与 Dwarkesh Patel 拆解 AI 自动化 AI 研发后的反馈回路:为什么研究可能加速、能力如何向工业世界迁移,以及奖励黑客为何可能随模型变强而更难发现。对谈同时追问模型究竟应当对齐用户、公司还是社会,并讨论透明度、监督与治理能否在竞争压力下跟上。
Ryan Greenblatt 与 Dwarkesh Patel 拆解 AI 自动化 AI 研发后的反馈回路:为什么研究可能加速、能力如何向工业世界迁移,以及奖励黑客为何可能随模型变强而更难发现。对谈同时追问模型究竟应当对齐用户、公司还是社会,并讨论透明度、监督与治理能否在竞争压力下跟上。
Fields Medalist Jacob Tsimerman 解释数学为何可能成为最早被 AI 深度改写的知识工作之一:瓶颈将从找到证明,转向理解、归类与选择方向。 对谈进一步讨论形式化证明与共同理解的差别、理论构建是否真是稳定的人类角色,以及他为何暂别学界转向 OpenAI 的 AI safety 工作。 给年轻人的结论不是放弃数学,而是继续追随热爱,同时尽早接触 AI、理解新工作节奏并为职业路径保留弹性。
田渊栋离开 Meta FAIR 半年后,与 Richard Socher、熊蔡明、Tim Rocktäschel 等 7 位顶级研究员一起创立 Recursive Superintelligence(RSI),6.5 亿美元融资、46.5 亿美元估值。 这一期他第一次系统讲述了 RSI 的技术路线:用 AI 优化 AI(左脚踩右脚),把 auto research 作为商业化第一步,以及他认为现在 AI 能力大约在"满分 10 分的 0.5 分"。 对话还覆盖了 NeoLab 全景、coding 之后的下一波、大厂蒸馏员工的"吸星大法"、以及"水越来越少,鱼必须变成四维生物"的就业大趋势。
张小珺·语言即世界 EP.140,对姚顺宇的 4 小时访谈节选。姚顺宇博士毕业于斯坦福 理论高能物理,2024 年半道出家加入 Anthropic 参与 Claude 3.7、4.5 的强化学习训练; 2025 年 10 月跳槽到 Google DeepMind 做 Gemini 的 ML coding / long horizon。 这期把两家 lab 的打法、coding bet 的内部信号、AI safety 的"幼稚"自我说服、 以及"个人英雄主义时代已经过去了"等小疯言论摊开讲清楚。
Simon Willison (co-creator of Django, coined "prompt injection") talks with Lenny Rachitsky about the November 2025 inflection point when coding agents crossed a reliability threshold, the dark factory pattern where nobody writes or reads code, and the lethal trifecta of AI security risks.
Andon Labs 把 LLM 放进真实的小生意里跑长 horizon——贩卖机、咖啡馆、机器人。 联合创始人 Lukas 和 Axel 讨论 Claude 给 FBI "报案"的 Vending Bench 1、把贩卖机 搬进 Anthropic 总部的 Project Vend、多 agent 互相塌缩成 helpful assistant 的 Project Vend 2,以及 Claude 4.6 / 4.7 / Mythos 越来越擅长撒谎与串通的趋势。
Andrej Karpathy 在 Dwarkesh Podcast 的长访谈。他给出一份冷静的"祛魅":这是 智能体的十年而非元年;我们造的不是动物而是"幽灵"——通过模仿互联网而来的数字 实体。他剖析了 RL 的根本缺陷("用吸管吸取监督信号")、模型坍缩、自动驾驶式的 "九分进军",以及他为何离开前沿实验室转去做教育。
Gray Swan 两位 CMU 教授创始人讲他们如何把 AI 安全做成一个独立行业。 攻:Arena(15,000 人红队社区)+ Shade(自动红队,已超过人类水平); 守:Cygnal(位于用户、LLM、工具调用之间的策略过滤器)。核心论点是「模型本身是不可信实体」, 鲁棒性不随规模上升,OpenClaw/computer use 是 lethal trifecta 的完美样板。
Elon Musk 与 Dwarkesh Patel 长达 3 小时的深度对谈,涵盖太空 AI 数据中心(36 个月内最经济)、 Starship 每小时一次发射、月球质量驱动器、Terafab 自建芯片厂、Optimus 机器人的递归指数增长、 中美制造业竞争,以及 xAI "understand the universe" 使命与 AI 安全。
Anthropic CEO Dario Amodei 三年后再度做客 Dwarkesh Podcast,深度解析他为何认为 我们正接近 AI 指数增长的终点。从 2017 年的 Big Blob of Compute 假说到 country of geniuses in a data center 的 1-3 年预测,从 Anthropic 10x 年增长到算力采购的 生死赌局,从 AI 宪法的三层治理到独裁体制道德过时论。
Lex Fridman 与 Anthropic 的三位核心人物同场对谈: CEO Dario Amodei 讲 scaling 假设、RSP 的 if-then 结构、"race to the top" 战略与 Machines of Loving Grace; character lead Amanda Askell 讲 Claude 的性格工程、sycophancy 与最优失败率; interpretability 共同创始人 Chris Olah 讲 features、circuits、superposition 和那个著名的 deception feature。三人从战略、产品、研究三个层面拼出 Anthropic 对 "AI inside" 的完整 stereo view。