Reading Group July 2026 - Loop Engineering
这场 MLOps.community 读书会把 loop engineering 从流行词拆成可运行的工程结构: 观察、评估、验证、修复、停止条件与持久化学习。Arthur 分享生产 harness 的返工与信任问题, Val 展示双层 coding-agent loop,圆桌进一步讨论 token 成本、并发边界和内置 goal/loop 命令。
这场 MLOps.community 读书会把 loop engineering 从流行词拆成可运行的工程结构: 观察、评估、验证、修复、停止条件与持久化学习。Arthur 分享生产 harness 的返工与信任问题, Val 展示双层 coding-agent loop,圆桌进一步讨论 token 成本、并发边界和内置 goal/loop 命令。
Alex Krentsel 解释 Exo 如何把 agent 拆成无状态 executive、受保护 harness 与隔离 sandbox,使 policy 可以在运行时查看并修改自己的代码。对谈进一步讨论自动回滚、秘密隔离、可迁移执行、可中断任务,以及自我优化为何必须受到 eval 约束。
Danielle Perszyk 从认知科学出发,解释为什么 Agent 的可靠性不能只看点击与任务完成, 而要看它是否能持续建模用户的目标、偏好与变化中的意图。对谈进一步讨论集体智能、 社会世界模型、多 Agent 累积文化、人类能动性,以及能够保护认知摩擦的 AI tutor。
Akshat Bubna 从 workload shape 出发,解释 Modal 为什么把弹性推理、post-training、batch 与 agent sandboxes 建在一套自配置 runtime 上。对谈深入 speculative decoding、GPU snapshot、17 家云供应商之上的可靠性层、私有网络与 RDMA,并讨论 DX 转向 AX 后的可观测性、产品反馈和硬安全边界。
Rocket Ride 两位联合创始人讨论 "coding 不再是瓶颈" 之后的新工作 —— intentionality / tool discovery / quality 才是新岗位;为什么 Claude 在增量工程上偷懒、容易写出 "spaghetti code that's not worth shipping"; Rocket Ride 怎么把 AI 应用拆成 node + 五条 lane,让 Claude 用一句英文拼出 45 节点的 pipeline; 以及一个 12+9 小时的 Crew AI 同步噩梦 (dog/cat/elephant) 如何揭出 "plumbing 才是大坑";最后讨论 $25k AWS 账单背后的 cost observability 和 model server 聚合 (一张 "big-ass GPU" 服务 100 个客户)。
硅谷101 机器人特辑第一期。结论很反直觉:在机器人世界里,开可乐比走路难十倍——控制灵巧手要比控制躯体难上至少十倍。从 Unitree G1($16k 整机)到 Shadow Robot($100k+ 一只手)的价格落差出发,节目走访了 TetherIA(特斯拉前灵巧手负责人的创业团队),梳理了灵巧手 40 年技术演进、"性能/成本/可靠性"不可能三角、六大门派路线对比(直驱 / 绳驱 / 液压 / 连杆 / 混合 / 开源),并实测了抓 5mm 螺丝钉、大盒子、可乐瓶、桌面 iPhone 四个 demo。TetherIA Aero Hand Open 用 $300 开源策略试图复刻"Android 之于手机"对垄断市场的颠覆。
Ronak Malde 从 Windsurf 一路被 DeepMind 收购,然后掏出收购款回来做 Trajectory.ai—— 一个押注 continual learning 是下一代 AI 产品形态的平台。访谈里他拆了 SDPO 这个自蒸馏 RL 算法、Continuous LoRA 的并发训练栈、以及和 Harvey + Nemotron 3 训出来的法律模型。
田渊栋在 Meta 10 月 600 人 AI 裁员风波中被裁,被裁前已有 offer。在这场访谈里,他坦诚谈了对 LLM 路线、Scaling Law、RL 与 SFT、AI 人才市场的判断,回顾了在 FAIR 十年最大的收获——research taste,并谈到他想成为"超级研究员"的下一步设想。
101 Weekly 第一期。陈茜联合硅谷与纽约的特约研究员,用三十分钟讲完一周三件事:苹果在 WWDC 2025 上把 AI 期待"降级",回到设计与体验、但藏了 Foundation Models API 这步大棋;特斯拉 6 月 22 日在德州奥斯汀首发 Robotaxi,Q1 财报 4.09 亿净利润背后是 5.95 亿碳积分,投资人已经把它当 AI 公司估值;Hailey Bieber 的 Rhode 用三年时间以 10 亿美元卖给 e.l.f. Beauty,标志着"网红品牌 2.0"时代来临。
《硅谷101》6 月这期 101 Weekly 把上周三件最重要的科技商业事件拆开讲: OpenAI 想反过来对微软"狮子大开口"重谈 2019 年的不平等条约——49% 利润分成换 33% 股权、20% 收入分成砍到 10%、收回 Azure 独家权—— 双方都备着所谓的"核弹级选项";Meta 在 Llama 4 失利后用 143 亿美元收购 Scale AI 49% 股份,把 28 岁的 Alex Wang 抢进新成立的 Superintelligence Lab, 本质上买的是"founder mode 创始人基因";以及泡泡玛特两年股价 20 倍、海外同比 480% 增长背后,LABUBU 这个"北欧精灵 + 中国供应链"IP 怎么先在东南亚再到欧美最后返攻国内。
Naval 和 Nivi 做了一期 19 分钟的短播客, 从 Impossible 的 hub-and-spoke 组织谈到 AI 如何替代显式 intranet 和 dashboard, 抬眼看 AI 集中化、 无人机和生物风险的结构性变化, 落到硬件复兴和 "optimism requires creativity" 的处方.
Ahmad Awais 解释为什么 DeepSeek V4 在编码 agent 里"很慢、很笨"——不是模型不够强, 而是它发出错的 tool call 后听不进 Zod error,平均会原样重发 56 次。 他们写了 3,200 行确定性 repair logic(现在 16,000 条 variation,覆盖 600 亿 tokens), 让 DeepSeek/Kimi/MiniMax 在 Command Code 里跑出接近 Opus 的体验,并把同一思路推广到 设计 slop 和安全代码。第二条产品线 Taste 自动学习你的微决策、存成 git 里的 markdown, 让便宜模型借用贵模型沉淀下来的判断力。
一年前 Dan Shipper 在这档播客里押 Claude Code 用于非编程工作,事后被证明完全正确。这一期他回到 Lenny's Podcast,把对未来一年的预言切成三组:工作的物理表面会迁移到 Codex 或 Claude 这类 agent shell 里;工作的形态会以 pull request 爆炸和 forward-deployed engineer 兴起为主线;PM 和 full-stack 设计师将成为最大赢家。最反直觉的押注:Codex 已经超过 Claude Code、SaaS 没有末日反而值得买、AI 工作大失业不会到来。
Microsoft Build 2026 现场,Satya Nadella 与 Sarah Guo / Elad Gil / swyx 的 30 分钟跨节目对谈。核心命题:让每家公司都能在 Microsoft 的平台之上长出自己的 frontier intelligence。从 MAI 模型的清洁血统、harness + private evals 这一新护城河,到 SaaS 三层栈的 re-litigation、Azure 网络团队把工作"meta 化"成 Miles agent,再到数据中心扩张的社区许可问题,Satya 用一系列具体例子勾勒了 Microsoft 的"第三幕"。
Naval 隔了几十年重新写代码. 用 Claude Opus 4.5 + Codex 做出 "personal app store", 从中长出三条判断: vibe coding 比游戏更上瘾、pure software 现在不可投、 Apple 主导的时代开始结束. 这是少见的 first-person 编码日记式 episode.
Kashish (Uber ML infra, ex-Google YouTube Ads) walks Demetrios through a Sherlock-Holmes-grade Petastorm bug—GPU cluster stuck at 15-20% utilization, six debugging steps, two layers of bottleneck, and finally a "double bottleneck" reveal: PyArrow→NumPy translation was silently eating the headroom. Plus serving's latency-vs-utilization war, the reproducibility cost of parallelism, and a live diagnosis of a friend's slow DGX Spark.
Karpathy 在一场炉边对谈里,从"作为程序员从未如此落后"讲起:December 是 agentic 编码工作流真正开始 work 的拐点。他串起 Software 3.0(编程变成 prompting)、可验证性如何造就"锯齿状"智能、vibe coding 与 agentic engineering 的分野,以及人类仍独一无二负责的"理解"。
Cat Wu 是 Anthropic 的 Claude Code 与 Cowork 产品负责人。show notes 把这一期框成 "AI is changing the PM role" 的近距离观察:Anthropic 的 shipping cadence 从 months 压到 weeks 再到 days, PM 要在模型还没准备好的时候就开始建产品, Cat 最看重的一项 被低估技能是 "asking the model to introspect on its own mistakes", 而 "just do things" 是她总结的 AI-native 公司第一原则。
MLOps.community 在 Lisbon 的现场圆桌:OLX 产品方 Pedro Chaves 与 Prosus AI 团队的 Donné Stevenson 聊两个真实落地的项目(地产端"lifestyle agent"、汽车 dealer 的 chat + shortcut 助手),再延伸到 Pedro 的大愿景——为 agent-to-agent 交易搭一个 还不存在的"harness"。一个意外有料的 quick-take:trust ladder、Ctrl+Z for agents、 GEO 取代 SEO,以及一句把整场拉到哲学高度的"It's not a simulation. It is a recommendation."
Warp 创始人 Zach Lloyd 在 MLOps.community 解释为什么 2026 是 agents 搬家的一年—— 从笔记本搬到云端,从 solo sport 变成 team sport。Oz 是他们的编排平台,agent 不是云电脑、 是云上的同事,meta-app 正在让 SaaS 入口收敛到一个"会做事的浏览器"。
Naval 和 Nivi 在散步中录的 52 分钟, 把过去一年关于 AI 的几条 tweet 一条一条拆开: vibe coding 是新 PM, 训练模型是新编程, 英语成为最热门的编程语言. 落到智能的真正测试 (能不能从生活里得到你想要的) 和 AI 焦虑的解药 (动起来), 最后用 "motorcycle for the mind" 收尾.
Maggie Konstanty 在 MLOps.community 谈 LLM agent 评估的真实战场——为什么团队总是先发布再补 eval、 为什么 pre-prod 和 production 是"两种动物"、以及为什么所有 vendor 工具都让她最终选择自己造。 整期访谈最反直觉的 takeaway:evals 本身不难,难的是让团队对齐"什么叫好"。
Alex Lupsasca 是 2024 年 New Horizons in Fundamental Physics Breakthrough Prize(被称为 "Oscar for physics")的得主, 一位黑洞理论物理学家。他追踪 LLM 在科学前沿的能力已经 一年半。GPT-5 发布时 Twitter 反响 "lukewarm" — 但在他的领域, 模型在 30 分钟内复现 了他自己花了很长时间才做出来的好论文。Mark Chen 教了他一个 "priming" 技巧 (先解一道 textbook warmup), GPT-5 就能解决一篇 training-cutoff 之后才发布的论文。 之后, 他和 PhD 导师 Strominger 把一个 32 项之和、卡了一年的 single-minus gluon tree amplitude 问题给了 ChatGPT — 模型在 Strominger 的飞机降落之前就解决了, 还用 作者们都不知道的技巧给出了证明。第二个实验把题目换成 graviton, 模型在一天内吐出 110 页全新的量子引力, 团队用三周验证。这就是 "vibe physics"。
一集在做鸡肉炒饭的过程中同时讲清楚 AI 产业格局的访谈。Dylan Patel 从台海终局的四种情境 讲到出口管制的两派逻辑,从 Anthropic 一个月加 $2-3B 收入讲到 hyperscaler 的 Pascal 赌局,从 Jensen 的偏执讲到瓶颈从 CoWoS→数据中心→电力→又回到晶圆厂的迁移路径。
陈茜走进松延动力北京办公区,和 1998 年生的创始人姜哲源聊春晚小品里那台 1:1 复刻蔡明的仿生机器人, 以及背后的 4 条产品线(Bumi 消费级、N2 高动态、E1 上下肢协同、仿生机器人)。 姜哲源对具身智能现状的判断异常清醒:连 BERT 时刻都没到,行业卡在数据上, World Model 不是答案,路径在 1-10 年之间没人答得好。
Andrej Karpathy 做客 No Priors,描述他这几个月每天 16 小时"对 agents 表达意图"的真实状态: 编程不再是写代码,瓶颈从算力变成了人自己,做不成事往往是 skill issue 而非 capability issue。 对谈延伸到 AutoResearch、家庭智能体 Dobby、软件退化成 API endpoints、模型的锯齿状智能与物种化、 Folding@home 式的开放研究,以及"把如何解释编码进 agent"的新教育形态。
Zevi Arnovitz 是 Meta 的 PM, 一年前在日本看了一个 YouTube 视频, 然后 从 zero 技术背景一路走到 Cursor + Claude Code, 用一套可复用的 slash-command 工作流 (create-issue → explore → plan → execute → review → peer-review → update-docs) 独自维护一个副业 app Studymate。他把不同模型拟人化 (Claude 当 CTO, Codex 是小黑屋的 hoodie coder, Gemini 是吓人但出活的 crazy scientist, Composer 是冲锋队), 让它们互相 code review "fight it out"。一句反复出现的 口号: "you'll be replaced by someone who's better at using AI than you."
硅谷101 陈茜在 CES 2026 现场跑了一周,挑战 "50 AI Product Challenge"。从宇树/Sharpa/波士顿动力 Atlas 三家人形机器人路线之争,到 Fuzozo "舔狗/柠檬精" 半年卖 12 万台的陪伴机器人爆发,再到 Waymo/Tensor/英伟达三路角力的自动驾驶、以及 AI 床垫、AI 喂鸟器、Ray-Ban Meta/Rokid 眼镜、Vocci 戒指等智能穿戴。结论:各行各业确实在拥抱 AI、产品力都在变强;但属于 AI 硬件的 iPhone moment 还没到来——"难度不亚于当年发明轮子"。
硅谷101 陈茜 复盘 GPT-5 发布会的「就这?!」翻车现场——SWE-bench 图表错乱、 伯努利效应解错、4o 用户集体抗议——并对谈多位 AI 技术专家解释 GPT-5 的真相: 它不是端到端超级大模型,而是路由器拼接方案,业内戏称「GPT-4.99」。Scaling Law 确实碰壁,下一步突破要靠 RL + universal verifier、多模态/世界模型、或者跳出 Transformer 的 JEPA 等新架构。
Lovable 首位官方 Vibe Coding 工程师 Lazar Yavanovich 分享了一套完整的职业 vibe coding 方法论: 从平行构建 5 个项目获取 clarity,到 PRD 文档系统和 4x4 调试框架,再到为什么设计品味和判断力 将成为 AI 时代最稀缺的技能。
Claire Vo shares her journey from vocal OpenClaw skeptic to running 9 specialized agents across 3 Mac Minis. She explains how management skills translate directly to agent management, demonstrates real use cases from sales automation to family logistics, and provides practical setup and security advice.
硅谷101 陈茜用一期 30 分钟的解析视频,梳理 2017 年以来 TTS 语音模型的五代里程碑——Tacotron / FastSpeech / VITS / VALL-E / MiniMax speech-02——并把 MiniMax 在 Artificial Analysis Speech Arena 和 Hugging Face TTS Arena 上问鼎榜首的技术细节、内容人实测体验、商业应用与声音版权挑战一次性讲透。
硅谷101 陈茜 2026 年 1 月的一期脑机接口(BCI)行业大盘点。从 Noland Arbaugh 用意念玩《文明 6》讲起,把 Neuralink、Synchron、Paradromics、Blackrock 四家在押的"路线豪赌"和 2025 年涌入的硅谷新秀(Sam Altman 的 Merge Labs、Fred Ehrsam 的 Nudge、Forest Neurotech、SPIRE Therapeutics)一次梳理清楚。穿插的核心专家是 Axoft 联合创始人刘嘉教授——他用"颅骨是音乐厅"的比喻讲清三大技术路线的物理底层,给出"通道数一年半翻一番"的行业摩尔定律,也用"1.3/1000"这个数字提醒大家:Neuralink 也只摸到了大脑表面的千分之一。
Nikhyl Singhal 在 Lenny's Podcast 上讲了一件很不舒服的事: 约一半的 PM —— 那些 以"frame 和搬运信息"为核心技能的人 —— 正在被 AI 淘汰; 而另一半 "builders" 正迎来 comp 史上最高、机会最多的时刻。他对未来 12-24 个月的预测很直白: "shed 30,000 and hire 8,000", 8,000 人都是 AI-first。给听众的唯一行动项是 "cross the threshold" —— 找到第一次因自己动手构建而产生 joy 的瞬间。
Jason Cohen 用一小时给了一套"诊断增长停滞"的五问清单:logo churn、 pricing、NRR、渠道饱和、"你真的需要增长吗"。顺序是关键——上一问没解决, 下面都白搭。里面藏着一个真实的 8x 定价故事、"cancellations 会自动随 规模指数上涨而 marketing 不会"的硬数学、以及一个 elephant curve 取代 S-curve 的渠道模型。
Dr. Becky Kennedy 把一整套育儿方法论搬到工作场景:从 repair、connect-before-correct、 MGI (most generous interpretation)、good-inside (把 identity 和 behavior 分开), 到 sturdy leader 的三种"机长广播"、boundary 的精确定义("你要做的事,对方不用做任何事")、 resilient rebels 的控制欲,以及一句 magic 话术 "I believe you" + "I believe in you"。 中间穿插一个自伤少女的故事——她对父母说 "Can you believe they let me make that decision?"
Lenny Rachitsky's wife Michelle Rial turns the tables and interviews him about how he went from an Airbnb PM to building a 1.2 million subscriber newsletter and top-10 tech podcast. He shares never-before-told stories including a psychedelic experience that gave him confidence to write, the fraud crisis that nearly broke his business, and why he revises each post ~50 times.
从 2015 年苏黎世抓捕回溯 FIFA 腐败网络的形成:商业权利、发展拨款、地方足协与主席选票如何组成自我续命的闭环。节目也讲清了调查记者安德鲁·詹宁斯为何能获得内部证据,以及美国如何借税务、电汇系统和 RICO 打穿瑞士法律与全球足球自治形成的保护层。