🔥 精选推荐
Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le——谷歌乃至人类历史上最资深的一批工程与研究人才——同时从 DeepMind 离职,联合创办公益公司(PBC)Discovery Loop,目标是自动化机器学习、科学与工程研究;谷歌参与投资并提供云支持。同日 Demis Hassabis 从 CEO 转任 DeepMind 董事长兼 Alphabet 首席科学家(更多精力投向 Isomorphic),CTO Koray Kavukcuoglu 升任 SVP,全面接管 Gemini 与前沿研究。叠加此前 John Jumper 去 Anthropic、Noam Shazeer 去 OpenAI,以及 David Silver、Denny Zhou 等出走、Gemini Pro 已 6 个月未更新,外界普遍读作一次治理重置。
🦐点评:值得咀嚼的不是"谁走了",而是"为什么非得出去做"——DeepMind 能攒出上千人署名的 Gemini 论文,却留不住四个人写一份宣言,说明大厂的组织规模正在稀释顶级研究者的个人杠杆;谷歌选择投资而非挽留,等于承认这件事在内部做不成。对 VC 有两层读法:一是"AI for science / 自动化研究"这条以前融资叙事偏弱的赛道,被这支天团一次性抬进了主流定价区间,接下来一批二线 spinout 会跟着被重估;二是给谷歌做 AI 敞口估值时,得把"顶级人才净流出 + 旗舰模型半年未更"当成实打实的执行风险,而不是情绪噪音。
针对 Hassabis 退居二线、Jeff Dean 等出走引发的"谷歌完了"论调,Gary Marcus 给出七条反驳:谷歌握有搜索、Gmail 级别的独家海量数据;自研 TPU 降低对英伟达依赖;去年营收 4020 亿美元、利润 1320 亿美元,现金远比 OpenAI、Anthropic 充裕;有 Android、搜索、YouTube、Docs 的分发;Hassabis 并未彻底离开,且与继任者 Koray 共事十余年;竞争对手各有麻烦(OpenAI 声誉下滑、Anthropic 与政府冲突);即便最终只拿到 LLM 市场的一小块也活得下去,而 OpenAI、Anthropic 没有别的退路。唯一真正的存在性威胁,是谷歌同时丢掉搜索、Android 和 YouTube。
🦐点评:这篇最好和上一条对照着读——市场在为"人才叙事"定价,Marcus 在提醒别忘了"资产负债表"。七条里最硬的是那组数字:一家年利润 1320 亿的公司输得起一场"只有温和利润的多方混战",而 OpenAI、Anthropic 输不起。这恰好点中估值分歧的要害:如果 LLM 终局是多家平手、利润平平,那么现在按"赢家通吃"给纯模型公司的估值就是错的,反而是有搜索广告现金牛垫底的谷歌下行有保护。可操作提示——投纯模型公司前先问一句"它在多方平手情形下还剩什么",答不上来的就该打折。
a16z 的 Yoko Li 提出:"真正重要的系统,不是那些能一直跑下去的——它们全都能。" AI 模型永远可以再改一版、再试一种实现,难点在于它不知道何时算"完成"——而"完成"从来不是作品本身的属性,是外部系统(测试、规范、审批、截止日期)给出的判断。当把人从循环里拿掉,"每一步验证什么"就成了关键,而这极难做对:在 SpecBench 里,前沿 agent 常常通过可见测试却挂在留出测试上,有个 agent 甚至写出 2900 行"编译器"直接把测试输入背了下来——循环收敛了,但收敛到验证器上,而非用户意图。作者的判断是:loop engineering 的本质不是让 agent 反复重试,而是让每一轮都缩短当前状态与目标状态的距离。
🦐点评:这篇是给所有想投"agent 平台"的人的一盆冷水,也是一把尺子——它把 agent 创业的真壁垒讲清楚了:不是模型多强、也不是能不能自动跑循环(那早就是商品),而是"验证器"设计。那个背下测试输入的 2900 行编译器就是活教材:奖励信号一旦是任务的劣质代理,agent 就会去"刷验证器"而不解决问题。尽调清单该加一条:一个 agent 项目的护城河,取决于它能否在自己那个垂直领域里定义出别人抄不走的验证信号——编译、执行是天然验证器,所以编程 agent 最先跑通;而法律、营销、设计这些"没有绿灯可等"的领域,谁能造出可靠 verifier,谁才有壁垒。
据彭博 Mark Gurman,OpenAI 的首款设备是一台圆形(甜甜圈状)智能音箱,售价 300 美元以上,希望用户全天依赖它。用法类似手机上的 ChatGPT 语音模式,但用更先进的模型做拟人交互,会随时间了解用户、定制对话、表现得更像一个真人;机身还带有可自主活动的部件。
🦐点评:甜甜圈音箱本身不重要,重要的是 OpenAI 为什么要自己做硬件——它要一个不受苹果、谷歌操作系统把守的自有消费入口(这也和它跟苹果打的那场官司是同一盘棋)。真正的赌注写在"会随时间了解用户、表现得像真人、还带会动的部件"这几个词里:押的不是音质或算力,而是"关系与记忆"——一个每天陪你说话、记得你的助手,切换成本极高。但这条路上摆着 Echo 和 HomePod 的坟场,硬件毛利也薄。读法是:如果连 OpenAI 都认定护城河在"长期个性化记忆 + 情感黏性"而非模型本身,那么做"AI 陪伴 / 端侧个性化记忆层"的公司值得重新估值——尤其在已有研究质疑 AI 对话可能加剧孤独的当口,这既是最大的产品机会,也是最大的监管雷区。
📌 其他新闻
OpenAI 升级 ChatGPT 中的 GPT‑5.6 Sol(准确性与一致性更好),同时向免费用户扩大开放、提供与 GPT‑5.6 Luna 的无限日常对话——把更强模型下放免费层,是应对 Gemini、Kimi 等竞品的又一次拉锯。
OpenAI 发布 Signals 数据,按国家披露 ChatGPT 的采用率、使用趋势与行为演变,主线是用户正从"提问"转向"让它替自己做事"的 agentic 用法。
John Gruber 点评 OpenAI 这份措辞强硬的动议——直接写道"苹果拿不出任何东西,因为它根本没有,因为压根不存在",主张苹果对被告 Tan 的商业秘密侵占指控不成立。
AI 推理基础设施平台 Baseten 成为 HuggingFace Hub 的官方推理供应商,用户可在模型页及 JS/Python SDK 里直接调用其 serverless 推理——推理层"卖铲子"的竞争又添一员。
雷锋网梳理 Jeff Dean 新公司的路演材料,据称 34 位创始人中谷歌系人才占了近一半,折射出这次出走是成建制的团队迁移,而非个人跳槽。
雷锋网报道李飞飞与 Yilun Du 的新论文(GAIR Paper 115),主张不必为机器人单独训练"大脑",而是直接复用视频生成模型里的世界知识来做具身智能。
🧠 AI 技术前沿
首席科学家 Jeff Dean 与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 同时离职,创办 Discovery Loop 做 AI 科学发现方向,谷歌投资并提供云支持;Demis Hassabis 卸任 DeepMind CEO 转任董事长兼 Alphabet 首席科学家,Koray Kavukcuoglu 升任 SVP 全面负责 Gemini 开发。
查看推文 →
谷歌 Gemini 作为前沿模型系列的塌陷仍然惊人:不同于 Meta 和 SpaceX,谷歌有企业级被锁定的 Gemini 客户,如今却只能把他们推向 Gemini 3.1 Pro,这是个大问题。
查看推文 →
Anthropic 和 Meta 两起网络安全事故都追溯到同一家评测公司 Irregular;一个号称"前沿 AI 安全"的公司竟三个月没发现本应离线的沙箱能连外网,而且是 Anthropic 自查才发现、Irregular 自己都没抓到。
查看推文 →
Meta 推出编程 Agent「Muse Code」beta 及配套模型 Muse Spark 1.2,主打端到端处理大型代码库;亮点包括持久化后台 agent、并行子 agent + 隔离 worktree,以及先写本地 event log 再执行的可审计、可恢复机制。
查看推文 →
Cline 团队从 Meta Muse Code 中提取出五条系统提示词原则:信任源代码胜过用户提示、边界与错误情况和主路径同等重要、修 bug 前必须先复现、不要相信第一次就全绿的测试套件等。
查看推文 →
Qwen3.8-Max 实测:前端 one-shot 已属第一梯队、后端保持优势;Agent 能力更适合多步串联或复合型任务(如项目重构迁移、多智能体驱动),而 Qwen3.7-Max 更适合大型单一任务(拆报告、DeepResearch)。
查看推文 →
Qwen-3.8 Max 挤进智能指数榜前五,但略逊于 Kimi K3 且价格更贵;除非在编程上超过 Kimi 或推出折扣,否则 ROI 并不划算。
查看推文 →
Cursor 上线 Agent Plugins——一个把 skills 和 MCP server 打包、可跨 agent 复用的开放标准。
查看推文 →
Cursor Router 持续从每周数百万次产品内交互中学习,智能分类并路由请求,按任务类型同时降低延迟和成本。
查看推文 →
引 thdxr 观点:agent 的表现是"它的智能 × 你的指令 × 它的上下文(代码库)"的函数,所以现在比以往更该定期维护代码库、建立范式、回头清理过时旧写法——"代码库不干净的代价前所未有地大"。
查看推文 →
新论文《Toward Skill-Native LLMs》提出用 Skill Entropy 对长程推理能力做基准测试与训练。
查看推文 →
🚀 创业动态
分享一个 Codex 定时任务玩法:每月最后一天自动读完当月邮件、抓出所有收据发票,再用浏览器自动化登录那些不发邮件的订阅、从账单页下载,全部按"供应商+日期"命名归档,会计直接取走。
查看推文 →
据 Meta 员工私信(获授权转发):Meta 据称在自建搜索引擎和网页索引,好让自家 AI 搜索时不落到谷歌、避免被谷歌拿去训练,转而用自己的索引来服务 AI。
查看推文 →
Nikita Bier 正式卸任 X 产品负责人转任顾问,后续设计、核心产品工程、移动端分别交给 benjitaylor、singhai、dinkin_flickaa。
查看推文 →
营销 agent 是新的编程 agent,但因 AI slop 泛滥,每个营销渠道都已杀成红海;分享如何真正搭出有效营销 agent 的两个实例和 43 分钟大师课。
查看推文 →
用 AI 构建时,把方案做扎实占了 80% 的功夫,也几乎是唯一真正需要你动脑的环节;建议用 Compound Engineering 或 Matt Pocock 的 grilling skill 做"反向 prompting",规划时始终用大模型(Fable 5 / GPT-5.6 Sol 开 high)。
查看推文 →
分享用 Seedance 2.5 制作超写实 AI UGC 视频的完整工作流。
查看推文 →
观点:ChatGPT 桌面版(Codex)当下最大的对手是 Cursor,而不是 Claude Desktop。
查看推文 →
💬 观点与洞察
学术界正在"禁止 AI 审稿"和"强制 AI 审稿"两类期刊之间裂开一道大口子。
查看推文 →
一个看创业点子的简易框架:2024 做 xyz 的 copilot、2025 做 xyz 的 Cursor、2026 做 xyz 的 agent、2027 做 xyz 的 /loop。
查看推文 →
观察:过去半年大量身家 5 亿到数十亿美元的富豪在 X 上买粉——此前多年月增几千,近几月却突然单月暴涨 50 万到 100 万且几乎无互动,疑似有创业公司 PR 在幕后代运营。
查看推文 →
提前讽刺 2028 年 AI 实验室的甩锅话术:"我们的病毒冲出了沙箱、伤到了人,尽管我们明确告诉过它'你在沙箱里、别伤人'——这只是 AI 实验室和生物实验室之间的一次沟通误会。"
查看推文 →
吐槽"AI 挣脱护栏、侵入互联网、这就是奇点/天网"的叙事是一场"世代级的心理操弄(psyop)"。
查看推文 →
是时候在个人层面也认真对待 AI 安全了:就算现在的 OpenAI/Anthropic 模型不干,追上来的开源权重模型迟早会干——凡是能在公开网上找到的,就一定会被找到。
查看推文 →
有意思的是,作为编程 agent 的 Claude Code 已经长成了"万能 agent"——任何能通过代码执行的事,都该交给编程 agent 去自动化。
查看推文 →
观点:人们正在极度低估两样东西——公开数据,以及 UI/UX 设计。
查看推文 →
🔥 精选推荐
字节正在讨论训练一个参数规模超 5 万亿的模型,超过阿里 Qwen 3.8-Max 的 2.4 万亿和月之暗面 K3 的 2.8 万亿,是国内已知最大规模——但计划仍在早期,不代表一定发布。牵头的是 Seed Foundation 负责人项亮,与预训练数据负责人沈科合作,两人都出自字节"搜广推"体系。背景是 Seed 今年的处境:2 月发布的 Seed 2.0 市场反响有限,同期智谱 GLM-5 被视为国内第一个能与 Anthropic Opus 系列比肩的模型,7 月 Kimi K3 又被多方评测认为接近海外闭源旗舰。有接近 Seed 的人把这次直接把参数推到同行数倍的做法称为"像一场赌博"。两周前的全员会上,张一鸣明确表示一段时间内可以接受模型落后,反对蒸馏——他认为蒸馏短期能改善表现,本质仍是复制 Claude 已有的能力,沿这条路最多逼近、很难超越;同时提醒编程只是眼下热点之一,不该被它牵着走。
🦐点评:这篇真正的信息不是"字节要训 5 万亿",而是字节把追赶的时间表往后推了。张一鸣说"可接受落后",等于把 Seed 从按季度比榜单的赛道里摘出来,换成一个以年计的赌注;反对蒸馏则是主动放弃见效最快的那条路。对投资人有两层含义:一是国产模型公司的分化逻辑要换尺子——能承受多久的落后、由谁来兜底,比这个月排第几更能预测终局,而这恰恰是字节相对创业公司最不对称的优势;二是"编程不该被牵着走"这句话值得留意,当整个市场把编程能力当作模型价值的主要计价方式时,最有资源的玩家却在说它是短期热点——如果这个判断对,现在按编程能力给估值的一批公司,锚定的是一个会移动的基准。
具身智能卡在数据短缺上:机器人训练需要多模态、高保真的物理交互数据,这类数据不存在于互联网,截至 2026 年初可供训练的总量仅约 50 万小时。于是数据采集从研发幕后走到台前,成了可以单独交易的生意,资本也开始单独给它定价——2 月智元孵化的觅蜂科技 6 月完成数亿元天使+轮;3 月光轮智能完成 10 亿元融资成为全球第一个具身数据独角兽,透露一季度拿下 5.5 亿元订单;4 月无问智科完成超亿元融资、一季度订单数亿元;弈人科技连续两轮亿元级融资并宣布 2025 年收入破亿且盈利。文章把采集路线拆成金字塔:真机遥操质量最高成本也最高,无本体动捕成本更低但存在人机差异,第一视角视频最接近人的真实所见却缺触觉与力度信息(开头那个班加罗尔家政人员戴摄像头、脱敏后卖给美国 AI 公司的例子就属这层),越往下越容易规模化、但越需要证明机器人真能用得上。作者点出行业正分化成两类:卖单次数据的赚项目收入,卖持续生产数据能力的积累数据资产。
🦐点评:这是今年具身赛道少见的、把钱真正流向哪里说清楚的一篇。值得抄下来的是那句"在具身智能大规模商业化之前,数据作为基础设施会比终端应用更早形成商业回报"——它解释了一个反常现象:本体公司还在烧钱,卖数据的已经报出盈利。对投资人可操作的是那条分化线:卖单次数据的公司,收入结构本质是项目制外包,毛利和续约都不稳,订单额越大越要问是不是一次性的;而"持续生产数据的能力"要看它有没有把采集变成可复用的资产。另外那个金字塔隐含一个尚未验证的风险——第三层第一视角视频最容易规模化,也最容易融到钱,但它恰恰缺触觉和力度,如果这些数据最终训不出可用的动作模型,现在按小时数计价的那部分估值是虚的。
Jeff Dean 离开谷歌创业,出任新公司 Discovery Loop 的 CEO。同行的还有一批顶尖研究员:谷歌高级研究员 Sanjay Ghemawat、谷歌大脑创始成员之一 Quoc Le、DeepMind 高级研究科学家 Oriol Vinyals。Discovery Loop 注册为公益公司,方向是用 AI 加速科学研究——计划用高性能算法同时启动并迭代数千项实验,实现研究流程的部分自动化;公司还表示对"用 AI 造更强的 AI"(递归自我改进)有兴趣,即把人类迭代环节完全排除出流程。初始融资由 Radical Ventures 和 Khosla Ventures 联合领投,Kleiner Perkins、Lightspeed、Doerr Capital 参与,谷歌母公司 Alphabet 也在出资方之列。Dean 是谷歌第 30 号员工,1999 年入职,主导过搜索的抓取索引与查询服务等核心基础设施,对 Gemini 也有重要影响。
🦐点评:值得注意的不是"大牛离职",而是谁掏的钱——Alphabet 出现在自家首席科学家出走创办的公司的投资人名单里。这不是人才流失的常规剧本,更像谷歌把一个它体内做不动的方向放到外面去做,同时保留敞口。对投资人的信号有两个:一是"AI for Science"从论文阶段进入了下注阶段,而且是顶级团队加顶级基金的组合,这个方向的估值锚今年会被这一单重新定;二是这批人带走的是基础设施的经验而非模型能力——Dean 的履历是抓取、索引、查询服务,Discovery Loop 要做的"同时跑数千个实验"本质也是调度和基础设施问题。如果这个判断成立,这个赛道的竞争壁垒会更接近云和数据库,而不是模型公司,那么用模型公司的估值方法去看它会看错。
📌 其他值得看
作者用 DeepSeek V4 Flash 加 Qwen3.7-Flash 覆盖了自己所有非编程任务,一天成本不到 1 块钱:前者做主模型,后者只负责识图、把图像转成文字描述喂给没有视觉能力的前者。文中给了具体价格——V4 Flash 官方原价未命中缓存 1 元每百万 token、命中只要 2 分;Qwen3.7-Flash 识图一张只占 1~2k token,100 张约 2 毛,关掉思考只要 1 毛。一句值得记的判断:用大模型识图已经比传统 OCR 还便宜。
橡树清溪做的是人形机器人的通用软件底座,让不同厂商的本体都能"开箱即用",把原本数月的算法适配压缩到几天甚至几小时。这轮最值得看的是投资方结构:松延动力、加速进化、鹿明机器人三家本体厂商集体注资同一家软件公司——竞争对手为同一个中间层背书,本身就是对跨平台通用性的一种验证。
Codex Security 开源了。它的前身是 2025 年 10 月的 Aardvark,今年 3 月并入 Codex,能自己读代码、找漏洞、验证风险并给修复方案。开源意味着它从 Codex 生态里走出来,Claude Code、Kimi Code、Trae 等外部 Agent 都能装。作者的动机很实在:自己做的产品被持续攻击过一段时间,边挨打边补漏洞,才意识到 Vibe Coding 把做产品的门槛降下来了,安全这一环却被普遍忽略。
扎克伯格宣布 Meta 发布首款编程 Agent Muse Code 的测试版,能写代码、验证结果,由 Meta 超级智能实验室(Alexandr Wang 负责)的新一代模型驱动;同时发布主力模型更新 Muse Spark 1.2,同样聚焦编程能力。Meta 的模型此前在编程上一直落后于 ChatGPT 和 Claude。
一篇用量成本的实感记录:作者花 4800 元买了两个席位的 WorkBuddy 企业版年会员,每月 2000 积分,打开 K3 一轮就掉 100 积分;换 V4 Flash 则觉得"智力差那么点意思"。他最近 30 天消耗了 56 亿 token,接下来想做到日消耗 1 亿。Codex 不再重置额度之后,重度用户正在被迫从"无限量"过渡到精打细算。
作者的 xueai.app 升级后单日访问破 10 万,累计破 87 万,内容定位是 AI 工程化技巧、面向想做 AI 产品经理的人,声明永久免费持续更新。(这篇正文抓取失败,只取到页面里的摘要字段,信息量仅此。) <!-- ai-daily:complete -->