🔥 精选推荐
Ben Thompson 用 1873 年铁路大亨 Jay Cooke 靠"面向散户卖债券"给北太平洋铁路做供应商融资、最终引爆全国性大恐慌的历史,类比 Nvidia 联合六大私募募集 5000 亿美元、并为其中最多 25% 提供残值兜底的新安排。他指出这套结构的高明之处在于不像增发新股那样稀释股东,而是找到愿意承担风险的新资金池、从而保住 Nvidia 的利润率;但 25% 的残值担保实质是变相降价——用 Nvidia 自己的利润去压低下游建数据中心的资金成本。而这背后是 Google TPU、亚马逊 Trainium 的逼近:当资金而非芯片成为建数据中心的约束时,更低的资金成本比 token 效率更重要。文章还捎带指出,DeepMind 高层出走后真正的赢家不是 Anthropic 或 OpenAI,而是 GCP。
🦐点评:Nvidia 从卖铲子变成给买铲子的人做信用担保,说明它对"compute 是可投资资产"这个判断,比市场更笃信——它的 5 年期 CDS 已从 41.6 翻倍到 77.5,市场在用脚投反对票。对看 AI infra 的基金,真正要重估的是:整条链的资金结构正从股权转向担保/债务,Nvidia 的利润率从此和下游数据中心的残值绑定,一旦利用率或电力落地不及预期,杀伤是杠杆化的。而 Thompson 埋的另一条线更值得跟——谁现金流飞轮最强谁赢算力战,他的隐含答案是 Google,那 GCP 82% 的同比增速(而非 Gemini 跑分)才是该盯的领先指标。
Decagon 的 AI 客服年化营收已过 1 亿美元,但创始人 Jesse Zhang 把差异化押在"反对前置部署工程师(FDE)"上——他认为需要把工程师长期塞进客户来定制软件,恰恰证明你的产品不行。这是一个逆势判断:FDE 模式如今被大量 AI 应用公司奉为标配。Decagon 面对的对手资金和规模都远超自己:Bret Taylor 的 Sierra 年化已超 2 亿、融资是它三倍,Salesforce 的 Agentforce ARR 破 10 亿并以 36 亿美元收购了 Intercom(Fin)。Decagon 及其投资人(Bain Capital Ventures、Accel、a16z)坚持,是产品而非庞大的服务团队,帮它拿下了大型航司和信用卡客户。
🦐点评:这是 AI 应用层两条路线的正面对撞:Sierra/Salesforce 用 FDE+服务把客户抱死、做厚粘性和客单,Decagon 赌纯产品自助、用上线速度换毛利和可复制性。谁对,取决于 AI 客服这个品类最终更像 SaaS(产品驱动、高毛利)还是更像咨询(服务驱动、重人力)。对投资人,Decagon 顶着 1 亿 ARR 坚持不堆人,是个可证伪的赌注——它若能在不扩服务团队的前提下把 ARR 追上 Sierra,就坐实了这个品类的护城河在产品;反之则说明企业级 AI 落地的"最后一公里"终究要靠人肉抹平,FDE 不是弱点而是必需品。
客座作者 Christian Catalini 用经济学家 Petra Moser 对 1851 年万国博览会近 1.5 万项发明的研究给开源/闭源之争降温:有无专利保护并不改变创新的总量,只改变创新的方向——瑞士当年没有专利,创新就涌向靠保密和领先优势就能获利的领域(雀巢 1866 年即诞生于此)。他据此认为,开源权重不会改变 AI 的总投入,只改变"谁来建、建什么、谁拿走回报":闭源实验室继续推最通用的前沿,开源权重则让实验扩散到能把机器智能与稀缺数据、分销、隐性知识结合的公司。文中直接点名 Dario Amodei 多年反对开源的立场,并指出这套主张"恰好"与 Anthropic 的商业利益完美对齐。
🦐点评:这篇的杀伤力在于把"开源 vs 闭源"从道德/安全叙事拉回资源配置问题——如果开源不改变总投入只改变方向,那对创业者的含义是:护城河不在权重本身,而在你能否把开源模型嫁接到别人拿不到的稀缺数据、分销和隐性 know-how 上。它也点破了一个利益结构:Anthropic 的安全论证与它"闭源收租"的商业模式高度重合,投资人在采信任何一方的"安全"说法前,都该先问一句这套论证在为谁的估值服务。真正的机会不在押注哪种模式赢,而在开源扩散后那批"有独家数据的应用层"会被重估。
今年 1 月 JPM 医疗大会上一口气宣布了四笔 AI×制药工具交易,成立仅两年、OpenAI 参投、估值已达 40 亿美元的 Chai Discovery 是核心玩家。播客点出一个结构性转变:过去 AI-for-pharma 公司几乎都被迫转去自建药物管线,因为要说服药厂用你的工具,得先拿出经临床验证的靶点,那还不如自己拿着靶点去融资或卖掉;如今工具好到药物设计团队愿意直接信任,这条"卖工具"的路才第一次走通。工具够好带来两件事:把更多更优的候选分子更快推进实验室和动物试验,以及解锁实验室方法做不到的新能力(如精准触发特定机制的抗体设计)。
🦐点评:关键信号不是 Chai 的 40 亿估值,而是"药厂开始为工具付费"这个拐点本身——它意味着 Bio×AI 第一次出现了不必自建管线、可以纯做工具卖钱的商业模式,这正是过去十年生物 AI 反复碰壁的地方。对投资人,判断标准从"模型多准"变成"药物设计团队是否真的把它接进了 workflow、带来了可量化的候选分子成功率提升"。一个夏天关掉四笔交易、两年做到 40 亿,值得追问的是这种付费是真需求还是 JPM 窗口期的 FOMO,以及当基座结构预测模型持续变强,Chai 这类工具层的溢价还能维持多久。
Ed Zitron 甩出一组数字给 AI 繁荣泼冷水:据他汇总的 Wells Fargo、Barclays、UBS 分析师笔记,微软、谷歌、亚马逊 AI 收入的 70% 以上来自 OpenAI 和 Anthropic 两家;UBS 甚至估算明年这两家的算力开支将占 Google Cloud 全部收入的 48%。而规划中的 190GW 算力每年需要 1.62–2.92 万亿美元的 compute 支出,对应的却是一个最乐观情形下年需求仅约 1100 亿美元、且 90% 以上来自这两家"只有被 VC 喂钱才花得起"的公司的行业。他还点名 Nvidia 那笔 5000 亿美元交易里的资产管理人个个在 AI 数据中心/neocloud 有敞口(尤其 Blackstone 早在 CoreWeave 最早期就进场),并直言 1.65 万亿美元的表外义务无人解释。
🦐点评:Zitron 的核心不是"AI 是泡沫"这句老话,而是把传导链条钉死:三大云的超增长、Oracle/CoreWeave/Nebius/IREN 的生死、乃至 Nvidia 的循环融资,全部悬在"OpenAI 和 Anthropic 能不能继续烧掉数千亿"这一个假设上,而这两家的钱来自 VC。对红杉这样的一级玩家,这才是真正扎心的地方——你投的不只是某家应用公司,而是整条链条对"两家永续融资"的隐含押注,一旦其中一家融资节奏断档,苦的是整个 neocloud 和二级 AI 敞口。它和当天 Stratechery 讲的 Nvidia 供应商融资,是同一枚硬币的两面:一个讲上游怎么用担保撑需求,一个讲需求本身有多集中、多脆弱。
📌 其他新闻
Gemini 月活突破 10 亿、成 Google 史上增长最快的产品(Pichai 周二在 X 上宣布),显示 Google 正持续从 ChatGPT 主导的消费级聊天机器人市场抢回份额。
世界杯投注推动预测市场 Kalshi 7 月年化营收翻倍至 40 亿美元以上(两个月前约 20 亿),正洽谈 400 亿美元估值的新融资、较上一轮近乎翻倍。
以色列软件并购火热:Team8 刚募 3.65 亿美元种子/A 轮基金,还没募完就靠去年联合领投的风险防护公司 Koi 拿下首个 exit;同期 General Atlantic 前高管 Anton Levy 为自己的新基金募资 10 亿美元。
Google Research 与 DeepMind 让基于 Gemini 的医疗 AI 系统 AMIE 首次展示实时临床视频问诊能力——不止听文字,还能像医生一样观察咳嗽、步态和不适的可见体征,并在该场景下达到专家级水平。
Meta 时隔一年重拾"个人超级智能"叙事:Zuck 发布续作长文,并开源 30B 的 Muse Glimmer(可在单张 RTX 3090 上运行)、主打本地常驻 agent,Spark 也将开源;MSL 把"把权力交到个人而非机构手中"立为长期议程。
戴盟机器人完成数亿元融资,蚂蚁集团领投、老股东超额跟投,这是蚂蚁首次布局触觉赛道(此前已投宇树、星海图、灵心巧手等一批具身企业),资本正从具身本体集体涌向"触觉"这一环。
OpenAI 官方博客宣布开始在 ChatGPT 中测试广告,是其消费端从纯订阅走向广告变现的一步。(原文正文被反爬拦截未能抓取,此处概述仅基于官方标题,不含具体形式细节。)
🧠 AI 技术前沿
分享论文 SWE-Bench ProMax:一个面向"大规模多语言代码重构"的 Agent 评测基准,把 coding agent 的考核从单点修 bug 推向工程级重构。
查看推文 →
Nvidia 已在做 Nemotron 4,据称参数超 1T、几乎是现有最大模型 Nemotron 3 Ultra 的两倍——芯片厂自己下场做开源模型的力度还在加码。
查看推文 →
Artificial Analysis 的 AA-Omniscience 基准显示 ChatGPT 幻觉严重:GPT-5.6 系列在答错时"自信瞎猜而非承认不知道"的比例高达 88%–93%(Ultra 最高);但作者补充,这个差距很大程度取决于你怎么 prompt。
查看推文 →
自 2026 年 8 月 2 日起,每个新版 Claude 都会在文本里藏隐形水印,且水印会随复制粘贴迁移、经部分编辑仍可能留存——求职信、帖子、论文、邮件都可能被追溯到机器生成。
查看推文 →
Anthropic 出了一份完整指南教你如何为 Claude 构建 skills:一个装着指令的文件夹,构建一次、Claude 在相关时自动加载,省去反复解释你的工作流和风格,但大多数人还不知道它的存在。
查看推文 →
LLM 仍会产 bug,但形态变了:不再是 off-by-one,而是系统设计、UI 可用性、缺乏更大上下文这类问题;部分编码已被解决、但不是全部。对抗式代码评审(哪怕一行 prompt)是抓这类 bug 的利器。
查看推文 →
webAI 开源了首个形式化推理模型 TwiL-LM3,仅 3B 参数,却在 5 项形式化推理基准中 4 项超过 OpenAI 的 GPT-OSS-120B(参数约为其 1/40、推理快 2.6 倍)。
查看推文 →
千问团队开源"原生多模态插件集"Qwen-MM-Plugins,把读图/读视频/读文档/听音/建模等能力以 MCP 形式注入任意 Agent harness,让纯文本 Agent 一键升级为多模态原生 Agent。
查看推文 →
开源世界模型 LTX-2.5 主打完全可控:生产级视频、多镜头控制、场景精度、原生 4K HDR,还更省算力——下载、运行、拥有,权重归你。
查看推文 →
实测智谱 ZCODE:11 分钟把还在用 20 年前 jQuery 的 Steam 页面重构成 React + TailwindCSS,效果出奇地好,prompt 却很简单。
查看推文 →
感觉 GPT Image 2 被 OpenAI 悄悄做了一次大升级——一句 prompt 就出了这张图,做缩略图几乎是"终局"了。
查看推文 →
Claude Code 默认很臃肿:费 token、爱争辩、还慢。修法从全局 CLAUDE.md 入手:加一句"用 ASD-STE100 简化技术英语,只说必要的话",并把文件压到 200 行以内——越长越容易被忽略。
查看推文 →
🚀 创业动态
刚拿到新发布的 GrokBot——面向桌面和 iOS 的通用 agent 平台,支持 Connections、插件、云电脑、agent 互相对话与触发器;对想做 agent-native 生意的人是件大事。
查看推文 →
抛出一个正在被反复问的问题:给公司搭 agentic workflow 该怎么收费?初次实施怎么定价、是否提供持续维护和评估、起步用什么工具栈——他发现每个人的答案都不一样。
查看推文 →
社媒一味鼓吹"做 SaaS""当网红",其实一个执行到位的服务型/代理(agency)模式,涵盖了创业的全部要件:销售、交付、留客、招人、管现金,还顺带攒下人脉网。
查看推文 →
post-bridge 现在支持多人协作发 Instagram 帖子了;如果你用 MCP,让你的 agent 重新拉一遍 API 文档或 skill 文件就能拿到新工具。
查看推文 →
ZCode 也加入了 AI 团队的"RESET"大军,而且已有 100 万用户——在巨头夹缝里能跑出这种增速已经很可以了。
查看推文 →
今天被 Cursor 团队刷屏:一面是设计师 Ryo Lu 离职、准备回归亚洲,一面是团队集体含糊其辞地发帖——大概率是 Grok 4.6 要发了。
查看推文 →
最近在做机器人训练的"罕见事件发现":消防无人机灭不了火、机器人遇到反常情况会如何反应?他认为像 LTX 这样的开源世界模型可以批量造出这些极端场景来训练机器人。
查看推文 →
💬 观点与洞察
就算 LLM 别的什么都不做,只做它在数学里已经做到的——把不同子领域的想法以新颖方式组合起来——都足以是革命性的。在 LLM 之前,科学正被"知识过载"拖住、研究趋于僵化。
查看推文 →
OpenAI 高层持续流血:过去 12 个月里 COO、CTO(B2B)、首席人事/传播/营销官、Sora 负责人、安全系统/伦理/硬件负责人、Stargate 数据中心高管等 16 个要职相继离任。
查看推文 →
Anthropic 更用力地押注生物学"以扭转公众对 AI 的负面情绪";而 Dario 2023 年曾说"为聚焦生物风险,我真会瞄准 2025、2026——若届时没有约束措施,我们会很惨"——耐人寻味的反差。
查看推文 →
不管当年 Ilya 到底看到了什么,那东西至今仍在惊扰 OpenAI 的其他高管。
查看推文 →
就这一个改动(Claude 隐形水印),会让"去水印/反 AI 检测"工具的需求暴涨 10 倍。
查看推文 →
有意思的是那条标题说的是 OpenClaw 而不是 Claude——好像 harness 真能拦住一个铁了心的用户似的。
查看推文 →
同感,Claude 一天比一天爱说教、动不动就拒绝我;只要 Grok 编码够用,我很乐意跳船——我的站点后端本来就跑在 xAI 上。
查看推文 →
认同 swyx 对 Skills 的判断:个人工作流可放心尝试,但生产环境务必谨慎——一旦授予生产权限,Skill 就等同生产代码,必须审查其作用域、重试与终止条件,有时最安全的"补丁"是删掉那条教 agent 永不停止的 Skill。
查看推文 →
太逗了,往后是不是每个 AI 团队都会配一位"首席重置官(Chief Reset Officer)"?
查看推文 →
BestBlogs 早报 08-12 精选:阿里 open-code-review 两月获 20k star、连续 5 天登上 GitHub Trending,靠 All in Code 让 agent 参与开发评审、又用 200 个 PR 的评测集和人工决策守住核心链路,README 从千行压到两百行。
查看推文 →
🔥 精选推荐
OSWorld-Verified 的数据显示,领先模型在真实桌面任务上的完成率一年内从约 42% 升到 85%,越过了约 72% 的人类基线——模型已经能看屏幕、点按钮、填表、切换系统,在没有接口的老软件里干真活。但文章的落点是另一面:企业买的从来不是一次基准测试。报销流程走到第七步失败,前六步都不算产出;保险申请显示"已收到",两天后因为保单号有误停住,而智能体不会知道办公室接到过一通电话。85% 换个口径就是每一百个任务仍有十五个失败,单步任务能接受,七八步串联的流程会把失败率继续放大——每步 85%、连做五步全成的理论概率只剩约 44%(真实系统各步并不独立,这个算法不能当预测,但足以说明基准分为什么不能直接换算成自动化率)。生产团队给出的边界很清楚:最适合交给它的是标准化、重复、路径明确、且能立刻确认结果的活——更新客户记录、处理零售订单、查监管页面、录合同、解工单。
🦐点评:这篇把 Agent 类公司的尽调问题问对了:该问的不是模型跑分,是"你的失败发生在第几步、由谁承担"。那句"任务是基准的单位,完整流程才是企业的单位"值得抄下来——它解释了为什么一批演示惊艳的产品卖不进企业。对投资人有两个可操作点:一是看这类公司有没有把"确认结果"做进产品(能立刻验证的场景才是它现在真正能吃的市场,反之是在替客户积累未爆的雷);二是 85% 到 99% 这一段的钱和 42% 到 85% 完全不是一回事——后者靠模型升级白拿,前者要靠工程、回滚和责任划分一点点啃,而这恰恰是模型公司不会替应用公司做的部分。
一篇关于 Etched 的研究分享。逻辑起点是推理正在取代训练成为算力主战场:训练负责造模型,推理是每次调用时真正跑的那部分,而随着应用生成的 token 越来越多、智能体反复调用,推理在 AI 成本里的占比持续上升。GPU 的长处是可编程加上成熟生态,但这种灵活性要用芯片面积、功耗和数据搬运来换;Etched 的判断是推理已经足够成熟和可预测,值得做更深的专用化,让每一美元、每一瓦电产出更多有用的 token。资本认了这个判断:2026 年 7 月红杉领投 3 亿美元 C 轮,估值 103 亿美元。三位创始人里,CEO Gavin Uberti 做过 AI 编译器基础设施、给 Apache TVM 写过 Cortex-M 后端,正是写底层代码的经历让他看到通用芯片的大量资源花在搬数据和维持灵活性上;Chris Zhu 主修数学与计算机,两人在 Uberti 休学期间隔天用视频推进这个宿舍里起步的项目;总裁 Robert Wachen 十六岁时被确诊四期骨癌、生存概率不足三成,在保命和保住行走能力之间选了手术,后来仍要接受放疗、花近两年重新学走路。
🦐点评:这篇值得看的是它把"专用化"的赌注条件写清楚了——推理要足够成熟和可预测,专用芯片才成立。这跟前几天 AMD 收购 Taalas 那笔是同一道题的两个答案:Taalas 把权重直接刻进硅片,Etched 是为推理这类计算做专用架构,两家都在赌"负载会定型"。对投资人可操作的是盯那个前提本身:如果模型架构继续每几个月换一次,专用化的摊销窗口就永远打不开;反过来,一旦开源权重收敛到少数长期版本,这一批公司的估值逻辑会同时成立。另外别把创始人故事读成加分项——它解释的是这个团队为什么扛得住长周期硬件研发,而不是它的技术判断为什么对。
Starcloud 在 2026 年 3 月完成 1.7 亿美元 A 轮,Benchmark 与 EQT Ventures 领投,估值 11 亿美元,累计融资 2 亿——从 Y Combinator 路演到独角兽只用了 17 个月,而彼时它还远未进入规模商业化。它要做的是把 AI 数据中心送进近地轨道,选太空的三个理由是持续太阳能、天然散热和不受限的扩展空间;对外讲的四代产品不是四颗卫星,而是一张通往吉瓦级轨道数据中心的技术路线图。文章把它放在更大的背景里:国际能源署预测到 2030 年全球数据中心用电需求将翻倍以上,达到约 945 太瓦时,略高于日本目前一年的总用电量,而人工智能是这一增长的主要驱动力。SpaceX、Blue Origin、Google 也已先后进入这个赛场。
🦐点评:这个标的本身可以先不判断,但它标定的东西值得记:当能源、电网和土地成为 AI 的实际约束时,资本已经开始为"绕开约束"的方案付溢价了——17 个月、尚未规模商业化就到 11 亿美元,定价的显然不是收入,是那个约束的严重程度。对我们的用处在于反推:它是一个关于"地面算力扩张会撞墙"的市场共识指标,而这个共识如果成立,受益的远不止太空这一条路——电力、散热、选址、余热利用这些更近的方向会先被重估。真要看这家公司,该问的不是技术浪不浪漫,而是发射成本、在轨维护和延迟这三项里,哪一项的改善速度支撑得起它的路线图。
📌 其他值得看
成立仅一年,正在洽谈的新一轮估值约 30 亿美元,是四个月前的两倍多;年化收入约 5000 万美元,比去年 11 月增长近四倍,Elad Gil 在洽谈领投。它做的是帮企业用自己的数据定制开源模型——文章点明了这轮增长的背景:越来越多企业想靠定制开源模型压低 AI 成本,而不是继续为闭源模型持续付费,同一趋势也在带动 OpenRouter、Baseten、Fireworks 这类公司。
从 Y Combinator 毕业后完成 900 万美元种子轮,Lightspeed India 领投,Peak XV 及 Paul Graham 等天使跟投。做法是用大量 Agent 集群生成候选材料方向,再用自训的基础物理模型跑仿真验证。创始人那句对比很具体:读博期间一天大概只能做 20 次猜测尝试,而现在这些 Agent 在云端 24 小时不停地沿着给定方向持续探索。
借新产品"懂模帝"讲了一个尖锐的观察:AI 应用公司正在集体"跪得太快"——一批转型蹭模型做后训练,另一批改叫各种定语的世界模型公司,反而丢掉了自己唯一的价值也就是场景。他的论点是模型公司不懂场景、朝着编程能力猛卷导致写作能力退步,所以模型优化需要更多真实场景的评测,而这正是应用公司擅长的。产品做的就是收录应用公司在自己场景上的评测集(游戏开发、训模型、让 Agent 运营一家公司、浏览器操作等)。
从 MiniMax DevMeetup 的一场分享延伸出来的思考:"Agent 能力越来越强、人人都能造奇观"的时代,人人都能说自己做得到,越来越难回答的是凭什么是你。作者给自己的答案是不执着于每次做出来的产品,而是通过做东西进入生态、获取认可,再与行业一同发展。
作者自己开发的 ColaMD,开源免费,支持所见即所得、主题切换、富文本复制、PDF 导出,三大系统都有。对我们更相关的是那个设计取向:它对 Agent 友好——当 Claude Code、Codex 这类工具改动正打开的 .md 文件时会实时同步,不用关掉重开也不用手动刷新。
(这篇正文抓取失败,只拿到页面脚本,这里只保留标题和链接。) <!-- ai-daily:complete -->