🔥 精选推荐

OpenAI 与 Hugging Face 联合公布了一起"在 AI 模型评估过程中发生的安全事件"的早期调查结果。官方表述的核心是:事件中被测模型展现出的"高级网络攻击能力"(advanced cyber capabilities)值得警惕,并从中总结了给防御方的经验教训。两家头部机构就同一起 AI 安全事件联合发声、共享调查结论,本身即不多见。(OpenAI 原文受反爬限制未能取到全文,本条基于官方摘要)
🦐点评:AI 安全正从"红队演示"走向"真实事件披露",这会把"前沿模型的攻击能力"从论文话题变成采购话题。对 VC 有两层含义:其一,模型评估(evals)环节本身正在成为攻击面——如果连 OpenAI 和 HF 在评估阶段都会踩雷,那企业把模型接进生产的每一步都需要新的安全中间层,这是一个正在被凭空创造出来的预算科目;其二,OpenAI 拉上 HF 联合披露,是在抢"负责任信息共享"的叙事高地,间接给"闭源+管控"路线背书——这跟这两天 emollick 说的"闭源受监管收紧、开源没约束"的张力是同一件事的一体两面。可跟踪的是 AI-native security(模型运行时防护、eval 安全、agent 权限沙箱)这一波新公司。
openai.com
欧盟委员会依据《数字市场法》(DMA) 向 Google 下达两套具约束力的规范。第一套要求 Google 让竞品 AI 服务在 Android 设备上获得与自家 Gemini "同等"的功能访问权;第二套要求 Google 把只有它能在规模上采集到的搜索数据——用户搜什么词、点了哪些结果、用什么语言和设备——共享给第三方搜索引擎和 AI 聊天机器人。数据名义上匿名化,但搜索词本身往往具个人可识别性,欧盟把"过滤掉密码、用户名等敏感信息"的责任丢给了 Google;Google 可对这类数据访问收费,但价格必须符合 FRAND(公平、合理、非歧视)原则。Gruber 用"其规模之大令人瞠目"来形容。
🦐点评:真正的信号不是罚款,而是监管首次把"AI 竞争"直接写进反垄断补救措施,逼 Google 把 Gemini 在 Android 上的特权让渡给对手。对投资的指向很直接:如果规模化搜索数据被强制以 FRAND 价开放,那么"没有自己的搜索数据"就不再是 AI 应用公司的死穴——Perplexity 们的数据壁垒会被欧盟这只手在欧洲市场抬平一块,可能催生一批"靠 Google 数据喂养"的挑战者。反过来也要重估 Google 的资产质量:当它最独特的数据资产可以被监管定价出售,那这条"数据护城河"在欧洲的会计价值就该打个折——而这套逻辑迟早会被美国 FTC 拿去参考。
daringfireball.net
Applied Intuition 本周推出 Dana——一个用于开发"物理 AI"应用的 agentic 平台。文章借 a16z(Marc Andreessen 亲自署名)之口讲了一个反共识故事:2017 年自动驾驶行业笃信"少数垂直整合公司通吃",资本涌向全栈 robotaxi;而 Applied Intuition 反其道而行,选择做"没人看得上的工具层"——把开发自动驾驶所需的最佳实践本身做成一家公司卖给全行业。Cruise 等明星全栈项目当年拒绝了它、如今大多已消亡(Cruise 被通用收购后因安全事故关停),Applied Intuition 反而活得更好,并把野心从"造车工具"扩展到"让十亿台机器都装上智能"。
🦐点评:这是 a16z 在为自家 portfolio 站台,但"卖铲子比挖金子活得久"的论证放在具身智能这一波值得认真对待。robotaxi 全栈派尸横遍野(Cruise 关停是最新一具)恰好印证了"垂直整合通吃"在硬件密集、长尾安全的物理世界里失灵——这跟纯软件 SaaS 的规律不同。启发是:在具身/物理 AI 赛道,"工具与 OS 层"可能比"本体制造"有更好的风险收益比,因为它不承担单点安全事故的归零风险、还能横向收整个行业的过路费。要警惕 a16z 的立场——它需要这个叙事成立;真正的检验是 Dana 能不能像当年卖给车厂那样,把客户从"自建工具"手里抢过来,而这一次的买家(人形机器人公司)现金比当年的 robotaxi 项目更紧。
a16z.news
Simon Willison 在 AI Engineer World's Fair 与 Anthropic Claude Code 团队的 Cat Wu、Thariq Shihipar 对谈,几个数字很扎眼:Claude Code 团队产品工程的 PR,如今有 65% 由新的协作式 Slack 集成 Claude Tag 完成;Claude Code 的功能先在 Anthropic 内部员工(内部叫 "ant fooding")中灰度,只有留存达标才对外发布;关键改动仍人工评审,但产品"外层"越来越依赖自动化代码审查。最反直觉的是提示词经验:对 Fable 5 乃至 Opus 4.8,往系统提示里加示例已不再是最佳实践,Claude Code 的系统提示词近期直接砍掉了 80%,一堆"不要做 X"的禁令反而会拉低最新模型的输出质量。
🦐点评:"65% 的 PR 由 AI 协作完成"若坐实,意味着 Anthropic 内部的工程组织形态已先于市场跨过了某个临界点——它不是在卖工具,是在直播"AI 原生研发团队"长什么样。含义是双向的:一方面,"删示例、砍禁令、系统提示缩 80%"直接打击了一整类"提示词工程/prompt 管理"工具的存在理由,模型越强,这层中间件越薄;另一方面,"内部先灰度、看留存才发布"这套 ant fooding 机制是 Anthropic 把自己当最大用户的护城河,产品迭代信号比任何用户调研都快。谁能拿到"AI 写了多少比例的生产代码"这类内部指标,谁就能提前判断 coding agent 的真实渗透率——而这正是我们评估 Cursor、Cognition 时最缺的锚。
simonwillison.net
Latent Space 深访 Xaira Therapeutics 的 Bo Wang(首席 AI 科学家)和 Ci Chu(首席发现官),核心是一个"数据而非参数"的判断:当模型规模超过约 15 亿参数后,训练损失还在降、测试损失却不再改善——说明模型被数据里的信息量卡死了,加参数、加算力都没用。Xaira 的解法是自己造数据:用大规模实验把可用信息量提升约 30 倍,让模型重新回到"随参数和算力扩展"的曲线。其预算结构更像强化学习的 rollout 预算(数据采集数千万美元、算力与研究几百万),而非数据充裕时代的预训练。底层数据资产是 CZI 的 CELLxGENE(1.68 亿细胞、约 4 万亿条目的基因表达矩阵),Bo Wang 此前的 scGPT 正是新模型的起点。
🦐点评:这篇把 AI 制药最关键的分歧点讲透了——瓶颈不在模型、在"因果数据"。意义是重估整个 TechBio 赛道的成本结构:如果领先玩家的钱要花在"造实验数据"而不是"堆 GPU"上,护城河就从"算法团队"重新回到"湿实验室+数据生成基础设施",这对纯 AI 背景、没有实验能力的 AI-drug 创业公司是坏消息。作者把 CELLxGENE 之于虚拟细胞模型,类比成 PDB 之于蛋白结构模型(AlphaFold 的地基)——这个类比若成立,谁掌握下一个数量级的因果数据生成能力,谁就可能吃到"AlphaFold 时刻"的红利。Xaira 把 Chu 和 Bo 分别提到首席发现官和首席 AI 科学家,是用组织架构给"数据优先"这个赌注背书;做 TechBio 尽调时不妨反过来用——先问 founder 的钱准备怎么花,就知道他信不信这套。
latent.space

📌 其他新闻

NVIDIA 团队系统梳理物理 AI/机器人的仿真现状:最大瓶颈是数据——机器人无法像 LLM 那样吃互联网规模语料,只能靠仿真在 GPU 并行中低成本生成大量照片级、符合物理规律的交互数据;文章逐一对比 MuJoCo、Isaac Sim/Isaac Lab 3.0、Newton 等主流仿真引擎的定位与取舍。
huggingface.co
Ben Thompson 对 Netflix 二季度财报的判断是"还行、但也就还行"——这是一家最精彩的日子大概率已在身后的成熟公司。(正文为订阅内容,本条基于免费导语)
stratechery.com
OpenAI Foundation 与 OpenAI Group PBC 董事会新增 David Vélez(Nubank 创始人)与 Robin Vince 两名董事,官方称看重二人在金融、科技与治理领域的全球经验——为财务与治理背景加码,是一家正走向公开市场的机构的典型动作。(原文受反爬限制,本条基于官方摘要)
openai.com
Simon Willison 推荐新工具 Nativ:由 MLX-VLM 库作者 Prince Canuma 开发,把 MLX 包成一个完整的 macOS 桌面应用,形态类似 LM Studio,同时提供聊天界面和本地 API 服务,还能自动识别 Hugging Face 缓存里已下载的 MLX 模型。
simonwillison.net
字节旗下 XR 业务 PICO 完成负责人交接:创始人周宏伟因个人规划卸任、离开公司,由 2021 年加入、主导 PICO 核心产品与技术的李晓凯接任;字节称对 XR 长期价值的判断未变,今年 PICO 仍将按计划推出新款 MR 产品。
36kr
腾讯 7 月 20 日调整组织:把基于 OpenClaw 打造、内测一周用户破数百万的 QClaw 相关业务与部分团队,并入 AI 办公智能体 WorkBuddy 所在的云产品六部——后者 6 月单月访问量破 2000 万、居国内 PC 端 AI 原生办公智能体市场第一,超二三名之和。腾讯多个 Agent 产品的整合进入新阶段。
雷锋网

🧠 AI 技术前沿

shao__meng @shao__meng
Gemini 悄悄发了 3.6 Flash 和 3.5 Flash-Lite(不是众人等的 3.5 Pro),知识截止 2026 年 3 月,输入价与 3.5 Flash 持平、输出价小降;他自己懒得测,等官方公告。
查看推文 →
Hesamation @Hesamation
Gemini 3.6 Flash 的编码指数竟然低于上一代 3.5 Flash,他直呼糟糕透顶——看起来 Google 这次只想着降本提速,而没在提升智能上下功夫。
查看推文 →
_akhaliq @_akhaliq
Motif-3-Beta 登陆 Hugging Face:约 3140 亿总参数、每 token 激活约 130 亿的稀疏 MoE,384 个专家选 8 个+1 个共享专家,原生 256K 上下文,多语言通用。
查看推文 →
_akhaliq @_akhaliq
苹果发布论文,提出一种无需真实环境、直接合成数据来训练"会调用 API 的 Agent"的方法。
查看推文 →
EXM7777 @EXM7777
Kimi K3 有"大模型的味道":英文写得比 OpenAI、Anthropic 的前沿模型还好,目前 frontend arena 排第一,能在 Claude Code 里流畅跑——他称这是中国的一次大胜。
查看推文 →
corbin_braun @corbin_braun
"Kimi K3 是用 Fable 5 的输出训练的"这个说法很站得住脚;他推测 OpenAI 和 Anthropic 可能会捂着下一代大模型不发——何必发个前沿模型、三个月后就被蒸馏走。
查看推文 →
shao__meng @shao__meng
Claude Code 系统提示词被砍掉 80%(适用于 Fable 5、Opus 4.8):删掉少样本示例反而更好,因为模型比示例更有创造力;也应少用"不要做 X"的禁令、多给上下文。
查看推文 →
emollick @emollick
当所有人都在谈为省钱/主权/灵活性而频繁切换模型时,最前沿的几个模型之间反而越来越不同——Fable 和 Kimi K3、Sol 的响应差别很大,无法即插即用。
查看推文 →

🚀 创业动态

vasuman @vasuman
越来越多公司把平台开成 API 给 Agent 用:DoorDash 上周宣布可用 API 点餐,Whop 从创作者支付起家、如今一个接口就能注册一家 LLC、另一个接口投广告——未来是为 Agent 准备的,不是为你。
查看推文 →
cursor_ai @cursor_ai
Cursor 宣布把所有个人和团队套餐的用量额度翻倍,适用于 Grok、Composer 及新推出的 Cursor 模型。
查看推文 →
EXM7777 @EXM7777
引用 Alex Hormozi"能比对方更清楚地说出他的问题,他就会本能相信你能解决"——他给出配套的四步法:从你自己已经解决过的痛点里,找出那个该被产品化的问题。
查看推文 →
MengTo @MengTo
在 Codex、Claude Code、Cursor 间并行管理多个 agent 越来越难,他用一个开源项目把任务进度放到 Mac 刘海区跟踪,顺带学 macOS 开发——把 GitHub 链接丢给 agent 就能装或改。
查看推文 →

💬 观点与洞察

eptwts @eptwts
所谓"AI 泡沫"的滑稽之处在于:跟普通人聊天时 AI 几乎从不被提起,它更像个梗而非话题——我们离大规模普及还很远。
查看推文 →
karpathy @karpathy
他常用的一个 LLM 用法是"长篇漫谈":懒得打字讲清意图时,切到语音、放松地胡乱讲十分钟意识流,有时先声明一句"切语音识别了、见谅错别字",再把它变成几轮小访谈。
查看推文 →
vasuman @vasuman
他发帖调侃 OpenAI,OpenAI 和 Anthropic 的人都来点赞、纯属玩笑;但他一调侃 Anthropic,Anthropic 团队没有一个人会碰,正负都不点——堪称造"教"的教科书级案例。
查看推文 →

🔥 精选推荐

成立仅 34 个月的硅基流动递交港股招股书,估值约 70-80 亿元,低于已上市的智谱、MiniMax 甚至老前辈商汤。它是行业里稀缺的"独立第三方 MaaS 平台"——不做基座、不做 to-C 应用,只做模型服务的中间管道。但财务是失血式增长:2025 年营收 5533 万、增速 653%,销售成本却涨了 14 倍,毛利率从 39.4% 掉到 -24%;其中面向个人和小团队的公有云 MaaS 占收入 52.9%、毛利率 -119%(卖一块亏一块一毛九),一年烧掉近 3500 万。账面现金加定存 2.7 亿、每月烧 1480 万,只够撑 18 个月;全部算力靠租(自有 PP&E 仅 92.7 万元),上市后还新签了总额 34.91 亿元的 60 个月算力协议。
🦐点评:硅基流动最大的问题不是市值,是"管道"这个定位在中国市场不成立——文章给的对照最致命:字节火山方舟日均吞吐 180 万亿 token,硅基只有 0.58 万亿,差 310 倍,而字节的算力是豆包/抖音推荐跑完剩下的边际产能,边际成本趋近于零。这意味着独立 MaaS 被"有自有流量+自有算力"的大厂从成本端直接碾压,-119% 的毛利不是烧钱换增长,是商业模式的结构性亏损。对一级市场的提醒是:别把"AI API 市场 5 年涨 25 倍"的高盛叙事直接套到管道公司上——水管会涨,但收过路费的人得先能活到那天,且未必是独立第三方。这单港股 IPO 更像被 18 个月现金流逼出来的"流血上市",定价会成为整个中国 AI infra 一级估值的一个残酷锚点。
晚点LatePost
法国和意大利三所大学的实验给出一组反向对撞的数字:能求助 AI 后,受试者愿意说"我不知道"的比例从 44% 跌到 3%,回答准确率从 27% 跌到 9%,自信却从 30% 升到 76%。实验被刻意设计成对人类有利——选的是 AI 常答错的电影画面细节(模型只能编造)、且用了一个以出错著称的模型,排除了"合理委托可靠工具"的辩护;结果一部分人原本自己能答对,问了 AI 反而改错。研究者用真金白银激励也只把"承认不知道"从 3% 拉回 8%。主持人 Capraro 的概括是:AI 的"在场"本身就足以瓦解人识别自身无知的能力;文章将其与沃顿"认知投降"(80% 情况下接受 AI 错误答案)相互印证。
🦐点评:这篇的价值不在"AI 会犯错",在于它量化了一个之前只能定性谈的东西——AI 侵蚀的第一个能力不是知识,是"知道自己不知道"这层元认知,而且钱买不回来。往产品设计上想:当前所有 AI 助手都被调成"永远给答案、永不说不知道",因为"我不知道"会拉低留存和满意度——但这项研究说明,正是这个默认设定在系统性地制造过度自信的用户。这里藏着一个反向机会:在医疗、法律、金融这些"答错代价极高"的场景,"会恰当拒答、会标注不确定性"可能从产品缺陷变成合规刚需和差异化卖点。谁先把"可信的不确定性表达"做成产品能力,谁就能在 to-B 高风险场景立住,而这恰恰是通用 chatbot 因为要冲 C 端指标而不敢做的。
深思SenseAI
报告的核心判断是:限制 AI 算力继续增长的已经不只是 GPU,而是电力、土地、电网容量和散热——一个 GW 级数据中心从选址供电到并网往往要数年。太空因此进入视野:轨道可持续获取太阳能、不受土地电网约束,遥感通信数据本就产生于太空、可在轨处理减少回传。让设想走向现实的是三件基础设施同步成熟——可复用火箭把近地轨道发射成本压到 Falcon 9 约 2700 美元/公斤(Starship 目标 100-200 美元/公斤)、星载 AI 芯片让卫星从"采集回传"走向"在轨计算"、Starlink 验证了大规模组网。美国最快:NASA 相关空间计算预算从 2023 财年 7690 万美元增至 2025 财年 2.25 亿美元,Starcloud 已于 2026 年发射搭载 NVIDIA H100 的轨道数据中心。
🦐点评:"太空算力"听着像科幻,但这份图谱把它还原成了一个很务实的能源套利问题:地面 AI 数据中心的真实瓶颈已从"买不到卡"变成"接不进电网",而轨道上的太阳能不排队、不审批。对 VC 的价值不在于现在就投轨道数据中心(发射和散热的单位经济性还差得远),而在它标定了一条新主线——AI 竞争正从"算力竞争"下沉为"能源竞争",这条线上更近的机会是地面侧的电力、变电、液冷、SMR 核电,太空只是这条曲线被推到极端的样子。可跟踪 Starcloud 这类公司的在轨实测数据(H100 在轨的散热与辐射表现),它们会先于市场证伪或证实"天地协同算力"的时间表;马斯克那句"真正远超地球的能源在太空"值得记下,但当下更该下注的是"电从哪来"而不是"算力搬去哪"。
Z Potentials
作者把 Chat Memo 的 Agent 端 0-1 全交给 AI 写、自己只做想法和审查,借此实测了 Fable 5、GPT 5.6 Sol、DeepSeek V4、Kimi K3、Qwen3.8-Max 等一线模型。结论偏体感但具体:Fable 5 最值得信赖,不会被用户提示推着走、常给意料外但论证严密的方案,尤其擅长按用户画像设计前端、按第一性原理给干净的后端架构,1M 上下文腐烂控制得好;Opus 4.8 适合已有模块的修补;GPT 5.6 Sol 是新宠、指令遵循和 Skill 触发极稳、额度便宜大碗(Pro 周约 10 亿 token),但太听话、容易钻进你最初的提示方向和现有代码架构、给不出让人醒悟的启发。
🦐点评:这类一线开发者的"体感评测"比跑分榜更有信息量,因为它测的是"把模型当合伙人"时的真实差异。最值得注意的判断是"Fable 保持独立思考 vs GPT 过度顺从"——若这个体感在开发者群里形成共识,会重塑 coding agent 的竞争维度:从"谁更聪明/更便宜"转向"谁更像一个有主见的资深工程师",而后者恰恰是最难被便宜模型蒸馏掉的部分。对投资的指向是,评估 Cursor、Windsurf 这类编排层公司时要多问一层:它绑定的底层模型是"顺从型"还是"主见型",这直接决定产品是"高级自动补全"还是"能独立扛活的 agent",两者的付费意愿和天花板完全不同。国产模型(Kimi K3、Qwen3.8)在"便宜大碗"上追平了,但在"独立判断"这条软性壁垒上还没被验证。
一泽Eze
NeoLab 里的 MindLab(成立于去年 12 月)发布 Macaron V1,号称是唯一完成对 GLM-5.1/5.2 后训练的外部团队。技术路线是只训练现有模型约 0.5% 的核心参数(LoRA),并独创 Mixture-of-LoRA(MoL):在冻结基座上挂多个各自专精 Chat/Agent/Coding/UI 的 LoRA 专家、隔离优化以消除能力互扰,由显式 Router 切换,加新能力只需再挂一个 LoRA。旗舰 Venti 基于 GLM-5.2(748B),并用自研 LongStraw 把上下文扩到 2M;配套还有生成式 UI 架构 UI4A、持久 Python 环境 REPL Harness,以及只在 Actor/Learner 间传 Adapter、支持百万级 Adapter 的 MinT 训练平台。
🦐点评:Macaron 真正有意思的不是跑分,是它示范了一种"寄生式"商业模式——不自己烧钱做基座,而是给别人的开源基座(GLM-5.2)做后训练增值,用 64 张卡跑万亿参数 RL。这在中国开源模型密集迭代的当下是个聪明的生态位:基座厂商(智谱)负责最贵的预训练,NeoLab 用极低成本在上面做能力增强和垂直适配,MoL 这种"挂 LoRA 专家"的架构还天然适合按需扩展。含义是"后训练/对齐即服务"可能长成一个独立赛道,尤其当开源基座越来越强、企业要的是"在强基座上做隔离化的能力定制"。要警惕护城河问题:MoL 和 LoRA 都不是秘密,这类团队真正的壁垒在于自研训练基础设施(MinT)和评测基准(ChatBench/LivingBench)能不能沉淀成别人复制不了的 know-how,否则很容易被基座厂商顺手做掉。
赛博禅心

📌 其他值得看

Google 悄悄发布 Gemini 3.6 系列共 3 款:主力 Gemini 3.6 Flash(3.5 Flash 升级版,输出 token 消耗降约 17%、DeepSWE 上最多降 65%,定价输入 $1.5/输出 $7.5 每百万 token)、更快更便宜的 Gemini 3.5 Flash-Lite(350 tokens/s,输入 $0.3/输出 $2.5)、以及面向政府和可信伙伴限量开放的网络安全专用模型 Gemini 3.5 Flash Cyber;文末还透露 Gemini 3.5 Pro 正在内测、Gemini 4 已开始训练。
赛博禅心
Netflix 在监管备案中披露,为本·阿弗莱克联合创办的 AI 电影公司 InterPositive 支付 5.87 亿美元现金;该公司的 AI 工具主要用于后期,修补缺失镜头、替换背景、纠正光线。Netflix 最新财报称已有约 300 部片目使用生成式 AI,阿弗莱克出任高级顾问、称希望"保护人类创造力"。
Z Potentials
主打"让人人都能当旅行顾问"的双边平台 Fora 完成 6000 万美元 D 轮(Forerunner、Tactile Ventures 领投),估值达 10 亿美元、晋级独角兽,累计融资 1.385 亿美元。新钱主要用于扩展其 AI 助手 Via(帮代理处理调研、行程等杂活);平台称代理已累计预订超 30 亿美元旅行、且多为新入行者。 <!-- ai-daily:complete -->
Z Potentials