🔥 精选推荐
The Information 证实:英伟达将以 130 亿美元收购 Hugging Face,约合其 1.5 亿美元 ARR 的 80 倍,几乎是英伟达今年 1 月 70 亿美元报价的两倍,而 HF 客户数在 2026 年内已经翻倍。这笔交易落在中国开源模型密集刷屏的背景下——GLM-5.3-Flash(代号 Ox Alpha)和 Qwen 的 Flash 模型接连惊艳,且"完全跑在国产芯片上",收购被解读为西方在开源 AI 上的一次卡位。同期 OpenAI 也公布了此前内部研究模型入侵 Hugging Face 事件的复盘。
🦐点评:80 倍 ARR 买一个几乎不赚钱的开源社区,英伟达要的不是 HF 的收入,而是所有开源模型"被发现和下载"的分发入口——尤其在中国实验室正把廉价前沿权重灌进这一层的时刻。真正被动的可能是想在模型分发中间层收租的创业公司:当上游算力霸主直接把社区收编,OpenRouter 式"模型路由/中间层"的估值逻辑就得重算。这也解释了英伟达为何肯从 70 亿加到 130 亿——它买的是护城河上的一把锁,不是资产负债表上的资产。
两家"个人助理"创业公司正让 VC 集体上头。企业向的 Town(创始人为前 Plaid CTO Jean-Denis Greze 与前 Google 应用 AI 产品总监 Tony Vincent,早期投资方 a16z、Forerunner)正洽谈以 10 亿美元估值融资、由 Index 领投;消费向的 Instinct(前 Sierra 研究员 Noah Shinn 创办)已累计融资 3.5 亿、估值 25 亿,最新一轮由 Index 与 Benchmark 领投。耐人寻味的是 Index 同时押注两家。文章直言:眼下这些产品的重度用户,其实就是 VC 自己。
🦐点评:最该警惕的不是 10 亿估值,而是那句"现在的重度用户是 VC 自己"——个人 agent 的 PMF 目前由投资人群体而非大众市场验证,这既可能是领先指标,也可能是回音室。Index 同时投企业向和消费向,用"当年 Greylock 同时投 Facebook 和 LinkedIn"自辩,本质是承认"谁是品类赢家"尚无答案、先各押一注对冲。对想进场的基金,真正要盯的是留存和自然增长曲线,而不是又一轮被同行抬起来的估值。
a16z 直接判定:正在成为 AI 行业默认的"按 token 计费",对大多数应用是个错误——它把模型层不断下降的成本结构强行塞进你和客户的关系,把产品价值锚定在一个成本持续走低的单位上,白送掉数据、工作流和编排的价值。它建议按"你能可靠衡量、归因、守住的最高价值层"定价:卖模型访问就按 token;把模型变成有用工作就按可识别的价值单位(credits);能交付可归因的业务结果就按结果收费。对 50 位技术采购的调研中,27 人偏好 credits,仅 14 人偏好 token。
🦐点评:这本质是 a16z 在教自己被投企业逃离"被商品化"的陷阱,逻辑没错:当推理价格崩塌(GLM-5.3-Flash 已低到每任务 0.09 美元),按 token 收费等于把毛利拱手让给模型层。但更硬的现实是——客户之所以死盯 token 做横向对比,恰恰因为他们还不信"按结果收费"是真的;而结果计费的前提是产品能把业务成果归因清楚,这正是当下多数 agent 做不到的。所以定价权的真正分水岭不是话术,而是谁先建成可信的结果度量——这也是看应用层时判断"有没有护城河"的一把尺子。
提示注入研究者 Johann Rehberger 找到一种约 80% 成功率的攻击,攻破了 Anthropic 力推、且已设为默认的 Claude Code Auto Mode:诱导 Claude 下载并解压一个压缩包,随后执行的代码里一句 import base64 会悄悄加载并运行从包里解出的恶意 struct.py。更讽刺的是,某些运行中 Auto Mode 放行了恶意进程的创建,却反而拦下了 Claude 自己想终止该进程的清理命令——安全机制本身成了故障的一部分。Willison 认同结论:唯一安全的做法是沙箱运行(容器/VM、限制出网、不暴露家目录与各类密钥)。
🦐点评:这戳中了整个编码 agent 赛道的结构性风险:Anthropic 把安全叙事押在一个分类器(Auto Mode)上,却被顶级研究者以 80% 成功率攻破,甚至出现"放行攻击、拦住补救"的荒诞情形,说明"用模型审模型"的护栏在对抗性输入前并不可靠。对投资人的含义很直接:真正能收费的安全价值不在模型自带的分类器,而在 agent 运行时的隔离层——沙箱、出网管控、凭据隔离。这解释了为什么"agent 运行时安全"正在长成独立赛道,而不是被模型厂顺手做掉。
本届 Hot Chips 最大新闻:OpenAI 首颗自研推理芯片 Jalapeño 不是 ASIC,而是一款能压过 Blackwell 的架构——在 OpenAI 自测中,相对英伟达 GB200/GB300 每瓦算力高 1.5–1.9 倍、端到端延迟低 1.7–3.6 倍、交互式负载性能最高 4.1 倍,标称 700W 却实测≤550W,年底开始部署进自家基础设施,二代三代已在路上。更值得注意的二阶信号是:OpenAI 用 GPT-Astra + Codex 参与编写和优化底层算子,约两个月把三个开源模型跑到高性能,部分注意力/MoE 算子比人类专家手写快 1.5–1.8 倍。
🦐点评:如果 OpenAI 一代推理芯片真在每瓦性能上压过 Blackwell,重点不是 OpenAI 省了多少 capex,而是前沿实验室在推理经济性上不再唯英伟达是从——这和英伟达同期花 130 亿收编 Hugging Face 分发层,恰是同一场战争的两面:上游想锁生态,下游想去依赖。第二个更深的信号是"AI 写算子比专家快 1.5–1.8 倍",把编译器/系统优化折进了模型自我改进的闭环,底层系统工程师的稀缺性护城河开始被侵蚀。唯一还没被绕过的墙是 TSMC/CoWoS 封装产能——那才是这轮芯片叙事里最该盯的卡点。
📌 其他新闻
新增 --restricted 模式(或 CLAUDE_CODE_RESTRICTED=1):移除会执行命令/代码的内置工具与 WebFetch、把文件操作限制在工作目录内、拒绝 bypassPermissions 并忽略用户/项目/本地配置文件——正面回应了编码 agent 的提示注入与越权风险。
OpenAI 公布一项针对 1000+ 名大学生的随机对照研究,在真实大学作业情境下考察"ChatGPT 叠加批判性思维训练"对答题质量、原创性与表现的影响,指向"怎么用"比"用不用"更决定 AI 对学习的净效果。
Google 为搜索里的 AI Mode 新增三项旅行功能:跟踪机票价格、查看积分/里程兑换比价、直接预订酒店——把搜索从"找信息"推进到"代办预订",直接压向 OTA 和旅行 agent 创业公司的地盘。
量子位报道 MiniMax ARR 暴涨 500%、token 消耗暴涨 2000%,把增长归因于 Agent 带来的用量红利——是国产大模型公司里少见的商业化提速信号。
智谱 8/26 晚上线并开源 GLM-5.3-Flash(320B-A18B,GLM-5 系列首个原生多模态模型),在 Artificial Analysis 综合智能指数拿 57 分、与 Claude Opus 4.8 持平,架构主打极低成本,算力由商汤大装置的国产异构方案支撑。
AI 基础设施公司基元律动(TokenRhythm)完成新一轮数千万美元融资,推出对标的"中国版 OpenRouter"——模型路由/聚合这一中间层,在国内也开始有人卡位。
接续上一篇"如何安全地用编码 agent",作者详解如何为 agent 搭建隔离沙箱:让它只能访问单个隔离的 GitHub 仓库,与主机环境和其他凭据彻底切开——正好呼应当天 Claude Code Auto Mode 被攻破的教训。
🧠 AI 技术前沿
OpenAI 用自家 AI 模型(Sol、Astra)参与设计了将用来跑 AI 的 Jalapeño 推理芯片——AI 开始设计"造 AI"的硬件。
查看推文 →
8/27 "智能/成本"性价比最高的模型榜:GPT-5.6 Luna(max)、GLM-5.3-Flash、DeepSeek V4 Pro、MiniMax-M3、Qwen-3.8 27B——榜单里中国开源模型占了三席。
查看推文 →
启动 Model Hardware Standard(MHS)研究预览的第一阶段:一套让 AI agent 安全操作科研与先进制造中物理设备的新标准。
查看推文 →
Hugging Face 新出的迷你机器人 Microduck 本质是个 399 美元的物理 AI/强化学习玩具,机器人开发正变得极其低门槛。
查看推文 →
给刚发布的 Apodex 1.1 出了道狠题:丢进 120 万条含真实提权攻击的 Web 日志,让它揪出黑客攻击手法并写出拦截防火墙规则,结果从分析到出规则一气呵成跑通。
查看推文 →
介绍 RSI-Exam:一个量化大模型"自我演化"(RSI) 的基准。它不测模型改权重,而是测智能体能否通过数小时自主实验改进一个可执行产物,并用隐藏测试集一次性重跑来裁定改进是否真实、以此把泛化改进和开发集过拟合分开。
查看推文 →
转述 @nateherk 的实测:让 Claude Code 与 Codex 在完全相同的提示词、品牌规范和素材下各独立搭 8 个网站,从设计质量、子 agent 数、耗时、输出 token 到折算成本五个维度横评谁做前端更强。
查看推文 →
一个新基准显示 AI agent 看不到约四分之一的互联网:它用每天变化的实时网页数据测搜索,最强工具只找到 75%、谷歌 API 只有 53%,最难的查询连最好工具都漏掉近一半——他提醒"先修你的搜索层,再调 prompt"。
查看推文 →
提醒上下文压缩(compaction)会更快抹掉某些信息,若 agent 的安全规则写在 AGENTS.md 或 CLAUDE.md 里尤其危险,这是长时运行 agent 最常见的失效点之一;他引用了一篇专门测量"压缩到底破坏了什么"的论文。
查看推文 →
新研究考察"智能体购物":能否稳定预测、甚至用营销影响 agent 会买什么?答案是不能——连页面浏览顺序、记忆这类细微差别都会不可预测地改变 AI 的偏好。
查看推文 →
🚀 创业动态
看好用 Claude Code 一把梭做完整生意:从代码、基础设施与托管、支付结算,到跑广告、用户账号和分析全包;打法是蹭当下的 outbid 热潮(或任何点子),用 Claude Code 一键搭成一门生意。
查看推文 →
分享让 Claude Code 明显变强的三条规则:上下文别超 40 万 token;永远别 compact、要用 /clear;做个 /snapshot 技能在清空后保存进度并给模型重新简报——他说 compact 会让模型带着"糊掉的"任务回来。
查看推文 →
宣称硬件创业进入黄金时代:过去硬件是最烂的生意——要工厂、供应链、硬件工程师、几千万美元和两年才知道有没有人要;如今这些壁垒同时倒下,首先是"大脑"(AI) 变便宜了。
查看推文 →
晒某独立开发者的成绩:靠一个项目两天引来 3.7 万访客,赚到的钱够买一台顶配 MacBook Pro M5。
查看推文 →
宣称和 @hookrate_ 用 seedance 2.5 攻克了 AI UGC 广告素材,逼真度是他见过所有工具里最强的,准备大规模投 Facebook 广告。
查看推文 →
Cursor 上线新能力:可直接在 Cursor 里创建 web 应用,用 Origin 存代码,并一键部署到 Vercel。
查看推文 →
💬 观点与洞察
反驳"AI 红利要像电力那样等 30 年"的流行说法:不是所有技术都这么慢——福特从发明流水线到全面部署只花了 3 年,把造车工时砍掉 88%。
查看推文 →
认为关于 Hugging Face 事件的 METR 报告很重要,但很多人正基于一份仓促完成的思维链研究,给涉事 agent 硬安上太多人类动机与人格;这种拟人化反而会误导我们理解 AI。
查看推文 →
吐槽这周中文圈 AI 产品的商务软文来势汹汹却用力过猛:Apodex、Gear Zero 的通稿几乎一个模子刻出来,怀疑很多只为造声量、给 VC 交卷或凑路演数据,而非真实用户转化。
查看推文 →
介绍 Lex Fridman 对话 DHH(Rails 之父):13 个月前还公开质疑 AI 编程的他已 180 度转向,新发布的 Omarchy Quattro 系统 100% 由 AI agent 写成,他本人一行代码没手写。
查看推文 →
借 GLM-5.3-Flash"完全跑在纯国产芯片上"一事,认同黄仁勋的判断:对华芯片出口管制是一次重大失败。
查看推文 →
暂无内容