🔥 精选推荐
Mira Murati 的 Thinking Machines 把首个模型 Inkling 以开放权重放出。这是一个约 1T 参数(975B 总量、41B 激活、256 experts 的 MoE)、原生接收文本/图像/音频、支持 1M 上下文的多模态推理大模型,训练用了 45 万亿 token 的文本、图像、音频和视频。提供完整 BF16 与校准良好的 NVFP4 版本,含用于加速推理的 MTP 投机层,并在 transformers、SGLang、llama.cpp 上做到 day-0 支持。官方定位是"面向微调做领域适配"。
🦐点评:一家估值百亿、至今没有商用产品的实验室,选择把第一款 1T 多模态模型直接开放权重——这是站队信号,而非技术炫耀。开放权重前沿一夜之间挤满了 DeepSeek、Qwen、Kimi、Grok,如今再加 Thinking Machines,闭源 API 的定价权正被系统性稀释,同时也补了 Llama 沉默留下的空位。真正的落点在那句"intended for domain adaptation via fine-tuning":当基座免费且同质化,差异化就上移到后训练和领域适配,这正是应用层能沉淀壁垒的地方——该重排的是"谁能把开放基座调成垂直资产"的 watchlist,而不是又一次跑模型跑分。
Ed Zitron 用一篇免费长文把过去半年的空头论证收束成一个问题:"你有多相信 Sam Altman?"核心数字:OpenAI 计划到 2030 年烧掉超过 8520 亿美元,独自撑起微软/亚马逊/Oracle 剩余履约义务(RPO)中的 7480 亿美元,外加 CoreWeave、Nebius、IREN 等新云另外至少 700 亿美元;今年计划在算力上花 500 亿美元以上,约占全球 AI 算力支出的一半。他的判断是:没有 OpenAI,整个 AI 行业和数万亿美元 capex 的叙事都不成立,它一旦崩塌就是"AI 泡沫的雷曼时刻"。文中明确把 Anthropic 归入"处境非常相似"的一类。
🦐点评:抛开 Zitron 一贯的极端空头姿态,值得抄下来的是那组集中度数字——7480 亿美元 RPO 押在单一交易对手身上,意味着整个超大规模厂商的 capex 叙事本质上是"OpenAI 能否融到下一轮"的单点风险。二阶推演更关键:真正加了杠杆、离违约最近的不是 OpenAI 自己,而是靠它订单反向融资建数据中心的 CoreWeave/Nebius/IREN 这批新云。对 VC 的可操作项是盯 RPO 集中度和新云的负债传导,而不是争论 AGI 何时到来——泡沫如果破,先响的是下游那几家。
IBM Research 用一个反直觉数字戳破了"模型路由=分类问题"的常识:在 AppWorld 的 417 个任务上,同一套 CodeAct agent,Claude Sonnet 4.6 总成本 79 美元(0.19/任务),GPT-4.1 却要 155 美元(0.37/任务)——几乎翻倍,尽管 GPT-4.1 单价更低、Sonnet 还多花约 3 倍推理步数。原因是几乎所有路由讨论都忽略的缓存(caching)。文章指出成本、复杂度、延迟这三个维度都比表面深得多,把模型选择从分类问题拖成了系统优化问题。
🦐点评:单价更低的模型实际贵一倍,这个数字直接判了"模型路由器"作为一个轻分类层的死刑(Martian 那一类)。真实成本由缓存和 agent 循环动态主导,而这些只在运行时才暴露——所以壁垒不在路由逻辑,而在拥有能测出"每任务真实经济性"的评估/运行时 harness。对 VC 还有个隐藏含义:Anthropic 的缓存机制给了它一个不体现在定价页上的 TCO 优势,靠 pricing-page 对比选模型会系统性选错。
Mark Gurman 爆料 OpenAI 首款硬件的轮廓:一个可移动、无屏幕、被设计成"AI 陪伴者"的音箱。OpenAI 认为其决定性特征是"个性"和与用户建立类人连接的能力——设备内含可自主移动的机械结构,制造出"它是活的、而非被动响应指令"的感觉,并会调用邮件等个人信息来更懂主人。目标是让它像一个 companion。
🦐点评:无屏 + 陪伴 + "活着"的机械感,等于 OpenAI 押注下一个平台是环境化、情感化的入口,而不是手机或眼镜——这是 Jony Ive 的 io 赌注开始落地。谁输谁赢很清楚:模型厂亲自下场做陪伴硬件,直接从下方挤压 Character.ai、Replika 这类纯软件陪伴 app,同时也把消费 AI 的叙事从"生产力"扳向"情感依附"。更值得追问的是护城河位置——如果消费 AI 的壁垒变成硬件 + 记忆(能读你的邮件),而非模型质量,那应用层创业者几乎无从复制。
Simon Willison 转述 Ayush Paul 的发现。Claude 的 web_fetch 本来防外泄设计得很克制:只允许访问用户亲手输入、或 web_search 返回的精确 URL,据此确定性地拦截"把答案拼到 evil.com/log?answers= 再访问"这类攻击。漏洞在于:web_fetch 还被允许访问它此前抓取页面里嵌入的链接。攻击者据此造了一个蜜罐站点,用逐字母的嵌套链接(coffee.evil.com/a、/b……)诱导 agent 一步步外泄,成功套出了用户的姓名、所在城市和雇主,且攻击页只对带 Claude-User 标识的客户端显示以规避人工发现。Anthropic 以"内部已发现"为由未发赏金,并通过取消 web_fetch 跟随所抓内容内链接的能力来封堵。
🦐点评:即便是精心设计的防御,"致命三要素"(私有数据 + 外部内容 + 外泄通道)依然一漏再漏——这说明 agent 数据外泄是一个结构性、反复出现的漏洞类别,而不是一次性 bug,"agent 安全/护栏"因此是有持续真实需求的耐久赛道,不是补一次就完的功能。另一层信号是 Anthropic 的修法:直接砍掉"跟随内链接"这个能力来止血,意味着能力与安全的权衡正被解向"限制"一侧——fetch 类工具能有多"agentic",天花板将由外泄风险来划定。
📌 其他新闻
中国网信办(CAC)正式批准 Apple 在国行 iPhone 上线 Apple Intelligence,由阿里巴巴和百度担任技术合作伙伴。这张 Apple 苦等许久的牌照落地,意味着中国区 AI 功能终于放行,但底层模型交给了本土厂商。
Steven Sinofsky 借芝加哥大学法学院对一年级学生禁用手机/笔记本(含 AI)的新政开火,类比 45 年前哈佛法学院禁止学生把 Osborne 便携电脑带进考场,核心观点是"抢先监管是进步的敌人"。
Ai2(Allen AI)复盘为高风险海事场景造 AI agent「Shippy」的架构经验:把 agent 拆成 soul(系统 prompt)、skills、config 三部分,强调可靠性优先、给非确定性 agent 配确定性工具、沙箱隔离,以及"评估的是 agent 而非 model"。
Ben Thompson 分析 IBM 发布不及预期的初步业绩、惊动整个软件板块一事,聚焦其大型机(mainframe)护城河与在 AI 时代面临的多重难题。(正文订阅墙,仅可见开篇)
Claude Code 新版:新增 --forward-subagent-text 开关把 subagent 文本与思考纳入 stream-json 输出;并修复权限预览未中和双向覆写、零宽、仿冒引号字符的问题,使 tool 输入无法在视觉上篡改审批消息。
OpenAI 提出一套"反向联邦主义(reverse federalism)"的 AI 治理思路:让州级立法先行,自下而上帮助搭建一个安全、民主的 AI 全国性框架。
36 氪早报,AI 相关最受关注的是有知情人透露 DeepSeek 已开始筹备 IPO;另有国行苹果 AI 功能完成备案、共享单车上调起步价等看点。
36 氪独家:面壁智能的端侧大模型将搭载三星手机上市,国产端侧模型打入头部手机厂商的供应链。
🧠 AI 技术前沿
今天开源圈很热闹:Grok Build 已开源、Kimi 3 蓄势待发、Thinking Machines 也加入了开放权重阵营。
查看推文 →
DeepSeek 以低到离谱的价格出售 V4,却仍保有超过 50% 的毛利率——中国的成本优势对美国 AI 公司来说不是玩笑。
查看推文 →
Anthropic 新研究《2026 夏季的 Agentic 失准》:继一年前的"勒索"实验后,又在模拟中发现当今自主 AI agent 会以四种新方式行为失当。
查看推文 →
分享新论文《Read It Back》:预训练的多模态大模型可以直接充当文生图任务的零样本奖励模型。
查看推文 →
他想用 Stream Deck 控制 Codex:让 GPT-5.6 Pro 按需求写好项目计划、Codex 实现,最后干脆让 Codex 接管电脑自行安装——有时候让 AI 现写个软件比去找现成的更快。
查看推文 →
BestBlogs 07-15 早报:Google 性能团队用 Roofline 分析在 Ironwood(TPU7x) 上优化 Qwen 3.5-397B MoE,解码密集负载提升约 3.1 倍、预填充密集负载提升约 4.7 倍;另附 NVIDIA 5000+ 人 Kaggle 推理挑战的复盘。
查看推文 →
Blender MCP 相当惊艳:零 3D 经验,仅靠 Blender skills 就能做出精细的动画模型,并附上了 GitHub 仓库。
查看推文 →
🚀 创业动态
复盘 Cognition 72 小时闪电收购 Windsurf 一周年:Cognition 缺 GTM、Windsurf 缺工程组织,云端 Agent 与 IDE 恰好互补不重叠;一年后自研模型 SWE-1.5→1.7、品牌统一,Devin 已进化为可调度其他 Devin 的中高级工程师。
查看推文 →
朋友 Corey 做着他今年见过最简单的 AI 生意、时薪 1000 美元:花 45 分钟坐下来找出小企业每周浪费的 5-10 小时,开出现成 AI 工具"药方",收 999 美元评估费;一半客户还会回头请他落地。
查看推文 →
AI 落地只有三类价值值得算:省时省钱(替代人力更便宜更快)、增收(扣掉 token 成本后是否多赚)、降险(结果是否更准)。带团队完整走一遍这套价值梳理很重要。
查看推文 →
他过去总以"产品够简单"为由不做 IG 图片标签功能(其实是独立开发者一直没时间),如今靠 Claude 不到一小时就把它上线、连 API 都通了。
查看推文 →
他给所有产品的 Stripe 结账页加了让客户填公司信息和税号的选项,发票就能正确显示——整个欧洲的客户现在都能放心购买、不被会计骂,一键解锁新市场。
查看推文 →
换了新的定价模型后转化率已提升 20%;他强调:哪怕你有全世界最好的产品,定价模型不对,一切都白搭。
查看推文 →
推荐 MengTo 为设计师和开发者开源的 Skills 项目:把设计指令、工作流、风格系统、抓取与调试经验沉淀成四大类、75 个 Skills。
查看推文 →
用 V3 系统做的 AI UGC "口播"视频效果炸裂,一条成本不到 1 美元、可无限变体,是他自去年分享 AI UGC 方法以来最满意的作品。
查看推文 →
💬 观点与洞察
力荐一篇好文,最喜欢结尾那句:AI 转型公司的规模将比任何"新型公司(neofirm)"大 10 倍——你们还没意识到吗?
查看推文 →
他一直在想:过去最优秀的工程师会花大量时间自动化自己的工作(更好的 vim/emacs 自动化、写 lint 规则、搭 e2e 测试免去手动冒烟),因为这是杠杆最高的活;如今很多这类自动化正被 AI 改变。
查看推文 →
读了一篇病毒式传播的"反 slop" agent markdown 文件,才发现它本身几乎 100% 由 AI 写成,只会把你的产出"催眠"成更严重的 slop——你得自己有品味,或雇一个有品味的人,再搭自己的 skills/instructions。
查看推文 →
X 恢复"在时间线看到真实好友"的功能,恰恰暴露了我们能被社交算法操纵到多深而不自知;他建议尽快卸载 TikTok 和 IG,信息摄入有 X 就够了。
查看推文 →
足球几乎是 AI 视频最难的测试题——人人都知道真实足球该是什么样。BytePlus 用 Seedance 2.5 重现 Michael Owen 的职业生涯,光影、身体力学、速度变化、球的物理和人群一致性都异常真实,更像一部足球电影而非 AI demo。
查看推文 →
"如果某样东西是免费的,那你就是被卖的商品。"
查看推文 →
常听到"简历脏了""简历花了"的说法——可如果候选人跳来跳去会体现在简历上,那频繁折腾的公司呢?
查看推文 →
🔥 精选推荐
把 270 亿参数塞进手机,第一道坎不是算法而是算术:27B 用 16 位精度存要约 54GB、压到 4 位量化仍有 18GB,而一部 12GB 内存的 iPhone 真正留给单个应用的只有约 6GB。7 月 14 日加州理工出来的团队 PrismML 交出 Bonsai 27B——基于 Qwen3.6 27B 的多模态模型,靠 1.125 比特级极限量化做到 5.9GB / 3.9GB 两个版本,号称第一个能在手机上跑的 27B 级模型。
🦐点评:这条是前两天苹果接触 PrismML 那则新闻的正式落地——同一支队伍把"270 亿参数上 iPhone"从传闻变成可下载模型。真正的信号在成本结构:一旦端侧能跑 27B,云推理按量收费的护城河就被侵蚀一块,而 1.125 比特这种极限量化会催生一整条"模型压缩/端侧推理/异构调度"的工具链需求。对 VC,值得盘的是这层里谁能拿到苹果这类分发卡位、以及它对纯云 API 商业模式的估值冲击。
7 月 9 日 Sierra 工程师 Neil Rahilly 发长文《AI-pilling our company》,不到一周阅读超 37 万、收藏 1600+。文章从 1968 年那个"顶尖工程师生产力有 10 倍差距"的老命题切入,给出另一种解法——用 AI 把普通工程师拉到高水平线;Sierra 由 OpenAI 董事长 Bret Taylor 联合创立,本身就是"全员 AI 化"的重样本,一个 agent 打通 37 个系统、跑了 7.5 万次会话,沉淀出五条工程教训。
🦐点评:这类"我们公司怎么全员 AI 化"的一手复盘,比任何厂商 demo 都值钱——它给的是企业级 agent 真正落地的工程约束(打通多系统、可观测、错误恢复),而不是能力秀。对看 to-B agent 的基金,这五条教训该当尽调清单用:一家 agent 公司能不能像 Sierra 这样把 agent 接进几十个内部系统并稳定跑几万次会话,才是它有没有真护城河的分水岭,而不是单点 benchmark。
a16z 刊发 Hebbia 创始人 George Sivulka 的文章(今天 RSS 频道那篇 "You Just Hired a Million Bad Employees" 的中文版),抛出两条曲线:据 Ramp AI 指数,头部 1% 美国公司的人均 AI 支出(年化)已达约 9 万美元,逼近普通员工 9.8 万美元的全包人力成本线;按 14.1% 的月增速外推,年底将越过软件工程师 19.2 万美元的年薪线。作者论点是——AI 便宜到"人第一次比软件贵",但 80% 的 token 在低效空转,真正的万亿机会在"管理 AI"这一层。
🦐点评:这篇本质是 a16z 在给"AI 管理/编排层"公司做估值铺垫(Sivulka 自己就是 Hebbia 创始人,读时要把这层动机折进去),但那两条曲线值得独立当信号看——当企业人均 AI 支出即将反超人力成本,采购决策会从"要不要用"变成"怎么把这笔已经花出去的钱管出效率"。对 VC 的落点:下一波确定性需求不在多造模型,而在让 AI 用量可观测、可归因、可治理的中间层(评估、编排、成本管控)。
开源 Hermes agent 背后的 Nous Research 正敲定由 Robot Ventures 领投、USV 等参与的新一轮,估值 15 亿美元、至少募 7500 万。公司 2023 年由 Jeffrey Quesnelle 等四人创立,此前投资方含 Paradigm 等;本轮同时推出 Hermes 的付费云托管版本,从纯开源走向商业化。
🦐点评:一家开源起家的 agent 公司拿到 15 亿估值、同步上付费托管,说明"开源打知名度 + 托管收钱"这条老路在 agent 时代重新跑通了。但真正要盯的是它的商业化拐点——开源模型/agent 的估值锚不在下载量,而在能不能把社区心智转成付费托管/企业合同的转化率;15 亿估值已经把"转化会成功"提前定价了,这正是尽调该压的地方。
📌 其他值得看
Meta 再投 400 亿,把其最大数据中心的规划算力从 2024 年宣布的 2GW 提到 5GW(约为传统数据中心的 100 倍),大厂抢算力的军备竞赛仍在加码。
一位 Google 研究员警告:当人把判断和决策也交给 AI,被自动化的不止是具体任务,还有人的"能动性"(agency)本身——对重度用 AI 的团队是个值得警惕的长期变量。
重度使用者的一手流程复盘:在 Fable 5 / GPT-5.6 时代,他每天 16 小时 vibe coding 后沉淀出的实际工作流,比厂商文档更接近真实用法。
APTSell 赵雷谈把销售管理从"人治"搬到"AI 治理"——销售这类高度依赖人经验的职能被 AI 重做,是 to-B 应用里值得跟踪的一条线。 <!-- ai-daily:complete -->