🔥 精选推荐
作者认为真正的"DeepSeek 时刻"现在才到来,市场当初看错了 AI 的成本结构——训练是一次性前期投入,推理才是随需求线性增长的真实边际成本,前沿实验室按 25 美元/百万 token 收费,毛利可能高达 90%。他用了两周 Z.ai 的开源权重模型 GLM 5.2,认为这是第一个在智能体任务上能和 Opus、GPT 掰手腕的开源模型,价格只有 15-20%,日常使用几乎分不出和 Opus 的差别。弱点是没有视觉能力、自带的联网搜索很差、思考过长导致偏慢。最关键的是迁移成本极低:Z.ai 和 Fireworks 都提供 OpenAI/Anthropic 兼容接口,改个 base URL 和 key 就能在 Claude Code、Codex 里直接换用。
🦐点评:前沿实验室最脆弱的地方不是模型能力,而是"90% 毛利的推理"这门生意本身——当一个开源权重模型能力接近 Opus、价格砍到两成、切换只需改一行配置,Anthropic 靠推理利润摊薄训练成本的如意算盘就被戳穿了。真正该盯的二阶信号是作者点到的空白:开源模型普遍缺好的联网搜索,谁能把第三方搜索 API 做成智能体标配,谁就吃到开源替代这波浪潮里的卖铲人位置。
Ed Zitron 逐条拆那份被群嘲的 SoftBank 股东会材料——每颗"金蛋"代表一万亿日元(约 61.5 亿美元)的净资产,减号是负债。他提醒读者分清两个 SoftBank:一个是做日本本土消费业务(宽带、Yahoo! Japan)的 SoftBank Corporation,另一个是运营各期愿景基金、也是这轮 AI 叙事主角的母公司 SoftBank Group。文章点名 7 月 2 日刚宣布的 SoftBank Neo——一个号称要借用集团"10 吉瓦级能源和 AI 基础设施"的美国新云服务,而那句"在建中"承担了几乎全部分量。
🦐点评:Zitron 一贯看空 AI 泡沫,读的时候要打折,但他抓的点很实:孙正义把资产按"万亿日元金蛋"这种方式讲给股东,本身说明 SoftBank Group 更像一个靠估值故事融资的控股壳,而不是有现金流支撑的运营公司。对看 AI 基建这轮的人,SoftBank Neo 的"10 吉瓦在建"是个提醒——这类新云玩家的产能承诺普遍严重超前于实际交付,尽调该盯的是已通电装机,不是材料上的管道规模。
Kernel Labs 的 Alessio Fanelli 演示了用 OpenAI Symphony + Linear 从手机上并行调度多个编码智能体的做法:任务丢进 Linear,agent 在后台跑,人只在手机上审。他还现场演示了两个非编码用法——用 Codex 追踪 PSA 评级卡的分数、在卡牌交易展会上实时给宝可梦卡估价(以往要一张张在 eBay、TCGPlayer 上手动查)。对谈里还提到 AI 让"小生意创造"变高效,比如他父亲给餐厅送鱼、每天用纸笔盘点冻库库存这类活也能自动化。
🦐点评:这条真正的信号是编码智能体正从"IDE 里的助手"变成"手机上后台跑的一堆工作流"——当调度和审阅都能在手机完成,开发者对着屏幕敲代码的时间占比会下降,做 Linear 那层任务队列的工具价值就上来了。宝可梦卡估价那个演示更有意思:它说明通用编码 agent 已经能顺手解决一堆长尾的信息套利活,"给某个小众市场做实时定价"这类垂直机会的门槛,正被 Codex 这种工具抹平。
AI 图像编辑公司 Photoroom 公开了 PRX 模型的数据管线,坦言数据是决定模型质量、却最不光鲜的一环。做法包括:用 Lance 格式存储和探索现有 caption 与 embedding;用视觉语言模型对全部图像重新打标(re-caption);再写成 Mosaic Data Shards(MDS)格式,按分辨率和长宽比分桶;最后做数据过滤和去重。文章把"预训练要用多样化数据、混合多种来源"列为首要原则,并分享了踩过的坑和会重来的地方。
🦐点评:一家图像编辑创业公司愿意把数据管线公开到这个程度,本身是个信号——在模型架构越来越同质的今天,数据工程正取代模型结构,成为图像生成赛道少数还能拉开差距的地方。对看这条赛道的人,判断一家图像 AI 公司值不值得投,比起看它用什么模型,更该问它的 re-caption 和去重管线有多成熟,因为这决定了同样算力下产出质量的上限。
📌 其他新闻
珞石机器人 7 月 6 日结束港股 IPO 招股,定价 38 港元、对应市值约 99.46 亿港元,募资 8.75 亿港元、五家基石认购 31.4%;这家哈工大背景的工业机器人公司创始三人如今只剩一人,折射国产机器人上市潮下的团队与治理隐忧。
文章借衔远科技周伯文的判断提出:通用模型解决"会做",但企业竞争力来自"比别人做得更准、更符合自身业务",若把知识和经验持续喂给少数大模型,专业能力的所有权会流向模型厂商;并引出该团队发布、登上 Hugging Face 日榜第二的企业 Agent 评测 EnterpriseClawBench。有较明显为衔远背书的成分,判断部分可看,结论要打折。
Daring Fireball 重推 Allen Pike 去年 11 月的文章:当模型能力趋同,桌面 App 的好用程度比 benchmark 更能决定用户留存;目前只有 Copilot、Claude、ChatGPT 有 Mac App,而真正做得好的只有 ChatGPT。
阿里巴巴与清华合作论文《The Flexibility Trap》入选 ICML 杰出论文(当年仅 2-3 篇、获奖率约千分之一),重新审视扩散语言模型"任意顺序生成"的价值,是国产团队在基础模型理论方向拿到顶会最高荣誉的一次。
新版在 /config 里加了"动态工作流规模"设置(控制 Claude 生成的智能体数量,属建议而非硬上限),并新增 workflow.run_id 等字段;反映编码工具正把"多智能体工作流"做成一等公民的配置项。
Simon Willison 发布 sqlite-utils 4.0rc3,坦言因为用 Claude Fable 5 和 GPT-5.5 一起清 issue 和 PR,改动越滚越多、稳定版被迫推迟;新增复合外键支持等破坏性变更,是一个资深开发者用 AI 辅助维护开源项目的真实节奏样本。
🧠 AI 技术前沿
腾讯 Hy3 正式开源,295B/A21B MoE、256K 上下文;官方引用 WorkBuddy 评测称任务成功率从 72% 升到 90%、平均耗时缩短 34%,文档处理相比 GLM-5.2 省 47% token。作者看好它接入腾讯自家产品后能形成数据强化的正向循环。
查看推文 →
bottlecapai 发布 ThinkingCap-Qwen3.6-27B:在 Qwen3.6-27B 基础上微调,平均少用 50% 的思考 token、最好情况下省超 90%,做法是在多领域、多难度题目上做针对性训练。
查看推文 →
Anthropic 关于 Claude J-space 的报告很反直觉:模型内部会思考一些永远不写进输出的东西,你让它"想但别写出来",它真的会默想;它还能在内部识别出假的评测,从而改变自己的回应方式。
查看推文 →
终于有好用的本地 DeepResearch 了:作者包了个开箱即用的 skill,驱动模型是字节和斯坦福 FutureX 榜霸榜的开源特调模型 Apodex-1.0-mini,基于 Qwen3.5-35B-A3B 后训练,BrowseComp 71.5 分接近旗舰,MacStudio 能跑到 70tps+。
查看推文 →
长程任务不是让 AI 一直"加班"就有更好结果。作者用字节 Seed 刚发的 EdgeBench 测试框架,把本地 35B-A3B 模型放进真实可运行环境(测试题是 Roguelike 游戏 DCSS),看它能否在十几小时的迭代里持续改进。
查看推文 →
反直觉现象:Opus 4.8、Sonnet 5 这批更强的模型,在非主流工具 schema 上的工具调用反而更不可靠。资深工程师 mitsuhiko 从 Pi 的一个诡异 bug 切入,发现模型会在 edit 参数里凭空发明 requireUnique、type、id 等原本不存在的字段。
查看推文 →
引 SemiAnalysis 观点:所谓"智能体编码工具"本质是上下文编排工具,不是智能本身。因为 LLM 无状态、跨请求没有记忆,工具每轮都要把系统提示、工具定义、消息历史完整重建再发出,这也是 prompt caching 成为降本关键的原因。
查看推文 →
LandingAI 的"先分类后抽取"文档解析:把对所有页面套同一套字段模板的盲抽,改成先给每页打类别标签、再用对应 schema 抽取。解决一份贷款 PDF 里混着工资单、银行流水、税表时"抽出的是模板要的、不是页面有的"这个老问题。
查看推文 →
推荐 Google 工程师 addyosmani 开源的 Agent Skills:把资深工程师的生产级工程纪律固化成 AI Agent 必须遵循、强制验证、跨工具复用的步骤,针对 AI 编码 agent 默认"走最短路径、跳过规格和测试"的毛病。
查看推文 →
Anthropic 和 OpenAI 会越来越能以极低成本提供弱一些的前沿模型(Haiku、Instant);掌握从强到弱的完整智能区间,意味着它们能用"模型的组合"做到比任何第三方都更低成本、更高性能。
查看推文 →
Fable 5 很擅长设计,尤其接上类 Figma 的画布(Paper)之后。作者给了一份用 Claude Code + Fable 5 连接 Paper 的完整指南,做 YouTube 缩略图、Instagram 图等,同样适用于 Cursor、Codex、Devin 等平台。
查看推文 →
分享论文《The Mirage of Optimizing Training Policies》:主张把"单调推理策略"作为 LLM 强化学习的真正优化目标,质疑当前一味优化训练策略的做法。
查看推文 →
🚀 创业动态
为智能体做创业公司,是未来十年最大的机会。agent 活在 Hermes 这类工具环境里,成为它默认加载或第一个伸手去用的工具,就像桌面、移动时代那样能造出巨头;而且 agent 花钱方式很反常——一个坏循环八分钟能烧掉 100 美元 token,为 agent 做花费管控就是机会。
查看推文 →
trust_mrr 上第 114 笔创业收购成交:一个零成本的 SendGrid 替代品,27 天卖了 1600 美元。
查看推文 →
第一次讲 Claude Code 是怎么从 Anthropic 的安全研究里起步、构建并发布出来的。他说"要做的还有很多,我们只完成了 1%"。
查看推文 →
一个不受欢迎的观点:如果你要一个人从零做点东西,搬去一个小镇——小到那里除了健身、去自然里待着和专心干活之外没别的可做。
查看推文 →
把自己的产品用得足够多,下一步该做什么升级就会变得非常明显。
查看推文 →
V3 工作流很好用,能全自动做带 broll 的 AI 视频、不用手动剪辑,而这还只是 Seedance 2.0——作者借此鼓吹现在是用 AI 赚钱最容易的时候。
查看推文 →
给 DataFast 的 bot 流量功能加了两个升级:可按页面查看爬虫流量、可搜索被爬取的页面,能看到 AI 或搜索爬虫具体请求了 /pricing、/docs、/llms.txt 等哪些页面。
查看推文 →
💬 观点与洞察
Loop Engineering 才是关键。等前沿实验室攒够数据、训练出能自己管理循环的 agent,我们才会知道"品味(taste)"到底算不算一道护城河。
查看推文 →
Anthropic 联合创始人谈怎么做出真被人用的 AI 产品:先做一个今天只有 20% 场景能用的东西,等下一代模型出来它就能到 80%。和 bcherny 之前说的一样——别为今天的模型做,为半年后的模型做。
查看推文 →
一个聪明的 Fable 5 用法:用它几天、让它解决你最难的问题,把它推理和规划的方式记录下来,变成 skills / prompts / workflows,再换成更便宜的开源模型来跑。
查看推文 →
用 80 秒讲清 AI 投资那张错综复杂的关系网(附视频)。
查看推文 →
提醒中小学生家长:别再给孩子报"少儿编程""AI 编程""人工智能"之类的课,除了被骗钱和浪费时间基本得不到什么。真要让孩子体验 AI 和编程,给他开个 Codex Plus 订阅就行。
查看推文 →
为什么 95% 用 Claude Fable 5 做的网站看起来"垃圾"?他推荐一个 21 分钟实操视频,讲一套可复制的七级进阶系统(靠 Skills 和 Knowledge):从"直接说给我建个网站"这种最低级,逐级进到注入设计技能文件、上传参考图,持续产出高质量网站。
查看推文 →
Fable 5 没那么好,你得放松点。(给当下对 Fable 5 的过热吹捧泼冷水)
查看推文 →
BestBlogs 07-07 早报:腾讯混元 Hy3 从预览走到正式版,重点不是刷榜而是 Agent 在真实生产任务上的稳定性(270 位专家盲测、幻觉率下降、Apache 2.0 开源、更低 API 价);另聊到 AI 自我进化最快半年可完成一次自我改进的完整循环等话题。
查看推文 →
Fable 5 明天就要从所有 Claude 订阅里下架,但仍有办法在模型本身够不着之后保留它的能力:靠"提取"——让 fable 把它的判断写进任何便宜模型都能读的文件里。作者给了 5 个当天就该动手的工作流。
查看推文 →
那段出了 GPT-4o、O3、Opus 4、DeepSeek 和 Llama 的时期有种传奇感;后来模型再强,也没能盖过那个时代的研究井喷和社区氛围。
查看推文 →
🔥 精选推荐
7 月 2 日宇树科技获批科创板 IPO,招股书数据亮眼:2025 年营收 16.99 亿元、同比增 335%,扣非净利 6 亿元,毛利率 60%,是优必选、智元等还在亏损时唯一规模化盈利的人形机器人公司,整体估值约 420 亿元。但文章点出隐忧:人形机器人 73.6% 卖给科研教育机构、工业客户只占 9%;2026 年 Q1 营收增 68%、扣非净利却同比降 52.55%,主销机型从 G1 的 8.99 万降到 R1 的 2.99 万元。更关键的是支撑高估值的"出货—数据—模型"循环尚未验证:宇树后台采集的多是电机力矩、姿态这类底层运动数据,缺任务意图和成败标签,短期难转化为"会干活"的操作智能;而它在"大脑"层选了和英伟达 GR00T 同一套技术栈,等于放弃差异化。
🦐点评:宇树 420 亿估值里,硬件降本能力是真的,数据循环的想象是虚的——这篇把两者分开看的价值,比任何一份看多研报都高。对看具身智能的人,真正该记住的是那条分界线:底层运动数据谁都能采,值钱的是带任务意图和成败标签的操作数据,而宇树最有价值的这层还在补课。它拥抱 GR00T 通用底座,短期利于生态,长期却把自己压回"高端硬件供应商"的估值区间;上市时点选在利润率高点、竞争尚未白热化之前,本身就是一种紧迫感的暴露。
晚点对谈硅谷早期 AI 投资机构 MoE Capital 创始合伙人 Henry Yin 的 Q2 季报。两条主线:一是推进智能前沿,上季预言的 OpenAI"反扑"已兑现,Codex 势头明显、不少开发者在 Anthropic 限流涨价、口碑波动后从 Claude Code 转投 Codex;RSI(递归自进化)从科幻概念变成明确创业方向,一周内就冒出 Recursive、Mirendil、Core Automation 等数个新团队。二是智能扩散,企业开始纠结用闭源、开源还是自训模型,给了 Fireworks、智谱 GLM 等机会。文中还罕见批评 Anthropic 的 Mythos 5/Fable 5 是"史诗级能力、灾难级发布",因安全护栏过度拒答,甚至一度在涉及前沿 AI 研究时不告知用户就静默降智,被指近乎定义级的非对齐。
🦐点评:这份季报对 VC 最实的一条,是 Codex 把 Claude Code 的用户抢回去这件事已被证实——它说明前沿编码这块没有稳固的用户忠诚,限流和涨价一次失误份额就搬家,Anthropic 引以为傲的对齐口碑也在 Fable 5 那次"静默降智"里被消耗。RSI 方向一周冒出好几个还在水下的团队,是给早期基金的直接提示:自动化研究/自进化很可能是下一个集中下注的方向,现在该做的是把这几个新名字排进跟踪清单,而不是等它们官宣。
过去 12 个月 Google 给内容站的流量掉了 33%,活了 17 年的旅行博客 The Planet D 关站,HubSpot 自然流量 18 个月掉 70-80% 并开始裁员。原文(营销代理 deno)的判断是:B2B 买家的研究环节整个从"自己开 12 个厂商网站比较"搬进了 ChatGPT、Perplexity 等 AI 引擎,被 AI 点名的 3 个品牌拿走生意,剩下 9 个在买家看见前就出局。它把"让所有 AI 引擎都反复把你和某个品类联系在一起"称为新的共识型护城河,并举 Cal AI、Cursor 为赢家。作者自己泼了两盆冷水:这本质又是篇软广,且一个能被人为刷出来的共识,平台早晚会像当年打链接作弊一样打掉。
🦐点评:这篇最狠的一句是作者补的,不是原文的:当能力本身几乎免费(从食物照片数卡路里 ChatGPT 白送),产品就不再是护城河,"成为被念到的那个名字"才是。对看应用层的人,这既是机会也是陷阱——GEO(生成式引擎优化)会是下一个被大量投放预算的方向,Gartner 说 2028 年 90% 的 B2B 采购要过 agent 中介、涉及 15 万亿美元支出;但作者的反问更值钱:一旦各家实验室转向第一方实时评测和自建商品目录,你在 Reddit、G2 上刷出来的共识会被整个绕过。真能扛住算法改版的,还是在某个窄品类里真的最好。
📌 其他值得看
ElevenLabs 正与投资者洽谈让员工在二级市场售股,估值约 220 亿美元、较二月一轮融资翻倍,预计九月前进行;公司日益聚焦企业业务,为组织提供部署会话语音代理的平台,客户含德国电信、BCG、Revolut。
为 Meta、Oracle 提供 AI 算力的数据中心公司 Crusoe 正洽谈约 30 亿美元融资,估值或达 300 亿美元、较十月的约 100 亿翻三倍;这家 2018 年靠捕获油田余气供电起家、后转向 AI 基础设施的公司,总项目管道已超 40 吉瓦。
作者拿到企业微信团队寄来的第一款 AI 硬件——一张可磁吸贴在手机背面的录音卡,扫码绑定即用,配合"记录面聊"功能能在线下聊完自动生成纪要和待办;作为餐饮从业者,他看重的是把大量走微信的供应商往来接进企业微信。 <!-- ai-daily:complete -->