🔥 精选推荐

Opus 5 官方口径说"接近 Fable 5",但多家独立评测显示它其实反超了。Artificial Analysis 的 AA-Briefcase agent 基准上,Opus 5 领先 Fable 5 近 150 Elo,同时把单任务成本压低 20%。定价与 Opus 4.8 持平(输入每百万 token 5 美元、输出 25 美元),约为 Fable 的一半。争议点在评测本身:Epoch 的 ECI 给 159(Fable 5 是 161),只比 Opus 4.8 高 1 分,被不少人认为严重低估了实际体验;还有人发现 Opus 5 在 FrontierCode 上中等算力档反而比高算力档得分更高,指向评测不稳定而非单调提升。
🦐点评:真正的信号不是"又一个 SOTA",而是 Anthropic 主动把顶配性能塞进 Opus 4.8 的价位——等于自己打自己 Fable 5 的高价档。模型层每一次"同价翻倍",都在挤压靠模型差价赚钱的空间;和同一天 Warp 创始人那篇"9000 万付给模型商"连起来看,壳越薄的应用越危险。另一个被低估的点是各家 benchmark 开始互相打架(ECI 只涨 1 分 vs AA-Briefcase 涨 150 Elo),评测口径的分裂本身会成为下一件该盯的事。
latent.space
作者以一线销售和交付的视角写了一篇反狂热长文:他接触的企业 AI 项目基本都在失败,但没人敢承认。承认公司"发疯"的高管会很快被换掉,说实话的员工会被"随机"裁掉,于是董事会、高管、员工、供应商、顾问都有动机粉饰 AI 项目的成功率。很多上市公司对外宣布 AI 带来生产力提升,实际只是买了一批 Copilot 授权就宣布胜利。文中引用 Mitchell Hashimoto 的话:他认识的一些公司正处在"AI 精神错乱"里,已经无法理性讨论。
🦐点评:一线吐槽当不了数据,但它和 Anthropic 那篇"AI 用了三年失业率没涨"是同一枚硬币的两面——如果企业真在大规模替代人,招聘和裁员数据早该反映;现实是既没大规模见效,也没大规模替代。对基金有用的动作是把被投公司里做企业 AI 应用的那批,按"真复购 vs POC 续不上"重新过一遍:这篇点破的失效模式(买授权就宣布胜利、付费 POC 只进不出)恰好能拿去做尽调清单。
ludic.mataroa.blog
欧盟委员会认定谷歌两项 DMA 违规,合计罚款约 8.9 亿欧元(合约 10 亿美元)。一是在谷歌搜索里给自家购物、酒店、交通、体育等服务更靠前、更醒目的排序(self-preferencing,罚 4.6 亿欧元);二是限制 Google Play 上的开发者向用户告知并引导到更便宜的外部购买渠道(anti-steering,罚 4.3 亿欧元)。DMA 要求"守门人"对第三方服务给出透明、公平、非歧视的排序,并允许开发者免费告知用户站外优惠。
🦐点评:罚款金额对谷歌是零头,真正的成本是排序规则被强制改写。搜索结果一旦被迫平等对待第三方,那些想从谷歌流量里分一杯羹的 AI 搜索和垂直比价产品,等于监管替它们撬开了入口。对看 AI 搜索赛道的人,DMA 是个被低估的顺风:欧洲市场的默认分发不再是谷歌一家说了算。
ec.europa.eu
加州北区联邦法院批准了 SerpApi 的驳回动议,驳回谷歌对它的起诉,并拒绝了谷歌想用 DMCA 把"访问公开网页"也纳入自己控制范围的主张。SerpApi 提供搜索结果抓取 API,客户包括开发者、AI 公司和研究者;公司称这是"开放互联网"的胜利,会继续支持依赖公开搜索信息的各方。
🦐点评:这条和欧盟罚单是同一方向的两记——谷歌想用版权法把公开数据圈进自留地,法院说不行。对训练和检索都极度依赖公开网页的 AI 公司,这是个有利先例,数据抓取的法律边界又清晰了一点。更该关注的是趋势本身:搜索结果的"可抓取性"正在变成 AI 时代的一种基础设施权利,谁握着合法抓取通道,谁就握着喂给模型的原料入口。
serpapi.com

📌 其他新闻

Kimi 前 AI 搜索负责人曾歆勋离职创办"良配",把 AI 搜索匹配能力嫁接到"找人"上,拿到今日资本徐新 200 万美元天使。徐新看过"AI 找工作"和"AI 找伴侣"两个方向,招聘团队几乎聊遍一家没投,婚恋只投了良配一家;产品上线后用户平均资料长度从行业的 132 字提升到 463 字。
36kr.com
Doctorow 批评一种把风险私有化、成本社会化的放贷玩法:设备联网后,放贷方可以远程锁死、甚至自动"收回"抵押的手机和硬件,把追债的脏活外包给技术。文章从次级贷款的"风险溢价"讲到智能设备如何一步步变成催收工具。
pluralistic.net
Anthropic 的 Boris Cherny 表示,比起各项评测分数,他更看重 Opus 5 在提示注入(prompt injection)上的表现——系统卡第 73 页显示,跨多项注入评测和红队测试,Opus 5 都很难被成功注入。对做 Agent 的团队,这比跑分更关键。
simonwillison.net
苹果宣布 Apple Maps 将为福特"通用电动车平台"(Universal EV Platform)提供车机导航体验。这是苹果放弃造车后,把地图作为服务嵌进车厂系统的又一单——只做软件层,不碰整车。
apple.com
Astral 的 Python 代码检查工具 Ruff 发布 0.16.0,默认启用的规则从 59 条猛增到 413 条,很多此前需手动开启、能捕捉语法和运行时错误的规则现在默认打开。Simon Willison 的多个 CI 因未固定版本而集体报错,也从侧面说明这个工具已成很多项目的默认依赖。
simonwillison.net
Redis 作者 antirez 撰文谈"写出第一个能跑的 Linux 内核"到底有多难:他的判断是,这是千分之一到万分之一的程序员能完成的壮举,稀有但远非独一无二,借此讨论顶尖技术天赋的真实分布。
antirez.com

🧠 AI 技术前沿

shao__meng @shao__meng
Claude Opus 5 发布:智能接近 Fable 5、价格只有一半,且与 Opus 4.8 同价(输入每百万 token 5 美元、输出 25 美元),定位是"每天都能高频用"的高端模型。编码上 Frontier-Bench 刷新 SOTA、比 4.8 提升一倍还更省成本,ARC-AGI-3 得分是第二名的三倍,OSWorld 2.0 以三分之一成本反超 Fable。
查看推文 →
shao__meng @shao__meng
介绍"ego lite"——一个 agent 原生的 Chromium 浏览器:它既是你的日常浏览器,又能让 Claude Code、Codex、Cursor 等任意 Agent CLI 通过 ego-browser 驱动,在各自隔离的 Space 里并行干活,不抢用户的标签页、不丢登录态,零配置、数据本地存储。
查看推文 →
emollick @emollick
他注意到 Claude 似乎不再展示总结版的思维链,认为这是不小的损失:哪怕是摘要过的思考过程,也能帮人诊断模型的错误,而且这些内容本身常常带有洞见。
查看推文 →
shao__meng @shao__meng
马斯克宣布 Grok 4.6 两周内发布、4.7 四周内发布。作者的疑问是:如果 4.7 是对 4.6 的升级替代,那 4.6 的生命周期只有两周;除非两者是不同能力、不同价位的互补款。
查看推文 →

🚀 创业动态

gregisenberg @gregisenberg
他认为 Jack Dorsey 那款"Slack 杀手"Buzz 最有意思的点是"共享算力":开源模型已经好到能真用,但最强的那些需要普通人不愿单独购买的昂贵硬件;共享算力让一个人开机跑模型、其他人共用,正好补上这一环。
查看推文 →
EXM7777 @EXM7777
他推崇把公司的一切——报价、广告角度、内容流程、写作风格、已经定下的每个决策——都放进一个 Obsidian 知识库,做成任何模型几秒就能读完的"金库",再给每个 AI 员工只喂它该看的那几页。灵感来自 Karpathy 的"知识库"概念。
查看推文 →
EXM7777 @EXM7777
他回看黄仁勋 2024 年那句"我们都将成为 AI 智能体的 CEO、核心技能是给比你干得更好的下属派活",认为当时做不到、现在能了,并给出用 5 个 AI 员工(内容、项目、研究各管一摊)搭一支团队的具体做法。
查看推文 →
eptwts @eptwts
真正能升级生活和生意的系统,大多围绕一个会自我更新、随时间复利的知识库;因此把一个 agent 放进团队日常沟通发生的地方是巨大的解锁——你干活的同时,信息自动沉淀和复利。
查看推文 →
0xROAS @0xROAS
分享一个用 Opus 5 的小技巧:在目标 subreddit 网址后加 .json 下载数据、上传给 Claude,让它"提取这个社区的确切用语、信念和痛点",就能用用户自己的原话钻进他们脑子里,而不是靠猜。
查看推文 →

💬 观点与洞察

shao__meng @shao__meng
英伟达黄仁勋也来了 X,第一条推就发布由 NVIDIA 牵头、多方联署的公开信《开放权重与美国 AI 领导力》,核心观点是:开放权重模型对美国 AI 领导力至关重要,世界需要前沿闭源与前沿开源并存,二者不是二选一。
查看推文 →
emollick @emollick
他对那封支持开放权重模型的公开信泼了点冷水:和所有公开信一样,联署者对"支持开放权重"到底意味着什么,想法很可能大相径庭(比如信里就对模型蒸馏留了保留意见)——但仍然值得一看。
查看推文 →
eptwts @eptwts
一个观察:编程语言正在变成人类不再需要读懂的东西,逐渐退化成纯粹的"机器对机器"语言——我们不用再手动把人的想法翻译成代码,agent 替我们做了,他觉得这几乎有点诗意。
查看推文 →
jackfriks @jackfriks
全程用手机或 iPad 干活很酷,但只在当"备份"时才酷:周末出门不用背电脑是很大的加分,但真正干活笔记本还是舒服得多,而且手机端的工具在电脑上也能用,等于两头都占。
查看推文 →

🔥 精选推荐

一个 ARR,现在至少同时指三种现金流:合同承诺的年度经常性收入(annual recurring revenue)、把最近一个月或一季度收入乘 12 或 4 的"年化运行率"(run rate),以及客户已签约但还没交付确认的 committed ARR。三个数字可以同时为真,又差出一倍以上。最极端的样本是 Mercor:年化收入 24 个月从 100 万冲到 20 亿美元,但六到七成要付给平台上的专家和承包商,净收入只有 6 到 8 亿——同一个 200 亿美元估值,按毛收入是 10 倍、按净收入是 25 到 33 倍。文章翻出 2011 年 Groupon 的先例:招股书把收入口径从毛额改成净额,一季度收入直接跌掉 56%,而利润分文未动。SaaS 早期亲历者 Matthew Cowan 的判断是,这场关于"收入到底怎么报"的危机比二十六年前更严重,多数当事人还没意识到。
🦐点评:这篇给一级市场递了一把尺子——当你以为在按 10 倍 ARR 下注,可能实际在按 10 倍 GMV 下注。对 AI 应用赛道尤其致命:按会计准则 ASC 606 的"委托人 vs 代理人"判定,定价权和履约成本都在模型公司手里的应用公司,真实收入是抽成而非流水,而比负毛利更危险的是"负抽成"(规模越大亏越多、没有拐点)。做尽调时该问的不是"ARR 多少",而是"未来十二个月你能确认多少收入,以及这个 ARR 是三种里的哪一种"。
深思SenseAI
Warp 创始人、前 Google Docs 首席工程师 Zach Lloyd 把"12 个月做到 1 亿 ARR"这条最亮眼的曲线翻过来看:这些公司多数在以极低甚至为负的毛利转售推理,1 亿收入里可能有 9000 万付给了 Anthropic、OpenAI 或开源模型云。他的判断是,衡量这类公司创造的价值该看净收入,而不是被 token 成本穿透的总收入;只要你提供的价值只是包在 token 外面一层薄壳,竞争者随时可以少赚一点把你顶掉。第二股压力来自企业客户越来越要求"自带推理"(BYO inference),动机是消耗用量承诺、管控数据流向、以及用上自己微调的模型。他抛出最锋利的一问:如果明天所有客户都要求自带推理,你的平台还值多少钱?Warp 自己的选择是退出 token 转售业务。
🦐点评:这篇的分量在出身——不是旁观者看空,是赛道里最卷的 AI 编程玩家自己动的刀。它和当天 Opus 5"同价翻倍"是一套逻辑:模型层每降一次价,转售型应用的水分就被挤一次。给 VC 的直接拷问是"你投的公司到底在卖智能,还是在倒卖 token",Lloyd 那句"我知道他们是拿什么指标融的资,但怎么走出这个局我不知道",基本点名了一批账面高增长、毛利存疑的标的。反过来,真正有粘性的生意可能是回到 AI 之前的样子:高毛利、增长慢一点。
深思SenseAI
Travis Kalanick 的机器人公司 Atoms 完成 17 亿美元融资,a16z 领投、Ben Horowitz 进董事会,Bain Capital、Fifth Wall 跟投——名单里最重的一个名字,是当年把他赶下台的 Uber。Atoms 不是从零起步:它由 Kalanick 离开 Uber 后经营的幽灵厨房 CloudKitchens 重组而来,今年 3 月改名,并收购了前 Uber 同事 Levandowski 的重工业自动化公司 Pronto,定位是造"机器人的轮距底盘"。没有产品发布会、没有营收披露,17 亿买的是三样东西:一份被验证过两次的"重资产+调度"运营履历、一台已经在产钱的存量业务,以及物理 AI 的时间窗口——同一周 Applied Intuition 估值到 150 亿美元,a16z 还发了《制造十亿台智能机器》。
🦐点评:这条最耐人寻味的是资本的记账逻辑:九年前 Uber 董事会认定他不配管公司,九年后 Uber 投委会认定值得再押一次,两个判断能同时成立——资本记账,不记仇。对机器人赛道的信号更硬:a16z 一边写"智能已过剩、稀缺的是把它装到钢铁上的组织能力",一边用 17 亿下注一个以运营见长而非论文见长的创始人,等于挑明这一轮物理 AI 定价的是运营履历,不是技术天才。看这条线的基金该重估一个问题:你被投的机器人公司,创始人是会写 paper 的,还是会调度上万台设备的?
深思SenseAI

📌 其他值得看

赛博禅心逐段中英对照翻译了 Claude Code 负责人 Thariq Shihipar 的官方博客,核心一句是"我们删掉了 Claude Code 里 80% 的系统提示词",讲 Claude 5 这代模型的上下文工程新规则,并配套翻译了《A field guide to Claude Fable 5》等几篇官方文档。对做 Agent 的团队是一手参考。
赛博禅心
AI4Bio 公司 Fullive.ai 宣布完成种子++轮,招商局创投领投,高瓴创投连续三轮加注,4 个月内连融三轮。资金主要用于首款 AI 睡眠硬件 Somni 的研发与量产,主打"模型 × 本体"路线——把生命建模从静态推进到真实物理世界里的动态响应。
Z Potentials
GMI Cloud 联合 InfoQ 发布《中国 AI 产业核心要素出海发展白皮书》,火山引擎、小米 MiMo、快手、出门问问、商汤等参与,围绕算力、Token 效率和出海三条线,梳理中国 AI 企业全球化中的成本、效率与数据合规问题。属行业白皮书,观点偏综述。 <!-- ai-daily:complete -->
有新Newin