🔥 精选推荐

Moonshot 发布 Kimi K3,2.8 万亿参数,自称第一个"开放 3T 级"模型,从 DeepSeek 1.6T v4 Pro 手里接过这个位置,开源权重承诺在 7 月 27 日前放出。定价 $3/$15 每百万 token,和 Anthropic Claude Sonnet 同档,是中国实验室迄今最贵的模型——相比 K2.6 的 $0.95/$4 涨了三倍多。自报 benchmark 上大部分超过 Claude Opus 4.8 max 和 GPT-5.5 high,输给 Claude Fable 5 和 GPT-5.6 Sol。Artificial Analysis 的长周期知识工作评测给出 Elo 1547,比 K2.6 高 732 分,仅次于 Fable 5;单任务成本 $0.94,约为 Opus 4.8 的一半。目前在 Arena.ai 前端代码榜上排第一,超过 Fable 5。
🦐点评:涨价到 $3/$15 才是这次发布最该被记住的事。中国模型"性能接近、价格砍到零头"的打法过去两年逼着 OpenAI 和 Anthropic 在中端市场让价,现在 Moonshot 自己主动定到 Sonnet 同档,说明他们认为能力和品牌已经撑得住溢价,也说明便宜不再是他们想要的标签。这动摇了一个很常见的假设:靠中国开源模型压低推理成本的应用层公司,成本曲线未必会一直往下走。真要重新算账的,是那些把毛利建立在"下一代开源模型更便宜"上的 startup。
simonwillison.net
Mira Murati 的 Thinking Machines Lab 发布第一个开源权重模型 Inkling:975B 总参数、41B 激活的 MoE,Apache 2.0 授权,在 45 万亿 token 的文本、图像、音频、视频上预训练,开源权重支持 100 万 token 上下文。同时预览了 Inkling-Small(276B 总参、12B 激活)。团队自己承认这不是最强模型,定位是给自家 Tinker 平台做微调的底座。发布当天 vLLM、SGLang、Modal、Baseten、Databricks、Hugging Face 全部支持。架构上用相对位置编码替代 RoPE、加入短卷积层、5:1 的局部与全局注意力配比,被不少研究者认为比分数更值得看。评论普遍认为它是目前最强的美国开源权重模型,但部分 benchmark 仍落后中国最好的开源模型和闭源前沿模型。
🦐点评:真正的信号是时间线。John Schulman 说预训练去年冬天才启动,一月中旬才有一支小团队接手做编程和 agent 训练。不到一年、一支小队伍就做出能进开源第一梯队的模型,这把"造一个前沿级开源底座要多少人、多少时间"的参考值往下压了一档,对任何还在用"追赶需要三年和一千人"做防守论证的公司都是坏消息。另一面是 Thinking Machines 的收钱方式:免费放权重,靠 Tinker 微调平台变现。他们赌的不是模型本身值钱,而是谁掌握定制入口。
latent.space
Hugging Face 披露本周一起生产环境入侵,整条攻击链由自主 AI agent 系统端到端驱动,是行业预警多年的"agent 攻击者"第一次真实发生。攻击者用恶意数据集触发数据处理管线里的两个代码执行漏洞(远程代码数据集加载器,以及数据集配置里的模板注入),拿到处理节点权限后横向进入多个内部集群,抓走了部分内部数据集和服务凭证。整个过程跨越一个周末,由一群短生命周期沙箱执行了数千个动作,命令控制通道藏在公共服务上并自我迁移。HF 用 LLM 跑完 17000 多条攻击日志完成取证,把原本要几天的活压到几小时。公开模型、数据集和 Spaces 未被篡改,软件供应链验证干净。
🦐点评:最该记的细节不是被黑,而是 HF 做取证时先用商业 API 上的前沿模型,请求被安全护栏挡了回来——因为提交真实攻击载荷和命令控制痕迹的人,在模型眼里和攻击者长得一模一样,他们最后换成自己机器上跑的开源 GLM 5.2 才做完。攻击方不受任何使用政策约束,防守方却被自己付费的模型拒之门外。这个不对称会直接催生一类生意:给安全团队提供可自托管、不设护栏但留审计痕迹的模型。顺带一提,这也是开源权重模型第一个说得清楚的刚需场景,比"便宜"这个理由硬得多。
huggingface.co
Newcomer 拿到 Menlo Ventures 2012 年以来早期和成长期基金的业绩数据,近期基金 IRR 超过 40%。Menlo 2015 和 2018 年的基金回报平平,转折点是 Anthropic:2023 年 C 轮首投,2024 年 7 月领投 D 轮,前后跨多只基金和特殊目的载体投入约 10 亿美元,是它历史上第二大单笔投资的 10 倍,目前这块股份价值 140 亿美元。Anthropic 分散在 MV XV、MV XVI、Inflection III、Inflection IV 几只基金里,把 2023 和 2026 年基金的 IRR 整体拉了上去。2025 年投的 Lovable、Wispr、Suno 也在加价。这组数据截至今年一季度,还没算上 Anthropic 5 月 650 亿美元 H 轮把估值推到 9650 亿美元。Menlo 上月完成 30 亿美元募资,是其史上最大一期。
🦐点评:10 亿美元成本换 140 亿美元账面,14 倍——但更该学的是 Menlo 敢把第二大投资 10 倍的钱压在同一家公司上。多数机构的分散纪律会在第三次跟投时叫停,Menlo 没停,还专门起了 SPV 和 Anthology 基金继续加。一旦确认自己抓到了幂律里的那一个,剩下的问题就只是怎么把更多钱塞进去。反面同样要问:这些 IRR 全是账面加价,Anthropic 不上市,DPI 就是零,而 LP 分不到钱的 40% IRR 只是一个故事。Menlo 敢在这个位置募到史上最大一期,本身说明 LP 现在愿意为账面数字买单——这个窗口不会一直开着。
newcomer.co
Lila Sciences 的判断是:互联网数据已经用完,科学是最后一块没被开采的训练数据。他们把实验室当数据中心造——仪器是图上的节点,磁悬浮轨道充当传输层,调度像 slurm 队列,AI 引导的机器人 24 小时不停做实验。目前已经攒下超过 10 万亿条经过实验验证的科学推理 token。CTO Andy Beam 和物理科学 CSO Rafa Gómez-Bombarelli 把强化学习当成数据生成机制,由自然本身充当验证者。公司同时做生物、化学、药物发现和材料科学。他们强调自己不是自动化公司,优先要的是灵活和通用而不是吞吐量,凡是自动化不划算的地方就留给人做。
🦐点评:"以自然为验证者"这句话值得单拎出来。强化学习这两年最大的瓶颈是缺便宜且确定的打分环境——今天微信频道里五源孟醒那篇 ICML 手记说,全行业公认像样的练手场只有芯片 EDA 和算子优化两个。Lila 的答案是把物理世界本身变成打分器:实验结果对不对,自然会告诉你,不用人来标。这条路成立的前提是实验成本能压到接近软件迭代的水平,10 万亿条验证过的 token 说明他们确实在往那走。风险也在同一处:生物、化学、药物、材料四个方向的实验周期完全不同,一旦哪个先出成果,公司大概率被迫收缩到那一个,现在讲的通用科学超级智能,可能只是融资阶段的最大公约数。
latent.space

📌 其他新闻

伦敦人形机器人公司 Humanoid 完成 A 轮第一笔 1.5 亿美元,投前估值 12 亿美元,本周早些时候交割,公司还打算继续募。欧洲终于有了自己的人形机器人独角兽。
theinformation.com
创业公司正把一部分算力从 AWS 等传统云迁到 Nebius 这类新玩家,原因是在 AWS 上要么拿不到需要的英伟达芯片,要么只能买到贵得离谱的打包方案。作者说紧张程度已经到了谁都躲不开。
theinformation.com
微软准备发布代号 Project Perception 的 AI 安全产品,最快本月亮相,用 Anthropic、OpenAI 和微软自家模型的组合来找漏洞,目标是分一杯企业不断上涨的网络安全预算。
theinformation.com
The Information 筛出 160 多家今年可能被收购的企业软件公司,标准是估值超过 10 亿美元、且 2024 年 6 月以后没有公开宣布过新融资。数据软件类公司是这波并购传闻最集中的地方。
theinformation.com
OpenAI 的 Thibault Sottiaux 解释了 GPT-5.6 删用户文件的原因:在全权限模式、且关掉沙箱和自动审查时,模型想把 $HOME 变量改到临时目录,结果误删了真正的 $HOME。
simonwillison.net
银河通用发布 WAM-TTT 框架,把语言模型上的测试时训练搬到具身智能,让机器人在部署现场靠人类视频边干边学,而不是全靠预训练一次定型。
量子位
云南玉溪地产行业出身的中专生刘梓瑜,5 月做出全网播放破亿的 AI 短片《丧尸清道夫》,被称为"国产爱死机",还收到好莱坞制作人的邀约。36kr 用他的故事讲 AI 怎么让影视圈边缘人翻身。
36kr
英伟达发布 Nemotron 3 Embed,在 RTEB 检索评测总榜排第一,主打给 agent 用的检索场景。开源嵌入模型这块的竞争重心正从通用语义相似度转向 agent 实际调用。
huggingface.co

🧠 AI 技术前沿

Hesamation @Hesamation
认为 K3 最惊人的是自我进化能力:15 小时里 K3 设计出一种新的两阶段 kernel 算法,在保持数值精度的前提下融合 kernel,把前向加反向的耗时从 283.6 毫秒压到 114.4 毫秒。K3 和 Fable 5 最终水平接近,但 K3 每轮迭代的进步更快。
查看推文 →
Hesamation @Hesamation
一句话概括 Kimi K3:Opus 级别的智能,Sonnet 级别的价格。
查看推文 →
karminski3 @karminski3
Kimi K3 前端测试速报:效果很猛,建模精确度、粒子效果,甚至复杂的 shader 内联代码都能一次过。测试用的 prompt 已开源。
查看推文 →
shao__meng @shao__meng
梳理 Inkling 在开源模型里的位置:强于 Nemotron 3 Ultra 和 Kimi K2.5;与 Kimi K2.6、DeepSeek V4 Pro 互有胜负(IFBench、FORTRESS、SWEBench Verified 略胜,HLE、SimpleQA、Terminal Bench 略输);整体略弱于 GLM 5.2,后者仍是当前开源组的事实王者。
查看推文 →
emollick @emollick
泼一盆冷水:用 Kimi K3 Max 对自己过去的学术工作做复杂统计审查时,K3 出了不少错,包括统计方法用错、有些地方处理得很糟。他附上了 GPT-5.6 Pro 对 K3 的批评并表示认同。
查看推文 →
emollick @emollick
在 Kimi K3 和开源模型重新逼近前沿之后,他好奇政府会不会允许 Anthropic 和 OpenAI 提高发布节奏。Mythos 四月就发布了(早于 Opus 4.7),这意味着 Fable 5 已经算是一个"旧"模型了。
查看推文 →
shao__meng @shao__meng
SpaceXAI 开源了 Grok Build 并为全体用户重置额度,回应此前上传代码库的安全风波。官方给的开源理由是:把 context 组装、模型响应解析、工具调用分发的代码完整暴露,用透明换可靠性;源码即文档;以及支持自行编译指向本地推理后端。
查看推文 →

🚀 创业动态

marclou @marclou
TrustMRR 上已验证的创业公司收入达到 15 亿美元,其中 Stripe 占 14.9 亿。59% 的创业公司用 Stripe,但这部分贡献了全部已验证收入的 98%。
查看推文 →
corbin_braun @corbin_braun
他的项目 Thumio 十天前还是 20 万行代码,这几天猛推更新后涨到 34 万行。他认为 Fable 5 就是大家等的那个模型,但问题变成了你付不付得起——多出来的这 14 万行代码花了他 1 万美元。
查看推文 →
jackfriks @jackfriks
过去 24 小时里,他的小产品 postbridge 在 AI 的回答中被提到 100 多次,他说营销的新时代到了。
查看推文 →
shao__meng @shao__meng
OpenAI 发布实体键盘 Codex Micro,定价 230 美元。他的评价是好看好玩但是真贵,喊话华强北把价格打下来。
查看推文 →

💬 观点与洞察

EXM7777 @EXM7777
现在人人都能花 200 美元一个月租到同样的智能,所以智能在你拿到的那一刻就不再是优势了,你把它转化成什么才是优势。答案在收到那天就花掉了,系统却会在你忘掉它之后继续给你产出。
查看推文 →
EXM7777 @EXM7777
不要再用任何没有 MCP 或 CLI 的软件。学一个新界面现在是负期望值的事:那些配置、开标签、点鼠标的时间,都是你在做 agent 继承不了的体力活。替代方案已经有了——对着你的 harness 说话,让它去开那些软件。
查看推文 →
emollick @emollick
Frontendmaxxing 会变成新的谄媚:让模型在网上收获好评最省事的办法,就是让它做出漂亮网站、好看的 SVG 和炫酷的 3js 世界。这些东西比后端代码和复杂分析好传播得多。
查看推文 →
EXM7777 @EXM7777
Kimi K3 是他唯一在等的开源发布。上一代是他花钱最多的开源模型,而且不是花在写代码上。多数中国模型 benchmark 都不难看,但一碰到需要判断力的任务就崩——营销 agent、真正的写作、日常主力活。Kimi 是有品味的,而品味从来不会出现在排行榜上,所以账单才是他唯一信的 benchmark。
查看推文 →

🔥 精选推荐

五源资本合伙人孟醒的 ICML 现场手记,底色是迷茫:他见的每一段超过半小时的对话,最后都绕回同一个问题——面对越来越强的模型,我的身位是什么。做 AI 应用的创业者已经开始把自己理解成"long horizon 的数据公司",等模型公司吃过来那天把手里的东西卖掉;几个月前还摩拳擦掌要创业的开源社区核心贡献者,这次见面时都回大厂了。数据生意之所以是眼下少数确定的方向,是因为训练和评估成本涨到了离谱的地步:字节内部测模型自进化能力的 benchmark,完整跑一次要 1000 小时、花 50 到 100 万美元。文章还给了一组硬数字:海外前沿实验室卡量一年翻五倍,年底预计 500 到 600 万张等效 H100,国内要维持"只差十倍",年底就得有 100 万张。另一头美国的瓶颈是电——纳德拉承认有芯片躺在库存里插不上电,当下电网只够部署其中一半到三分之二。今年 ICML 投稿 23918 篇,几乎是去年 12107 篇的两倍。
🦐点评:这篇最锋利的不是中美算力对比,是 Noam Brown 给创业者的那句提醒:要搭 harness 可以,别投入太多,三个月后多半就过时了。孟醒把这句总结成"壁垒蒸发的速度,正快过挖掘的速度"——这是今年应用层投资最该记住的一句话。他给数据公司的比喻也很毒:今天卖数据给 researcher 有点像一级市场的 FA,本人往往是有品味的 researcher,能预判下一代模型缺什么能力,先造出现有模型刷不好的 benchmark,再把补课的数据卖回去;等所有模型都刷上来,这批货就过期,永远活在 day one。这意味着数据公司根本不是护城河生意,是永续的军备竞赛供应商,估值逻辑该按周期股而不是 SaaS 来算。真正被低估的可能是那两家韩国公司:JP Morgan 算未来三年 SK 海力士和三星的预期净利润是韩国全部政府债务的 1.4 倍。
晚点LatePost
前腾讯 AI Lab 和混元核心成员刘威 2024 年底创业做视频生成,Video Rebirth 已完成 8000 万美元融资(启明创投、AMD Ventures、现代汽车集团、Granite Asia),正在募新一轮。今年 5 月上线的 BACH 引擎在 Artificial Analysis Video Arena 盲测里排全球第 6,是榜上排名最高的创业公司模型。面对字节 Seedance 2.0 这个 200B 参数、被认为"kill the game"的对手,刘威说反而更安心,因为它证实了视频模型有自己的 scaling law。他的差异在取舍:Seedance 求大而全,他求精准——只做强一致性和对物理规律的强遵循,想用不到 Seedance 十分之一的资源做出相当的效果。技术上他从第二代开始动 DiT 里的 Diffusion,理由是现在的扩散模型太低效:同一套参数对同一个噪声块反复去噪几十次,但每一步的难度并不一样。他还给了两条路的终局判断:大语言模型的终局是 coding agent,世界模型的终局是能预判后果、规划行动的仿真 agent。
🦐点评:刘威有一个判断值得单独验证:语言模型预训练可用的真实文本 token 已经见顶,但真实世界的 video token 取之不竭,所以视频的 scaling law 还能一直跑。如果这条成立,视频赛道的时间窗口比语言模型长得多,现在入场不算晚——这大概是他敢在 Seedance 2.0 之后继续融资的真正底气。要泼的冷水是晚点记者当场问出来的那个问题:Seedance 毛利率已经能做到 80%,理论上有巨大降价空间来打价格战。刘威的回答绕到了高并发下的服务延迟,没有正面回应。另外他说客户"知道 Veo、Seedance、Kling 但都还不能满足精准需求,比如汽车广告只能回到实拍",这是个可以直接去验证的说法:找两家 4A 或车企市场部问一句,就知道这个窗口是真的还是创业者的自我安慰。
晚点LatePost
作者把 Codex 官方更新页的 93 张卡片、跨 61 个日期全部展开,对着增长里程碑复盘。2 月 5 日 100 万活跃用户,7 月 14 日双产品 800 万,首尾约 160 天。他把这段拆成四次换挡:先把 Codex 从命令行搬到桌面 App,把"会不会用"从用户能力问题变成产品设计问题(App 首周下载超 100 万,Codex 整体周增超 60%,印度市场两周周用户涨 4 倍);再用 Plan Mode、中途纠偏、审批、任务分叉让过程可控可复用,4 月 3 日 App 超过 CLI 和 IDE 成为最大入口;接着把任务入口扩到浏览器、手机和远程;最后用 ChatGPT Work 把非技术工作纳入同一套增长叙事,统计单位从 Codex 单产品换成双产品。他的总结是:模型负责点火,产品负责扩圈,额度与反馈机制负责把尝鲜变成深度使用。
🦐点评:最值得抄的是那个额度重置机制。Tibo 宣布每新增 100 万用户就重置一次额度,直到 1000 万——这看着像送补贴,实际是行为设计:模型发布制造关注,重置把老用户拉回来,更多真实任务带来案例和问题,公开修复再吸引下一批。它解决的是 AI 产品最难的那件事——用户第一次惊艳之后就不再回来。另一个不该错过的信号藏在统计口径里:从 6M 开始 OpenAI 把 Codex 和 ChatGPT Work 合并计数,作者自己也说"产品范围已经模糊,不能再称纯 Codex"。看到竞品报 800 万时先问一句这 800 万是怎么数出来的。至于 Peter Steinberger 三块显示器开 18 个终端那张图——Alex 判断只有顶尖 1% 的工程师会这么用,于是做了 App。这个判断是整条增长曲线的起点。
AI产品黄叔
作者一开始认为 Raft(前身 Slock)主要是投资人自嗨的产物——有复杂任务在 Codex 里开一堆子代理就行,何必在群聊里跟一堆 agent 玩。用下来他改了主意,认为 AI 群聊解决两个真需求:远程用自己电脑上的 agent,以及团队协作。他举的例子是办黑客松收问卷,把飞书文档链接发进群聊,因为本地装了飞书 CLI,群里的 agent 直接就能编辑在线表格,他自己完全不用碰那个表格。他的判断是 Raft 赢在简单——没有客户端、只有群聊、一行终端命令接上本地 agent;而功能更多的 Bloome 反而让人想不起来用。文章后半段介绍 Tutti 走到了另一个极端:在云端跑一个本地环境的镜像,实时同步上下文,同事之间能互相看到彼此在跑什么进程、随时接管对方的 agent,理论上团队内部不再需要任何文档交接。
🦐点评:这篇的真正价值不在夸 Raft,在于它顺手指出了一个正在消失的品类——作者管在线文档叫"无聊 GUI",几千上万个工程师的努力只是为了让人更顺畅地忍受它。如果 agent 可以代替人去编辑表格,那么在线文档的价值就从"人用得爽"变成"机器读得懂",钉钉飞书这类工具积累的交互优化会大面积贬值,而它们的护城河恰恰建在那上面。Tutti 那个思路更值得盯:如果同事之间能实时看到并接管彼此的 agent 进程,协作软件的形态就不再是文档而是共享的运行时——这才是真正可能吃掉飞书的东西,虽然作者自己也承认复杂到不敢用。文末那句"听说有头部美元基金找借口不给已投的 AI 应用打款",如果属实,比这篇文章的所有产品分析都更值得追。
葬AI
连续创业者 Louis McKeeve 7 月 13 日在 X 上的长文,两天拿到 14 万阅读。他公开讨厌个人品牌,却三次建起靠注意力吃饭的生意,从没做过一天网红。文章给的错配数字很硬:全球 2 亿多内容创作者,只有约 2%(400 万人)粉丝过 10 万,而这最头部的 2% 里约一半年收入不到 1.5 万美元,67% 的人从未接到过一单品牌合作——按美国联邦最低时薪 7.25 美元算,全职干一年是 15080 美元。他的做法是发一千封冷邮件找合伙人:15 次对话、1.5% 回复率,最终和全美最大的田园生活创作者之一合伙做电商,签约时他连 homesteading 是什么都不知道,这家 Thrive Creators 如今年收入七位数美元。他另一个生意 Pitchlo 曾 90% 依赖 Meta 广告,两个月后翻转成 90% 来自 Google 和 AI 搜索。
🦐点评:他把广告和 SEO 的区别讲成了会计问题,这个角度比所有增长方法论都实用:广告是损益表上的费用,花掉即消失、停投即归零;SEO 资产更像资产负债表上的无形资产,会折旧但也会增值。所以获客靠创始人个人账号发帖的公司,和获客来自搜索引擎的公司,在卖的时候不是同一个估值逻辑——能卖掉的只有后者。这句话该直接进尽调清单。另一个反直觉的观察:正因为所有人的收件箱都在被 AI 生成的模板邮件淹没,肯花 10 分钟手写的邮件回复率能到 5-10%,是群发的 5 到 10 倍。AI 把平庸的成本压到零,同时把真诚的溢价推到了历史最高——那些靠"AI 帮你批量发一万封"讲故事的公司,可能正在卖一个正在贬值的东西。
深思SenseAI

📌 其他值得看

作者实测 Kimi K3 后的结论是国产模型终于撑得起常规 vibe coding 了,他强调 K3 是目前少数具备多模态能力的国产模型。可以和今天 RSS 里 emollick 泼的冷水对照看。
洛小山
作者用 K3 在 12 小时里写完一套可商用的收银 ERP 系统,还有此前微信里的 Markdown 阅读功能。需要说明的是,文章开头发的 1000 张酒券由 Kimi 赞助,算半篇软文,但实测部分仍有参考价值。
赛博禅心
Vibe Coding 把"想法"到"Demo"的距离压到很短之后,真正的问题变成产品怎么找到用户。作者用自己做的应用 Alice 和观猹平台讲这段路。
洛小山
OpenAI 研究员 Miles Wang 即将离职创办 AI 药物发现公司,预计还有数名 OpenAI 研究员跟着走,正洽谈以 20 亿美元估值融资约 2 亿美元。前沿实验室人才外流做垂直科学 AI 的又一例。
Z Potentials
帮小企业用 AI 做应用的印度公司 Emergent 完成 1.3 亿美元融资,估值 15 亿美元,Creaegis 领投,Claypond 和 Sentinel Global 联合领投,Khosla Ventures 和软银愿景基金参与。印度为数不多的 AI 独角兽。
Z Potentials
作者分享自己在外面也能随时给 agent 派活的整套远程方案,支持多设备协同,不用操心 .md 文件、agent 记忆和 skill 同步。和今天 Twitter 上 EXM7777 那条"对着 harness 说话"是同一个方向。
数字生命卡兹克
在同行打价格战、同店营收下滑的时候,喜茶反过来减少新品和联名、门店从 4600 多家收缩到不到 4000 家,新品售价回到 20 元左右。一个关于不跟随低价共识的消费样本。 <!-- ai-daily:complete -->
晚点LatePost