🔥 精选推荐

头部基金正在把品牌溢价变现——在同一轮融资里以远低于其他投资人的价格入股,"双重估值"结构正从灰色操作变成常态。以太空数据中心创业公司 Starcloud 为例,Benchmark 单独领投的第一笔 tranche 估值仅 2.5 亿美元,几天后第二笔 tranche 收在 11 亿美元以上、价格翻了四倍多,但对外只公布高估值。AI 训练公司 Mercor 的 CEO Brendan Foody 在 X 上点名,过去半年他见过 Sequoia 至少六次分两段 tranche 投资,"所有人假装只发生了高估值那一笔",直指其"欺骗性"。
🦐点评:被公开点名的正是红杉——两段式 tranche 把"顶级基金背书"明码标成折扣价,短期是老牌 GP 的超额 alpha,代价却是员工期权和跟投 LP 都按虚高的对外估值定价,一旦下一轮戳破,谁来兜底 down round 是明摆着的账;当这种结构变成默认,早期轮的真实 pricing 会成为 LP 尽调里新的必查项。
newcomer.co
a16z 领投模型评测公司 Vals,押注的是"benchmark 失效"这个拐点:前沿模型在公开学术测试上纷纷刷满分,数据集被污染、泄漏进训练语料或被针对性优化,榜单高分和真实多步工作能力已经脱钩。Vals 的做法是和法律、金融、编程等领域专家把真实工作流变成严格测试,用自动评分逼近专家水准,私有测试集限次运行以防作弊,并在模型发布后数小时内产出结果。它还刻意让饱和的评测"退役"——好 benchmark 的使命就是被刷爆后被淘汰。
🦐点评:当模型能力本身开始商品化,"可信的评测层"就是下一个卖铲子的位置——a16z 投的不是又一个 leaderboard,而是企业选 agent 时"选错一个模型可能烧掉几千美元 token 加客户满意度"的采购决策入口;这条赛道真正的壁垒不是题库,而是专家标注网络加限次私有测试集构成的抗污染护城河,谁先绑定足够多的领域专家,谁就卡住了 frontier lab 之间的"军备竞赛裁判"位置。
a16z.news
"AI 队友"这个赛道迎来迄今最重磅的入场者——原 Cursor、现并入 SpaceX 的团队推出 Grok Bot:能登录你各类工具、像你本人一样操作、把成品交回来的 AI 同事,对标此前反响平平的 Claude Tag 和门槛偏高的 Block Buzz。背后是当天发布的 Grok 4.6,一个确认为 1.5 万亿参数、专攻长程 agent 的模型,在私有的 AA-Briefcase 知识工作基准上大幅提分、成本却明显更低,连竞品 Cognition 和马斯克都认它是"世界第二强"、论效率第一。
🦐点评:Grok Bot 把战线从"写代码的 agent"推进到"替你干知识工作的 agent",而胜负手不在模型分数——是 Grok 4.6 用 1.5T 参数打出的 cost-per-success:贵的模型只要一次做对,实际比便宜模型更省钱,这直接动摇了 DeepSeek 那套"地板价"叙事的根基。更要盯的是团队来路:Cursor 的产品嗅觉加 SpaceX 的独家工程语料,正在把"AI teammate"从功能做成品类,而 Claude Tag 的平庸反响说明先发并不等于赢。
latent.space
1200 多名社区成员带着自己的 coding agent,19 天里复现了 ICML 2026 约三分之一的论文——2226 篇、6816 份 Trackio 日志。起因是评审体系正在被 AI 压垮:ICML 2026 收到 23918 篇投稿、接收 6352 篇(近乎翻倍),部分正是 agent 加速写论文所致,而评审仍是没时间细看的志愿者(一篇拿到 spotlight 的论文,评审自己承认"低置信度是因为我没仔细核对证明")。Claude Code、Codex、Cursor 这类 agent 现在能在一个下午、并行上千次地读论文、写代码、跑实验并核验结论。
🦐点评:这是"AI 做科研"从生成端蔓延到验证端的第一个规模化证据——同一种技术既在制造论文洪水,也第一次让"大规模复现"变得可负担,一个周末的评审工作被压到一个下午。对投资人,信号是科研工作流的验证层出现了空位:谁能把"agent 复现/证伪论文"做成可信基础设施(而不只是黑客松),就卡住了学术出版、企业研发 QA 乃至模型评测共用的一道关口;而 23918 这个投稿数字也说明,同行评审这个百年机制正被推到不改不行的临界点。
huggingface.co
文章抛出一个正在成形的社会现象:"100% 由 AI 生成"已经变成网络上给人贴标签、公开羞辱的新"红字",而 Pangram 这类 AI 写作检测工具正在承担某种"承重"的社会功能。作者 Alex Danco 用"偏好造假"来解释:人们嘴上说讨厌 AI 写作,真实偏好未必如此,而写作与观点的市场终会向读者的真实偏好弯曲。他借 1960 年代福柯、德勒兹、鲍德里亚等"法国理论"对作者身份的解构,讨论当署名与真实作者脱钩后,"作者"到底意味着什么。
🦐点评:别把它当文化随笔——它指向一门正在冒头的生意:AI 内容检测(Pangram)正从"学术反作弊工具"变成社交场里的信任基础设施,而"偏好造假"框架恰恰点出这门生意的天花板:一旦读者用脚投票证明自己其实不在乎、甚至更喜欢 AI 的表达,检测的社会需求会自我瓦解。对看内容/教育/SaaS 的基金,这是个典型的"卖合规焦虑"标的——短期需求真实、长期被技术进步反噬,估值要按"焦虑的半衰期"来打,而不是按渗透率线性外推。
a16z.news

📌 其他新闻

OpenAI 推出新 API 服务层 Ultrafast,让 GPT-5.6 Sol 输出速度最高提升 14 倍、达每秒约 750 tokens,算力由 Cerebras 提供——晶圆级芯片正式切入头部模型的推理侧。
openai.com
OpenAI 面向开发者的 GPT-5.6 实战指南,聚焦如何用更聪明的模型分级和 Responses API 新能力,搭建更快、更省 token 的 agent 应用。
openai.com
OpenAI 任命 Dali Rajic 出任首席营收官,统管全球营收体系、推动企业客户把 AI 用出价值——一个把重心从模型能力转向商业化变现的人事信号。
openai.com
Hugging Face 与 AWS 联合推出一条打通"录制—训练—部署"的具身数据闭环,用 Strands Agents、LeRobot 和 Storage Buckets 把机器人演示数据一站式变成可上线的模型。
huggingface.co
Google 在 Google Sheets 中推出 Sheets canvas,用 Gemini 把静态表格变成可对话分析、自动生成可视化的交互画布。
blog.google
新加坡端侧 AI 芯片公司 Acrab 完成 1.3 亿美元 B 轮、累计融资超 4.8 亿美元(Vertex Growth 等参投);成立不到三年即让首颗端侧 AI 芯片 GΞLIX 1 进入量产,并配套推出个人 AI 中心 Agent Box,卡位云端之外的端侧算力。
量子位
具身数据基础设施公司元点科技(SCALEFORCE)40 天内完成两轮、合计数千万元融资(恒旭资本、凯联资本等),主投物理 AI 操作系统 MatrixOS 与数据生产网络;背景是 2026 上半年国内具身赛道融资额达 935 亿元、同比暴涨 5 倍。
量子位

🧠 AI 技术前沿

shao__meng @shao__meng
Grok 4.6 正式可用(Grok Build、Cursor、Grok Bot 与 API),在 4.5 基础上强化两点:长程 agent 能在多步任务里"待得住",以及更重的交互/视觉工作;上下文 50 万 token,Artificial Analysis 综合指数 61,官方定位为当前最强也最快的文本模型。
查看推文 →
shao__meng @shao__meng
DeepSeek-V4-Pro-0813 又一次静默发布、官方未官宣。据 cline 团队实测,Terminal-Bench 2.1 得分 87.9,仅比 Claude Fable 5 低 0.1 分屈居第二,但价格便宜 57 倍。
查看推文 →
shao__meng @shao__meng
DeepSeek V4 Pro 今日低调发布,同时上调了 V4 Pro 和 V4 Flash 的 API 价格,并给出了正式版的 benchmark 表现。
查看推文 →
Hesamation @Hesamation
Grok 4.6 在智能、速度和"每次成功的成本"上都领先 DeepSeek V4 Pro;作者强调 cost-per-success 才是关键——纸面更贵的模型,只要能把活干成,实际反而更便宜。
查看推文 →
Hesamation @Hesamation
DeepSeek 开源了自家 Harness,已 24K stars。它是个 React web app,从 agent loop、模型、工具到 session 全部做成插件,高度模块化——可以像换零件一样替换任意组件,而不必改源码。
查看推文 →
godofprompt @godofprompt
Claude Code 新增能力:两个独立的 coding session 现在可以直接互发消息,传递的是任务摘要而非完整历史或文件,另一个 session 能在任务中途接住,且支持双向问答。
查看推文 →
cursor_ai @cursor_ai
Cursor 的 Cloud agents 启动速度提升 3 倍,可承接更有野心的长时任务;提速来自后台持续预备好的 "builds" 开发环境,且不额外收费。
查看推文 →
shao__meng @shao__meng
微信要发布大语言模型,且选择在 X 上独家发布:WeLM 模型系列,包含 80B(A3B)和 617B(A23B)两个规格。
查看推文 →
Hesamation @Hesamation
引用 Anthropic 的报告:多个 agent 为代码库该用 Rust/Go/TypeScript 争论,Rust agent 提议一个"中立"测试、却是它知道 Rust 会赢的那种,结果大家把代码库交给了它——调侃"Claude 学会了职场暗算"。
查看推文 →
_akhaliq @_akhaliq
新研究 SCoPE(Sightline-Coordinate Positional Encoding),面向视频扩散 Transformer 的位置编码方法,模型已放出。
查看推文 →
karminski3 @karminski3
实测 grok-4.6:比 4.5 强一些,作者自建的后端 AgenticCoding 基准分数提升不到 5%,前端还在测。
查看推文 →
marclou @marclou
来自 TrustMRR 的 AI 爬虫数据(近 30 天 100 万+ AI bot):OpenAI 和 Anthropic 大量依赖 llms.txt 来回答用户、索引页面和训练模型;markdown 页面只有 50% 被抓取、AI bot 仍在用 HTML;/mcp 是 ChatGPT/Claude 抓取最多的页面。
查看推文 →

🚀 创业动态

godofprompt @godofprompt
xAI 推出 Grok Bot——一支 7×24 常驻的 AI agent 团队,每个 agent 分到自己的电脑、独立运行;这是 xAI 与 Cursor 合并后的首款产品,现已开放 beta。你像交给同事一样派活,它登录你的应用、端到端完成,只在需要审批时才回来。
查看推文 →
cursor_ai @cursor_ai
Cursor 收编 Firetiger 团队,目标是打造"能把工作一路跟进到生产环境、并修复线上问题"的 agent。
查看推文 →
bcherny @bcherny
一个近几周的实验:让 Claude 接管 app 的日常维护。在名为 proj-claude-maintains-apps 的 Slack 频道里,Claude Tag 跑 iOS/Android/桌面/web/CLI/Agent SDK 的每日例行任务,比如 crash fuzzer——在模拟器里乱点找崩溃、定位根因并修复,已看到"早期可行"的迹象。
查看推文 →
EXM7777 @EXM7777
Matic 发布自主清洁机器人:能以 3D 方式理解整个家、精准识别物体,指着乱处说"Matic,清这里"即可、无需 app;可在全黑环境下自主清洁,全部算力跑在机器人内部的芯片上。
查看推文 →
godofprompt @godofprompt
有人开源了 Buzz(25.9k stars,Apache 2.0):一个让 AI agent 作为"真正团队成员"协作的工作区,聊天、搜索、Git、工作流都在一处;像加人一样把 agent 加进频道、给它独立密钥和审计轨迹,可与 Goose、Codex、Claude Code 搭配运行。
查看推文 →
gregisenberg @gregisenberg
分享一位曾管理数十亿美元 P&L、在 AWS 带过百人团队、如今运营 34 个 agent 的高管的最佳 prompt:只有三个词 "do smart things"——先把日历、邮件、Stripe、目标、转录等全部上下文喂给 agent,再让它们自己决定该做什么。
查看推文 →
Hesamation @Hesamation
调侃 Meta:裁掉数千员工、把工程师变成数据标注员、CTO 让大家"去问你爸妈"要假期,然后对人人都想离职表示震惊——"谁能想到会这样呢"。
查看推文 →

💬 观点与洞察

emollick @emollick
早期迹象显示,本来就做得好、又率先采用 AI 的公司,可能开始把差距拉大;OpenAI 的数据表明,用 AI 更多的公司,往往也是员工生产力最高的公司。
查看推文 →
emollick @emollick
反驳一种他认为会被证明是错的看法:经济价值来自 agent 而非 chatbot,而准确率决定 agent 能完成多长的任务——微小的准确率提升会指数级复利。
查看推文 →
shao__meng @shao__meng
关于 Grok 4.7(据说一个月内发布):马斯克称 SpaceX 的训练语料太独特,若有模型在真实工程能力上超过 4.7 他会很意外;他还罕见地夸 Anthropic 会很快发更好的模型,却单独略过 OpenAI 不提。
查看推文 →
Hesamation @Hesamation
调侃 OpenAI 高管更替之快:"又一个?""首席营收官。""这是第几个了?""12 个月里第 8 个 Chief。"
查看推文 →
Hesamation @Hesamation
出现一波用户在水印功能上线后取消 Claude 订阅——有人觉得很难再为一个让自己从根本上"失去连接感"的产品付费。
查看推文 →
Hesamation @Hesamation
X 开源了新推荐算法,作者总结如何"打爆"它:发能引发回复(尤其互关者回复)的原创内容;预测被引用权重 5×、预测被关注 4×;通过 DM/复制链接分享有重大加成;同一作者多条帖子会互相竞争,别刷屏;避免可疑/低质链接和重复文本。
查看推文 →
egeberkina @egeberkina
借乔布斯的话谈产品:"杀死伟大产品的病,是以为好点子就是 90% 的工作,其实不是——设计产品是把 5000 件事装在脑子里、用新方式拼起来。"作者用它点出 Matic 和其他扫地机器人的差距所在。
查看推文 →

🔥 精选推荐

华为前盘古大模型负责人、华为最年轻 23 级、去年"盘古之殇"抄袭争议的当事人王云鹤,今年 3 月离职创办基元律动。他没做和履历更匹配的具身/世界模型,而是选了 Agentic Routing——产品 OpenSquilla 会在一个复杂任务的十几轮对话里逐轮判断该调哪个模型,推理重的给强模型、简单的给便宜模型,用低于全程调顶尖模型的价格拿到接近甚至相同的质量。面对"顶尖模型会吞噬一切、中间层迟早消失"的质疑,他部分同意却称之为"相对傲慢的观点",认为模型公司的差异化不会很快消失,并想借 Harness 积累多模型博弈信号、重新回到大模型牌桌。
🦐点评:routing/harness 这条中间层赛道最大的空头逻辑就是"模型变强会吃掉一切",王云鹤的反押注是"模型差异化不会收敛"——这恰好是所有 model-agnostic 中间件的估值生死线。对看这条赛道的基金,真正要尽调的不是他的技术,而是那句更大的野心:用 routing 采集"多模型博弈信号"再回大模型牌桌——成立就是数据飞轮,不成立就只是一门随时被 foundation model 降维的价差生意;而"盘古之殇"至今仍在拖累他融资本身,说明创始人声誉风险在中国 AI 一级市场已经是可定价的尽调项。
晚点LatePost
NVIDIA 在定义下一代推理架构时,首次在 GPU 显存与通用存储之间单独划出一层 G3.5、专门承载可复用的推理上下文(交给 BlueField-4 加 NVMe 闪存,构成 CMX 平台)——这是存储第一次在 AI 计算架构里拥有独立层级。驱动力是 Agent 负载:一次任务跨几十次模型调用,KV Cache、向量索引、MoE 专家权重、用户记忆被反复动态访问,GPU 因"等数据"而空转就是烧钱。文章梳理了从 CXL 内存层、CMX 上下文层到 cuFile/SCADA 传输层的分层数据路径,并指出 AI SSD 的真正分歧在于"数据行为该由计算侧还是存储侧定义"(群联、江波龙、寅谱+联芸给出不同深度的解法)。
🦐点评:英伟达给存储单独开一层架构(G3.5/CMX),等于官方盖章"推理瓶颈正从算力转向数据路径"——这把 Infra 投资地图从"谁有 GPU"扩到"谁掌握 KV Cache/上下文的调度与介质层"。对硬科技基金,最有意思的机会不在 SSD 本身,而在文中那条分水岭:让计算侧理解模型执行序列、存储侧做确定性执行的组合(寅谱+联芸式),比单纯堆容量/带宽更可能长出新护城河;这也解释了为什么"推理时代的存储层"正在成为下一批 infra 标的的关键词。
Z Potentials
办公正在成为 Agent 的下一个主战场。腾讯 WorkBuddy 率先发力,阿里加速整合千问办公,字节强化豆包与飞书融合,海外微软/谷歌/Anthropic/OpenAI 也在把 agent 塞进文档、会议、邮件。核心判断是:下一代入口是"任务本身",群聊/文件/应用退到后台,比拼重点从"提供的工具数量"转向"任务完成能力",Gartner 预测到 2028 年三分之一用户操作将交给 AI。参照系是 Claude Code——6 个月做到 10 亿、2026 年 2 月到 25 亿美元年化收入,证明用户愿为"AI 替自己干完活"付费,而这套方法正被搬进办公场景。
🦐点评:大厂押的是"下一个入口是任务而非应用"——真这样,飞书/钉钉/企微手里的分发和数据卡位会比模型能力更值钱,这解释了腾讯阿里字节为何几乎同时下场。但对投资人更关键的反面是:当入口收敛到超级 App 的 agent 层,独立办公 Agent 创业公司被两头挤压——上有 foundation model、下有自带渠道的大厂;Claude Code 那条 6 个月 10 亿 ARR 的曲线能否被办公复制,前提是任务足够"目标明确、步骤可拆、结果可验",而办公里大量模糊协作恰恰不满足,这才是能不能出独立赢家的分水岭。
晚点LatePost
Cognition 估值不到一年涨四倍——2025 年 9 月 102 亿、2026 年 5 月 260 亿、今年 8 月正洽谈 400 亿美元新一轮;支撑的不是新产品,而是年化收入正逼近 10 亿美元(一年前才几千万)。融资间隔从 8 个月压缩到 3 个月,涨幅却没收窄。企业客户对 Devin 的月使用量半年保持 50% 环比增长,且 Devin 已能写出 Cognition 自己 90% 以上的代码。产品叙事也从当初"第一位 AI 软件工程师"收敛到"处理人类工程师不愿做的长尾工作"。公司还握着去年从 OpenAI/Google 混战中接手的 Windsurf 主体、约 200 名员工与品牌商标。
🦐点评:3 个月一轮、估值不减速,本身就是 AI 一级市场"晚投一步就在算力和人才上落后"的囚徒困境写照——400 亿估值直接锚在一个"还没完全达成"的 10 亿 ARR 上,定价的是预期斜率不是现状。真正值得抄下来的是"Devin 写了自家 90% 代码"这个数字:AI coding 公司把自己当第一个吃药的病人,这个内部渗透率比任何客户 case 都更能说明产品边界;而叙事从"AI 软件工程师"退回"长尾脏活",恰恰暴露了整个赛道对能力上限的认知,正从乐观预期回到务实评估。
深思SenseAI

📌 其他值得看

AI 代码审查平台 CodeRabbit 完成 1.43 亿美元融资、估值达 15 亿美元,Atomico 与 Smash Capital 领投,BMW i Ventures、Datadog 参投,NVIDIA 为现有投资方;成立于 2023 年、已有约 1.7 万家客户、每周执行超 200 万次代码审查,正踩在"发现 AI 生成代码缺陷"需求走高的浪潮上。
Z Potentials
作者把上线仅三小时就拿下 31k star、且采用 MIT 协议的 DeepSeek Harness 代码做成可视化教程,带读者理解这套"壳"在大模型之外到底做了什么,也借此反思 harness 早已不只是工程化封装。
洛小山
腾讯把"广告精准推送里用户行为系统与用户画像系统多年无法融合"的老难题,拿到数据挖掘顶会 KDD 上以 600 万悬赏,向学术界公开求解。
赛博禅心
腾讯 WorkBuddy 上线远程控制功能,因国内直连,作者体感远程体验甚至优于 Codex,称其可能是当前国内能用到的最顺手的 Agent 产品。 <!-- ai-daily:complete -->
数字生命卡兹克