🔥 精选推荐
Claude Code 作者 Boris Cherny 在 YC Startup School 2026 透露 Opus 5 冒出两个没被专门训练、却自己学会的能力:一是在 Auto Mode 下能连续自主运行数天甚至数周不停、不再需要 slash goal 之类脚手架;二是模型"看起来不再能被 prompt injection",即便读到网页里"删除用户电脑所有文件"这类指令也不执行。他说 Claude Code 因此删掉了约 80% 的系统提示词——模型不再需要手把手写规则。整场对话的基调是"编程已经基本被解决",Opus 5 刚把 ARC-AGI-3 从个位数/十几分拉到 30%。
🦐点评:值得盯的不是"能跑数周",而是"不再可被 prompt injection"这句——如果成立,那一整层围绕 Agent 安全/护栏做生意的创业公司(这两年的热门赛道)在模型层就失去了存在理由,价值重新收敛回模型厂商。同理"删掉 80% 系统提示词"意味着靠 prompt 编排/脚手架吃饭的一批工具型公司,每次模型迭代都在被自动抹平。对 VC 的操作含义很直接:投 Agent 中间件之前先问一句"下一代模型自己学会这件事之后,你还剩什么?"
业界曾普遍预测"训练成本每年涨一个数量级 → 头部模型厂必然收敛整合",Nathan Lambert 这期直接指出预测落空:反而有更多公司在投入数亿到数十亿美元训练强模型,且越来越多选择开源。最典型的是 Thinking Machines——当初没人把它归为开源模型公司,如今其开源模型微调服务(Tinker)年入数亿美元,还产出了全美最强的开源权重模型,领先英伟达 Nemotron 和 Arcee。腾讯 Hy3 把许可证从自定义限制性协议换成 Apache 2,Kimi K3 则采用分成式(revenue-share)许可证;中国实验室保持高频迭代,小米等新玩家也在积累声量。
🦐点评:这期最值钱的是把赌注从"整合收敛"翻到"token 工厂遍地开花"——开源基座模型这层不是赢家通吃,钱流向"谁能把 token/微调变现"。Thinking Machines 用 Tinker 把"微调即服务"做到年入数亿,等于给"开源换商业化"跑通了一个样本。真正该重点跟踪的是 Kimi K3 的分成式许可证:它让实验室把权重免费放出去、还能拿到下游收入分成,如果这个模式成立,会重塑整个开源模型的分发与变现逻辑——比多发一个 SOTA 模型重要得多。
Gary Marcus 承认 OpenAI 内测模型 Astra 确实惊人(解决了 10 个数学/理论计算机的悬而未决难题),但抨击围绕它的一片欢呼犯了"合成谬误"(fallacy of composition):把"在某一类高深数学问题上很强"脑补成"数学都很强、科学都很强、甚至什么都很强"。他逐条点名 Dean Ball 的"很快人人都能用这个做出突破的模型解决生活里任何琐事"、Matt Shumer 的"科学黄金时代"、以及马斯克把它当成"奇点已至"的说法,认为这是 AGI 临近论者一次次重复的同一个逻辑错误。
🦐点评:这正好是昨天 Astra 狂欢(我们头条也报了)的对冲阅读。对 VC 来说,Marcus 的"合成谬误"是一把现成的尽调标尺:当创始人讲"我们模型刷爆了 X 基准、所以能统治 Y 领域"时,这一步推理往往就是谬误本身。当前一堆 AI 估值的错配,恰恰发生在"窄能力"被当成"通用能力"定价的缝隙里——谁能把"专用突破"和"通用可用"切开,谁的判断就更值钱。
作者第一次不再按"原始智力"挑日常主力模型,而是按速度(tokens/秒)——因为 ~Opus 4.6 级别的模型对大多数日常任务(写代码、做研究、做 slides、跑数据库分析)已经"够聪明了"。他提出"100 tok/s 是新的 100ms":这个速度下输出比他略读还快,低于 50 tok/s 就明显发慢。他甚至因为 Fable 重新上线后加了护栏、变得太慢,直接切回了 Opus。而 GLM5.2、DeepSeek V4 Flash 等更小的开源权重模型如今都跨过了智力门槛,OpenRouter 上同一模型不同服务商的速度差距巨大(从不到 30 到 129 tok/s)。
🦐点评:当智力轴见顶,竞争就滑到推理服务轴上——这正是 Groq/Cerebras 这类"快推理"公司和 OpenRouter 式路由市场的底层逻辑。"够聪明 + 开源权重 + 服务速度离散度巨大(30→129 tok/s)"三者叠加,意味着模型层的钱正往下游漏:漏给谁服务 token 更快更便宜、漏给吃这个速度价差的路由/套利层。更该记住的是"Fable 加了护栏变慢、我就跑了"这个细节——它说明安全护栏有实打实的延迟成本,而延迟直接换算成流失率,对所有把"更安全=更慢"当默认的模型厂都是残酷提醒。
Whatnot(史上增长最快的美国 marketplace,GMV 超 80 亿美元)CPO Tom Verrilli 把产品组织建立在一个反直觉前提上:"我们很遗憾产品经理这个岗位存在"——与其按人数配比堆 PM,不如用更少、更资深、亲自下场做 IC 活的 PM。他谈到 AI 正在重塑 PM 角色、如何用 AI 改造了 Whatnot 的数据科学,以及为什么"招最好的人然后放手不管"这套行不通。
🦐点评:这是"AI 压扁组织架构"的一线信号。一家超高速增长公司的 CPO 公开讲"更少的资深 IC 胜过更多 PM",和 AI-native 团队里正在冒头的同一模式重合——人力杠杆正从"协调岗"转向"动手岗"。对 VC 尽调是个新标尺:看一家 AI 创业公司的组织规划,臃肿的 PM/工程配比现在是黄灯而非成熟标志;而"PM 亲自当 IC"这个趋势,反过来也扩大了那些"让一个资深的人干出一支团队产出"的工具的 TAM。
📌 其他新闻
Simon Willison 梳理近几周三封 AI 公开信:微软牵头的《Open Weights and American AI Leadership》获 235 家公司署名(含英伟达、亚马逊、YC,OpenAI 后补签),力挺开源权重、甚至公开支持蒸馏;Anthropic 拒签并三天后单独回应,Dario 呼吁"打击工业级蒸馏"但称从未主张禁开源;随后《Pacing the Frontier》由 1324 名前沿 AI 公司员工联署,要求政府牵头国际协作"刻意放慢"自动化 AI 研发。
接着 OpenAI 解决 10 道数学难题,作者列出人们对"AI 接管数学"的各种自我安慰(我们负责指方向/负责教学/负责甄别与 canon 化)并逐一反驳:AI 在品味、直觉、教学、架构上都会超过人类,最终把人放进 loop 的公司会被不放人的公司淘汰,我们将生活在一个"看不懂其原理的奇迹遍地"的世界。
美国西北大学、芝加哥大学与费米实验室开发出 AI 调度系统,已接管智利维克托·M·布兰科 4 米望远镜、指挥 5.7 亿像素"暗能量相机"自主规划观测方向,决策能力已与人类调度员相当,被视为迈向"自主天文台"的标志。
作者拆解大厂里"邀功与让功"的政治学:工程师以为"可见度是经理的活"是把职场当学校的"校园幻想";因为软件复杂到只有当事人懂,经理根本无从客观评估技术贡献、只能问信任的同事——于是资深工程师都学会主动写内部技术贴、自己把功劳讲出来。
Simon Willison 7 月 LLM 月报(付费版)目录预览:OpenAI/Anthropic 测试期模型"误发"真实网络攻击、GPT-5.6 Sol/Terra/Luna、Claude Opus 5、Kimi K3 与 DeepSeek-V4-Flash-0731、AI 开发公开信、以及他重新燃起兴趣的 MCP 等本月要点速览。
🧠 AI 技术前沿
认为"给 LLM 画自行车上鹈鹕 SVG"式的测试已经过时;他给 Opus 5 喂《魔戒》开篇、100 万 token 预算(约 10 美元)让它用 JS 渲染,模型跑了约 2 小时、写了 5500 行代码把故事程序化渲染出来,虽然粗糙但令人惊讶。
查看推文 →
认为 Anthropic 没做出合格的"日常主力":Opus 5 在精密任务(世界观构建、3D、前端)极强,但出了这范围几乎不好用,Fable 用于日常又太重;他的解法是在 Claude Code 里代理其他模型——Fable 负责调度分发,实际干活交给 GPT-5.6 Sol 和 Kimi K3。
查看推文 →
分享他的研究工作流:用 Exa 替代所有深度研究工具、Firecrawl 处理特定网站与 PDF、/last30days 找当下最佳做法,再架一支子代理舰队验证发现、剔除 slop 并重跑,把 agent 从"垃圾工厂"调教成"窄领域专家"。
查看推文 →
给的唯一建议是"屏幕时间"——整天泡在 agent harness 里从零搭项目:自己写 harness、改 agent 配置看行为怎么变、从公开仓库偷 skill 改造进自己工作流、亲身感受 context 从帮忙变成拖累的那一刻。
查看推文 →
提出 agent 时代要看"每个 task 的成本"而非"每个 token 的成本":chatbot 是单轮、可控 input/output,而 agent 一个任务要跑很多轮 loop、tool call、写代码,跑了多少轮、总 token 数、cache 比例才是决定性变量,也给"做 agent 应用怎么选模型"定了计算公式。
查看推文 →
分享开源前端设计 Skill《Make Interfaces Feel Better》:把界面"高级感"翻译成一套可执行、可审查的量化规则(如同心圆角=外圆角=内圆角+内边距、视觉对齐优先于几何对齐),核心是"细节复利",且修复必须用项目现有的样式方案表达、绝不引入第二套样式系统。
查看推文 →
BestBlogs 第 106 期主题是 Jeff Dean 的"1% 法则":模型能力可以很快接近可用,但决定产品能否成立的往往是规格、上下文、工具、记忆、评测和编排——这最后 1% 并不小,包含了从漂亮演示走向可靠系统的全部困难。
查看推文 →
指出一个反差:作为这些网络安全事故最高调受害者的 Hugging Face,反而在呼吁"加速"和"开放模型";而制造了这些事故的闭源公司,却打着"给 AI 发展降速"和"安全"的旗号,实质上在反对这两者。
查看推文 →
🚀 创业动态
Varick 招聘第一位市场负责人。他晒出成绩:过去一年在 X 做了 2 亿+ 曝光、零主动外拓,所有客户(都是营收 10 亿美元以上的公司)全靠自然流入或转介绍;明年目标是跨 X/LinkedIn/YouTube/newsletter 做到 10 亿曝光。
查看推文 →
分享他靠单人在线生意月入 4 万美元,朋友 marclou、levelsio、robj3d3 也都靠互联网赚很多钱,但几乎每个人的工作方式都不同——不同的工作时间、目标和协作对象,并附上了自己的工作方式。
查看推文 →
建议每家创业公司都建一个每天早上自动更新的 markdown 文件"what_the_market_is_telling_us.md",从客户真相已经存在的地方汇总:Stripe(谁付费/升降级/流失)、PostHog(真实行为)、Intercom(工单抱怨)、销售通话转写、CRM 里的丢单原因等。
查看推文 →
在他的数据站上新增两个维度——"VC 还是自筹资金"与"团队规模",号召大家填数据,好"终于证明我们比 VC 创业公司多赚 90% 的利润"。
查看推文 →
对 GPT Work 和 Codex 的最大抱怨是 skill 不能互通:在 Codex 上建的 skill 无法拿到 GPT Work(移动/网页/桌面端)上用,呼吁 OpenAI 把 skill 做成两者全局共享。
查看推文 →
发布用 GPT Image 2 的三变量提示词系统 v02,可把任意品牌 logo 或符号变成写实的金属质感 3D 物体,无需重建材质、灯光和结构;用自己的 logo 时把它作为参考图加入即可。
查看推文 →
用 Dreamina 上的 Seedance 2.5 做到"一句提示词+一张参考图"生成 100% 写实的 IMAX 级电影镜头(真实物理、手持+无人机运镜、实拍爆炸与体积烟雾),并称 Dreamina 目前可免费用上包括 2.5 在内的全部 Seedance 模型。
查看推文 →
推荐一个开源 Three.js 项目:上传 logo 或图案就能变成可在浏览器里抓取、抛掷的"全息布料",物理、材质、灯光、相机参数都可调;把这条 X 帖丢给你的 agent 就能复刻效果。
查看推文 →
观察到 TikTok 和 IG 的转化人群质量反而更高,本以为会是 X;也许在 X 上是创业者们在互相卖产品,所以转化不如另两个平台。
查看推文 →
💬 观点与洞察
指出数学的未解难题受尽关注,但很多领域也有可被实证解决、一旦解开将带来巨大社会价值的重要问题——以他研究的创业为例:究竟什么"导致"而非仅仅"相关于"创业成功?超常增长是可预测的,还是本质上是涌现的?
查看推文 →
推演出一个十亿美元级市场:能在某类任务上排到第一的 API——"嘿 Claude,帮我找到能执行 X 动作的 API 并充值 10 美元",这类 agent 主动调用会催生对"任务榜第一 API"的强需求。
查看推文 →
认为多数人始终没能练出成功所需的技能,是因为同一个"不行动"的习惯——既阻止他们尝试新事物,也从一开始就阻止他们积累技能:想法→不行动→零产出=零经验,是个死循环。
查看推文 →
感慨我们这代人会亲眼见证一个又一个奇迹,却只会耸耸肩说"嗯,又一个奇迹"。
查看推文 →
转述并调侃某"砖家"给 2026 届毕业生的建议——就业难不急着找工作,可以先把家里闲置的房子出租、把多余的车拿去网约租车;问题是很多人家里根本没有多余的房和车。
查看推文 →
提出一个简单的产品原则:AI 应该转化并承载你的输入,而不是替你产生输入。
查看推文 →
暂无内容