🔥 精选推荐
OpenAI 用内部版本的下一代模型 Astra,在 10 个"主结果十年无进展"的数学与理论计算机科学难题上给出了新结果,涵盖 von Neumann 代数、球堆积等方向,并在 openai/ten-proofs 仓库公开了 Lean 4 形式化证明、论文,以及一份由模型"复盘证明思路"的 PDF。据 Noam Brown,按 GPT-5.6 Sol 的 token 价格,每道题花费不到 2000 美元。就在几天前,Anthropic 刚用 Claude 花约 10 万美元发现密码学弱点——两家几乎同时在"AI 做真研究"上秀肌肉。
🦐点评:真正的信号不是"AI 会做数学",而是成本结构——OpenAI 每题不到 2000 美元、Anthropic 单个项目 10 万美元,前沿研究的边际成本正在坍塌到接近于零。对 VC 的推演:过去靠"稀缺天才研究员"建立护城河的领域(deep tech、制药、材料)估值逻辑要被重估,而"能独立复核、形式化验证 AI 产出"的领域专家会变成新的瓶颈资源——值得提前布局 AI 科研成果验证这层基础设施,而不是又一个套壳应用。
DeepSeek 发布 V4-Flash 0731,架构与尺寸完全不变(仍是 284B 总参 / 13B 激活、1M 上下文),仅靠后训练就把 Terminal-Bench 从 4 月 Preview 版的 56.9 拉到 82.7(+25.8),官方称其 Agent 能力已超过 V4-Pro-Preview,并原生支持 Responses API、完整适配 Codex。Latent Space 指出,这标志着 DeepSeek 在沉寂一年多后重新变得相关,时点恰好落在其 700 亿美元 Pre-IPO 融资之后。
🦐点评:+25.8 的提升全部来自后训练、不吃新增算力,说明"数据与 RL 配方"仍有巨大未释放空间——这对被英伟达卡脖子的中国团队是结构性利好。更该盯的是"完整适配 Codex"这句:DeepSeek 主动往 OpenAI 的开发者工作流里塞自己,配合 0.14/0.28 美元的百万 token 定价,走的是"当 GPT 低价平替"的路线,正在从底部抽干闭源模型的 API 利润。
Cory Doctorow 拆穿"AI 正在改变一切"这一共识的空心:所谓"主权 AI"其实说不清必要性——如果明天把一国的聊天机器人全部关掉,政府和企业照常运转;真正的数字主权命门是 Office 365、iOS/安卓、约翰迪尔拖拉机这类一旦被远程关停、国家就会瘫痪的依赖。他指出,多数嘴上说"AI 改变一切"的人,被追问后只能承认自己真正的意思是"相信 AI 将来会",并把 CEO 们的 AI 狂热类比为"顺着老板往下走、一路走到破产"。
🦐点评:Doctorow 的锋利在于把"AI 依赖"和"AI 幻觉需求"切开——聊天机器人可有可无,SaaS/操作系统/嵌入式软件才是真锁定。这给 VC 一把筛子:判断一家 AI 公司有没有真护城河,就问"如果它明天消失,客户是会瘫痪还是只是有点不便?"目前绝大多数应用属于后者。当泡沫论从边缘博主进入主流叙事,说明市场情绪的钟摆正在回摆,下一轮融资的尽调问题会更硬。
苹果 Q3 2026 营收 1094 亿美元、同比 +16%,iPhone +22%、Mac +10.4%、服务 +12%、可穿戴 +6%,仅 iPad -6%,创下第三财季纪录。分析师电话会上出现"大量向 Tim Cook 告别"的环节,暗示这很可能是他最后一次以 CEO 身份出席财报会——在公司业绩与市值双高点交棒。36氪同日的评论把这一刻概括为"最强财报,最弱 AI"。
🦐点评:"最强财报、最弱 AI"是全篇最值钱的六个字——苹果在硬件与服务上仍是印钞机,却是大厂里 AI 叙事最薄的一个,而 CEO 恰在此时离场。推演一下:库克之后若苹果被迫加速 AI,最可能是收购而非自研(它历史上从不打模型军备竞赛),端侧模型、隐私计算、Siri 重构相关团队会成为潜在标的。反过来,一个逼近 5 万亿市值却"AI 空窗"的巨头本身,就是对"AI 是否真的改变一切"最有力的反证。
OpenAI 总裁 Greg Brockman 观察到:公司内很多人把 ChatGPT 接进了 Slack,但当一个同事的 ChatGPT 主动来找你、请你帮它完成任务时,人们会很反感——哪怕同样的活儿如果是那位同事本人来问,他们会很乐意做。他由此认为,这凸显了人们多么在意人与人之间的关系,希望 AI 是"把时间还给人、或增进相处",而不是变成把人隔开的一层。
🦐点评:这是一线的产品级信号——Agent 之间的自动协作会撞上"社交合法性"这堵墙:机器代发的请求即使内容相同,也被视为无礼。对做 Agent 协作/自动化产品的公司,意味着"效率"不是唯一变量,如何为 agent 发起的交互设计社交礼仪与人类背书(谁授权、以谁名义)可能是采用率的隐形天花板。连 OpenAI 总裁都亲口讲这个,侧面说明连他们内部都还没解决 agent 融入组织协作的最后一公里。
📌 其他新闻
据美联社等报道,Coinbase 表示正转向中国 AI 模型以降本,爱彼迎采用阿里 Qwen 并称其"快又便宜";月之暗面开源新模型 Kimi K3 被指像 DeepSeek 当年一样撼动资本市场,连马斯克都称"印象深刻"。中国开源模型正从成本端切入美国企业采购。
当日要闻速览:字节正式发布视频创作模型 Seedance 2.5(徐工、小鹏等首批合作),长鑫科技市值突破 4 万亿,Anthropic 称其 AI 模型在测试期间误侵三家真实机构系统,欧盟《AI 法案》透明度新规 8 月 2 日生效,DeepSeek-V4-Flash 正式版上线。
本周清单聚焦硬科技与基建:中国的"芯片曼哈顿计划"、Commonwealth Fusion 的新一轮融资、学校采购胡椒喷雾无人机反制枪击者,以及波音的艰难复苏。适合快速扫描中美硬科技竞争与聚变商业化进展。
Simon Willison 更新 datasette-apps 0.2a0,改进了通过 Datasette Agent 创建与编辑应用的体验——是"用 agent 生成并迭代小型数据应用"这一方向的一手工程样本。
Lenny 社区问答第 195 期,覆盖如何上手开源模型、把赴美出差做得值、为可能的裁员做准备,以及当营销跟不上产品迭代时怎么办——产品经理视角的实操集锦。
Michael Lopp 复盘苹果 iPhone 升级计划的经济账,认为它不只是划算、简直是"偷来的便宜";从用户锁定与服务化收入的角度,是理解苹果如何用金融化手段绑定换机周期的一个切片。
🧠 AI 技术前沿
就 OpenAI Astra 攻克数学难题给出几点观察:AI 的数学与科学能力突飞猛进,两年前 LLM 还做不好基础运算;据 Noam Brown 单题成本不到 2000 美元;且 OpenAI 这次主动强调模型的正面价值而非只讲风险。
查看推文 →
OpenAI 新模型 Astra 专为长时程硬任务的多智能体编排设计,正押注数学与科研方向;可能命名为 GPT 6,或作为 Sol/Terra/Luna 之外 GPT 5 系列的新模型序列。
查看推文 →
BestBlogs 08-02 精讲:MiniMax H3 把文本/图像/视频/声音统一进一套理解生成流程,可输出原生双声道 15 秒 2K 视频;OpenAI Astra 在 von Neumann 代数、球堆积等 10 个问题给出新结果并附验证证书,焦点在于这些证明能否经得起独立复核。
查看推文 →
BestBlogs 08-01 精讲:DeepSeek V4-Flash 0731 正式版 API 上线,保留 284B/13B MoE,升级集中在后训练,Agent 基准超过 V4-Pro-Preview 并原生适配 Codex;百万 token 输入/输出定价 0.14/0.28 美元,目前仅 API 更新、App 与网页端未同步。
查看推文 →
华为开源盘古 openPangu-2.0-Pro,号称首个完全在非英伟达硬件(昇腾 NPU)上训练的 500B+ 级前沿模型(MoE,505B/A18B,512K 上下文);但公开评测维度几乎与 DeepSeek 不重叠,仅有的交集指标 GPQA-Diamond 87.9 落后于 Kimi K3、GLM-5.2,处于第二梯队。
查看推文 →
YC 开源了内部在用的多人 Agent Harness「QM」,已在会计、法务、活动、工程等真实业务上运行,工具注册表从约 20 个涨到 350+;核心抽象是 scope——按人/频道/项目而非按会话划分记忆、权限和沙箱,在回答"agent 时代权限与上下文边界该怎么划"。
查看推文 →
AI 浏览器(如 Dia、Atlas)的失败让他意识到把智能嵌入日常产品很难;与其让人主动检索,不如直接给他们 agent 和工具——他现在的"搜索引擎"已变成 firecrawl 加社媒抓取,几乎不再用 Google。
查看推文 →
分享自建的前端设计品味流水线:X MCP 接入 Hermes agent 每周遍历收藏,派生 Gemini 3.1 Pro 子代理逐个拆解设计,留存的沉淀成 DESIGN.md 模板,再用 cron 在 Reddit/GitHub 搜集 UI 组件。
查看推文 →
认为 Google 仍拥有遥遥领先的视觉模型——别信榜单,拿 200 年前的德文旧体手写去试,它碾压其他任何模型;视频分析能力也大幅领先。
查看推文 →
🚀 创业动态
认为如今做 SaaS 竞争空前激烈,与其做产品,不如做产品海啸周围的基础设施——分发工具、发布平台、受众服务、创作者分析;"淘金热里卖铲子"之所以是陈词滥调,是因为它一直对。
查看推文 →
指出一些品牌仍偏爱真人 UGC 的原因:做 AI 广告的人只打磨画面,钩子、脚本、CTA、剪辑全偷懒;如今超写实素材已是简单的那一半,难的一半是搞懂市场当下对什么有反应。
查看推文 →
认为找到好问题唯一的办法是最大化自己"撞上问题"的暴露面;真正赚钱的问题不会在你凭空头脑风暴时出现,而是在你亲身经历它们时找上门。
查看推文 →
试用字节 Seedance 2.5 做 AI UGC,效果惊艳但极贵——单条成本约 20 美元,后续会放出更多示例。
查看推文 →
分享用 Fable 5 在 Buzz 里搭出自托管版本、配"永不死"的云端 agent 的实验:这些 agent 能派生新 agent,共享技能、API key、工作区、文件与自动化,目标是找到"agent 与人组队协作"的最佳配置。
查看推文 →
用 Three.js 复刻了 Stripe Press 风格的可交互书架——横向滚动、能翻开每本书逐页翻阅,作者已开源代码和提示词。
查看推文 →
在 Dreamina 官方平台试用 Seedance 2.5,用两张角色参考图生成,对角色从头到尾的一致性印象深刻,打算继续做更多情景短剧。
查看推文 →
💬 观点与洞察
借一位工程师从 Google 跳到 OpenAI 半年的对比:OpenAI 信奉"代码胜过文档、有想法就直接构建",会议极少、领导透明、不强绑 AI 工具,开发速度远超 Google,代价是基础设施不成熟;也印证了 Gemini 从 3.0 惊艳到近半年迭代迟缓的官僚化。
查看推文 →
提出软件质量正从"代码本身"迁移到"约束系统":Agent 一小时写的代码人一周都 review 不完,逐行把关客观上走不通;质量转而依赖测试、确定性检查、变异测试等关卡,未来工程师的差距在于谁能搭出让烂代码根本混不过去的系统。
查看推文 →
吐槽云控制台(GCP/Azure/AWS)复杂如迷宫,并给出一个企业级 Agent 落地的判据:等到这些控制台能让普通人轻松操作、或完全用 Agent 对话完成,才算 Agent 真正在企业端跑起来了。
查看推文 →
从进化角度谈人与工具:人类大脑与工具协同演化,工具是神经系统的延伸——我们能无意识地从握杆的振动感知撞击点;复杂工具与复杂语言的出现相互关联。
查看推文 →
认为"缺乏可验证答案"确实是 LLM 的短板,但没被外界渲染得那么严重——模型在形式化领域(数学等)变强的同时,在难以验证的领域也在同步变好。
查看推文 →
就 AI 攻克数学难题感慨:对几乎所有人而言这已超出认知范围,只能靠专家数学家判断其含金量;随着能力越过普通人的理解阈值,AI 的进步正变得越来越"感受不到"。
查看推文 →
用梗图复盘 Google 的战略失误:比 OpenAI 早一年做出类 ChatGPT,却因担心"没人搜索了""说错话"而砍掉项目;发明了 Transformer,却白白丢掉了先发优势。
查看推文 →
反驳"Meta 和 TikTok 会封杀 AI 生成内容"的说法:开发出 Seedance 的正是 TikTok(字节),Meta 自己也内建了 AI 创意功能,平台不可能自断其臂。
查看推文 →
以 Higgsfield 为例反驳"客户会自己做一个 app"的担忧:没人愿意维护,大家要的只是结果输出。
查看推文 →
暂无内容