🔥 精选推荐
Thinky 联合创始人 Lilian Weng 发布长文《Harness Engineering for Self-Improvement》,把"harness 工程"与递归自我改进(RSI)直接挂钩,单条推文两天内 40 万+浏览。她的核心判断是:即便许多 harness 改进最终会被内化进核心模型,"指定目标与上下文"的需求也不会消失。文章梳理了当前已被验证的 harness 设计范式,并回顾了从 ACE 论文到 Meta-Harness 的优化文献。AINews 认为这延续了连 Greg Brockman 都在悄悄背书 agent/harness 工程的趋势。
🦐点评:harness 正从"模型套壳"升格为独立技术栈和投资标的——当 Lilian Weng 这样的 neolab 创始人把它和 RSI 绑定,意味着"谁能把自动化研究的 harness 做深"可能比"谁的基座模型强 0.5 分"更决定下一轮护城河;对早期基金,值得盯的是做 harness 优化、自动实验编排的公司,而不是又一个套壳 Agent。
Modal 刚完成 3.55 亿美元 C 轮融资,CTO Akshat Bubna 复盘了"Agent Experience"(AX)为什么现在跑通了。核心论点:旧的云基础设施是为"能读文档、会推理 YAML、看 dashboard"的人类开发者设计的,缺失的上下文由人脑补齐;但 Agent 没有这种能力,它需要能写代码、跑代码、检查输出、改环境、调试重试的紧密反馈闭环。sandbox(隔离沙箱)是这一转变最清晰的体现,Agent 可以随时拉起隔离环境做"编程式基础设施"。
🦐点评:3.55 亿美元 C 轮的估值逻辑不是"又一个 Serverless",而是赌"Agent 才是云的下一个主要用户"——AX 一旦成立,面向人类的 DX 产品就要被重做一遍,dashboard、docs、错误提示全得变成机器可消费的接口;对基金而言,"给 Agent 用的云/sandbox/环境层"是比应用层 Agent 更靠底、更难被套壳颠覆的一层。
NVIDIA 在 Hugging Face 撰文,主张 agentic AI 的瓶颈不是模型权重而是数据,合成数据是规模化的关键路径。真实世界不像 benchmark,一个无法从 API 报错或没见过的 workflow 里恢复的 Agent"只是带工具的自动补全"。跨过这道坎所需的数据包括:软件工程轨迹、工具调用失败案例、多步推理、检索、安全、用户模拟、workflow 执行,乃至最终的物理世界交互——这正是 NVIDIA Nemotron 开放数据产品覆盖的范围。
🦐点评:NVIDIA 亲自下场做"Agent 训练数据"的开放产品,信号是它想把护城河从 GPU 往上延伸到数据与后训练层——这对 Mercor、Surge 这类专家数据公司既是背书也是威胁;对投资人真正的问题是"合成数据能否替代人工标注的专家数据",若能,Mercor 们 60-70% 分给承包商的成本结构会被直接冲击。
"不是模型,是 harness"这句话人人在说,却很少有人讲清 harness 到底是什么。Lenny 播客请 ChatPRD 的 Claire Vo 现场用 Claude Agent SDK 搭了一个 Sentry bug 排查 harness:她用 Ink 做终端 UI,为 Sentry/Linear/GitHub/Vercel 写了专用适配器,让 harness 自动完成取证、根因分析和后续工件生成。她还拆解了每个 harness 必备的三个组件,以及何时该搭 harness、何时用 Claude Code/Codex 这类通用工具就够。
🦐点评:值得注意的是 Claire Vo 是产品负责人而非基础设施工程师,却能自己搭出生产级 harness——这把"谁能构建 Agent 自动化"的门槛从 ML 团队下放到了懂业务的 PM,等于给每个 SaaS 公司内部的重复工作流都装上了可被 Agent 接管的接口;这类"把 harness 做成公司内部资产"的趋势,最终受益的是 Agent SDK/框架层,而非单点 Agent 应用。
📌 其他新闻
OpenAI 发布新一代语音模型 GPT-Live 并接入 ChatGPT Voice,主打更自然的实时人机对话——可边听边说、把推理与搜索交给后台前沿模型处理。
OpenAI 系统阐述其政府与国家安全合作原则,强调负责任使用、民主问责与公共安全,为进入政府与国防市场铺路。
Hugging Face 让 transformers 的 vLLM 后端在多数架构上达到甚至超过定制 vLLM 实现的速度,模型作者无需额外工作即可免费获得极速 vLLM 推理。
据 InfoQ 报道,DeepSeek 被曝一年前已启动自研 AI 推理芯片,目前正对接晶圆代工与存储厂商;若属实,将是中国大模型公司向下游算力自主延伸的重要信号。
36 氪实测数十款 AI 视频工具后横评 6 款主流产品,认为 2026 年 AI 视频已从"能用"迈入分钟级连贯叙事的成熟竞速期,Seedance 2.0 成出圈代表。
智源发布悟界·Orca 世界模型,主张先让模型理解世界如何变化再去执行操作,登上 Hugging Face 论文月榜第一。
Ben Thompson 以微软 Xbox 大裁员和 Game Pass 战略失败为切口,分析互联网对"捆绑"的溶解作用,以及交易成本、协调成本与沉没成本之间的关系。
🧠 AI 技术前沿
Cursor 宣布与 SpaceXAI 合作训练出 Grok 4.5,称这是其迄今最强模型,也是第一个不只面向软件工程的模型。
查看推文 →
Grok 4.5 极其便宜:以约 Opus 25% 的价格提供前沿智能水平,仅略高于中国开源模型的价格区间,作者称从未对 Grok 这么惊艳。
查看推文 →
OpenAI 新发布的 GPT-Live 修复了旧版语音模式的多个痛点:可边听边说、更好的话轮切换、把推理/搜索/规划放到后台处理、边推理边说话;OpenAI 本就领先,这代差距会更大。
查看推文 →
抢先体验新版 GPT 语音后表示效果很好、更接近科幻电影里与 AI 对话的感觉(因为模型更聪明了),加上 Claude Tag,预示与 AI 协作的新模式正在出现。
查看推文 →
认为 GPT 语音发布与 Thinking Machines 的思路很像:实时语音模型带有可在后台调用工具的交互层,你说话时它能在后台并行做事,不必等它完成。
查看推文 →
LingBot-World 2.0(Infinity)登陆 Hugging Face:可交互世界模型,支持长达一小时、零画质漂移的生成,含攻击/施法/召唤风暴等丰富动作,由 Director Agent 驱动实时世界演化,720p/60fps,像游戏一样可玩。
查看推文 →
LingBot-Video 发布:面向具身智能的 MoE 视频基础模型,300 亿参数、推理时仅激活 30 亿,在大规模互联网视频预训练之上追加了 7 万小时具身数据。
查看推文 →
RynnWorld-4D 发布:面向机器人操作的 4D 具身世界模型。
查看推文 →
整理 Claude 官方分享的两种多智能体模式 Advisor 与 Orchestrator;实测 SWE-bench Pro 上 Sonnet 5 单独约 75.5%/$0.75,Fable 5 单独约 91.5%/$2.25,而 Sonnet 5 + Fable 顾问的组合方案以约 63% 的成本拿到约 84%(接近 Fable 单独九成)的表现。
查看推文 →
Claude Code 新增 /checkup 命令:清理无用 skills/MCP/插件省上下文、去重 CLAUDE.md、拆分嵌套 CLAUDE.md、关闭慢 hook、升级版本、默认开启 auto 模式、预批高频只读命令等,执行前会先与你确认。
查看推文 →
OpenAI 据传正在打磨 GPT-6,计划几周后发布。
查看推文 →
常用 Pinokio 下载并运行本地开源 AI 工具/模型,它能无缝暴露给 Code 和 Codex;GPT-5.6 曾自行发现他本地的视频和图像模型,把它们当作付费 API 的廉价替代来用。
查看推文 →
🚀 创业动态
认为史上第一次会出现"顶级模型坐进最好的 harness 里"——用 GPT-5.6 Sol 和 Fable 5 就能规划、编排并执行任何项目;呼吁尽可能多囤 Claude/ChatGPT 订阅去撬动这波杠杆。
查看推文 →
称这是又一次 Fable/ChatGPT 时刻,只是这次是自己每天(连在日本旅行时)都在跑 agent 的 app;Codex 慷慨、Sol 便宜,终于能解决过去太贵或太耗时的问题。
查看推文 →
提前几周测试了 5.6,评价很高:Codex 无论写代码还是非编码任务都变得有趣了 3 倍,正式发布后会做视频细讲。
查看推文 →
介绍面向"一人公司"的开源 Agent Skills 库 OPC Skills:10 个技能分 4 类、累计安装 51K+,覆盖市场调研、数据采集、设计生产等,如 requesthunt 从 Reddit/X/GitHub 等抓真实用户反馈生成需求报告。
查看推文 →
分享 3 个能帮你省 token 的 Claude Code 插件。
查看推文 →
认为 2026 年是语音 Agent 终于变好用的一年。
查看推文 →
Thumio 又上新功能:用户现在可搜索数百万图片素材并直接加入自己的缩略图。
查看推文 →
分享一套 Serverless 文档处理流水线(ADE + Lambda + S3):把 ADE 提取能力装进 Lambda 容器、由 S3 上传事件触发,纯 AWS 原生,支持 Parse(喂 RAG)与 Extract(Pydantic schema 落库)两种模式。
查看推文 →
推销一个把历史 AI 会话变成"alpha"的 prompt 流程:excavate 找出所有会话存档、distill 提炼成一份证据文件、interview 用五个问题促你自省、最终勾勒出"你是谁"。
查看推文 →
💬 观点与洞察
原本不看好语音模型,试了这款后改观:非常逼真甚至有点瘆人,最酷的是能极快联网搜索、擅长调工具;预测很快就能靠对话完成收发邮件、查业务数据、安排会议等几乎一切事。
查看推文 →
GPT-5.6 Sol 周四发布,他只关心一件事:OpenAI 是否终于攻克了写作和"审美品味"——这东西没法靠 harness 打补丁,模型要么有要么没有,而 ChatGPT 的写作已近一年没有实质进步。
查看推文 →
感慨如今就像当年互联网刚出现时的困惑——你手握全世界的数据,却不知道该拿它做什么。
查看推文 →
劝想做内容的人看多 YouTube:短视频正在归零,因为 AI 已经把它解决了,只是很多人还没意识到。
查看推文 →
对世界模型很兴奋,设想把它用到体育行业——用数据驱动的比赛瞬间模拟替代教练在白板上画战术、按运动员表现做个性化指导;同时惋惜曾是他主力平台的 LTX Studio 转型。
查看推文 →
BestBlogs 7-9 早报聚焦 GPT-Live / Grok 4.5 / 本地模型编程 / Agentic Coding / AI Harness;指出 Grok 4.5 的重点是训练目标从纯软件工程扩展到数据科学、金融、法律等更宽的知识工作。
查看推文 →
调侃 OpenAI 挑了最糟的时间发关于 SWE-bench Pro 的博文——就在 Grok 4.5 于该基准上碾压 GPT-5.5 之后。
查看推文 →
🔥 精选推荐
一个反直觉的数据:整个企业市场花在开源模型上的 LLM 支出占比,过去一年从 19% 降到了 11%,而 Decagon 自己 90% 的生产流量却已跑在开源模型上。Decagon CEO Jesse Zhang 给出的框架是——未来不是"开源取代闭源",而是分工:前沿模型负责 Discovery(探索),开源模型负责 Production(生产)。企业做新 AI 产品时不知道 Agent 该长什么样、workflow 怎么设计,需要最聪明的闭源模型;等产品成熟、评测完善、数据变多,再迁移到"小而快、可微调"的开源模型。Decagon 用开源不是为省钱,而是因为客服 Agent 延迟决定生死,而前沿公司不让你按需微调它们最强的模型。
🦐点评:这解释了闭源 API 的付费池为何还在扩大——多数企业仍卡在"探索期",真正迁移到开源要等 workflow 冻结之后;对投资人这意味着两件事:一是前沿模型的企业收入短期不会被开源侵蚀,二是真正的机会在"帮企业从探索走向生产"的蒸馏/微调/推理工具链,谁能把这条迁移路径做成开箱即用,谁就吃到开源放量的红利。
Momenta 港股上市市值超 700 亿港元,2025 年收入超 24 亿元、毛利超 17 亿元,城区 NOA 市占率约 65% 超越华为登顶。曹旭东判断高阶辅助驾驶的竞争 2026 年就会结束,中国最终大概率剩 2-3 家、全球 3-4 家(不含车企自研),而 Momenta 与华为两家份额相加已超 90%。他已停止接高速 NOA 新定点,认为有了城区能力后高速只是产品设置问题。下一个十年,他把"数据驱动"的方法论迁移到具身智能与物理 AI。
🦐点评:第三方智驾赛道的终局正在收敛,这对一级市场几乎是"关门信号"——当头部两家吃掉 90%,再投智驾算法公司的窗口已经关闭;更值得跟的是曹旭东"善战者无赫赫之功"的打法本身:十年前押"数据驱动"是非共识,如今押具身/物理 AI 同样非共识,若方法论可迁移,Momenta 会是中国具身赛道里最不该被忽视的老玩家。
成立仅三年的 Mercor,6 月毛收入年化已跑赢 20 亿美元,是年初的两倍,增长来自 AI 应用开发者和财富 500 强对"构建/微调模型"的数据需求。公司按小时向物理、金融等领域的专家承包商付费,由他们回答问题、生产训练数据。据 The Information,Mercor 把 60%-70% 的营收分给承包商,推算净收入约 6-8 亿美元,且已在自由现金流层面盈利;对手 Handshake 年初毛年化收入也做到了 10 亿美元。
🦐点评:ARR 半年翻倍说明前沿实验室对"高质量专家数据"的军备竞赛还在加速,Mercor 是这轮最典型的"卖水人";但 60-70% 营收要分给承包商,它的毛利结构本质更像高端人力外包而非软件公司,用 SaaS 倍数给它估值需要打个问号——真正的变量是 NVIDIA 今天下场做开放合成数据(见 RSS)后,人工专家数据还能独占多久。
华为诺亚智驾方向首位天才少年钟元鑫(97 年生、清华+密歇根、Waymo/苹果 Vision Pro 实习经历)2025 年底离职,联合创立日冕(Rimbot)。他判断通用大模型离操控物理世界还很远,具身智能必须独立做基座模型。日冕核心架构 LaMPA 延伸自 LeCun 的 JEPA 体系,加入 Mask 机制和 Block Diffusion,在隐空间做"完形填空"式预测,实测推理比纯自回归快约 10 倍。配套的 E-E-E 表征体系能把不同灵巧手、不同触觉传感器乃至人手视频编码进同一空间混训,数据已达上亿帧、约 90% 为异构人手数据。
🦐点评:这是"具身要不要独立做基座"这场路线之争里旗帜鲜明的一方——押 JEPA/世界模型、赌数据效率,而不是等通用大模型下沉到机器人;与 Meta/LeCun 同源意味着世界模型正从论文走向创业公司基座层,对基金真正要赌的是"谁的数据效率先跑通",以及人手视频这类廉价异构数据能否替代昂贵的真机数据。
📌 其他值得看
马斯克晒 Optimus 量产线照片带动拓普涨停站上千亿;晚点复盘拓普十年换四套估值体系(周期股→成长股→Tier 0.5 平台→机器人期权),如今机器人执行器业务全年收入仅 1359 万元、占营收 0.05%,动态 PE 却仍站上 40 倍。
法律 AI 公司 Norm 完成 1.2 亿美元融资、估值 12 亿美元,Khosla 领投,Blackstone/Bain/Coatue 参投;不同于卖软件给律所,它自建律所 Norm Law 直接向客户提供 AI 法律服务,并按结果而非工时收费。
前 OpenAI 研究员 Phil Chen 的 agent 原生公司面试不再考 Leetcode,改测三件事:多快看懂陌生环境、能否识别"哪个问题值得解"、能否在约束下解掉;他判断"凡是能写出评分标准的事 AI 都会越来越强",稀缺的是挑问题的品味和用更小代价解好的能力。
作者把自己让 Codex 调用 GPT-Image 2.0 生成社媒配图的提示词打磨成正式开源 Skill(guizang-material-illustration),主打干净白底、克制的 3D 材质、中文标签直接印图,解决写文章/周报/PPT 的配图痛点。 <!-- ai-daily:complete -->