🔥 精选推荐

一篇突破当日头条的论文:研究者发现所有前沿厂商的 API 都存在同一个漏洞,可以把 Claude/GPT/Gemini "加密"的隐藏推理链解码出来,并验证还原出的 token 数与账单里的 thinking token 1:1 对得上。手法是把一个合法的签名推理块"重放"给同厂商的更弱模型(如 Claude → Haiku 4.5),再提示它把附带的推理"抄写"出来。危害有两层:一是能把前沿模型的推理蒸馏进开源/更弱模型;二是隐私泄露——对约 7000 条公开分享的 trace 扫描,翻出 62 个 API key、33 个邮箱、33 个密码,其中 64 项只藏在推理块里、在可见会话中根本看不到。漏洞已负责任披露、部分修复,但"关掉 thinking、改用一个 deep_think 工具"的绕过思路说明很难根治。
🦐点评:推理模型厂商这两年赖以自保的护城河——把 CoT 加密以防蒸馏——被证明是漏的,一旦前沿推理能被提取、平移到更弱或开源模型上,"闭源推理"的溢价就会被稀释,利好长期被指控搞蒸馏的开源阵营(尤其中国实验室),利空任何把某家实验室估值建立在"推理保密"之上的人。真正可操作的二阶信号是那条隐私链:把"分享你的 Claude Code 会话"变成了数据外泄通道,这是一个具体的、给企业安全产品的切入楔子——谁能做"agent 会话脱敏/审计",谁就吃到了这波恐慌。
latent.space
Nathan Lambert 抛出一个来自前沿内部的逆向信号:模型在编程和数学上已经超人,却在长篇非虚构写作上停滞——如今公认"写得好"的模型(GPT-4.5、Kimi K2)反而是老模型。他刚写完一本 RLHF 教材(用 LLM 做 LaTeX、文字校对和画图,但正文自己写),结论是模型在长篇技术写作里"增加熵":单句能对,但整章就会组织混乱、还随手塞进概念错误。他的核心论点是:组织知识本身是一种压缩,压缩是产生洞见的前提;如果模型连把已成型的科学清晰讲出来都做不到,指望它自主解决开放科学问题就为时过早。他仍然乐观,但认为近期 AI 对科学的贡献是"摘低垂果实 + 连接远距离领域",而非革命性洞见。
🦐点评:对任何在给"AI 科学家/自主发现"叙事定价的人,这是一记来自前沿内部的现实校准——瓶颈不是算力也不是某个 benchmark,而是写作/组织缺乏可干预的训练数据、且它与 scaling 擅长的方向"正交"。可投资的读法是:近期价值仍沉淀在 human-in-the-loop 的工具层(助手),而非端到端的自主研究 agent,后者的时间线比 Anthropic 那条"Claude 在黎曼猜想上有进展"的头条所暗示的要长。值得持续跟踪的判据是:inference-time scaling 会不会像解锁数学那样解锁写作——如果不会,"AGI 解决科学"的时间表就要顺延。
interconnects.ai
a16z 的数据专栏(数据来自做 B2B 催收 agent 的 Stuut),拆解企业收账的经济学:2025 年底美国非金融企业躺着 7.2 万亿美元的应收账款,平均延迟每多一天就是约 1500 亿美元的代价。核心结论是 DSO(应收账款周转天数)这个 CFO 被考核的指标近乎失效——两家 DSO 同样"体面"落在 40 多天的公司,最慢那 10% 的账单可能一家当天到账、另一家拖 599 天。而且钱高度集中:最大的 10% 逾期账单占了约 66% 的逾期金额,所以催收是"搜索问题"而非"苦力活"。另外,一半的付款承诺会被违背,但守信和违约的客户之后都以 41 天中位数付款——承诺几乎不含任何信号,你只能不停地催。
🦐点评:有意思的不是这篇文章,而是 a16z 把 Stuut 的账本数据当楔子端出来——"催收是个搜索问题"恰好是 agent 最能证明 ROI 的形态:一个能对逾期账单排序、专盯头部 10% 去追的 agent,可以直接量化收益(全行业一天=1500 亿)。对看 agentic-AI 垂类的投资人,这是模板:挑一个有硬美元指标(DSO)的后台职能,那里现有工作流还是笨的顺序式"催款阶梯",让 agent 去做人做不到的、按集中度分优先级的分诊。要下注该验证的是 Stuut 能不能把 DSO 的"尾巴"压下去,而不是中位数——中位数本来就会自己还上。
a16z.news

📌 其他新闻

Ben Thompson 批评 Anthropic 为应对欧盟 AI 法案给 Claude 输出加隐形水印,认为这从根本上(哲学层面)就是个坏主意,且技术上比看起来更脆弱、更没用。(注:原文为付费墙,此处仅基于可见的标题与开篇论点。)
stratechery.com
Polymarket 预测 Anthropic 或于 10 月底 IPO、有投行估计募资超 600 亿美元(将成仅次于 SpaceX 857 亿的全球第二大 IPO);但投资者开始受不了 CEO Dario 整天预警"AI 毁灭世界",希望他少讲末日、多讲怎么赚钱。
量子位
自变量机器人在无人兜底的实时直播中,用双臂+夹爪方案连续一小时分拣 1816 件随机异形包裹、准确率 98%,效率超 Figure AI 的 1248 件/小时约 45%、硬件成本低 70%,背后是其自研 WALL-B 世界统一模型。
量子位
大疆、安克前核心产品负责人刘力源(曾操盘 eufy 洗地机产品线、后任安克大健康事业部负责人)已下海创业,切入宠物陪伴机器人赛道,完成由元禾领投的天使轮融资。
雷锋网
Vibe coding 正在重构数据基础设施:Lovable 的 ARR 六月冲到 5 亿美元、每周新增约百万个项目(八成用户无技术背景),蚂蚁灵光上线四个月生成超 3000 万个闪应用——数据库面对的不再是"一个越来越大的库",而是数千万个动态 schema、彼此独立的小库。
雷锋网
Cory Doctorow 用"半人马/反向半人马"拆解 AI,并给出一个尖锐的泡沫判断:真正推动 AI 投资热的不是相信 AI 能替代工作的富豪,而是押注"AI 能被卖给老板"的人——他们评估的是销售潜力而非产品本身好坏,就像赌 Joe Rogan 能卖出几百万美元的肽类保健品,缺陷是买单者(被裁员工)的问题。
pluralistic.net
一篇关于"生产力提升去了哪"的随笔:作者把非营利机构一天只能录十几条的数据录入流程一步步优化提效,但红利很快被"重置"、吸收进更高的期望值和更多的活——指向 AI 时代同一个老问题:效率提升的收益到底被谁拿走了。
idiallo.com

🧠 AI 技术前沿

_akhaliq @_akhaliq
分享论文 BDH-CQ:用循环隐式推理(recurrent latent reasoning)做上下文学习(in-context learning),把推理放进隐空间循环而非显式展开。
查看推文 →
Hesamation @Hesamation
传 Grok 4.7 将在 3-4 周内发布,模型比 Grok 4.6 更大、且号称在各方面都更强——xAI 的迭代节奏还在加速。
查看推文 →
karminski3 @karminski3
实测刚发布的 DeepSeek-V4-Pro-0813 疑似有问题:reasoning_effort=max 时在长程 Agentic Coding 任务下更爱"早停",50 轮测试里两次在 42-43 轮就停手、成绩甚至没打过 GLM-5.1,怀疑是奖励机制或长上下文注意力衰减。
查看推文 →
shao__meng @shao__meng
拆解 SpaceXAI 的 Grok Bot:拥有自己的电脑环境、能像真人一样登录 Zendesk/CRM 直接交付"已完成的工作",异步 7×24 运行、可并行开多个 Bot 分管不同职能,还能"观摩一次"就把流程存成可复用 routine。
查看推文 →
shao__meng @shao__meng
用 Codex 后的两声"卧槽":一是 Computer Use 能力真强,二是 Computer Use 真费 token。
查看推文 →
Hesamation @Hesamation
推荐一篇解析 Meta 从 Llama 3 到 Muse Glimmer 两年研究、两代架构主要变化的文章。
查看推文 →
EXM7777 @EXM7777
给 AI 文本加水印既不新也不持久:Google 一年多前就随 Gemini 2.5 上线了,且用一个玩 Unicode 字符的 GitHub 小工具就能去掉;下游真正在意的只是文字值不值得读,没人会查是不是 Claude 帮你想的,所以这条新闻没标题看起来那么大。
查看推文 →
rileybrown @rileybrown
认为 GrokBot 在很多方面落后 Codex/GPT Work,但它最大的创新是把聊天会话"人格化":一个 agent 就是一个带迷你系统提示的命名会话,定时任务/自动化住在会话里、共享技能与插件,用户不再每次新建会话而是去找那个"专门干某事"的 Grokbot。
查看推文 →

🚀 创业动态

shao__meng @shao__meng
前千问负责人林俊旸官宣创业方向:新公司 Pragmatik Labs(语用科技,简称 p7k),做横跨数字与物理世界的下一代智能体(数字 Agent + 具身智能),由高榕创投与红杉中国联合领投、腾讯与上海未来产业基金跟投,据 The Information 融资达数亿美元、投后估值约 20 亿美元。
查看推文 →
shao__meng @shao__meng
感慨 Manus 这半年不容易,认为其 Agent 理念绝对领先行业,如今恢复独立运营,希望能重回状态、找到引领 Agent 未来的新方向。
查看推文 →
rileybrown @rileybrown
一句话点题:知识工作者也该拥有自己的 agent,这就是现在这场竞赛的主战场。
查看推文 →
marclou @marclou
独立开发者宣言"我为什么永不融资、永不招人":醒来不知今天做什么、关机陪妻子吃早餐、健身、四小时深度工作只做激发创意的事、亲切地回客服、随时合上电脑,睡前满怀期待明天再来一遍。
查看推文 →
jackfriks @jackfriks
今天给自己的生意省下每年一万美元,然后就去吃蓝莓、和妻子看 YouTube 了——独立开发者的凡尔赛。
查看推文 →

💬 观点与洞察

emollick @emollick
提醒别只看单一来源判断谁在 AI 竞赛领先:OpenRouter 上看开源权重似乎在逐渐胜出,但提交到 Pangram 检测的作品却压倒性来自 ChatGPT、且 Claude 占比在上升,两个信号方向相反。
查看推文 →
emollick @emollick
调侃如今所有 AI 评论员都得假装自己一直深谙那些只有专家听过的未解数学难题,一本正经地比较"Gromlach 猜想被证伪比上周解出 Erdős 444 号问题更惊艳"。
查看推文 →
EXM7777 @EXM7777
唱衰 Anthropic:Opus 5 是"终极 slop"、Sonnet 5 想打价格战却更糟,Fable 虽好但要 200 美元订阅;同时 OpenAI 靠 Codex 高歌猛进、中国在便宜快速的本地模型上称霸、Google 却在长睡。
查看推文 →
Hesamation @Hesamation
一句话观察:前沿模型阵营里有一个"Google 形状的空洞"。
查看推文 →
Hesamation @Hesamation
爆料 OpenAI 有条内部规定:如果别的团队挡了你的活,你可以"打小报告",然后 Sam 会亲自去找那个团队。
查看推文 →
EXM7777 @EXM7777
生产力毒鸡汤:搭建完美的系统不等于做事——配好 Notion、Obsidian、装满待办 App、看完所有教程,然后每次都放弃;勾选复选框会释放多巴胺,于是你不停打勾来代替真正的工作,"生产力系统"是一种感觉像在进步的拖延。
查看推文 →
steipete @steipete
agent 的战场在快速上移:CLI 是一年前的事、桌面 App 大概半年前,现在已经是服务、Web 和云端会话。
查看推文 →
eptwts @eptwts
感慨手写代码这件事已经"古老":五年前还在手敲 Python 脚本干像素处理这种琐事,如今世界变化之快正体现在这里。
查看推文 →

🔥 精选推荐

8 月 11 日晚,Manus 官网那句挂了小半年的"已成为 Meta 的一部分"改成了"即将恢复独立运营"——从被 Meta 以超 20 亿美元收购(Meta 史上第三大并购、仅次于 WhatsApp 和 ScaleAI)到确认拆分,不到八个月,中间被中国发改委 4 月 27 日禁止投资、要求撤销交易。戏剧性的是,被审查、收购悬置的这三个月里 Manus 收入反而增长约 5 倍、日营收从 30 万美元涨到近 150 万、一度超过 DeepSeek,ARR 首次突破 3 亿美元,150 人团队零流失。此前保持距离的 VC 如今又开始排队,准备参与其恢复独立后的首轮融资(一度传腾讯将控股)。2.0 版本已开发完,将在交易彻底撤销后发布。
🦐点评:这件事最该被记下的不是"20 亿美金一夜归零"的戏剧性,而是在被收购悬置的最坏处境下收入还能翻五倍——这反过来证明 Manus 的增长引擎不靠资本站台,是真实的产品需求在拉。对红杉这样的机构,真正的问题变成了估值锚点:三个月前 Meta 给的 20 亿是"退出价",如今恢复独立、ARR 破 3 亿、增速陡峭,下一轮该按什么定价?以及肖弘那道战略选择题——继续用产品洞见抢跑,还是往模型训练这类核心技术的深水区走——直接决定它是被 Claude/Codex 的模型能力碾过,还是长成一个独立的应用层赢家。
晚点LatePost
微信(腾讯)亮出自研大模型 WeLM,一次两款、均为 MoE 架构:WeLM-80B(80B 总参数、3B 激活)和 WeLM-617B(617B 总参数、23B 激活)。其中 80B 版本已部署到微信智能体"小微",支持对话与搜索、操作微信原生功能、并调用小程序服务;617B 版本仍在开发中,主打用相对适中的激活参数增强通用理解与推理。(注:原文为图文帖、正文以图片为主,此处基于文中公开披露的规格与部署信息。)
🦐点评:参数规格不是重点,"80B 已经能操作微信原生功能、调起小程序"才是——这意味着腾讯把 agent 的落点直接放进自己十几亿用户 + 小程序生态这个别人进不去的护城河里,WeLM 的价值不在跑分而在它能触达的私域动作空间。对看 C 端 agent 的投资人,这是一个平台级信号:当超级 App 自带模型 + 智能体 + 小程序调用形成闭环,第三方通用助手在微信生态内的生存空间会被系统性挤压;真正该盯的是"小微"能不能把交易、服务这些高价值动作跑通,而非它聊天聊得好不好。
赛博禅心

📌 其他值得看

实测字节 Seedance 2.5:画质确实解决了 2.0 的大部分老毛病(皮肤像真人、有微表情、多人背景可控、自动生成的 BGM/音效贴合剧情),但价格翻倍到肉疼——即梦上生成 720P/15 秒要 390 积分、做一条 30 秒视频约 390 元,而 Kling 3.0 Omni 同时长约 135 元、MiniMax H3 约 75 元;作者判断在全行业定价腰斩时它独不降,已被价格钉死成"非民用级"生产力工具,而真正看 AI 短剧的观众根本不在意画质。
葬AI
面向纯小白的 12 步"用好 AI"上手流程,值得注意的是它给出的默认心法已高度 agent 化:直接用 Codex(或国内 WorkBuddy)、全程语音输入、让 AI 先用苏格拉底提问法问清需求、把整个文件夹丢给它自动完成、最后把跑通的流程沉淀成可复用的 Skill——反映大众 AI 用法正从"聊天问答"转向"托付任务给 agent"。 <!-- ai-daily:complete -->
数字生命卡兹克