🔥 精选推荐

OpenAI 今晨正式放出 GPT-5.6 三档模型 Luna/Terra/Sol(每百万 token 分别 $1/$6、$2.50/$15、$5/$30),全部为 2 月 16 日知识截止、100 万上下文。这次官方主打的不是绝对跑分而是"长程 Agent 效率":在覆盖 55 个职业领域的 Agents' Last Exam 上,Sol 拿到 53.6,比 Claude Fable 5 高 13.1 分,而 Terra/Luna 以约 1/16 成本也超过 Fable。反过来 Fable 在 SWE-Bench Pro 上以 80% 碾压 Sol 的 64.6%——OpenAI 随即发文称该基准约 30% 任务本身有缺陷。API 侧新增 Programmatic Tool Calling(模型自己写 JS 编排工具调用)和多智能体子代理。
🦐点评:OpenAI 这次比的不是"谁更聪明"而是"每个 token 榨出多少活"——把 Sol 定价压到 Fable 的一半、小模型压到 1/16,等于在最吃 token 的 Agent 长任务场景发起价格战。对投资人的信号是模型层竞争的轴心正从"能力上限"滑向"单位成本智能",这利好一切按调用量付费的 Agent 应用(成本结构改善),却让纯靠"接最强模型"叙事的应用层护城河更薄。顺带看一个动作:OpenAI 一边输 SWE-Bench Pro 一边发文质疑该基准,这种"打不过就质疑裁判"本身说明编码仍是 Anthropic 的主场。
simonwillison.net
xAI("SpaceXAI")发布 Grok 4.5,定位为其首个专为编码与 Agent 训练的前沿模型,且是与 Cursor 联合训练的产物。马斯克称其"Opus 级别"但更快、更省 token、更便宜,内部对标"大致相当于 Opus 4.7 但快得多",卖点是"每美元能力"而非榜单登顶。Cursor 称这是自家最强模型、且"首次为编码之外的场景而建",并在产品内首周开放双倍额度。官方明确 Grok 4.5 与 Composer 系列(1.5T)属不同权重量级。
🦐点评:xAI 用 Cursor 的真实编码轨迹反向喂养基座,这条"应用数据回流模型"的闭环才是看点——Cursor 既是分发渠道又是数据飞轮,跟字节靠短视频生态喂视频模型是同一套逻辑。马斯克刻意不打榜单、只打 capability-per-dollar,其实是承认绝对能力追不上 Opus/GPT,转而在性价比侧卡身位。对一级市场,这意味着编码 Agent 赛道的模型供给端又多一个愿意贴身打价格战的玩家,独立 coding 模型创业公司的生存缝隙被进一步压窄。
latent.space
Meta 周二发布 AI 图像生成器 Muse Image,附带一个争议功能:允许用户基于他人公开 Instagram 账号的照片生成 AI 图像。据 NYT 报道,这一权限对成年人的公开账号默认开启,需用户手动关闭。换言之,任何成年公开账号的 Ins 照片,都可被他人直接拿去当作 AI 生成素材。
🦐点评:Meta 把"默认授权"用成了数据获取的杠杆——不是买数据也不是爬数据,而是靠产品默认设置把数十亿用户的公开图库一键变成生成语料,这是 Stratechery 那句"verifiable data 定义 AI 竞赛"最赤裸的落地。投资人看两点:一是这类"平台默认吞噬用户内容"会持续给创作者身份、水印溯源、opt-out 管理类工具制造需求;二是监管风险正在累积,GDPR 或美国州级隐私法一旦对"默认开启"开刀,Meta 引以为傲的数据护城河可能一夜变成合规负债。
nytimes.com
Instagram 负责人 Adam Mosseri 在 Lenny 播客里谈 2026 年产品团队结构的变化:从"一打人的专业分工小队"转向 4–6 人的精简通才 pod;崛起的是"product staff"角色——把 PM、设计、数据科学、研究揉进一个通才操作者。他仍看好设计师,认为 AI 生成内容对 Instagram 反而是顺风(推高真实创作者身份的价值),并复盘了职业生涯两大失败:Facebook Home 和第一版 Reels。
🦐点评:这篇最该被投资人划下来的不是"AI 利好真实性"这种场面话,而是团队结构从"13 人专业分工"塌缩成"4–6 人通才 pod"——这是 AI 抹平 PM/设计/数据/研究边界后,组织形态给出的第一手反馈。它直接改写两件事:SaaS 工具的买方正从"给专业岗位配专用工具"转向"给通才配一站式工具",以及早期团队的招聘信号——能一个人打通 PM+设计+数据的"product staff"会比细分专家更值钱。看 SaaS 和看团队的人,都该按这个新单元重估。
lennysnewsletter.com

📌 其他新闻

作者用自创的"vibe review"基准逐项实测 GPT-5.6 三档模型,结论是 Sol 已成日常首选工作马(PRD 撰写、原型、Agent 任务),并与 Fable 做性价比对比——一线产品从业者视角的选型参考。
lennysnewsletter.com
继 4 月的 Muse Spark 之后,Meta 发布 Muse Spark 1.1——首个提供 API 的 Spark 模型,主打 agentic 工具调用与 computer use 的显著提升,评测报告里"两个模型自我对话"涌现出的独白片段颇有趣。
simonwillison.net
Ben Thompson 认为"可验证数据(verifiable data)正日益定义这场 AI 竞赛",从 Meta 到 Grok 到前沿实验室都在围绕数据来源做文章(正文需订阅)。
stratechery.com
Momenta 港股 IPO 首日(7/8)市值达 700 亿港元,创始人曹旭东被员工称"马斯克式 CEO";靠早年押注 L2 量产而非同行扎堆的 L4,拿下定点车型市占率超 50%、量产搭载超 60%。
36kr
蚂蚁灵波开源 LingBot-Video——号称全球首个面向具身智能的 MoE 视频生成模型,把视频生成定位为"机器人大脑"的下一站,为机器人构建可预测物理世界的引擎。
量子位
支付宝在全栈 AI 支付体系之后再推 Agent 经营方案,核心是开发套件 AIS——让 Agent 自动完成商品发现、调用、计费的完整商业链路,瞄准 Agent 时代商家变现的基础设施位。
雷锋网

🧠 AI 技术前沿

Hesamation @Hesamation
已宣布的 NVIDIA Grace Blackwell GPU 中 95% 尚未部署:10 万张已上线、30.8 万张安装中、166 万张仍停留在"已宣布"——需求爆棚,但绝大多数卡在机房建设瓶颈上。
查看推文 →
Hesamation @Hesamation
写 AI 2027 报告的团队发布了 AI 2040,罕见地建议"不要公开发布前沿开源模型",理由是恐怖分子等可能利用高能力开源权重设计毁灭级生物武器。
查看推文 →
Hesamation @Hesamation
有人让 Claude、Hermes、DeepSeek 互相辩论而不是一味附和用户,作者认为这种"AI 组队互搏"才是 Agent 团队的实际未来——用 Bloome.im 选个任务模板就能拉起一个协作 Agent 群聊。
查看推文 →
emollick @emollick
给所有从编码扩张到通用知识工作的 AI 实验室提个醒:非程序员不是"更笨的程序员",把编码 App 的选项砍掉不会让它更适合知识工作,需要的是更多种类的控制与可见性,而不是更少。
查看推文 →
emollick @emollick
有点困惑:Claude Cowork 定位是比 Code 更安全(略弱)、防止非程序员闯祸的版本,这他懂;但搞不清 ChatGPT Work 到底是什么、相比在 Codex 上跑他到底得到或失去了什么。
查看推文 →
EXM7777 @EXM7777
如果你用 AI 做任何正经工作,未来几个月不把 Claude Fable 和 GPT-5.6 Sol 当主力模型简直是疯了——用够久就知道 Fable 有多离谱,这一档模型和其它一切的差距……
查看推文 →
cursor_ai @cursor_ai
GPT-5.6 Sol、Terra、Luna 已上线 Cursor;其中 Sol 在 CursorBench 上得分 67.2%。
查看推文 →
rileybrown @rileybrown
Grok 4.5 又快又好、价格划算,在 Cursor 里用着很爽;作者实测让它在三分半内构建了一个调用 Grok voice API 的 iOS App,完成得不错。
查看推文 →
rileybrown @rileybrown
GPT-5.6 Sol 通过了他的 Replit 基准:一句 prompt 就在 Codex 上造出带数据库、沙盒和"能自建并编辑网页应用的 Agent"的完整 Replit 克隆,目前只有 Fable 和 GPT-5.6 通过。
查看推文 →
karminski3 @karminski3
实测蚂蚁灵波 LingBot-Vision:仅 1B 参数就展现极强的空间几何与边界感知,直接打平甚至超越 7B 的 DINOv3,很适合做具身智能视觉主干;免微调视频目标追踪、透明反光物体深度补全表现堪称杀手级。
查看推文 →
karminski3 @karminski3
实测混元 3 正式版:300B 参数下拿到超高 Agent 能力、极具性价比,可用作驱动模型或嵌入 Agent 框架;前端能力不错,后端仍有较大提升空间。
查看推文 →
shao__meng @shao__meng
Vercel Labs 开源 Native SDK:保留 Web 那套声明式 UI 的开发体验,却用自研引擎直接绘制到操作系统窗口——没有浏览器、没有 WebView、二进制里也没有解释器,试图破解桌面应用"原生 vs Web"的经典两难。
查看推文 →
shao__meng @shao__meng
SWE-Bench Pro 不再可靠:约 30% 任务存在致命缺陷,OpenAI 撤回推荐。此前正是因 SWE-bench Verified 的设计与污染问题才转推 Pro,而准确评测直接关系到部署与安全判断。
查看推文 →
AnthropicAI @AnthropicAI
Anthropic 宣布其长期利益信托(Long-Term Benefit Trust)新增一名成员:前美联储主席 Ben Bernanke。
查看推文 →

🚀 创业动态

0xROAS @0xROAS
GPT-5.6 Sol + Seedance 2.0 做 AI 广告太猛了:作者搭了个 Agent 全自动生成端到端广告,一句 prompt 就产出 broll、口播头像、角色动作镜头。
查看推文 →
marclou @marclou
TrustMRR 上第 116 笔创业收购:一款 AI 虚拟试穿 iOS App,月收入 300 美元(80% 利润),以 6000 美元成交。
查看推文 →
shao__meng @shao__meng
开源分享 ChatCut Codex 官方插件:把 Codex 接到 ChatCut MCP,让 Agent 在真实可编辑的多轨时间线上完成导入、剪辑、生成、字幕、导出;仓库核心是插件元数据 + MCP 配置 + 15 个工作流 Skills。
查看推文 →
godofprompt @godofprompt
分享一个 prompt:丢进三段自己的写作样本,它就能映射出你的句子节奏、用词、开段习惯乃至怪癖,然后生成"真的像你本人、而非 AI 版的你"的新内容。
查看推文 →
rileybrown @rileybrown
挺神奇:他现在衡量一个模型好不好的新基准,就是它能不能一句 prompt 造出一个 Replit/Lovable 克隆。
查看推文 →
eptwts @eptwts
多年积累了 300 万+ 条组织内容、广告和 VSL 的 swipe file(含高转化素材及其数据、所卖产品、落地页等),未来几周将公开。
查看推文 →
levelsio @levelsio
我所有网站的流量平均 92% 来自 Google,只有 2.5% 来自 X。
查看推文 →

💬 观点与洞察

vasuman @vasuman
关于跑分的双标:我的模型赢了,你就是虾兵、我的模型就是 AGI;你的模型赢了,那跑分就是糟糕的智能指标、你盲信榜单就是傻。
查看推文 →
Hesamation @Hesamation
扎克伯格要用价格战来毁掉 OpenAI 和 Anthropic 的好日子了。
查看推文 →
Hesamation @Hesamation
算了笔账:一个 X Premium+ 订阅就能拿到 Grok Imagine(图/视频)+ SuperGrok(通用)+ Grok Build + Opus 级别却更便宜的 Grok 4.5,还能靠发 X 把订阅费赚回来——ROI 高得离谱。
查看推文 →
shao__meng @shao__meng
推荐 Addy Osmani《Own the Outer Loop》:Agent 能写代码,但工程师必须守住"外环问责"——谁能说清改了什么、为什么安全、错了怎么办;模型越强(Fable 5、GPT-5.6),这一点越关键。
查看推文 →
shao__meng @shao__meng
面试时该不该在意 Title?他的看法:早到连创始人都没明确 Title 的阶段可以不在意,过了那个阶段还是得明确——研发负责人 / 技术负责人 / 技术合伙人 / 工程负责人,差别不小。
查看推文 →
corbin_braun @corbin_braun
到 2020 年代末,你会震惊于一个人能构建并规模化出什么东西——看多代码与硬件。
查看推文 →
eptwts @eptwts
软件的 80/20,无非是把已有技术重新包装成那些不如你懂行的人也能用的东西。
查看推文 →
暂无内容