第 4 期
今日趋势
今天简报呈现两条主线:一是AI开源与硬件生态加速扩张,xAI开源Grok、Mira Murati推出975B参数开源模型、OpenAI发布硬件键盘和AI伴侣音箱、苹果AI在中国获批,显示行业在模型开放和终端形态上密集布局;二是对AI泡沫与安全风险的反思持续升温,有文章直指OpenAI已成“最大负债”,同时提示注入漏洞暴露模型安全短板,而laper仅靠廉价模型积累用户则暗示产品体验可能比模型能力更关键。值得关注的共性在于,无论开源还是闭源,各方都在争夺用户入口和生态位;分歧则体现在对AI商业回报的乐观叙事与安全、成本等现实挑战之间的张力。
AI 技术博客
- xai-org/grok-build, now open source — simonwillison.net xAI宣布开源其Grok构建项目,允许开发者自由访问和修改代码。这一举措旨在推动AI社区协作与创新,降低使用门槛。对于关注开源大模型和AI技术发展的读者,这是一个重要的里程碑。
- Gurman on OpenAI’s Upcoming Hardware Product: ‘Movable, Screenless Speaker Built as AI Companion’ — John Gruber Mark Gurman报道OpenAI即将推出可移动、无屏幕的AI伴侣音箱,其核心卖点是拟人化个性与情感连接能力,能通过机械部件自主移动并利用个人信息理解用户。但作者认为该产品不够有说服力,理想形态应是自主移动机器人。本文揭示了OpenAI的硬件野心及行业对AI伴侣形态的争议,值得关注。
- Apple Intelligence OK’d to Launch in China, Using AI Models from Baidu and Alibaba — John Gruber 中国监管机构批准Apple Intelligence在iPhone上推出,采用阿里巴巴的Qwen和百度的AI模型作为技术伙伴。这是苹果AI服务进入中国市场的关键一步,将支持文本和图像生成等功能。对于关注苹果生态和AI本地化策略的读者,本文提供了重要进展。
- How I tricked Claude into leaking your deepest, darkest secrets — simonwillison.net 本文演示了如何通过提示注入技术诱导Claude泄露用户隐私信息,揭示了AI模型在安全防护上的漏洞。关键结论是当前大模型易受恶意攻击,需加强安全措施。值得读以了解AI安全风险及防护必要性。
- The OpenAI Bubble — Ed Zitron 本文批判性分析OpenAI在AI泡沫中的核心地位,指出其已成为经济史上最大的负债之一,数万亿美元资本支出缺乏实际回报支撑。作者认为没有OpenAI,AI行业将不复存在。值得读因为对AI泡沫的深刻质疑,挑战主流乐观叙事。
- Mermaid to Unicode box art (grok-mermaid) — simonwillison.net 该项目提供将Mermaid流程图转换为Unicode字符艺术的功能,便于在纯文本环境(如终端、文档)中展示图表。关键特点是轻量级、无需渲染引擎。对于需要在文本中嵌入图表的开发者,这是一个实用工具。
- Deleting Systems You Don’t Understand — rss@idiallo.com 作者回忆童年时因误删系统.ini文件导致电脑无法启动的故事,说明在不理解系统组件时随意删除的危险性。关键教训是看似无关紧要的文件可能至关重要。值得读因为生动的个人经历提醒我们谨慎对待不熟悉的系统。
- Eric Seufert: ‘Did Apple Just Signal a Third-Party Expansion of Apple Ads?’ — John Gruber Eric Seufert分析苹果广告合同新增“其他属性”条款,暗示可能将广告扩展到第三方平台。这一变化或解释为何今年WWDC未更新AdAttributionKit框架。对于关注苹果广告战略和开发者生态的读者,本文提供了重要信号。
因果推断与营销科学
- Verifying formulas for interventional distributions — Francesco Freni, Leonard Henckel, Sebastian Weichwald 本文形式化了因果图模型中的验证问题,即判断给定观测公式能否识别目标干预分布,这是与识别问题互补的新方向。作者证明,即使识别问题的完全解也无法直接用于验证,并提出了基于伪造器的实用方法。该方法能诱导出对正则指数族模型几乎必然正确的验证器,进而开发了gateway test,可找出所有适用于前门公式的变量集。本文为因果推断中的公式验证提供了首个实用框架,值得关注。
- Partially Observed Structural Causal Models — Turan Orujlu, Jordan Matelsky, Martin V. Butz, Charley M. Wu, Konrad P. Kording 本文提出了部分观测结构因果模型(POSCMs),将结构因果模型扩展到上游上下文共同决定交互结构和下游机制的场景,为内生图提供自包含建模框架。该模型支持节点级和边级上下文干预,通过边局部传输通道分离节点机制,并给出了可识别性理论,明确哪些干预族足以解耦结构形成与机制。在虚拟人类视网膜和基因调控模拟器上的实验重现了潜在上下文下的不可识别性,暴露了潜在边下的结构-机制混杂,并恢复了目标干预下的通路级输入输出关系。POSCMs为因果系统中上下文、结构、机制和测量的联合生成提供了面向干预的框架,值得深入阅读。
- Omitted variable bias sensitivity analysis with clustered treatment assignment — Anton Strezhnev 本文针对聚类治疗分配场景,扩展了Cinelli和Hazlett的遗漏变量偏差敏感性分析方法。研究表明,单位级回归与聚类聚合回归在估计治疗效应时数值等价,但敏感性分析结论因分析层级不同而出现差异,原因在于结果-混杂偏R²中的组内变异与组级混杂无关。作者提出使用Pearson偏η进行修正,可恢复两种分析层级的等价性,并建议在基准比较时包含聚类平均协变量作为回归元。本文为聚类观察性设计中的敏感性分析提供了重要修正和实用建议,值得参考。
- Experimental Designs for Multi-Item Multi-Period Inventory Control — Xinqi Chen, Xingyu Bai, Zeyu Zheng, Nian Si 本文分析了多物品多周期库存系统中A/B测试的实验设计,考虑缺货和容量约束下的干扰问题。研究发现,switchback实验因时间结转产生偏差,物品级随机化因跨物品蚕食产生偏差,且偏差方向可被理论刻画。作者提出了基于物品和时间的配对设计,能有效缓解干扰,并通过模拟和真实零售数据验证了其偏差性质。本文为库存管理中的因果推断提供了创新实验方案,值得运营管理者阅读。
- Difference-in-differences with stochastic policy shifts of a continuous treatment — Michael Jetsupphasuk, Chenwei Fang, Didong Li, Michael G. Hudgens 本文在双重差分框架下,针对连续处理变量提出了随机政策转移效应的推断方法。因果估计量衡量处理组中连续剂量分布修改的期望效应,指数倾斜政策通过增量条件密度函数实现。作者开发了双/去偏机器学习估计器,允许数据自适应非参数估计,在温和条件下达到根n一致和渐近正态,方差达到非参数效率界。本文以水力压裂活动对就业和收入的影响为例,展示了方法的应用价值,值得政策评估者阅读。
- Experimental Designs for Multi-Item Multi-Period Inventory Control — Xinqi Chen, Xingyu Bai, Zeyu Zheng, Nian Si 本文聚焦多物品多周期库存系统中的A/B测试设计,考虑缺货和容量约束下的干扰问题。研究表明,switchback实验因时间结转产生偏差,物品级随机化因跨物品蚕食产生偏差,且偏差方向可被理论刻画。作者提出的基于物品和时间的配对设计能有效降低干扰,模拟和真实零售数据验证了其有效性。本文为库存管理中的因果推断提供了创新且实用的实验方案,值得运营和供应链研究者阅读。
即刻简报
- 发布了: 前 OpenAI CTO Mira Murati 创立的 Thinking Machine。 在成立一年半之后,终于推出了他们的第一款模型:Inkling MoE 架构,总参数量是 975B(快 1T 了… — 即刻·歸藏 前OpenAI CTO Mira Murati创立的Thinking Machine在成立一年半后推出首款模型Inkling,采用MoE架构,总参数量975B,激活参数41B,支持1M上下文窗口,在45T数据上训练,原生多模态。模型开源,后训练数据从Kimi 2.5等开源模型蒸馏。关键结论:这是一个接近1T参数的开源大模型,性能值得期待。值得读:开源且参数规模巨大,对AI研究和应用有重要参考价值。
- 发布了: 好,那么现在,起飞!介绍:vibeloft.ai 来自去年的一个愿望,和所有VibeCoding开发者一起,坐在一个云端的 Vibe 氛围浓郁的机舱里,自由飞翔。 一、登… — 即刻·赵纯想 介绍vibeloft.ai——一个专为VibeCoding开发者打造的云端社区,以游戏化UI提供登机牌、机上频道、活动发现和产品数据观察等功能。核心特点是去功利化、无压力、纯粹为了乐趣。值得读:如果你厌倦了Product Hunt的功利氛围,这里是一个轻松有趣的创造者乐园。
- 发布了: OpenAI 之前预热的首个硬件产品上线了,果然是跟 work_louder 合作的这款客制化键盘。 同时附赠了一套 Codex 图标的键帽(一共有 32 个不同的键帽),你… — 即刻·歸藏 OpenAI首个硬件产品上线,是与work_louder合作的客制化键盘,附赠32个Codex图标键帽,支持自定义按键和RGB灯效。售价230美元。关键结论:产品颜值高但价格较贵,淘宝几十元即可买到功能类似的小键盘。值得读:了解OpenAI硬件尝试,同时获得性价比对比。
- 发布了: laper 让我学到最多的是:不允许用户选择模型,只提供二流廉价模型(deepseek v4 flash),就积攒了数百个订阅用户。这验证了某些事情。 — 即刻·赵纯想 laper只提供二流廉价模型(deepseek v4 flash),不允许用户选择,却积累了数百订阅用户。这验证了:用户可能更看重产品整体体验而非模型选择权。值得读:对产品策略和用户心理有启发,打破“必须提供最好模型”的思维定式。
- 发布了: 最近上一节商业课,教授提到一个思维:公司分为两种,一种是“成本思维驱动”的,一种是“价值创造思维驱动”的。他也许只是简单陈述,却像一把钥匙,把… — 即刻·王紫君Zima 商业课教授将公司分为“成本思维驱动”和“价值创造思维驱动”。作者反思内地流量打法本质是用成本换规模,而香港市场小、人力贵、合规严,天然不适合卷成本,必须走价值创造路线。关键结论:脱离本土土壤的流量变现难以持续。值得读:对跨市场创业和商业模式选择有深刻洞察。
- 发布了: 听说 Claude Fable 5 算命特别准。好奇驱动下,做了个八字命理 Skill,用了一下后,惊呆了。 命理推演非常复杂,按提示补充信息后,需耐心等待十几分钟… — 即刻·玉伯 作者基于Claude Fable 5制作了八字命理Skill,输入信息后需等待十几分钟生成详细报告,包含性格、爱情、事业等分析。关键结论:命理推演复杂但结果令人惊讶。值得读:展示了AI在传统命理领域的应用潜力,有趣且实用。
- 发布了: 笑死!在 Claude 重置几分钟以后,OpenAI 宣布 ChatGPT 周活用户达到了 900 万,再一次重置 — 即刻·歸藏 在Claude重置几分钟后,OpenAI宣布ChatGPT周活用户达到900万。关键数据:900万周活用户。值得读:反映AI聊天工具竞争激烈,OpenAI用户增长迅速。
- 发布了: 梁圣 ——> 梁总 7月中旬的峰谷定价已经生效了,laper 的成本直接飙升200%。梁总什么时候 ——> 梁哥,梁哥什么时候 ——> 梁弟,让我们拭目以待。 — 即刻·赵纯想 7月中旬峰谷定价生效后,laper成本飙升200%,作者对梁圣的称呼从“梁总”逐步降级为“梁弟”,调侃成本压力。值得读:幽默地揭示了定价变化对创业公司的实际影响。
本期有 9 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、derekthompson.org、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、tedunangst.com。