第 14 期
今日趋势
今天的简报揭示了AI发展的两条主线:一方面是AI在密码学漏洞发现、代码开发、游戏制作等特定领域展现出惊人的效率突破,甚至有人开始计算算力投资的直接回报;但另一方面,多条内容也同时警示了AI能力的失衡——过度聚焦agentic coding导致泛化能力倒退、模型厂流量拐点出现,以及AI强化个人能力后反而可能削弱必要的专业协作。这些共性与分歧共同指向一个深层问题:AI的边界正在从“能不能做”转向“该不该做”和“如何与人配合”。
AI 技术博客
- Discovering cryptographic weaknesses with Claude — simonwillison.net 本文介绍如何利用Claude模型发现密码学系统中的弱点,展示了AI在安全分析中的新应用。关键结论是Claude能识别出传统方法难以发现的漏洞,为密码学安全提供新思路。值得阅读以了解AI在密码学分析中的前沿进展。
- Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident — simonwillison.net 本文详细剖析2026年7月发生的前沿实验室代理入侵事件,从技术角度还原攻击时间线,分析入侵途径和防御漏洞。关键结论是入侵利用了系统间的信任关系,强调了隔离的重要性。值得安全从业者阅读以吸取教训。
- Pluralistic: Enshittification and Reverse Centaurs go global (29 Jul 2026) — Cory Doctorow 本文分享了作者Cory Doctorow的书籍《Enshittification》和《Reverse Centaur》在全球的成功,包括获得Locus奖、纽约时报畅销书,以及“enshittification”一词被收入OED。作者还提到这些书在国际上受欢迎,因为读者多是讲英语的互联网人。值得阅读以了解技术政治类书籍的全球影响力。
- You don’t have to be smart if you can think clearly — seangoedecke.com 文章探讨了“聪明”工程师与“强”工程师的区别,指出聪明工程师依赖直觉快速解题,但遇到难题易慌乱;强工程师则通过系统化方法逐步解决。关键结论是清晰思考的能力比聪明更重要。值得阅读以帮助工程师培养稳健的问题解决能力。
- Quoting Akshat Bubna — simonwillison.net 本条为Akshat Bubna的简短引用,虽无详细内容,但通常此类引述蕴含深刻观点,值得读者品味。核心观点可能涉及技术或效率,需结合上下文理解。值得关注以获取灵感。
- uv 0.12.0 — simonwillison.net uv 0.12.0版本发布,带来了新功能和性能优化,是开发者的重要更新。关键更新包括改进的依赖管理和更快的安装速度。值得用户及时升级以体验新特性。
- Steve Jobs in 2011: ‘We Build Products That We Want for Ourselves, Too, and We Just Don’t Want Ads’ — John Gruber 文章引用Steve Jobs 2011年关于苹果产品无广告的言论,并对比当下苹果的变化。关键结论是领导风格塑造组织文化,苹果从Jobs时代转向Cook时代。值得阅读以反思苹果战略演变和商业伦理。
- Making an agile version of a Windows Runtime delegate in C++/WinRT, part 7 — Raymond Chen 本文为C++/WinRT中实现agile委托的第七部分,重点解决构造unique_ptr时可能抛异常导致的泄漏问题。通过先创建deleter再初始化指针来避免泄漏。值得C++/WinRT开发者阅读以掌握安全实现技巧。
因果推断与营销科学
- The positivity assumption in causal mediation analyses? Checked! — Arthur Chatton, Genevi`eve Lefebvre, Mireille E. Schnitzer, Denis Talbot 本文针对因果中介分析中常被忽视的积极性假设,提出扩展的PoRT算法来检查中介效应中的积极性。该算法适用于受控、自然和干预中介效应,并通过心理健康应用和R包实现。关键结论是,该算法无需对模型或数据生成过程做假设即可有效检测积极性违规。值得读,因为它为心理学等领域的因果中介分析提供了实用的假设检验工具。
- On the magnitude, sign and ranking of recanting-twin path-specific effects — Tran Trong Khoi Le, Pham Hien Trang Tu, Nhat Long Ngo, Tat-Thang Vo 本文系统研究了recanting-twin路径特定效应与自然路径特定效应在大小、符号和排序上的一致性。通过模拟发现,排序不一致率在15%至56%之间,符号不一致率在5%至43%之间,且受中间混杂因素的反事实相关性强烈影响。关键结论是,在非线性非单调场景下,recanting-twin PSE需谨慎解释。值得读,因为它揭示了该方法的局限性并推动未来研究。
- Causally Interpretable Meta-Mediation Analysis With Missing At Random Mediator and Outcome Data — Marie-F'elicia Beclin, Apolline Courr`eges-Vartanian, Genevi`eve Lefebvre, Tat-Thang Vo 本文提出一种新的元分析中介效应方法,解决标准方法忽略中介-结果混杂和缺失数据的问题。该方法将研究特异性自然间接效应运输到明确定义的目标人群,利用半参数理论构建灵活估计量,并开发随机效应模型分解异质性。关键结论是,该方法能整合未明确研究中介但收集了中介数据的研究。值得读,因为它为跨研究因果中介证据合成提供了更严谨的框架。
- Addressing Confounding by Indication Through (Un)Measured Centre Characteristics in Learn-As-you-GO(LAGO) Trials — Minh Thu Bui, Christopher T. Longenecker, Ante Bing, Donna Spiegelman, Allison R. Webel, Hayden B. Bosworth, Judith J. Lok 本文在Learn-As-you-Go(LAGO)试验设计中引入固定中心效应,以控制由中心特征引起的混杂。方法适用于少量中心,统一了连续和二元结果的理论,并推导了点估计、区间估计和假设检验。关键结论是,通过固定效应可无需明确刻画未测量混杂即可保证渐近性质。值得读,因为它解决了大规模实施试验中常见的中心混杂问题。
- Longitudinal Outcomes Truncated by Death: Causal Estimands and Bayesian Estimators — Juliette Ortholand, Young Lee, Marie-Abele C Bind 本文回顾了纵向结果因死亡截断的因果估计量,将其分为两类并阐明识别假设。通过模拟比较贝叶斯估计量,建议配对使用幸存者平均因果效应和受限平均生存时间。关键结论是,在慢性病中,避免对死亡后结果做不恰当假设的估计量更可解释。值得读,因为它为处理死亡截断的临床试验提供了实用的因果推断建议。
- Introducing the CP-plot Based on Covariance Representations of Weighted Average Treatment Effects — Pengfei Tian, Fan Yang, Peng Ding 本文推导了加权平均处理效应差异的协方差表示,揭示ATE、ATT、ATC等之间的关系。关键结论是,ATE被ATT和ATC夹在中间,且重叠权重的ATE也在两者之间(当协方差符号一致时)。基于此,推荐绘制条件ATE对倾向得分的CP图,并扩展至工具变量。值得读,因为它提供了直观的可视化工具来理解处理效应异质性。
即刻简报
- 发布了: 这个能力已经在 Codepilot 上线了,我自己最近一直也在用,太爽了! 充分发挥各个模型的能力长处,而且可以帮你节省成本。 你可以在一个聊天里启用、由… — 即刻·歸藏 介绍了Codepilot新上线的多模型subagent功能,用户可在同一聊天中启用不同模型协作,发挥各自优势并降低成本。例如,用Grok检索Twitter信息、DeepSeek生成文案、K3生成网页,再由GLM 5.2统筹,实现高效分工。该功能通过减少昂贵模型消耗来节省成本,值得开发者尝试以优化工作流。
- 发布了: 终于,大家意识到了这个严重的问题 最近半年,模型的训练是在 agentic coding 方面一直突飞猛进 RLVR 但在其他领域却止步不前 甚至英文写作都开始倒退了… — 即刻·AGENT橘 指出近期AI模型训练过度聚焦agentic coding领域,导致其他能力如英文写作出现倒退,模型泛化未真正实现。关键数据是Opus 4.7到5的迭代被判定为失败试验品,Mythos和Fable在RLVR后效果反而下降。文章引发对RL训练失衡的反思,适合关注AI发展方向的读者。
- 发布了: 最近最惊喜的两个 Agent 是: 1、Linear Agent:基本是一个掌管所有项目进展、客户反馈、风险分析等数据的超级管家的角色了。 2、PostHog Agent:基本实… — 即刻·玉伯 分享了两个令人惊喜的Agent:Linear Agent用于项目管理和客户反馈分析,PostHog Agent实现数据查询与可视化。强调这些Agent需要团队约定和准确数据基础才能发挥效用,但能有效减少汇报等无效工作。值得读是因为展示了实际落地中如何通过规范协作提升Agent效率。
- 发布了: Opus 5 + Codex 吓到我了! 我们用 WebGL / Three.js 写了一个 3D 网页游戏,爱丽丝的茶话世界。 目前还在制作过程中,但迫不及待先和大家分享一下录屏… — 即刻·海辛Hyacinth 展示了使用Opus 5和Codex在WebGL/Three.js上快速开发3D网页游戏《爱丽丝的茶话世界》的体验。关键成果是仅一个晚上就完成了初步制作,证明了AI在创意开发中的惊人效率。该案例适合对AI辅助游戏开发感兴趣的读者,启发无限可能性。
- 发布了: 找老爹要 1200 万元人民币,买一台英伟达 DGX B300 服务器,瞬间获得打包销售的 8 张 D300 GPU。显存 2.3 TB。 把 1.4 TB 的 Kimi K3 装进去。跑起来。 … — 即刻·赵纯想 计算了购买英伟达DGX B300服务器(1200万元)用于AI推理的经济模型:8张D300 GPU、2.3TB显存,满载功耗14.5kW,每年电费5万元。理论每天收入4.5万元,9个月可回本,之后成为纯利润来源。这篇分析以具体数字展示了算力投资的潜在回报,适合关注AI基础设施经济的读者。
- 发布了: AI 叙事已经大结局的另一个佐证: 所有,我是说所有的模型厂网站流量,都在以6月作为拐点,不约而同地平了!大部分跌了! 2026年6月、7月,值得被记载的… — 即刻·赵纯想 报告了所有模型厂网站流量在2026年6月后普遍持平或下跌,作为AI叙事终结的佐证。关键数据是流量拐点明确出现在6月,7月延续趋势,表明AI热潮可能已过顶峰。该观察提供了行业趋势的重要参考,值得关注AI市场动态的读者留意。
- 发布了: 意图 / 判断 / 选择 → 执行 / 自动化 → 结果 / 责任 / 意义 AI 取代了其中的几个? — 即刻·AGENT橘 提出一个简洁的思考框架:意图/判断/选择 → 执行/自动化 → 结果/责任/意义,并追问AI取代了其中几个环节。没有给出结论,但引导读者反思AI在人类工作流程中的实际替代范围。适合对AI哲学和人文影响感兴趣的读者进行深度思考。
- 发布了: AI 越强,人越喜欢单干。人越单干,会到某一天猛然发现,人与人之间的专业协作必不可少。 AI 很容易让一个人的长处变得更长,同时让一个人的短处得到些… — 即刻·玉伯 讨论了AI增强个人能力带来的陷阱:AI让长处更长,短处得到微弥补,但容易让人误以为自己全能,从而忽视专业协作。核心观点是AI无法真正替代深入学习和团队配合,反而可能滋生狂妄。值得读是因为它提醒我们保持谦逊,重视人际协作的必要性。
本期有 8 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、tedunangst.com。