第 28 期
今日趋势
今天的简报覆盖AI技术、因果推断学术研究及实用工具分享三大板块,其中AI领域既有对模型崩溃、递归自我改进等前沿风险与技术趋势的深度探讨,也涉及内容标记透明度、推理痕迹窃取等安全伦理议题,同时包含写作识别、AI写作工具应用等实用层面内容。因果推断与营销科学领域的研究则针对传统方法的局限,提出多个稳健估计框架,覆盖分位数处理效应、高维协变量调整等场景,为实证研究提供了更可靠的工具支撑。即刻简报板块则分享了多个AI工具的限免信息、使用体验及教程上线等动态,为从业者提供了实用参考。整体来看,AI领域呈现出前沿风险讨论与实用落地并行的特点,学术研究则聚焦方法的稳健性与场景适配性,二者共同构成了今日简报的核心脉络。
AI 技术博客
- Pluralistic: Model collapse (12 Aug 2026) — Cory Doctorow 这篇文章围绕AI领域的“模型崩溃”展开,核心是区分了两类人机协作模式:一类是“半人马”(人类借助AI提升工作),另一类是“反向半人马”(人类被当作AI的外围工具)。文章还拆解了AI替代工人的悖论,说明老板用AI的本质是轻信AI销售的忽悠。它用清晰的二分法帮读者理解AI与人类工作的复杂关系,值得一读。
- Ryan Greenblatt – What happens once AI can automate AI research? — Dwarkesh Patel 这篇内容是关于AI递归自我改进(RSI)的讨论,嘉宾Ryan Greenblatt提出,若AI实现AGI后,可能在一年内完成相当于人类6年的AI研发进展,他预测AI自动化AI研究的中位数时间是2031年。双方还探讨了超级智能AI的对齐问题,担忧现有方案无法真正服务人类。它聚焦AI领域核心的未来风险与发展节点,对关注AI安全的读者很有价值。
- Stealing Reasoning Traces from Proprietary LLM APIs — simonwillison.net 本条是关于从专有大型语言模型(LLM)API窃取推理痕迹的相关内容,目前暂无具体展开的细节,核心是提及这一技术方向的存在。它涉及AI领域的安全与数据隐私相关议题,值得关注AI技术伦理和数据安全的读者留意。
- Anthropic Posts ‘How Claude Marks AI-Generated Content’ Without Explaining How Claude Marks AI-Generated Content — John Gruber 这篇文章聚焦Anthropic的AI内容标记政策,Anthropic声称遵守欧盟AI法案,将为Claude生成的文本嵌入隐形水印,且水印会随内容传播,但未公开具体的标记和检测机制,透明度极低。文章指出这一做法的不合理性,对关注AI透明度和合规性的读者有参考意义。
- The Economist: ‘How to Spot AI Writing’ — John Gruber 这篇是经济学人关于AI写作识别的研究,他们对比了多家主流LLM生成文本与人类写作,发现AI写作的特征包括使用更多拉丁词缀、句子结构公式化、缺乏人类写作的流畅性与优雅度,且风格会随模型更新变化。文章揭示了AI写作的独特规律,对区分AI与人类内容有实用价值。
- Mark Zuckerberg Posts 6,500-Word AI Essay — John Gruber 本条是关于扎克伯格发布的6500字AI长文的评论,指出该长文几乎未补充新观点,仅提到Meta在路易斯安那州数据中心带来的教师奖金,以及Meta推出的免费职业培训项目。文章还提到数据中心建设能缓解熟练技工短缺,对了解Meta的AI相关产业布局有一定参考。
- The Talk Show: ‘Getting the Snack Right’ — John Gruber 本条是The Talk Show的一期节目,嘉宾Chance Miller回归,讨论了iOS27的进展、Vision Pro的棒球直播、RAM危机、苹果起诉OpenAI等科技话题,还提及欧盟DMA相关情况。节目覆盖多个近期科技热点,对关注苹果及AI行业动态的读者有参考价值。
- The Fruits of AI — blog.jim-nielsen.com 这篇文章围绕AI的使用态度展开,将AI比作果树,指出依赖AI会让人变得粗心,只有通过持续的警惕和主动参与,才能从AI中获得好的成果,否则会得到劣质的“果实”。它提醒读者正确使用AI的方式,对避免AI依赖的负面影响有启发意义。
因果推断与营销科学
- Doubly Robust Estimators of Quantile Treatment Effects With Semiparametric Cumulative Probability Models — Hao Wu, Chun Li, Bryan E. Shepherd 本文针对因果推断中传统聚焦潜在结局均值估计、分位数处理效应(QTE)估计易受模型误设影响的问题,结合含检测限的HIV偏态结局研究,提出基于半参数累积概率模型(CPM)的双重鲁棒QTE估计框架。该框架包含逆累积分布函数法和直接法,对应的估计量具有双重鲁棒性且渐近正态,还扩展到概率处理效应及条件情形,模拟显示经验三明治估计和非参数bootstrap表现稳定。该方法为偏态结局的分布因果效应估计提供了更稳健工具,适合生物医学研究中处理效应的分布层面分析,因此值得关注。
- Stop Calling the First Significant Day a Win — Mila Sudarikova 本文指出在A/B测试中,若提前检查直到p值小于0.05才判定显著,会将名义5%的假阳性率大幅提升至近28%,通过带种子的模拟量化了该偏差的影响。作者还对比了能让早期停止结果更可靠的修复方法,为避免A/B测试中的假阳性错误提供了实用警示和解决方案。该内容针对数据科学中常见的A/B测试误区,能帮助从业者提升实验结果的可靠性,因此值得一读。
- COMPACT: Spectral Adjustment Scores from a Complete and Irreducible Causal Criterion — Eric V. Strobl 本文针对观测性数据中高维协变量的因果调整变量选择难题,指出传统倾向得分虽简化调整但对因果图的特异性不足,提出基于完全不可约因果准则的COMPACT算法。该算法通过广义特征值问题构建得分空间,能利用代理变量恢复目标空间,刻画估计和因果误差,bootstrap有效,模拟和实证显示其优于多种替代方法。该方法为高维观测数据的因果效应估计提供了更精准的调整工具,适合处理弱分布的混杂问题,因此具有较高应用价值。
- Principal Stratification with Bayesian Additive Regression Trees for Count-Valued Intermediate Variables: Estimating the Effect of Fertility on Women’s Employment — Lucas Godoy Garraza, Leontine Alkema 本文针对生育率与女性就业因果效应估计中,传统工具变量法难以处理计数型中间变量(如子女数)和异质性的问题,扩展了主分层结合贝叶斯加法回归树(BART)的框架。该框架能灵活处理协变量依赖的工具变量有效性,模拟显示其在非线性混杂和异质性下优于传统工具变量估计,应用于非洲三国数据发现就业效应存在异质性。该方法为计数型中间变量的因果效应估计提供了稳健工具,能揭示异质性效应,适合人口与劳动经济学研究,因此值得关注。
- Donut Regression Discontinuity Designs — Cladia Noack, Chistoph Rothe 本文针对广泛用于解决运行变量操纵、排序或测量误差问题的Donut回归断点(RD)设计,指出其现有实现多为启发式,缺乏正式指导和对偏差、方差的清晰分析。作者在局部线性估计框架下开展理论分析,推导了Donut RD的点估计、统计推断和设定检验的新结果,发现修剪会增加估计的不确定性,偏差感知置信区间可有效处理该问题。该研究为Donut RD的规范应用提供了理论基础和实用工具,能提升实证研究中该方法的可靠性,因此值得一读。
- Donut Regression Discontinuity Designs — Cladia Noack, Chistoph Rothe 本文针对广泛用于解决运行变量操纵、排序或测量误差问题的Donut回归断点(RD)设计,指出其现有实现多为启发式,缺乏正式指导和对偏差、方差的清晰分析。作者在局部线性估计框架下开展理论分析,推导了Donut RD的点估计、统计推断和设定检验的新结果,发现修剪会增加估计的不确定性,偏差感知置信区间可有效处理该问题。该研究为Donut RD的规范应用提供了理论基础和实用工具,能提升实证研究中该方法的可靠性,因此值得一读。
即刻简报
- 发布了: WorkBuddy+Hy3 0积分居然能做到 全量社群聊天记录整理后放到飞书云文档 黄叔不是做了个Agent社群嘛 已经300+人了 每天一大堆的群聊信息 之前我都用Herme… — 即刻·AI产品黄叔 本文介绍了WorkBuddy+Hy3工具的限免功能,可整理300+人规模的Agent社群全量聊天记录并同步至飞书云文档。此前作者用Hermes生成信息图,此次尝试发现Hy3能处理单日甚至10天的群聊内容,还自动调度10个Agent完成任务。该工具限免状态下可高效解决社群历史聊天查询的需求,适合有大量社群信息整理需求的从业者参考。
- 发布了: 又有羊毛薅了,Manus 从 Meta 剥离以后开启了限免。 25 日之前不消耗积分 如果你之前自己买过 Manus 会员,或者是通过 Lenny’s Newsletter 领过会员的话… — 即刻·歸藏 本文告知Manus从Meta剥离后开启限免活动,25日前使用不消耗积分,仅限Manus1.6和Manus Lite两个模型。若用户此前购买过Manus会员或通过Lenny’s Newsletter领过会员,近期可免费使用相关模型。该信息适合相关工具用户薅取免费使用的机会,参考价值较高。
- 发布了: 我使用一台 5090 部署了 H3 视频生成模型,你可以在这个网站上使用它,免费,无需注册登录,上传图片变成视频! https://memevideo.net/ — 即刻·王登科 本文分享了用5090算力部署H3视频生成模型的情况,推出网站memevideo.net,该网站提供免费无门槛的图片转视频服务,无需注册登录即可使用。用户上传图片后可生成视频,依托5090算力保障运行。该服务适合有图片转视频需求的用户,操作便捷无需额外成本。
- 发布了: Flash 0731 用下来还是笨笨的 我是说干活还可以 但是缺少思考 经常干完了发现个一开始就能发现的大问题。。。 虽然便宜,但是很浪费时间 — 即刻·AGENT橘 本文评价了Flash0731工具,称其干活能力尚可,但缺乏思考能力,常出现可提前发现的大问题。虽价格便宜,但因需返工而浪费时间,实用性有限。该评价适合想了解该工具优缺点的用户,帮助判断是否适合自身使用场景。
- 发布了: 新增了一个skill: /ljg-classic 用来辅助阅读古文。 https://github.com/lijigang/ljg-skills — 即刻·李继刚 本文宣布新增/ljg-classic技能,用于辅助阅读古文,相关代码开源在GitHub仓库。该技能可帮助用户处理古文阅读中的难点,降低古文理解门槛。适合古文学习或阅读的用户,可通过开源仓库获取工具使用。
- 发布了: 和B站独家合作的Codex系列教程终于上线了! 肯定会是全网质量最强的教程[加油] 接下来会猛猛更新多集内容! 欢迎关注Agent黄叔[抱拳] — 即刻·AI产品黄叔 本文告知和B站独家合作的Codex系列教程已上线,作者称其为全网质量最强的教程,后续会持续更新多集内容。教程由Agent黄叔推出,呼吁用户关注。该教程适合学习相关技术的用户,能获取高质量的学习内容。
- 发布了: 一天烧掉8个亿token😂 当然是在做一些很有意思的事情啊🤗我很期待呢,今天先交给ai余一了,本体先下班了。 最近一块一块吃,也是蛮爽的,一步步收口… — 即刻·余一.Dev 本文分享了处理大量token的进展,一天处理8亿token,正在做有意思的事情,将任务交给AI余一,本体先休息。作者提到做事需逐步推进,不能跳步,近期进展顺利。该内容适合了解AI处理大规模任务的用户,能感受到推进过程的节奏。
- 转发了: 过程和结果一样重要,祝福manus — 即刻·瓦恁 本文转发了对Manus的祝福,强调过程和结果一样重要,传递了重视做事过程的理念。转发内容来自@判官,表达了对Manus发展的支持。该动态适合关注Manus发展的用户,能了解相关祝福信息。
本期有 10 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、chiark.greenend.org.uk/~sgtatham、mjg59.dreamwidth.org、tedunangst.com。