第 15 期
今日趋势
今天简报的两条主线清晰浮现:一是AI模型评估与训练中的深层矛盾,尤其是定量指标与真实体验的背离,以及计算成本飙升带来的行业压力;二是AI应用从工具向服务与生态的演进,强调Agent作为核心而非附件的逻辑,以及商业上“服务而非软件”的持久价值。在技术层面,模型测试成绩与实际使用体验的差异成为共识性分歧,无论是GPT-2权重对比还是Claude用户反馈,都指向评测体系可能失真的问题。而在经济与政策维度,成本上升、平衡创新与风险的需求,以及AI对传统经济学假设的冲击,构成了另一条值得关注的共性线索。
AI 技术博客
- Why do OpenAI’s GPT-2 weights beat mine? — gilesthomas.com 作者训练LLM后发现,OpenAI的GPT-2 small权重在指令遵循评估上始终优于自己的模型,尽管自己的模型在测试损失上更低。关键结论:定量评估(损失)与定性评估(指令遵循)存在不一致,可能源于训练数据、微调方法或评估指标差异。值得读:本文揭示模型评估的复杂性,对理解LLM训练和评估有重要启发。
- Why compute might get 10x+ more expensive in coming years — Dwarkesh Patel 本文讨论未来几年AI计算成本可能大幅上涨的原因。作者指出,Anthropic收入年增10倍,若持续需大量计算投入,导致价格上升。关键结论:实验室收入增长、计算需求飙升、推理占比增加等因素共同推动成本上升。值得读:了解AI行业经济趋势,对投资和决策有参考价值。
- The AI Aesthetic — blog.jim-nielsen.com 本文探讨AI带来的新设计美学,如流式文本、闪烁文字表示思考,以及AI应用中普遍使用的小图标。关键结论:这些设计模式正从AI界面扩展到其他软件,可能成为未来交互范式。值得读:思考AI如何影响软件设计,对设计师和开发者有启发。
- AI: Overwegingen voor wie erover gaat — berthub.eu 作者在公共网络和科技咨询委员会上分享关于AI的见解,面向政策制定者。关键结论:AI政策需平衡创新与风险,强调实用性和可操作性。值得读:为AI政策制定者提供实用思考框架。
- AI Worming through Word — simonwillison.net 本文标题为“AI Worming through Word”,探讨AI如何逐渐渗透到Word等办公软件中,实现自动化写作、智能建议等功能。核心观点:AI正在改变传统办公工具,提升效率。值得读:了解AI在办公领域的应用趋势。
- Wheels, Bottles and Images — Andrew Nesbitt 本文比较Python wheels、Homebrew bottles和OCI images三种二进制分发系统的相似性。关键结论:三者都通过HTTP下载校验和文件,索引与存储分离,支持静态缓存。值得读:理解不同生态中二进制分发系统的共通设计,便于跨平台分发。
- Making an agile version of a Windows Runtime delegate in C++/WinRT, part 8 — Raymond Chen 本文继续讨论C++/WinRT中Windows Runtime委托的agile版本实现,重点解决lambda捕获构造顺序未指定导致的异常安全漏洞。关键结论:预创建deleter并确保构造顺序,避免引用泄漏。值得读:对C++/WinRT开发者有实际指导意义,提升代码健壮性。
- Logic for Programmers is Done — buttondown.com/hillelwayne 宣布《Logic for Programmers》一书完成并发布1.0版,包括纸质和电子版。关键结论:经过五年努力,书籍正式出版,包含大量示例和专业知识。值得读:对逻辑编程感兴趣的读者不容错过。
因果推断与营销科学
- Visible or Covert? The Causal Effect of Inspector Visibility on Fare Evasion Detection: A Causal Machine Learning and Policy Learning Approach — Hannes Wallimann, C'edric Br"utsch, Martin Huber 本文研究检查员可见性(制服vs便衣)对逃票检测效率的因果效应。利用瑞士最大区域公交运营商PostAuto的178,686条检查记录,采用因果机器学习方法估计。结果发现穿制服使检测效率降低0.156次/小时(约26%),便衣检查在91.8%的情境下更优,且该效应在旅行卡持有者比例高的区域更大。值得读是因为它为公共交通运营者优化检查策略提供了数据驱动的决策依据,具有直接实践价值。
- The Confounder Trap: Treatment-Encoding Representations in Causal Inference with Text — Marie Neubrander, Graham Tierney, Alexander Volfovsky 本文研究从观测文本估计语言属性因果效应时,表示学习可能直接编码处理变量导致重叠违反的问题。提出基于掩码的调整表示,在表示学习前移除词汇处理信号,形式化表示诱导的重叠失败并证明掩码的有效性。模拟表明掩码改善重叠诊断、稳定处理效应估计并减少偏差。值得读是因为它揭示了文本因果推断中一个被忽视的陷阱并提供了实用解决方案,对自然语言处理中的因果推断有重要指导意义。
- On the use of cross-fitting in causal machine learning with correlated units — Salvador V. Balkus, Hasan Laith, Nima S. Hejazi 本文证明在因果机器学习中,即使研究单元相关(如空间、聚类或时间序列数据),使用独立假设下的交叉拟合仍能消除关键偏差项。通过多种相关结构的模拟实验,发现忽略相关性的交叉拟合在偏差和精度上等同或优于专门设计的方法。这一结果纠正了常见误解,简化了相关数据下的因果推断实践。值得读是因为它为研究者提供了理论保证,避免不必要的复杂交叉拟合设计。
- Causally Interpretable Meta-Mediation Analysis With Missing At Random Mediator and Outcome Data — Marie-F'elicia Beclin, Apolline Courr`eges-Vartanian, Genevi`eve Lefebvre, Tat-Thang Vo 本文提出一种新方法用于元分析多个研究的自然间接效应估计,处理中介和结果数据缺失问题。该方法将研究特定估计运输到明确定义的目标人群,利用半参数理论构建灵活的数据自适应估计器。还开发了随机效应模型和基于ANOVA平方和的非参数类似物来分解异质性。模拟和真实数据验证了有限样本性能。值得读是因为它填补了中介分析元分析中处理缺失数据和混淆的空白,增强了因果可解释性。
- Optimal Causal Annotations: An Application to Casenotes in Social Services — Ezinne Nwankwo, Lauri Goldkind, Angela Zhou 本文研究在有限标注预算下,如何选择观测值以最小化平均处理效应估计方差。提出两批次估计器达到最优渐近方差,在模拟和真实数据上比随机采样降低43%-91%的标注成本。案例研究发现LLM低估客户进展,而方法表明增加外展服务可改善住房结果。值得读是因为它为利用LLM进行因果推断提供了预算有效的标注策略,对非营利组织运营有直接管理启示。
- A Simple Robust Procedure in Instrumental Variables Regression — Xiyu Jiao 本文改进工具变量回归中离群值检验的启发式方法,建立渐近理论。推导了修剪2SLS的极限分布和偏差校正因子,构造了Hausman型检验,并证明迭代固定点等价于Huber-skip M估计量。模拟支持理论,实证示例显示实用性。值得读是因为它为实证研究者提供了严谨的离群值稳健性检验工具,提高了工具变量回归的可靠性。
即刻简报
- 发布了: CodePilot 刚更新了 0.62 版本。 因为这个工具主要是我给自己做的,满足了我自己的需求,把我的一些工作流也放进了里面。 这次更新主要优化了体验: 1. … — 即刻·歸藏 CodePilot 0.62版本发布,主要优化了侧边栏文件树,新增右键菜单支持新建、删除、移动文件,并可将文件树内容拖入聊天框。同时Markdown编辑和预览同屏显示,补齐了左侧和输入框的右键菜单。作者强调该工具自用且满足自身工作流,此次更新专注于提升开发者的文件管理和编辑体验。对日常使用CodePilot的开发者来说,这些改进能显著提升效率,值得一试。
- 发布了: Software 可能会死,但 Service 不会 你永远无法 vibe coding 出来一个 service 你看 vibe coding 出来的东西,一个月后有几个还在提供 service? servi… — 即刻·AGENT橘 作者认为软件可能消亡,但服务永恒,vibe coding无法产生持续服务。核心观点是服务才是本质,成本与持续性是关键,梁文锋也指出如果Codex贵10倍增长不会这么好。本文直击AI时代创业的商业逻辑,提醒创业者不要沉迷于工具本身而忽视服务价值。对商业模式和AI产品战略感兴趣的读者,此文能带来深刻启发。
- 发布了: 昨天专门抓了陈冕的所有访谈 让Fable5提取了有价值的语录 有几句很扎心窝子 “这是不急,但一定要快” “timing 是难以预测的,但来了之后,你需要像狼… — 即刻·AI产品黄叔 文章整理了陈冕关于AI浪潮中时机与速度的语录,强调“不急但一定要快”,时机来临时需像狼一样扑上去。作者反思AI时代奖励更快、更焦虑的人,并以自身经历说明用时间换空间的重要性。这些语录对创业者在AI浪潮中把握节奏、珍惜时间有很强的现实指导意义,值得反复品读。
- 发布了: 可能很快会大力拥抱WorkBuddy 黄叔的Agent社群已经把 WorkBuddy的产品/生态负责人邀请进来 下周二先在北京和生态负责人交流一下 国内的Work类大战,值得… — 即刻·AI产品黄叔 作者预告将大力拥抱WorkBuddy,黄叔的Agent社群已邀请其产品/生态负责人,下周二将在北京交流。作者认为国内Work类大战值得期待,8月将是激动人心的起点。WorkBuddy作为AI Agent工作平台,其生态合作预示新格局,对关注企业服务与AI Agent落地的读者来说,这是值得跟踪的动态。
- 发布了: 要不是 Cloud Max 有 Fable 5 的话,我现在根本都不想订阅。 Opus 4.7、4.8 和 5.0 都太他妈拉胯了,越来越拉胯。 测试成绩越来越好,但是使用体验上效… — 即刻·歸藏 作者批评Claude Opus模型从4.7到5.0版本体验越来越差,测试成绩虽好但实际使用中不说人话、无法沟通、偷工减料。认为Anthropic似乎失去训练更好模型的能力,Opus 4.6是偶然。本文提供了真实用户对AI模型的负面反馈,对评估AI产品实际体验和模型迭代方向有重要参考价值。
- 发布了: 理性经济人这一经济学底层原理在ai时代已经崩塌 经济学这座大厦也要崩塌 — 即刻·泓深 作者指出经济学底层原理“理性经济人”在AI时代已崩塌,经济学大厦或将崩塌。核心观点是AI改变了人类决策的理性假设,传统模型不再适用。虽仅一句话,但直击理论要害,对经济学和AI交叉领域感兴趣的读者,能激发深入思考。
- 发布了: agent + x > x + agent — 即刻·李继刚 作者提出“agent + x > x + agent”,强调AI Agent应作为核心而非附加组件。核心观点是Agent优先于其他功能,能带来更大价值。虽短,但引发关于AI系统架构设计的思考,对开发者设计Agent驱动产品有启发意义。
- 转发了: 让相册再次伟大 — 即刻·kyth 作者转发了一个让相册更强大的App,源自多年前Hackathon想法,实现了有趣的界面和交互。调侃“让相册再次伟大”,展示了创意落地的过程。对产品设计和创意爱好者来说,这是一个从想法到产品的鲜活案例,值得参考。
本期有 9 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、mjg59.dreamwidth.org、tedunangst.com。