第 41 期
今日趋势
今天的内容围绕AI技术迭代、行业落地与动态争议展开,核心主线一是AI技术的实用化进展,包括LLM工具库的适配更新、因果推断领域针对模型误设等问题的新方法突破,以及多款AI工具的版本迭代;二是AI办公赛道的“百公大战”格局,大厂扎堆推出产品但存在同质化、落地难、营销乱象等问题,也有观点质疑Agent大战的伪叙事性。此外,关于AI是否会中心化、欧盟DMA的监管争议、苹果调整隐私域名计划等内容,补充了行业发展的多元视角,不同观点的碰撞为理解AI生态提供了丰富参考。
AI 技术博客
- llm-anthropic 0.27 — simonwillison.net llm-anthropic 0.27版本发布,主要适配Anthropic刚推出的v1.0.0 Python库,该库已从httpx切换为httpx2,OpenAI两周前在v3.0.0版本中也完成了相同切换。作者按Anthropic提供的迁移指南修改代码,生成了对应的PR,相关标签包含python、httpx、llm、anthropic、claude。
- Foot Guns for Sale — rss@idiallo.com 作者不认同AI会中心化的主流说法,认为开发者不会沦为仅提交提示的角色,未来本地开源模型会缩小与前沿模型的差距。他提到企业想将开发者锁在自身生态中,但开发者切换模型很容易,未来开发者会比企业更受益。
- Your executable is a SQLite database — simonwillison.net Farid Zakaria提出一种Linux模式,可创建能直接作为可执行二进制文件使用的SQLite数据库。该模式将SQLite文件的应用ID设为SELF,用SQLite表组织ELF组件,搭配自执行解释器实现功能,还可通过binfmt_misc机制让内核自动识别执行这类文件。
- [Sponsor] Finalist 4: Inspired by Paper Day Planners — Daring Fireball Department of Commerce Finalist4是纸灵感日程应用的最大更新,覆盖iOS、iPad、Mac及Apple Watch平台。其核心功能是笔记,支持与Obsidian双向同步,任务会关联到对应日期的提醒和事件,重建的时间线可规划任务,经1000名测试者测试后推出,可在App Store免费下载。
- Apple Rethinks Plan to Merge ‘Hide My Email’ Domain Name With ‘Sign In With Apple’ — John Gruber Apple调整了Hide My Email域名的合并计划,原计划将新的Sign In With Apple地址转到private.icloud.com,现改为保留在icloud.com域名下。现有privaterelay.appleid.com的地址仍会正常转发邮件,该调整是因社区及内部的反对意见,相关改动后续推出。
- ★ What Is the Point of the DMA? — John Gruber 作者认为欧盟的DMA实际目的并非开放竞争,而是欧盟的官僚主义,用于展示自身存在并向企业罚款。欧洲委员会称Apple调整后的业务条款符合DMA要求,将监控实施情况,但作者指出DMA文本晦涩,无明确开放竞争的意图。
- BitCam: The 1-Bit Camera App Turns 2.0 — John Gruber BitCam是一款1位相机应用,10年前推出1.0版本,2.0版本是重大更新,保留1.0的优点并新增更多功能。该应用致敬原Mac,细节丰富,适用于iPhone和Mac平台,可在App Store免费下载,支付10美元即可解锁全部功能。
- More on TestFlight’s Screwy Sort Order — John Gruber 作者抱怨Apple的TestFlight应用更新后,测试应用列表从按最近更新排序变为按字母排序,该问题影响部分用户,部分用户仍保持按最近排序。他提到iPhone曾短暂恢复最近排序后又变回字母排序,Mac和iPad则一直按字母排序,两种排序下的列表类别标题显示不同。
因果推断与营销科学
- Covariate Balancing Value Estimation for Optimal Individualized Treatment Rules — Yue Zhang, Shanshan Luo, Zhi Geng, Yangbo He 本文研究最优个体化治疗规则的价值估计问题,发现现有双重鲁棒估计器在倾向评分与结果回归模型均误设时无法控制剩余偏差,因此提出协变量平衡双重鲁棒估计器,结合协变量平衡的倾向评分估计和基于影响函数的经验方差准则选取的结果回归分量。该估计器只要倾向评分模型正确或规则相关的结果回归误差在指定空间内即一致,倾向评分正确时渐近方差最小,模拟与白血病数据集验证了方法有效性,为解决双模型误设下的价值估计偏差提供了可靠方案,值得一读。
- CausalSmith: A Formally Grounded, Self-Improving Agentic Framework for Automated Research in Causal Inference — Jiyuan Tan, Vasilis Syrgkanis 本文针对因果推理自动化理论研究中LLM评审不可靠的问题,提出基于Lean证明助手的CausalSmith框架,包含含7035个机器验证因果声明的Causalean库,以及可选择研究主题、构造证明的自改进智能体流水线,还加入声明审计步骤对比形式定理与非正式科学主张。该框架结合机器验证与人工审核,解决了LLM评审的不可靠性,源码等资源公开,为因果推理自动化研究提供了可靠的评估框架,值得一读。
- Optimizing Treatment Allocation in Experiments with Network Interference — Zuhra F. S. Lebbe, Asim K. Dey 本文研究网络干扰下的实验治疗分配优化问题,发现现有方法多在小简化网络评估,适用性有限,因此提出基于Fisher信息矩阵的网络感知治疗分配框架,结合分配平衡与网络拓扑,开发适配大网络的高效局部搜索算法,还研究了总、直接、间接效应的因果性质。模拟与大学住房、Facebook网络应用显示该方法能利用拓扑提升设计实用性,为复杂网络下的实验分配优化提供了有效方案,值得一读。
- Randomization tests for model specification in causal inference under network interference — Supriya Tiwari, Pallavi Basu 本文针对网络干扰下因果推理中暴露映射假设易误设的问题,提出设计-based模型设定框架,开发随机化检验程序评估暴露映射模型的正确性,该程序有渐近有效性理论保证,模拟与青少年反冲突规范实验验证了其良好功效。现有方法少关注暴露映射的实证检验,本文的方法为减少网络干扰下的因果估计偏差提供了可靠的模型设定检验工具,值得一读。
- Transporting Randomized Trial Effects to Real-World Populations via Riesz-Calibrated Optimal Transport — Anik Burman, Margaret Gamalo, Promit Ghosal, Prosenjit Kundu 本文研究将随机试验效应迁移到真实人群的问题,发现现有方法易受模型误设与协变量重叠问题影响,因此提出RICOT方法,即Riesz校准的最优运输程序,结合半非平衡最优运输与校准方程,解决了无校准最优运输的偏差,估计器为双重鲁棒且达半参数效率界,模拟与心肌病应用显示性能优于传统方法,为试验效应迁移提供了可靠的估计方案,值得一读。
- Deep adaptive design with an evidential bias criterion — David Chen, Michael Evans, Xinwei Li, Prateek Bansal, David J. Nott 本文针对贝叶斯最优实验设计中常用的EIG准则不控制误导性证据风险的问题,提出BA准则,结合策略式深度自适应设计框架,最小化BA的可处理上界等价于最大化方差惩罚的EIG,用蒙特卡洛与随机梯度优化,例子显示与EIG设计的差异。该准则为自适应实验设计提供了控制误导性证据风险的新方向,优化了设计的实用性,值得一读。
即刻简报
- 发布了: 中美做Work类产品的路径还挺不一样的。 Anthropic算是这场产品变革的发起者,从Claude Code延伸出了Claude Cowork,直接激发了国内外各种work类产品的诞… — 即刻·Alchian花生 这段内容分析了中美Work类AI产品的发展路径差异,Anthropic是该类产品变革的发起者,国内腾讯、阿里、字节等大厂均推出相关Work产品,各产品有不同优劣势,还提及国内Work类产品体验或优于海外厂商。内容清晰梳理了国内外Work类AI产品的竞争格局,对了解该赛道的发展现状有参考价值。
- 发布了: AI办公疯狂圈地,但种不出庄稼 当下大厂们正在疯狂涌入AI办公赛道,过去半年超过20款桌面端Agent产品问世,6月份国内17款主流桌面端AI原生办公智能体平… — 即刻·莫唯书Mark 当下大厂疯狂涌入AI办公赛道,半年内推出超20款桌面端Agent产品,产品同质化严重,多数企业的AI Agent项目未实现规模化落地,存在泡沫风险。文章剖析了大厂抢AI办公入口的逻辑,以及该赛道面临的同质化、落地难等问题,对理解AI办公赛道的现状与未来有帮助。
- 发布了: 千问办公、豆包工作、我可八帝 还是腾讯的名字最有意思 除了上面三家 至少还有九十七家 百公大战正式开战 你最看好哪家 — 即刻·玉伯 千问办公、豆包工作等AI办公产品推出,加上其他至少97家厂商入局,AI办公赛道爆发百公大战,其中腾讯相关产品的名字较为有意思。该内容快速呈现了AI办公赛道的竞争热度,能让人直观了解赛道的入局规模。
- 转发了: “你不干有的是人干” — 即刻·莫唯书Mark 转发内容指出AI办公Agent的大众付费意愿低,海外厂商的产品有竞争优势,认为Agent大战可能是伪叙事,其普及需要长期过程,并非短期补贴能实现。该内容从付费意愿、竞争格局等角度分析AI办公Agent赛道,能引发对赛道发展的思考。
- 转发了: 太真实了 AI 办公的饱和式攻击 让 KOL 都魔怔了 — 即刻·橘AI 转发内容提到AI办公的饱和式营销让KOL出现魔怔现象,博主频繁更换推荐的AI办公产品,更应关注如何做不用测评就能发稿的AI博主。该内容揭示了AI办公营销中的乱象,对了解该赛道的营销现状有参考意义。
- 发布了: 本周 Skill 推荐:自媒体必备 Skill 合集 1. Punk-skill 把文章转成多个社交媒体平台封面,提供极简、拼贴、杂志、科技、建筑等多种风格 http://go.cola… — 即刻·橘AI 本周推荐了5个自媒体必备的Skill,包括将文章转成多平台封面、Markdown转公众号HTML、内容创作大合集、小红书人像封面设计、口播文稿转视频等。这些Skill能为自媒体创作者提供实用的工具支持,对提升创作效率有帮助。
- 转发了: 希望记录更完整的行业全貌和一手声音。 — 即刻·kyth 2026年小宇宙站内AI相关人物搜索量同比增长470%,AI领域关键人物多在播客发声,小宇宙成为AI圈重要的发声平台,AI话题播客增速达300%左右。文章分析了播客在AI时代的价值,对了解AI领域的传播生态有参考作用。
- 发布了: 真实世界的问题远比刷榜复杂,Human in the loop的含金量还在提升 — 即刻·莫唯书Mark 这段内容指出真实世界的问题远比刷榜复杂,Human in the loop的含金量正在提升,还以网吧包宿老哥懂Benchmark为例说明这一点。该内容从实际应用角度强调了Human in the loop的重要性,对理解AI的实际应用有启发。
本期有 10 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、chiark.greenend.org.uk/~sgtatham、tedunangst.com、即刻·即刻资讯台。