第 40 期
今日趋势
今天的内容主要涵盖AI领域的多维度动态、因果推断与营销科学的方法论进展,以及实用技术与行业思考,核心主线可分为两大方向。其一为AI领域的动态与从业者思考,包括头部厂商的运营数据、模型成本过高影响普及的现状、模型成本与实用性的平衡讨论、AI产品设计反思、行业整合动向等,呈现出行业在规模扩张与成本控制、用户体验之间的平衡难题。其二为因果推断与营销科学的研究突破,多篇成果聚焦兼顾伦理的政策优化框架、解决连续治疗效应估计难题的方法创新、面板实验的风险缓解方案等,为相关领域的决策与分析提供了可靠新工具。此外,还有CSS排版单位优化、老旧硬件BIOS修复、LLM辅助数据整理等实用技术分享,以及对AI泡沫、AI协作问题等话题的行业探讨,内容维度丰富且兼具行业参考价值与实用意义。
AI 技术博客
- Anthropic’s best AI model struggles to attract users as cheaper tools thrive — simonwillison.net 这篇文章对比了Anthropic与OpenAI的AI模型市场表现及营收情况,提到Anthropic2026年7月年化收入达650亿美元,Q3预计盈利,拥有6000个年消费超10万美元的客户;OpenAI同期年化收入超400亿美元,GPT-5.6发布后表现回升。还引用Ramp AI指数数据,显示Anthropic各模型使用占比,如Opus4.8占28%,Fable5仅8%,反映其成本高影响普及。该文提供了头部AI厂商的一手运营数据,值得关注行业动态的读者参考。
- Getting an LLM to Make Me a Tool for Enriching the Color Metadata in My Icon Collection — blog.jim-nielsen.com 作者手动给图标集合添加了颜色元数据,但有2000多个图标未标记,想借助LLM辅助筛选未标记的同色图标,同时保留自己的视觉决策控制权。他设计了工具框架:左侧选颜色,右侧分已标记和待推荐图标,选后复制ID回传添加元数据。LLM提出用色相直方图处理,排除透明和低饱和像素,按橙色色相带占比排序未标记图标。该思路兼顾自动化与人工控制,对个人数据整理有参考价值。
- Fixing an eMachines EL1200 BIOS bug with Claude — Doug Brown 作者2008年的eMachines EL1200主板,官方支持单槽2G共4G内存,但插8G DDR2能进Linux,却无法进BIOS(黑屏闪光标),换4G内存正常。他尝试BIOS更新、集成新AGESI都没解决,2021年搁置。该记录了老旧硬件BIOS修复的尝试过程,对硬件爱好者有一定参考意义。
- Quoting Drew Breunig — simonwillison.net Drew Breunig提到,此前AI模型更新快、成本低,无需优化编码工具;但Anthropic的Fable模型虽好,成本高,而Opus、GPT-5.6等已能满足多数编码需求,因此要重新分配工作内容。该观点反映了AI模型成本与实用性平衡的行业思考,对从业者有启发。
- Cooper Sharp Proves That American Cheese Can Be Great Cheese — John Gruber 作者提到Anthropic宣布给生成文本加水印以区分AI和人类内容,引发争议,有人认为是为了避免训练时用自家或竞品输出导致模型退化,而非单纯应对欧盟AI法规。还提到Cooper Sharp奶酪的例子调侃相关争议。该文梳理了AI水印背后的商业和技术动机,而非表面的监管原因。
- Death to px, long live ch! — @edent 作者认为CSS的px单位是双重谎言,不对应物理像素或实际长度,而ch单位基于字符宽度,更适合设置内容宽度、内边距等,能适配不同设备的阅读体验。他用min(75ch,100%)设置主内容宽度,还考虑用ex单位做垂直间距,只是在实验,并非完全摒弃px。该思路优化了CSS排版单位,提升可读性。
- Anger, Anxiety and Agency — Armin Ronacher 作者同意Sean关于职场不要愤怒的观点,认为科技行业当下的焦虑(如AI对职业的影响、未来不确定性)是合理的,而愤怒需要明确的指责对象,反而无益。他提出应将焦虑转化为不确定感,进而产生好奇心,而非愤怒。该文提供了科技从业者应对行业变化的情绪调节思路。
- What exactly is modified about a modified Bessel function? — John 作者解释修正贝塞尔函数的命名由来,纯数学上是贝塞尔函数沿虚轴的变形,带i的幂次项保证结果为实数;应用数学上,它源于圆柱坐标系下热方程等问题的求解,对应双曲函数关系,命名是为了区分不同应用场景的需求。该文清晰梳理了特殊函数命名的逻辑,帮助理解其应用背景。
因果推断与营销科学
- Counterfactual Optimization of Policy Interventions: Lexical Ordering and Leapfrogging — Martina Scauda, Tobias Freidling, Qingyuan Zhao 多数数据驱动的政策学习方法仅最大化平均结果,忽略平均有益但仍可能伤害大量个体的情况。该研究基于“不伤害”的伦理原则,设计从基线政策调整的方案,在提升整体福利的同时,将个体伤害的最坏情况概率或期望控制在指定阈值内。研究确立最优政策转换的充分条件,其具有词汇级跳跃结构,推导不同潜在结果依赖模型下的优先级得分,通过乳腺癌临床试验重分析验证方法,发现考虑反事实伤害会改变治疗亚组的优先级结论。该研究为兼顾整体福利与个体安全的政策优化提供了新框架,适用于医疗等需伦理考量的决策场景。
- Heterogeneous Effects of Continuous Treatments via Conditional Modified Treatment Policies — Samhita Pal, Jared D Huling 对于药物剂量、呼吸机强度等连续治疗,临床关键问题是小调整的利弊而非是否治疗,标准估计量要求剂量范围正性,但观察性临床数据常因协议绑定剂量与患者特征无法满足。该研究开发框架刻画连续治疗小调整(“轻推”)的异质性效应,定义条件轻推效应和条件修正治疗政策效应,在弱假设下识别,通过重复数据构建将δ调整转化为两臂比较,开发加权和A学习估计量,引入方差缩减的增强版本并证明渐近正态性。模拟验证理论,MIMIC-III呼吸机数据分析识别出可从适度降低机械功率中获益的患者群体。该研究解决了连续治疗效应估计中数据假设不满足的问题,为临床个性化调整治疗剂量提供可靠工具。
- Design-Based Confidence Sequences: A General Approach to Risk Mitigation in Panel Experiments — Dae Woong Ham, Iavor Bojinov, Michael Lindon, Martin Tingley 随机实验是企业评估产品服务的标准方法,同时降低创新暴露风险,序列实验中允许管理者“偷看”结果并提前终止的anytime-valid方法需适配更复杂的时间序列、切换、面板实验场景。该研究扩展现有anytime-valid方法,采用设计型方法聚焦轻假设、与管理者相关的有限样本估计量,纳入建模假设和协变量的方差缩减技术。模拟和Netflix三个真实应用验证效果,该置信序列可在少量样本后终止有害实验,比如3万人的Netflix实验可在100人后终止。该研究为企业序列实验提供灵活的风险缓解方案,尤其适用于需实时监控实验结果的场景,有效降低创新推广风险。
- Double Machine Learning of Continuous Treatment Effects with Additive Instrumental Variables — Shuyuan Chen, Peng Zhang, Yifan Cui 估计连续治疗的因果效应是实践常见问题,如平均剂量反应函数,经典分析假设所有混杂因素可观测,但实际应用中常存在未测量混杂导致偏差。该研究提出用工具变量识别平均剂量反应函数的新框架,引入均匀正则权重函数,覆盖治疗空间的有限开集,在每个集内识别局部平均剂量反应函数,基于去偏机器学习框架开发增强逆概率加权得分,提出证伪测试和检验程序,证明渐近性质和理论有效性。模拟和实证研究评估有限样本性能。该研究解决了连续治疗效应估计中未测量混杂的问题,为相关因果推断提供可靠方法学支持。
- Double Machine Learning of Continuous Treatment Effects with Additive Instrumental Variables — Shuyuan Chen, Peng Zhang, Yifan Cui 估计连续治疗的因果效应是实践常见问题,如平均剂量反应函数,经典分析假设所有混杂因素可观测,但实际应用中常存在未测量混杂导致偏差。该研究提出用工具变量识别平均剂量反应函数的新框架,引入均匀正则权重函数,覆盖治疗空间的有限开集,在每个集内识别局部平均剂量反应函数,基于去偏机器学习框架开发增强逆概率加权得分,提出证伪测试和检验程序,证明渐近性质和理论有效性。模拟和实证研究评估有限样本性能。该研究解决了连续治疗效应估计中未测量混杂的问题,为相关因果推断提供可靠方法学支持。
- Targeted Deep Survival Contrasts: Valid Inference for Treatment-Specific Survival Benefit with Neural Networks — David McCoy, Yi Li 神经生存模型常需支持治疗对生存的反事实结论,而非仅预后风险评分,从观察性数据回答该问题需在混杂和协变量依赖删失下对治疗特异性生存对比进行有效推断,而标准深度生存估计量存在偏差且无可靠不确定性。该研究提出目标深度生存对比(TDSC),扩展目标深度架构至治疗特异性生存曲线的完整向量,推导效益曲线和受限平均生存时间差,采用通用目标路径、一步残差补充得到双重稳健估计量,通过乘数自助法得到同时置信带,证明联合渐近线性性等性质。七个蒙特卡洛研究显示,TDSC插件的MSE比同类方法低35%,补充步骤恢复不良模型下的名义推断,样本内诊断可区分情况。该研究为神经生存模型的治疗特异性生存效应推断提供有效方法,适用于观察性数据中需考虑混杂和删失的场景,为临床决策提供可靠因果证据。
即刻简报
- 发布了: 空白对话框是AI产品最懒的设计 每当你打开一个AI产品,迎面而来就是一个空白输入框,光标一闪一闪地等着你输入。 你明明有需求,但有时面对那个空荡荡的… — 即刻·莫唯书Mark 本文指出空白对话框是AI产品的懒设计,这类设计将用户视为问答题考生,增加认知负担;而Roameo旅行规划产品用滑动投票的选择题交互,解决群体旅行的共识问题,还提出四条设计原则,强调好的AI产品应让用户保持原有习惯,AI后台处理事务,能为AI产品设计提供参考。
- 发布了: 最近 Flash 级别的模型能力都上来了,又一个全新模型 August 来了 小型,快速,高性能。 Ox 牛来在海外已经火到暴量,现在全网的资源紧张,在官方公布谜… — 即刻·橘AI
- 发布了: https://m.okjike.com/originalPosts/6a27c89a1bd695bf203fe9fb?s=ewoidSI6ICI1YTczNjhkNTgzZDgzNTAwMTczOTBhODgiCn0= 很早就预言要合并了,只能说是虽… — 即刻·莫唯书Mark 字节跳动完成AI生产力整合,TRAE、扣子并入豆包,将推出统一办公品牌“豆包工作”,此前已有相关合并预言,此次落地是AI办公领域的重要动向,能让读者了解行业整合的最新情况。
- 转发了: 一条动态 — 即刻·kyth 该转发动态指出与AI协作时存在的问题,如习惯性将复杂问题丢给AI导致自身思考能力下降,还会受AI表达习惯影响出现不说人话的情况,同时提及语言学习需关注字词细微差别,能引发对AI协作与自我成长的思考。
- 发布了: 一觉醒来几个长程任务都api error 529了。 但对于某些用户来说,Claude还是很稳定的。 — 即刻·李自然 发布者一觉醒来发现多个长程任务出现API error529错误,不过Claude模型对部分用户来说运行仍保持稳定,该信息能为相关用户排查API问题提供一定参考。
- 发布了: 沉舟侧畔千帆过 病树前头万木春 — 即刻·莫唯书Mark 引用诗句“沉舟侧畔千帆过,病树前头万木春”,结合当前AI领域的现状提出疑问,探讨AI泡沫的规模,能引发读者对AI行业发展趋势的思考。
- 发布了: eli5(explain like i’m 5-year-old),与其说是在描述「学习者」,不如说是在约束「解释者」。 — 即刻·李继刚 该内容指出eli5(用五岁小孩能懂的方式解释)的核心并非针对学习者,而是对解释者提出了明确要求,即需用简单易懂的方式传递信息,能帮助读者理解eli5的本质。
- 发布了: 结合大家最近在推特看到的黄推广告机器人文案,下面这句话有了新解: 傻人有傻福 — 即刻·哥飞 结合近期推特上的黄推广告机器人文案,“傻人有傻福”这句话被赋予了新的解读,该内容能让读者从新的角度理解这句俗语的含义。
本期有 9 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、chiark.greenend.org.uk/~sgtatham、tedunangst.com。