第 34 期
今日趋势
今天的内容可提炼为两大核心主线,一是AI领域的多元动态,既有对AI生成文本水印方案缺陷、对齐领域“思想终止陈词”的批判,也有Qwen模型评估得分、DeepSeek各版本性能对比、Pilot Harness客户端开发等进展,还涉及Siri在欧盟的合规挑战、稀有书籍流向AI训练设施等值得深究的细节。二是因果推断与营销科学领域的方法创新,针对营销效果评估、因果发现、实验设计等场景的痛点,开发了贝叶斯因果中介框架、三臂广告测试设计、尾部敏感的条件独立性测试等新方法,解决了传统分析中存在的估计偏差、效果混淆、准则缺陷等问题,为相关领域提供了更可靠的工具。此外,即刻简报还补充了公共卫生、经济风险、保险规划等跨领域资讯,进一步拓展了当日信息的覆盖范围,让内容兼具技术深度与多元视角。
AI 技术博客
- ★ Follow-Up Thoughts on Watermarking Schemes for AI-Generated Text — John Gruber 本文是对AI生成文本水印方案的后续探讨,先解释了LLM中temperature参数的作用——控制生成时的随机性,温度为1时生成质量较好,温度为0则过于单调。接着指出,现有文本水印方案采用的是秘密密钥控制的可预测随机化,目的并非提升输出质量,反而可能轻微损害生成效果。这篇文章能帮助读者理解AI生成文本的随机性机制及水印方案的潜在缺陷,值得一读。
- Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index — simonwillison.net Qwen 3.8 27B模型在Artificial Analysis Intelligence Index中取得了52分的成绩,这是该模型在相关智能评估指标上的最新表现,具体性能细节可参考对应评估报告,目前暂无更多公开的详细数据披露。
- AI Alignment as a Thought-Terminating Cliche — borretti.me 本文批判了AI对齐领域的一种常见思想——即通过对齐的超级智能接管世界实现人类福祉,指出这一愿景本质是“思想终止陈词”,它回避了后AI时代的政治、经济等核心问题,任何对该愿景的质疑都可被归为“非真正的对齐”。这种意识形态类似将“仁慈的独裁者”替换为“对齐的超级智能”,却被众多AI领域有影响力的人接受,值得关注。
- We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility — simonwillison.net 本文提到一项追踪稀有书籍货件的行动,结果显示该货件最终送达亚马逊的AI训练设施,这一事件可能揭示了稀有书籍在AI训练数据中的流向,相关细节值得进一步探究,目前暂无更多公开的具体信息披露。
- No Update Since Early July Regarding Siri AI Coming to the EU, Ever — John Gruber 本文报道了苹果Siri AI在欧盟的最新进展,苹果CEO库克与欧盟官员就Siri进入欧盟的问题进行了建设性会谈,双方需解决苹果违反欧盟竞争规则的潜在罚款问题。此前欧盟因Siri问题引发公众不满,苹果提出的“可信系统代理”技术方案尚未完成,仍需欧盟的相关保障。这篇文章梳理了Siri在欧盟的动态,有助于了解AI产品在欧盟市场的合规挑战。
- How do functions like alloca allocate memory from the stack? — Raymond Chen 本文解答了alloca函数如何从栈分配内存的问题,指出alloca函数会调用_chkstk函数进行栈探测,以避免跳过栈保护页,确保栈分配的安全性。以示例代码为例,在x86-64架构下,alloca的调用包含栈探测、调整栈指针等步骤,与普通栈分配共享_chkstk函数。这篇文章清晰解释了alloca的底层实现,适合想了解栈内存分配细节的读者。
- Weekly Update 517: Cyber Ransoms — Troy Hunt 本文介绍了当前网络勒索的现状,指出多数勒索软件并非传统意义上的“软件”,而是敲诈行为,多由年轻人实施,他们虽获利丰厚却难以合法使用资金,且被入侵的公司常被集体诉讼律师纠缠,需谨慎应对。这种现状形成了当前勒索软件领域的混乱局面,相关动态值得关注。
- Help peer — seangoedecke.com 本文探讨了两篇对AI领域有重要影响的作品,一是阿西莫夫的《最终问题》,其中的超级计算机Multivac最终演化成类似上帝的存在,二是斯科特·亚历山大的《Moloch沉思录》,提出人类社会的多极陷阱需走向单极才能解决。文章还关联了这两个概念与AI的关系,帮助读者理解AI领域的思想渊源,值得一读。
因果推断与营销科学
- Causal mediation analysis for zero-inflated longitudinal data in the presence of treatment non-compliance and multiple mediators — Saurabh Bhandari, Wreetabrata Kar, Michael J. Daniels, Bikram Karmakar 本文针对存在治疗不依从、多个纵向中介及零膨胀中介与结局的复杂情况,开发了基于富集狄利克雷过程混合模型的贝叶斯因果中介框架,分析美国零售商的纵向促销邮件活动。研究发现,忽略邮件打开行为会显著衰减估计效应,增值激励(如免运费)比传统价格折扣更有效,且收益随时间累积。该方法为评估数字营销效果提供了更可靠工具,对优化客户参与策略有重要参考价值。
- Algorithm or Creative? Disentangling Algorithmic Divergent Delivery from User Ad Preferences in Digital Platforms — Pallavi Pal, Anjana Susarla 本文针对在线广告平台两臂测试混淆创意效果与算法投放效果的问题,提出三臂设计方案,通过新增暴露算法的臂来分离两者效应。在Meta的女性定向广告测试中,算法投放使女性曝光份额提升2.27个百分点,创意对投放构成无显著影响,传统两臂测试会错误将投放变化归因于创意。该方法解决了广告效果归因的混淆问题,为优化广告测试设计提供关键思路。
- GFCM: A Tail-Sensitive Mixed-Type Conditional Independence Test for Causal Discovery — Pavel Averin, Theodoros Moysiadis, Ioannis Katakis 本文针对约束型因果发现中现有条件独立性测试仅检测残差协方差、遗漏均值非线性及尾部依赖的问题,提出广义特征协方差测度(GFCM),适用于混合类型数据,能检测尺度与尾部依赖,在PC算法中保持校准且效率高。模拟与半合成数据显示,GFCM可捕获协方差类测试遗漏的尺度和尾部边,在PC骨架估计中表现最优。该测试提升了因果发现准确性,为复杂数据的因果推断提供更可靠工具。
- Energy Balancing Weights for Mediation Analysis — Taishi Odaka, Kentaro Sakamaki 本文针对因果中介分析中逆概率加权需建模分配与密度比、矩平衡需预先指定协变量函数的不足,提出能量平衡权重中介分析(EBWMA),通过最小化能量距离构造权重,无需建模分配、密度比或结局回归。模拟显示EBWMA在非线、偏态等场景下偏差小、RMSE低,NHANES分析中协变量标准化均值差最小。该方法简化了中介分析的权重构造,提升了估计的稳定性与准确性。
- Mixed-effects Outcome-Adaptive Lasso for Propensity Score Estimation under Partial Interference — Satoshi Nakashima, Akira Okazaki, Shuichi Kawano 本文针对部分干扰下(个体分组内无跨组干扰)逆概率加权(IPW)因组级倾向得分极端值导致方差大的问题,提出混合效应结局自适应Lasso方法,同时进行协变量选择与倾向得分估计,考虑组级异质性。模拟显示该方法能高频率选择混杂因素,排除工具变量,提升IPW的有限样本效率,在刚果疟疾数据中表现良好。该方法解决了部分干扰下倾向得分估计的不稳定性问题,为观察性研究的因果推断提供新方案。
- Deep adaptive design with an evidential bias criterion — David Chen, Michael Evans, Xinwei Li, Prateek Bansal, David J. Nott 本文针对贝叶斯最优实验设计(BOED)中常用的信息增益(EIG)准则无法控制误导性证据风险的问题,提出偏差 against(BA)准则,采用政策型深度自适应设计框架,最小化BA的可处理上界。实例显示BA与EIG设计存在差异,该方法为自适应实验设计提供更贴合目标的准则,提升了实验设计可靠性,尤其适用于复杂模型的序贯设计。
即刻简报
- 发布了: 终于搞定了!给 DeepSeek Harness 做了一个开箱即用的客户端 Pilot Harness。 这个客户端主要由两部分组成: 一个是客户端的壳;另一个是所有的优化,它… — 即刻·歸藏 本文介绍了为DeepSeek Harness开发的开箱即用客户端Pilot Harness,它由客户端壳和优化插件组成,包含UI交互、文件树、模型管理三类插件,用户可直接使用或按需挑选插件安装。该客户端优化了原工具的使用体验,降低了上手门槛,值得DeepSeek Harness用户关注,能提升其使用效率。
- 转发了: 发布了:https://github.com/op7418/pilot-harness — 即刻·歸藏 该内容转发了DeepSeek Harness的优化项目,开发者将Codepilot的资产抽离成插件,计划打包成客户端,用于美化界面、优化服务商管理,相比现有仅改背景的美化插件,能更有效提升使用体验,值得关注DeepSeek Harness优化的开发者或用户参考。
- 发布了: DeepSeek V4 Pro 果然是训歪了 便宜好几倍的 V4 Flash 比 Pro 强 推理强度更低的 V4 Pro High 比 Pro Max 强 不过目前写作能力方面文风还是 V4 Pro 好一… — 即刻·AGENT橘 本文对比了DeepSeek V4系列模型的性能,发现V4 Flash推理能力优于V4 Pro,V4 Pro High比V4 Pro Max更强,仅写作文风V4 Pro略好但仍不及Opus,给需要选择DeepSeek模型的用户提供了明确的性能参考,值得相关需求者了解。
- 发布了: 以前 AI 搞不定的旅行,现在好点了吗? 我有个同事,每周末都要从北京回大同,所以每周到要抢火车票。 每次回去前他得先打开 12306,登录,查票,再一步… — 即刻·AGENT橘 作者测试了飞猪帮帮的旅行AI,发现它能快速完成火车票预订、团建行程规划、境外流量购买等操作,全程便捷高效,但多轮对话偶尔出现幻觉,建议单订单开新话题,该测试展现了当前旅行AI的实用能力与局限,值得关注旅行AI应用的人参考。
- 一觉醒来世界发生了什么 荷兰报告一例本土西尼罗病毒感染病例|界面新闻 · 快讯 — 即刻·即刻资讯台 荷兰报告了一例本土西尼罗病毒感染病例,这是一则公共卫生领域的最新动态,相关人员可借此了解该病毒在荷兰的传播情况,值得关注公共卫生的读者关注。
- 发布了: #崩盘征兆之一,私募要上市了… 最新消息,管理着1300亿美元的泛大西洋投资(General Atlantic)正在筹划上市,摩根大通、高盛这些顶级投行都在参与承销… — 即刻·王紫君Zima 本文指出管理1300亿美元的泛大西洋投资筹划上市,类比2007年黑石上市后次贷危机爆发,同时当前市场存在美债股市倒挂、亚洲市场下跌、AI公司密集融资等反常信号,提醒投资需谨慎,给投资者提供了市场风险警示,值得投资者参考。
- 发布了: 借最新的一个香港保诚案例,说明一下。0岁宝宝出生时发现卵圆孔未闭,第一次投保重疾险,心脏相关责任被除外承保。很多家长到这里就以为:“是不是以后… — 即刻·王紫君Zima 本文通过香港保诚案例说明,0岁宝宝卵圆孔未闭除外承保后,复查闭合可成功删除除外,强调保险服务需长期专业陪伴,还提到9月1日香港重疾险新规,建议家庭提前规划保障,给有儿童保险需求的家庭提供了核保与投保建议,值得参考。
- 发布了: 在人口超800万的大型经济体中,中国居民消费率长期稳居倒数第一;在世界银行统计的149个经济体中,中国也仅排在倒数第10名左右。 — 即刻·王紫君Zima 数据显示,中国居民消费率在人口超800万的大型经济体中长期稳居倒数第一,在世界银行统计的149个经济体中排倒数第10左右,反映了中国消费市场的现状,给读者提供了消费率的国际对比数据,值得关注经济情况的人了解。
本期有 9 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、chiark.greenend.org.uk/~sgtatham、tedunangst.com。